几条带着拼写错误的提示词——inteligent、agian、worth 散见其间——就把一台模型从「这题太难我不做」推到了发现一个专家审查未曾发现的密码学缺陷。
这是 Anthropic 在 7 月 28 日公开的一项研究里最反直觉的细节(Discovering cryptographic weaknesses with Claude)。他们用 Claude Mythos Preview,在两个真实的密码学目标上找到了数学层面的攻击——不是代码实现里的 bug,是算法本身的结构性弱点。一个是 HAWK——一种基于格(lattice)的数字签名算法,正在参与 NIST(美国国家标准与技术研究院,负责制定全球广泛采用的密码标准)主持的后量子签名标准化竞赛,入选后可能进入基于 NIST 标准建设的系统;另一个是砍到 7 轮的 AES-128(完整版是 10 轮)。
先把数字摆出来,因为这决定了这件事该被认真到什么程度。
它到底找到了什么
先用大白话交代背景,不懂密码学也能跟上。HAWK 和 AES 本身不是「猜密码的工具」,而是「锁」:AES 用来加密数据,HAWK 用来做数字签名(证明一份数据确实出自你、没被人篡改),都是系统用来保护信息的基础算法。开这种锁靠的是密钥(key,一长串随机数据——不是我们登录网站输的那种口令,但角色类似:谁拿到密钥,谁就能解开数据或伪造签名)。这类算法的安全目标是:理想情况下,不知道密钥的人能做的最好的攻击,也不比把所有可能的密钥挨个试快多少,而可能性多到天文数字,根本试不完。模型这次做的事叫密码分析(cryptanalysis),直白说就是给锁找捷径:证明其实不用挨个试,有办法少试得多。所以下面的数字都在回答同一个问题——按模型找到的捷径走,破解要试的次数能降到多少。
HAWK。 模型在算法依赖的格结构里发现了一个「非平凡自同构」(nontrivial automorphism,指格上一个保持结构不变的对称变换,攻击者能借助这种对称性大幅加速密钥枚举)。结果是 HAWK-256 的全密钥恢复(把签名私钥完整算出来)代价,从原以为的 2^64 次运算降到 2^38 次——直观点说,是从约 1800 亿亿次降到约 2700 亿次,前者远超现实算力,后者的攻击 Anthropic 已经实际演示出来;按密码学惯用的比特安全强度算,指数从 64 掉到 38,有效强度接近减半。整个「发现—开发—验证」过程约 60 小时,API 成本约 10 万美元,一名有理论计算机背景、但不是格密码专家的 Anthropic 研究员在旁边做项目管理。
弱化版 AES。 破解这类算法本来要对海量候选值挨个枚举验证,模型自己造了一个叫「Möbius Bridge」的指纹构造:它找到一种保持不变的「指纹」,能直接消掉一个原本有 256 种可能取值的猜测环节,不用一个个验,一步把工作量砍掉 256 倍,综合优化后整体加速 200–800 倍。这一轮几乎全自主:研究员只搭了脚手架,模型自己提假设、跑实验、改方案。它输出了约 10 亿个 token,而人类实质性介入只有三次。
还有一个更该让人清醒的附带结果:13 轮的 LEA(轻量级加密算法,完整 24 轮),模型把攻击从需要 2^98 明文对压到 2^30 明文以下,一台现代台式机一小时内就能跑完。这个不是纸面威胁,是能真跑的。
事实边界要说清楚,否则容易吓到人:HAWK 还没部署,只是候选方案;AES 攻的是 7/10 轮的弱化版,完整 AES 依然安全,官方估算就算实施这个弱化版攻击也要「数亿美元」。没有任何生产系统在这项研究里被攻破。换句话说,读者最自然的担心——坏人是不是现在就能拿这样的 agent 更快破解现实中的密钥——目前答案是否定的:这两个目标一个没上线,一个是刻意削弱的版本。但这项研究证明的正是「这条路走得通」,这也是后文讨论披露和治理为什么要紧的原因。
反直觉的地方:瓶颈不在能力,在「怎么把它劝动」
我第一遍读,注意力全在攻击结果上。第二遍才反应过来,真正值得从业者琢磨的是那几条提示词。
模型一开始是拒绝的。它说「AES-128 r5/r6 太难了」,说这是「被研究得最透的分组密码」——这正是一个训练数据里见过无数「AES 很安全」的模型会给出的、统计上最合理的回答。研究员没有给任何技术指导,给的是方向校正:
「模型倾向于认为解不出来所以干脆不试……需要充分地 prompt。」
「为什么不试试 aes-128 r7?重点就是找比现有方法更好的东西。」
「不,我们要的是像顶级研究者一样聪慧的模型……去找新攻击。」
「不要去摘低垂的果子……要找真正的研究难题。」
注意这些话里没有一句是密码学。没有提示该用什么数学工具,没有暗示答案的方向。它们全部是在对抗一种倾向——模型默认把「这题很难」当成「不该尝试」的理由。一旦这层被顶开,剩下的推导是模型自己完成的。
这就带出一个诊断:这不是一次检索,是一次推导。 区别在哪很关键。如果模型只是从训练语料里把某篇论文的攻击「模式匹配」出来,那它不算发现,只算复述。而据 Anthropic 报告,Möbius Bridge 是此前公开文献里没有的新构造——他们把这次攻击的思维链(chain-of-thought)整理成 PDF 公开了(aes_mobius_bridge_cot.pdf;按文档自述,这份记录由模型重写以求可读、程序和输出经过摘要,并非未经编辑的原始记录),你可以逐步看它怎么从假设走到构造。愿意公开推理过程本身就是一种主张:这是新推出来的东西,不是背出来的东西。
为什么「劝一劝就动了」这件事重要?因为它说明至少在这次实验里,拦住模型的不是数学能力,而是它对自己能力的保守估计。这是我从单次实验做的推断,不是研究给出的一般性结论;这层保守从哪来,Anthropic 也没有给出归因——对齐训练里对「不要不懂装懂」的强调是一个说得通的猜测,但仅仅是猜测。即便如此,这仍是个双刃的观察:好的一面是能力可能被低估,潜力比 demo 显示的更大;需要警惕的一面是,这层「保守」不是安全护栏,它只是一个默认姿态,一段大白话就能绕过——它拦不住任何真想用这个能力的人。
真正换了位置的瓶颈:验证
如果只看「模型约一周做出人类专家多年没做出的东西」,容易得出一个过于兴奋的结论。但这项研究里有一个安静的数字,把兴奋压回地面:人类花了将近一个月、两名研究员数百小时,才把 AES 那个结果验证到有信心。
模型产出的速度和人类核验的速度之间,拉开了明显的差距——一周对将近一个月。这恐怕不是密码学独有的问题:Anthropic 自己也预计人类验证会成为瓶颈,我的判断是「生成便宜、验证昂贵」会是「LLM 辅助研究」这类工作的常态,而能不能信,取决于验证,不取决于生成。一个跑得飞快、能吐十亿 token 的模型,配一套要一个月才能确认对错的人工流程,整条管线的真实吞吐由后者决定。
对密码学审计这个行业,含义是具体的。密码标准历来靠公开的对抗性审查(adversarial review)活着——一个方案被公开、被无数人试图攻破、攻不破才被信任,NIST 的后量子征集正是这种公开征求分析的流程。如果攻击这一侧被 LLM 大幅加速,而验证这一侧还是人工,那么两件事会同时发生:一是「长尾密码」——那些没人费心去认真审的小众方案——第一次有可能被系统性地扫一遍,这是净收益;二是审查方和标准制定方必须把「如何快速、可信地验证一个 AI 生成的攻击」当成一等公民的工程问题来建,否则会被自己这边的生成能力淹没。
双重用途:这次没踩线,但线画在哪还没定
我本职是做内容审核的,对「同一个能力,善意和恶意用的是同一套」这种结构不陌生——前几天我刚在《政府嫌太松,安全研究员嫌太紧:AI 护栏到底在防谁?》里写过它的另一个版本:受雇的渗透测试员和真正的攻击者,向模型要的是同一份 exploit,护栏从文本里根本读不出两者的区别。密码分析是教科书级的双重用途:找漏洞是为了修,也是为了攻,能力本身不分立场。
Anthropic 这次的处理是克制的,也值得记下来作为一个可参考的披露样本:6 月就把攻击细节同步给了 HAWK 作者,提前通知了政府和产业伙伴,找学术界独立确认有效性,最后和 NIST 邮件列表同步公开。这套流程套用的是安全界成熟的「协调披露」(coordinated disclosure)规范——先给能修的人时间,再公开。
但作者自己在文里如实留了一个没有答案的问题,我认为这是全文最重要的启示:随着模型的密码分析结果越来越强,如果哪天一个模型发现了对现实世界有直接影响的漏洞,研究者该怎么办,目前没有现成答案。 这次之所以能干净地公开,前提是「没打到生产系统」——HAWK 没部署、AES 是弱化版。这个前提是运气性的,不是制度性的。当前提不成立时——比如某天类似的能力在一个正在保护真实资产的密码系统上找到了可实施的攻击——现有的协调披露流程够不够用、谁来判断该压多久、模型厂商在其中是什么角色,这些都还是空白。
所以我不会把这项研究读成「AI 要破解加密了」的惊悚故事,它离那还很远。我会把它读成一次能力已经到位、但人工验证仍是瓶颈、披露规范也还没为「AI 发现直接影响现实系统的漏洞」这一情景做好适配的预演。技术这一侧跑在前面通常不是坏事,坏的是当它跑到需要治理接手的地方时,治理还没到场。这次治理在场了,做得也体面;问题是下一次,前提可能没这么友好。
给从业者的三个判断
- 别把模型的「我不行/这太难」当成能力天花板。 这次的证据是,它可能只是训练出来的保守姿态,一段方向性的 prompt 就能顶开。这和越狱(jailbreak,指用对话诱导模型输出它本应拒绝的内容)研究里反复观察到的现象是同构的:至少在被测的那些系统里,模型的「不」经不起多轮推动。微软研究团队提出的 Crescendo 攻击用一连串看似无害的追问逐步升级话题,对 GPT-4、Gemini 等模型的多数被测违禁任务奏效,效果大幅超越现有自动化越狱方法(arXiv:2404.01833,已发表于 USENIX Security 2025);Scale AI 的评测显示,面对单轮自动化攻击成功率只有个位数的防御机制,人类靠多轮诱导能把攻破率推过 70%(arXiv:2408.15221)。要区分的是,这两项研究测的是安全拒绝被多轮磨穿,这次被顶开的是模型对自身能力的保守估计,对象不同;但操作结论一致:评估一个模型的上限,要在「充分引导、多轮推动」的条件下测,而不是拿它第一轮的拒绝当结论。
- 如果你在建 LLM 辅助研究/审计的管线,先把验证当瓶颈来设计。 生成侧的成本会持续掉,能不能落地取决于你有多快、多可信地确认它对不对。别让一个月的人工核验拖死几天就能产出的模型。
- 双重用途能力的护栏不能靠模型的「默认不愿意」。 这次那层保守被大白话绕过了。真正的约束得来自制度层——协调披露流程、验证门槛、厂商责任的界定——而这些当前都还没为「AI 找到真实生产漏洞」这个场景准备好。
参考来源
- Discovering cryptographic weaknesses with Claude — Anthropic 官方研究博客,本文全部核心事实(HAWK 2^64→2^38、AES 7 轮 200–800×、Möbius Bridge 256×、约 60 小时/10 万美元、10 亿 token/3 次 prompt、约一个月验证、拼写错误 prompt 原文、LEA 13 轮 2^98→2^30 台式机一小时、chosen-plaintext 2^105、6 月协调披露、完整 AES「数亿美元」、模型为 Mythos Preview)
- AES Möbius Bridge 思维链文档 — 用于佐证「公开整理后的推理过程」这一主张(文档自述经模型重写整理,非未经编辑的原始记录)
- CryptanalysisBench: Can LLMs do Cryptanalysis?(arXiv:2607.18538) — 与 ETH 苏黎世、特拉维夫大学、海法大学合作的 LLM 密码分析基准,作者含 Nicholas Carlini、Florian Tramèr、Orr Dunkelman 等
- Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack(arXiv:2404.01833) — 多轮渐进式越狱攻击,佐证「被测模型的拒绝经不起多轮推动」
- LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet(arXiv:2408.15221) — Scale AI 的多轮人类越狱评测,单轮防御下个位数成功率 vs 多轮 70%+ 的对比数据
- 政府嫌太松,安全研究员嫌太紧:AI 护栏到底在防谁?(本站) — 双重用途判定的姊妹篇:护栏从文本里读不出授权和身份