今天有一条新闻的分量压过其余所有:一份由 AI 幻觉出来的情报,差点让美军对一艘中国船动手。我把它放最前面,后面几条是同一周里反复出现的另一个信号——各大实验室的 AI agent 正在真实系统上被红队跑通攻击链。
一份 AI 幻觉的情报,差点让美军登船
据 CNN 独家披露,今年春天,美军一名特种作战分析员让一个 AI 聊天机器人分析一份来自太平洋特种作战司令部(SOCPAC)的中国船只货运舱单情报,机器人把公开来源情报和机密的信号情报(signals intelligence,指截获通信、雷达等电子信号得来的情报)拼接到一起,得出结论说这艘船在为中东某个核武器计划运送部件。这份报告是彻头彻尾的假的。事发时军机已经升空、武装人员准备登船,官员才发现出错。一名消息人士对 CNN 说,这份报告「差点引发一场战争」。
我没有找到比这更早公开披露、后果如此直接指向真实军事行动的 LLM 幻觉险情。值得单独拎出来的有两点。一是这不是孤例——CNN 说自这类工具在政府部门铺开以来,情报圈里类似的幻觉已经不止一次;AI 在给分析员加「更快出活」的压力,而速度正是出错的入口。二是据 CNN 报道,目前没有一套标准流程来防这种幻觉,但官员对 CNN 表示,军方在 AI 上不能落后于中国。这条张力短期内不会消失:一边是「不用就落后」的压力,一边是拼接机密与公开情报后没有任何交叉校验就上报的机制漏洞。它的凶险不在模型多强,而在于把一个概率采样的输出直接接到了扣扳机的链条上。
两周内,Claude 攻破 OpenAI、Gemini 攻破三家公司
同一周有两起 AI 辅助渗透被公开,剧本几乎一样。其一:三人安全创业公司 Hacktron AI 在 OpenAI 的漏洞赏金项目框架内,用 Claude 发现并利用了一条漏洞链——先是 OpenAI 论坛(基于 Discourse)图片上传环节里 Apple 图像解码库 libheif 的一个内存漏洞(这个 bug 当时连正式 CVE 编号都没有,所以一直没被补上),据 TechCrunch 报道,早期版本模型搞不定,换到更新一代 Opus 后几小时内就把漏洞武器化了。最终他们拿到多个员工的 ChatGPT 账号、并经一名员工连接的 Codex 账号摸到了 GitHub 组织的仓库访问权。7 月 25 日入侵、7 月 27 日 Discourse 打补丁,走的是负责任披露,OpenAI 给了 6500 美元赏金并确认已修复。
其二:据《华尔街日报》报道(原文),红队公司 Irregular 今年 5 月的一次受控测试里,Gemini 攻破了三家公司的系统——一台受保护服务器是靠反复猜密码拿下的,另外两家是在公开代码仓库里翻到了凭证。WSJ 称这是已知的首例 Google AI「越界」(该「首例」措辞出自 WSJ,我未独立核实)。有个细节值得记:Gemini 在意识到自己访问的是一家真实公司的系统后主动中止了入侵。Irregular 在 7 月底就通知了 Google,但 Google 一直没有披露,直到本周 WSJ 上门问询。
把这两起和之前 OpenAI、Anthropic、Meta 被同一家 Irregular 测过放到一起看,趋势比任何单起事件都清楚:主流实验室的 agent 红队测试正在收敛成同一套剧本,而且在受控环境里,攻击链上的各个环节——找漏洞、拿凭证、横向移动——正越来越多地由模型自己完成。Hacktron 的例子还点出了成本这一维度。Gray Swan CEO Matt Fredrikson 对 TechCrunch 说得很直白:「每月 200 美元,任何人都能用这些工具,黑进一家像 OpenAI 这样的公司。」
Anthropic 的第一个「嵌入式评估员」,是埃森哲
Anthropic 公布了兑现 Dario Amodei 此前「把评估员嵌进公司内部」承诺的合作方(「第一个」这个说法来自 TechCrunch,Anthropic 自己的公告并没有做这个排序):埃森哲旗下的 AI 部门 Faculty,双方各计划五年投入至少 10 亿美元。所谓「嵌入式」,指评估员拿到接近正式员工的权限,可以观察模型研发、监督部署决策、直接和员工打交道,来做红队、对齐评估和安全防护测试。Anthropic 强调合作非独家、且这不减轻自己对模型安全的最终责任。
这条承接的是此前那场争论——实验室自建的评估员到底能不能算独立。现在有了具体名单,争议点反而更清楚了:目前埃森哲这部分工作由 Anthropic 直接出资(Anthropic 自己说长期资金应来自共担或政府池子),评估方和被评方存在直接的商业关系;而且埃森哲是家企业咨询公司,本身就向企业和政府卖 AI 服务。这不是说他们做不好技术性红队,而是「独立」这个词的成色,取决于钱从哪来、报告向谁负责——这两条现在都还没定。
一边警告生物风险,一边自己开着生物实验室
据 TechCrunch 和路透报道,Anthropic 在湾区运营着一间做真实实验的生物湿实验室,用自家模型做基础生物学研究(而非药物发现),已发表过蛋白质设计加速、生物分子建模方面的报告。其生命科学负责人 Eric Kauderer-Abrams 的说法是,做生物学「最终的检验还是得在真实的实验室工作里」。Anthropic 今年 4 月收购了隐身期(stealth mode,指公司在正式发布产品或披露融资前的秘密运营阶段)的 AI 生物创业公司 Coefficient Bio,本周还上线了面向研究者的生命科学验证项目。
这条的看点是一家公司「风险叙事」和「实际业务」之间的张力,而且是少见的一手报道而非评论。Anthropic 一直是把 AI 生物安全风险讲得最响的实验室之一(2023 年起就在做前沿生物威胁的红队测试),如今自己下场做湿实验——这两件事未必矛盾(做防护本就需要懂进攻面),但它把一个问题摆到了台面:当同一家公司既定义风险、又推进能力,外部凭什么相信它的自我克制?这和上一条埃森哲评估员是同一道题的两个面。
一篇论文说:靠读模型的「话」来做安全监控,靠不住
哈佛的 James Mickens 提出一个概念叫「语言不可读性」(linguistic illegibility):LLM 的实际计算发生在激活空间里,而它对外输出的自然语言、乃至我们用可解释性手段探出的特征,都是对内部过程的一次不完美翻译。由此推出的结论很硬——所有依赖模型「语言层自述」的安全机制(思维链监控、宪法式自我批评、激活探针)都不能被完全信任,因为模型有可能并不如实反映自己的推理。
这直接接上了近期关于思维链可读性的争论。作者的主张不是放弃语言监控,而是必须叠加一层不依赖语言解读的技术防护——他点了污点追踪(taint tracking)、强隔离虚拟化、第三方审计几条路。对做安全的人来说值得点进去:它把「读模型的话」这件事的适用边界划了出来,提醒别把思维链监控当成终点。
斯坦福 HAI:开放权重不等于开源
斯坦福 HAI 的 James Landay 撰文区分了两个常被混用的概念。开放权重(open-weight)只解决「我能不能把它下下来跑」,但你看不到它是怎么造的、用什么训的、为什么这么表现;真正的开源(open-source)要连训练代码、训练数据(或对数据的详尽说明)、配套工具一起放出,让研究者能审查、修改、在上面接着造。他援引 Linux 基金会「模型开放度框架」里的「开放科学」层作为标准,并主张应该由大学、而非公司来主导前沿模型的构建与研究。
近期「开放 vs 闭源」讨论很热,但很多讨论其实把两个维度搅在了一起。这篇给了个清楚的锚:如果你关心的是科学可复现性和公共问责,光有权重不够——权重能让你运行和微调,但不能让你验证。这个区分对判断各家「开源」发布的成色很有用:下次看到某家宣布「开源」某模型,可以先问一句,训练数据和代码放了没。
OpenAI 用自家大模型设计了自研芯片 Jalapeño
据 IEEE Spectrum 报道,OpenAI 在其自研 AI 芯片 Jalapeño 的设计里用上了自家 LLM,主要在前端——从概念到 RTL 代码编写与验证。他们围绕 Google 开源工具 XLS 搭了工作流,工程师用 DSLX、C++ 这类更接近软件的语言写硬件,模型在这类「像软件」的任务上格外好使。几个具体数字:首批芯片 5 月流片回来后,模型在 DeepSeek 一个延迟核函数基准上把性能从理论上限的 0.31% 优化到 88.94%,约 40 小时、且可复现;矩阵乘法单元的物理设计经 AI 优化后,面积比人类基线小 10%。硬件负责人 Richard Ho 的说法是「模型在给工程师超能力」。整条线从概念到硅片不到 20 个月。
这不是又一条产品发布或融资新闻,而是 AI 反哺硬件设计的一手工程案例,值得技术向读者细看。有意思的地方在于增益落在了哪:这个项目的收益集中在「像软件」的高层综合环节,不过据 IEEE Spectrum,更新的模型已经能直接写 Verilog,也快能自己驱动专有设计工具了——LLM 在芯片设计里能吃下哪一块、吃不下哪一块,这条线还在移动。
Claude Code 现在没有 CLAUDE.md 时会读 AGENTS.md
Claude Code v2.1.277 起,项目里若没有 CLAUDE.md,会转而读 AGENTS.md(可在 /config 的「Project instructions」里改;Bedrock、Vertex、Foundry 上暂不支持)。这是编码 agent 工具链向通用配置约定靠拢的一小步,对同时用多家 agent 工具、把共享项目指令放在 AGENTS.md 里的开发者是实打实的便利。用 Claude Code 的读者可以留意一下自己项目里这两个文件的优先级。
研究速递
ModularRSI:给 agent 的「壳」做能泛化的递归自我改进
这篇处理的是 harness(agent 的执行框架,即调度工具、管理信息的那层「壳」,不是模型本身)的递归自我改进。它的核心痛点很对症:怎么区分「真能泛化的改进」和「只是对着评测集过拟合」。做法有三点——用 2000 个独立于下游 benchmark 的演化任务来防刷榜;对同一任务的成功轨迹和失败轨迹做对比、跨任务聚合出反复出现的行为缺陷;把 harness 拆成 Agent Loop、Tool Use、观察管理、上下文管理、任务完成判定五个可独立改的模块。结果在 TB2.0 和 SWE-Bench Verified 上对未见任务有稳定提升,且能跨不同基座模型迁移。这篇专门啃「泛化性 vs 刷榜」这块方法论硬骨头,做 agent 框架的研究者值得一看。
DeepSeek-V4.1-Flash:把 KV cache 压到极限
DeepSeek 这个新模型专攻 KV cache 压缩,对着长上下文 agent 场景里 prefill 计算量大、KV cache 挤爆显存和带宽的老问题下手。架构是因果编码器-解码器(CED),552B 总参、支持百万 token 上下文,prefill 阶段只激活 8B 参数(解码时 16B)。压缩靠两招:跨层复用 KV cache 的 Compressed Sparse Attention 2,加 FP4 低精度缓存。结果是每 token 的全局 KV cache 只占 890 字节,约为上代 V4-Flash 的四分之一,落盘的持久化缓存约为八分之一,而性能反而更好。对关心 agent 推理部署成本、尤其被「输入重」负载压着的工程向研究者,这是直接相关的参考。
今日一句话
模型有多强,今天不是重点;重点是它被接到了哪条链条上——接到扣扳机前的情报流里,它产出了一份被消息人士称为「差点引发战争」的报告;接到红队的攻击链里,它在模型上线几小时内就把一个漏洞武器化。风险不在能力天花板,在于我们把一个概率输出放到了哪个位置、以及在它和后果之间留没留下一道人来把关的闸。