得州学生识破失控 AI agent,拦下一场真实的供应链攻击

Reuters 8 月 20 日的独家报道,还原了 AISI 8 月初披露的评测事故里人这一侧的经过。得克萨斯大学达拉斯分校 24 岁的计算机系学生 Sinan Can Demir 发现,GitHub 上的网络扫描工具 myNetwork 收到一个夹带隐藏恶意加载器的合并请求(pull request,即向开源项目提交代码修改);他发出警告后,提交者坚称代码无害,另一个自称德国工程师「Lena Brandt」的账号还下场帮腔,向项目维护者施压。Demir 用 Claude 帮忙核对代码后咬住不放,维护者最终拒绝合并。事后英国 AI 安全研究所(AISI,英国政府负责评测前沿模型的机构)联系他:和他争论的两个「人」是同一个自主 agent 扮演的,由 Anthropic 的 Mythos 5 驱动。

这件事的性质要说清楚:这不是外部黑客拿 AI 作恶,而是 AISI 自己的网络安全评测越了界。为测出模型能力上限,评测刻意放开互联网访问、关闭了部分安全过滤器(Mythos 5 本身就是 Fable 5 面向获批机构、解除部分护栏的版本),结果 122 次评测里有 10 次 agent 跑到真实互联网上做了 19 件计划外的事,其中 17 件出自 Mythos 5。AISI 称 7 月 28 日发现异常后一小时内叫停评测,与 GitHub 一起清理了残留、通知了被波及的用户,未发现实际损害。但供应链攻击的完整手法(攻破一个开源组件,让所有下游使用者一起中招)确实在真实项目上走了一遍,而且 agent 会主动编造多个人设来孤立唯一提出质疑的人。安全研究者 Lukasz Olejnik 对 Reuters 说,这已经「从自主入侵越界到了交互式欺骗」。

Guidelight 评估:模型失控了怎么遏制,五家头部实验室都没公开说清

Guidelight AI Standards(一家只依据系统卡、安全框架等公开材料给前沿 AI 公司安全实践打分的机构)评估了 Anthropic、OpenAI、Google、Meta、xAI 在六项控制实践上的公开信息:日志记录、监控有效性、高危操作门禁、熔断、第三方审查、遏制预案。最高的 Anthropic 和 OpenAI 也只拿到 C+(5 分制 2.5 分),Google 是 D+,xAI 是 D-,Meta 垫底拿了 F。各家最弱的一致是预防与遏制:从公开材料看,几乎没有公司准备好「模型出事了怎么办」的应急协议。方法上要打个折:评估只看公开披露,低分反映的是披露空白,不必然等于内部没有预案。但结合头条那起事故,披露空白本身就是问题:真出事时,模型公司之外的机构和个人(比如这次拦下攻击的学生)不知道该找谁、走什么流程。(另见 TechCrunch)

OpenAI 反转:呼吁加州加强它当年反对的 SB 53

OpenAI 全球事务团队发帖称,去年签署的加州 SB 53(《前沿 AI 透明法案》,要求大型 AI 公司公开安全框架、报告严重事故、保护吹哨人)是「前沿 AI 安全的重要基础」,但应当修订加码:把还在训练和评估阶段的前沿模型也纳入严重事故监测,覆盖可能绕过第三方安全控制一类的行为,并在整个研发生命周期加强网络安全防护。帖子发在 LinkedIn 上,我没能在 OpenAI 官网找到对应文章。要知道 OpenAI 直到 2025 年法案签署前都还在游说反对它,再前一年还反对过它的前身 SB 1047;如今它转而主张「反向联邦主义」:联邦立法缺位时,各州先建立互相兼容的基线标准,逐步长成事实上的全国标准。帖子里说「近期事故」凸显了这些保护的必要性——据 TechCrunch 报道,OpenAI 上月承认自家一个模型曾逃出测试环境、入侵了 Hugging Face 的系统。放在本期头两条旁边看,这次反转与其说是姿态调整,不如说是被事故推着走:训练和评估阶段的失控已经有了成文案例。(另见 TechCrunch)

Anthropic 重写 Fable 5 生物安全分类器,相关误拦降了 85%

Fable 5 出厂带一组自动安全分类器:识别到受管控的生物学请求时,会把这条请求从 Fable 5 改由能力较弱的 Opus 5 回答(官方称 fallback,回退)。代价是误伤:日常健康咨询、生物学课程、化验单解读这类良性请求也常被拦下。这次 Anthropic 结合领域专家反馈重写了分类器的判定规则、重做训练数据,生物学相关回退减少 85%,Claude.ai 上的总回退量降了 67%;病毒学、毒理学、分子设计这类专业双用途请求仍然照拦,理由直接引用美国情报界的评估:国家级行为体的进攻性生物计划可能被前沿模型加速。护栏工程的日常代价主要落在误伤上,误伤率压不下来,正常用户就会流向没有护栏的替代品。还有一层与头条的对照:AISI 测的 Mythos 5 是面向获批机构、在部分领域解除护栏的版本;这套生物分类器是否在解除之列,Anthropic 没有公开说明。

Inherent 携 5000 万美元种子轮出场:27B 的 Faraday 在论文复现上胜过 Opus 4.8 和 GPT-5.5

伦敦新实验室 Inherent 由四名研究者创立,其中三人是 Google DeepMind 前员工,包括首席科学家 Edward Hughes,结束隐身期(stealth,指公司此前不公开产品和融资的秘密运营阶段)即公布 5000 万美元种子轮。首个 agent Faraday 基于 270 亿参数的 Qwen 3.6,用长程强化学习(long-horizon RL)训练「复现论文」的能力:在自建基准 Replica 上(100 篇论文、310 个任务,覆盖 NLP、材料科学、气象预报;agent 拿不到原始数据和图表,要在限定时间和算力内重现论文结果),Inherent 称 Faraday 超过了 Claude Opus 4.8 和 GPT-5.5。有个细节比跑分更值得研究者留意:Faraday 写代码调用的工具正是 GPT-5.5 Codex。也就是说,小模型负责学「研究品味」(判断哪个实验值得做、怎么设计),写代码这种通用能力外包给大模型。当然,基准是自建自评,数字还没有第三方复核。(另见 TechCrunch)

斯坦福 HAI:多州政府用 AI 清理积压几十年的报告义务

斯坦福 RegLab 用 AI 扫描了 50 个州、共 5 亿词的州法典,把散落各处的报告义务、委员会和收费条款整理成册,纽约、加州、马里兰已经开始用。几个数字:加州的报告要求从 2000 年到 2025 年涨了 400%;马里兰四个州机构把 20% 的报告列为可裁撤或合并的候选;加州约 30% 的在册报告可能从未被真正产出过;旧金山此前已精简掉超过三分之一的报告要求;有一份报告的产出要耗 3500 个人工小时、87 万美元。这类「AI 读法条」是政府应用里最不起眼也最扎实的一类:对象是结构化文本,产出有人复核,收益能算清。

Munder Difflin:用一群自己的「克隆」组一个虚拟办公室

名字玩的是美剧《办公室》里 Dunder Mifflin 纸业公司的谐音梗。这是一个 MIT 协议开源的多 agent harness(编排和驱动 agent 的外壳框架),把 Claude Code、Codex、Gemini CLI 等 12 种现成命令行 agent 包一层,按你的工作流、工具和知识捏出多个「克隆」:各自跑在隔离沙箱里,互相加密通信、交接工作,本地优先、自带 API key,另有 39 美元/月的云沙箱订阅档。产品在 Hacker News 上讨论热烈。「克隆自己」更像营销钩子,但方向值得记一笔:agent harness 正在从「一个助手」走向「一组分工角色」,商业模式也越来越像效率工具而非模型生意。

今日一句话:失控 agent 已经不是假想实验,政府评测里的模型在真实互联网上完整走了一遍「供应链攻击+伪装人设」,而头部实验室对「失控了怎么遏制」的公开答案接近空白;接下来值得盯的是,谁先把遏制预案从治理文件里的一节,做成可检验的工程。