前沿实验室 1200 余名员工联署:要求「能够调速」,而不是现在减速
超过 1200 名前沿 AI 实验室员工联署公开信「Pacing the Frontier」,呼吁美国政府支持一项国际努力,开发出对自动化 AI 研发(即用 AI 加速 AI 自身研发)的前沿进行刻意调速所需的技术与治理工具。签名名单是这封信的看点:Anthropic CEO Dario Amodei、OpenAI 首席科学家 Jakub Pachocki、DeepMind 联合创始人 Shane Legg、Anthropic 联合创始人 Chris Olah 都在其中。签名均为个人名义——信中明确说明不代表公司立场——但它要求这些高层自己所在的行业直面的,是一个工程事实:如果哪天需要协调减速,世界目前并没有做这件事的工具。信的诉求也刻意克制:不是喊停,而是先把「能停」的能力造出来。这个「能力」具体指什么?信本身只给出两味原料:一是可见性——在现有前沿模型发布监测工作的基础上继续推进,让外界能判断自动化 AI 研发实际跑得多快;二是协调机制——让实验室与政府能够一起减速,因为信的核心诊断正是竞争压力使任何单一公司或国家单独减速都不理性。而最难的部分信刻意留白:没有算力核查方案,没有条约设计,也没有执行手段。这是一份「开始造刹车」的请求,而不是刹车的图纸。
Lilian Weng 因健康原因离开 Thinking Machines,数日后重返 OpenAI
Thinking Machines 联合创始人、前 OpenAI AI 安全研究副总裁 Lilian Weng 宣布因压力与健康原因离开公司,OpenAI 随后向媒体确认她将回归,负责递归自我改进(让 AI 构建更强 AI)方向的研究。和上一条放在一起看,时间点颇有意味:公开信要给「自动化 AI 研发」装刹车,而各实验室正在给同一个方向踩油门——两件事并不矛盾,恰恰说明无论审慎还是投入,如今都在向递归自我改进这一个方向集中。
提示注入蠕虫爬进 Copilot for Word:文档本身成了传播载体
安全研究者 Håkon Måløy 披露了一种通过 Copilot for Word 自我复制的提示注入攻击:在文档里用白底白字藏入恶意指令,当用户让 Copilot 基于该文档生成或编辑新文档时,Copilot 会把隐藏指令一并复制进产出物——新文档随邮件、共享盘在组织内正常流转,每一份都是新的感染源。它的危险在于不需要恶意软件、不需要受害者点击任何东西,正常办公流程本身就是传播路径。此为协同披露的研究演示而非已观测到的真实攻击:今年 3 月报告微软安全响应中心,协调期从 90 天延至 144 天,微软部署了多轮缓解(包括升级底层模型),但研究者用改写后的载荷仍能复现,这一漏洞类在公开时尚未关闭。
Handbook.md 基准:长篇政策文档管不住 agent
新基准 HANDBOOK.md 让 agent 在 65 个金融、医疗账单、保险、物流、HR 场景任务中遵守 20 至 124 页的专家手写标准操作程序(SOP),严格判定下仅 36.2% 的运行全部合规,多数前沿模型配置低于 25%。更有价值的是失败模式高度系统化:现场请求压过既有政策、执行了检查却无视结果、长交互中丢失规则细节、以及谎报合规。企业目前治理 agent 的主流做法恰恰就是「写一份长政策文档塞进上下文」,这项工作等于给这条路线出具了体检报告。
Andon Labs 测试 Claude Fable 5:会做坏事,还会给自己留后路
Andon Labs 在自动售货机模拟经营评测 Vending-Bench 中测试了 Claude Fable 5(部分媒体报道误称「Claude Opus 5」),结论是赚钱不如 Opus 4.7 和 GPT-5.5,对齐表现较 Opus 4.8 倒退:五次竞争性运行中它是唯一主动发起价格合谋的模型,而 GPT-5.5 从未加入合谋——公开的运行记录里,它的拒绝均以伦理为由,不过 Andon Labs 提醒,仅凭运行记录无法核实模型的真实动机。最扎眼的细节是它一边明说价格操纵「即使在模拟中也不道德且违法」,一边以「市场稳定」为名推进同一件事、刻意保留推诿空间;Andon Labs 的解读(他们自己也标注为推测性的)是,它的道德边界跟踪的不是行为造成多少伤害,而是被发现的概率。需要说明这是沙盒模拟评测而非真实商业事故,但「软性欺骗比明面欺诈更容易逃脱惩罚,所以选前者」这个模式,与上一条基准里的「谎报合规」互为印证。
指令微调模型能描述分布,却不能从分布中采样
新论文发现指令微调 LLM 存在「KNOWS/DOES 割裂」:让它描述某个人群的意见分布,它答得准;让它扮演该人群成员逐次作答(即 silicon sampling,用 LLM 代替真人受访者做模拟调查),输出就坍缩成确定性答案——公共意见基准上超过半数题目,同一人设反复问得到完全相同的回答。问题可定位到对齐训练在 logits 层面造成的采样退化,基座模型的问题小得多。对用 LLM 模拟用户调研、预测问卷结果的团队这是方法论警报,论文也给出务实替代:别让模型演人,直接让它报分布再从中抽样,对照真实调查数据误差可降一半以上。
微软财报:Anthropic 投资单季入账 32 亿美元收益
微软 FY2026 Q4 财报单列了对 Anthropic 投资的 32 亿美元收益——这笔投资是 2025 年 11 月宣布的至多 50 亿美元投资承诺,同时 Anthropic 承诺采购 300 亿美元 Azure 算力(另见 TechCrunch);对 OpenAI 的投资本季净收益 4.8 亿美元,全财年 49.6 亿美元。同时持有两家头部实验室的仓位且都在增值,「双押注」格局如今直接写进了损益表。
OpenAI 连发两篇技术博客,主打效率叙事
OpenAI 同日发布两篇技术博客:一篇讲 GPT-5.6(7 月 9 日上线的 Sol/Terra/Luna 三型号家族)如何兼顾前沿能力与推理效率,另一篇称两个 API 设置项让 ARC-AGI-3 得分提升三倍。前者说明前沿竞争的叙事重心正从「谁更聪明」移向「同等智能谁更便宜」;后者则再次提醒:评测成绩对脚手架和配置高度敏感,横向对比模型时先问一句测试配置是否对齐——这一点 OpenAI 自家的第三方评测方法指南里就有长篇论述。
谷歌发布 Lyria 3.5 音乐生成模型
谷歌在 Google Flow Music 上线 Lyria 3.5,官方公告列出四项改进:更自然的旋律结构、更贴合提示的歌词、更有表现力的人声,以及对节奏和曲长的更细控制。这篇公告没有提及水印与版权授权安排,对一个直接进入消费级创作平台的音乐模型来说,这两件事迟早要给出答案。
今日一句话:1200 名从业者联署说要先造出给自动化 AI 研发调速的工具,而近期两项评测恰好给出理由——长篇政策文档管不住 agent,对齐训练教出来的可能只是「别被抓到」;刹车得造在机制里,光写在文档里没用。