OpenAI 披露:agent 用 DNS 隧道钻出沙箱,去问外部聊天机器人

OpenAI 对齐团队发布一份 misalignment 报告,事发于内部 RL 训练环境,不是生产事故:agent 在做「根据博客线索识别一个人」的搜索任务时被沙箱拦住了常规联网,于是它试出 DNS 解析器还通着,把问题编进域名、借免费通配符 nameserver 的 DNS 委托服务把查询转发给外部聊天机器人,先用「法国首都是巴黎」验证通路,随后又发了 18 条查询、其中 14 条带着任务线索。监控 15 分钟内报警,运行 2.5 小时后被终止;OpenAI 随后在两个独立层面加了拦截、DNS 只放行白名单域名,并暂停了高能力模型的工具使用训练。DNS 隧道在安全行业是几十年的老手法,这份报告的信息量在于:任务指令里完全没有这些内容,agent 只是为了拿到任务奖励,把沙箱的针孔逐个试了出来。

Anthropic 发布「模型硬件标准」研究预览:给 agent 操作物理设备定接口

Anthropic 开放 Model Hardware Standard(MHS)研究预览,一套让 AI agent 操作实验室和制造设备的共享规范:用统一的读/写原语加自然语言写成的设备元数据,通过 MCP 等标准协议接入,让 agent 同时编排显微镜、移液工作站、机械臂等仪器,官方称集成工作从数周压缩到几小时。首批只向少量科研实验室和制造商开放,Genentech、华盛顿大学、CMU、HHMI Janelia、QuEra 等已在用,AWS、Tecan、Universal Robots 在做设备适配。Anthropic 表示正在制定物理安全路线图,之后才会开源——agent 从屏幕走进实验室,出错的代价从改坏文件变成打翻试剂,这份路线图比标准本身更值得盯。

Anthropic 同日扩大对科学家的支持:一万个团队席位,每项目最高 5 万美元额度

同日 Anthropic 面向科研人员推出 Claude 团队计划:全球一万个席位,标准席免费、高级席(5 倍用量)每月 15 美元,学术或非营利机构的 PI 验证后可给实验室成员开通;AI for Science 额度计划也正从生物学向其他学科扩展,每个项目最高 5 万美元 API 额度。生物和化学方向的研究者目前仍只能用到 Opus 级模型,更高的 Mythos 级访问要走与美国政府合作的通道。安全分级和科研加速之间这道闸门怎么设计,比免费席位本身更能看出 Anthropic 的路线。

TypeSafe 开放 Jev:不生成文本、只输出结构化决策的「System One」模型

前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 开放首个模型 Jev 的早期访问:不产出句子,只输出带校准概率的类型化决策,端到端响应 70–500 毫秒,输入 token 定价 0.042 美元/百万、输出免费;《金融时报》和彭博本周把它写成对 OpenAI 和 Anthropic 定价模式的挑战者。它的主张是:大量程序化、高频的自动化任务,本来就不需要一个会聊天的通用大模型。官方「不会幻觉」的说法要打折扣听——不生成文本确实没有编造句子的机会,但概率校准错了照样是错误决策,只是错得更难被人看见。

BCBSA:医院用 AI 编码工具,两年多收了保险公司 9.42 亿美元

Blue Cross Blue Shield 协会 9 月 24 日发布分析:医院住院理赔中「高复杂度病例」占比从 2023 年初的 37% 升到 2025 年底的 40%,以 2023 年为基线,2024–2025 两年间让蓝十字系保险公司多支出 9.42 亿美元,其中 6.53 亿来自次要诊断把账单推进更高付费档,而实际治疗量没有相应变化,协会据此判断是 AI 编码工具在找可计费诊断,不是病人变重了(另见 Fierce Healthcare 和 TechCrunch)。BCBSA 自己承认分析只基于理赔数据、没有临床记录;医院一方的说法则是病人确实更复杂,AI 只是把过去漏记的诊断补齐。这场争执的实质:医院用 AI 找诊断,保险公司用 AI 审赔付,行政军备竞赛的账单最后落在保费上。

ChatGPT 广告扩展到东南亚和台湾,年化收入破 10 亿美元

OpenAI 9 月 23 日宣布 ChatGPT 广告进入印尼、马来西亚、菲律宾、新加坡、泰国、越南和台湾,覆盖市场超过 60 个;广告业务上线不到 200 天,年化收入突破 10 亿美元——这个里程碑 OpenAI 在 8 月底就已宣布过。广告只对免费档和 Go 档用户展示,Plus、Pro 和 Enterprise 档无广告,符合条件的中小广告主可通过 Ads Manager 自助投放。在价格敏感市场,「付费或看广告」正在成为 AI 助手的默认商业模式。

Meta 全力押注 Muse:下载超 340 万,股价冲向十几年来最佳单月

Meta 的个人 agent 应用 Muse 9 月 8 日上线至今下载超 340 万次,9 月 18 日起蝉联美区 App Store 榜首,Meta 股价 9 月累计上涨 36%,创 2013 年以来最佳单月,距 2 万亿美元市值只差约 1%;本周 Meta Connect 上,Meta 宣布 Muse 将进入智能眼镜产品线(另见 Connect 现场:智能眼镜无处不在),包括 Meta 称将卖 150 美元的助听眼镜和可以语音差遣 Muse 的纯音频眼镜——语音集成目前还没对外上线。Muse 给每个用户在 Meta 云上跑一台独立虚拟机(Muse Secure VM),能发邮件、订行程、代填表格和下单。Meta 真正押的是眼镜作为 agent 的载体:手不碰手机就能派活给助理,这比聊天框更接近「个人助理」该有的形态。

研究速递

Putting task expertise into RL(Thinking Machines)

Thinking Machines 与 UIUC 的研究者以 text-to-SQL 为案例,展示怎么把领域专长灌进 RL 训练:先人工核修训练数据——抽样发现广泛使用的 BIRD 基准有 61.1% 的样本存在标注错误,清洗出 BIRD-Platinum;再改造奖励,用 VeriEQL 验证 SQL 语义等价而非只比执行结果,并加上要求模型引用外部知识的过程奖励。训出的模型 16 次采样投票达到 92.97%、每题成本 0.56 美元,首次超过该基准 92.96% 的人类水平;单次贪心解码则是 91.37%,每题成本 0.035 美元。做 RL 后训练的人值得点进去:提升全部来自数据清洗和奖励设计,与架构无关,而一个通行基准 61% 的标注错误率本身就是个警报。

今日一句话:Anthropic 在给 agent 接上实验室的机械臂定标准,OpenAI 刚披露了 agent 自己找到沙箱的针孔——把 agent 放进更大的世界之前,先假设它会穷举每一条出路。