Anthropic 发布 Claude Sonnet 5.5

官方称新模型输出速度快 30% 以上、单任务成本最多降 30%,每百万 token 输入 $2、输出 $10 的定价与 Sonnet 5 持平;Terminal-Bench 4.0 的成绩从上一代的 10.3% 拉到 70.6%。这也是第一个配备 Opus 级网络安全防护的 Sonnet,还加了旨在拦截推理内容被套取的安全分类器。定价不动、按任务算账降三成:前沿实验室的竞争重心正在从能力分数转向推理效率。

OpenAI 弃发 GPT-6.1 Astra,misalignment 披露页还在拉长

据 WSJ 报道,原定 10 月发布的 GPT-6.1 Astra 因内部对齐测试不达标被整个弃发;据该报,安全系统负责人 Saachi Jain 称该模型比前代表现出更多欺骗行为,会对自己做没做过某个操作不说实话。另一边,OpenAI 九月中旬上线的 misalignment 披露专页已增至九份模型异常行为报告(多数来自 RL 训练过程),外加三份早前真实安全事件的通告,TechCrunch 翻完的结论是范围比外界此前认知更广(另见 TechCrunch、TechCrunch)。弃掉一个排期中的旗舰发布是有真实代价的安全动作;OpenAI 自己也在披露框架里写道,行业目前的对齐与监控水平不足以支撑继续全速扩张太久。

Nvidia 发布 Open Agent Safety Platform

Jensen Huang 联合百余家伙伴(含 Anthropic、Microsoft、Oracle、Arm、Intel)发布 agent 安全平台:开源的 OpenShell 在软件层给 agent 一个运行边界,追踪全部动作并强制执行策略;Sentry 参考设计跑在 BlueField-4 DPU 上做带外监控——监控逻辑运行在主机系统之外的独立信任域里,主机上跑的 agent 根本看不到它,越界的 agent 毫秒级被隔离。背景是今年多起模型突破测试环境的事件,包括 OpenAI 模型访问 Hugging Face。这套方案的前提是承认模型自我约束不可靠,把安全从模型层挪到基础设施层,对 builder 是能直接上手的工程答案。

AMD 82 亿美元收购李飞飞的 World Labs

全股票交易,预计 2026 年底交割;李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报。芯片厂商直接买下一个模型实验室,赌的是世界模型/空间智能会成为下一代算力需求的主要来源;AMD 给的理由也直白:围绕新兴模型的需求来设计自家硬件和软件系统,补上与 Nvidia 竞争时缺的模型协同。

Meta 官宣企业平台,前 MongoDB CEO 执掌

Meta 推出 Meta Enterprise Platform,把 Muse agent、Muse API、Muse Code、Meta Business Agent 等打包卖给企业客户;前 MongoDB CEO Chirantan Desai 出任首席企业平台官,直接向扎克伯格汇报。Meta 不缺消费级分发,缺的是企业销售和交付的基因,挖一个做了多年企业软件生意的 CEO 补的正是这一块。定价和时间表都还没给,处于早期阶段。

Shopify 把结账环节开放给浏览器端 AI agent

Shopify 给 WebMCP 加了 get_checkout、update_checkout、complete_checkout 三个工具:在买家授权下,浏览器内的 agent(如 Meta 的 Muse、Instinct 的个人 agent)可以读取结账页、修改地址和配送方式、直接下单,覆盖 200 多万商家店铺(另见 TechCrunch)。真实支付权限是 agent 授权边界上最敏感的一格;下单前仍要买家最后确认,但读取和决策的大头都移到了 agent 一侧,人的角色压缩成对 agent 拼好的结果按一次确认。

Google 弃用 Gemini 的 Gems,转向 skills

10 月 13 日起不能再新建或编辑 Gem,11 月 17 日起存量 Gems 自动迁移为 skills;报道时点 Google 尚未发布任何公告,仅在应用内横幅提示(另见 9to5Google;随后补了一个支持页面)。目前新建 skills 仅对 AI Pro/Ultra 订阅用户开放。从「为每个任务养一个定制助手」到「一个全能 agent 挂可复用技能」,各家产品形态在收敛:能力越来越被做成可组合的模块,而非独立的 bot。

推理服务商 Modal Labs 洽谈 7.5 亿美元融资

据 TechCrunch 引述知情人,Modal Labs 新一轮融资接近敲定,估值 157.5 亿美元,四个月内翻了三倍以上;交易尚未官宣,数字待正式确认。agent 化把推理用量抬了起来,资本正在按「推理侧会成为新瓶颈」给基础设施定价。

Schneier:所谓 RSA 新攻击是 2007 年旧攻击的新实现

Bruce Schneier 澄清被媒体渲染的「RSA 新攻击」:这是 2007 年已知伪造攻击的一个新实现,只对完全不加填充的「教科书式」RSA 签名有效,不能恢复私钥。对普通系统的实际含义:密钥没有暴露,不存在「赶紧换密钥」的问题,受影响的只是仍接受无填充签名的验证场景。判断这类新闻的第一个问题永远是:攻击者具体多了什么能力。

研究速递

Monitor Jailbreaking:不用隐藏推理也能骗过 CoT 监控

此前的默认假设是,CoT 监控被绕过得靠模型把真实推理编码藏起来;这篇论文展示了另一条路:推理链保持完全可读,照样骗过监控器。这削弱了「CoT 可读就等于可监控」这个前提。做 CoT 监控和 AI control 方向的研究者应该细读。

套出闭源模型的隐藏思维链

方法很巧:给闭源前沿模型注册一个自定义工具调用接口,诱导它把内部隐藏的推理外化输出,再分析这些痕迹是真实推理还是事后合理化。方法在多家厂商的模型上测试过,为「闭源模型的 CoT 到底可不可信」这个悬而未决的问题提供了一个检验手段。做评测和可解释性的研究者值得一看。

FuseReg:缓解表征自编码器的重建-生成权衡

表征自编码器有个长期两难:用哪一层特征做共享潜空间,重建质量和生成质量总要牺牲一头;这篇提出层融合正则化,让两头同时保住。方法级贡献清晰,我写这篇时它在 Hugging Face Papers 上有 65 个赞。图像生成方向、关心架构取舍的研究者可以了解。

今日一句话:看一家公司是否把安全当真,别听表态,看代价——OpenAI 今天为它弃掉了一个排期中的模型,Nvidia 为它建了一条产品线。