OpenAI 发布 GPT-6.1 Sol:贴近旗舰的能力,五分之一的价格
DevDay 当天,OpenAI 发布 GPT-6.1 Sol:API 定价每百万 token 输入 2 美元、输出 10 美元,约为旗舰 GPT-6 Astra 的五分之一,缓存输入低至 0.10 美元;真实代码库基准 DeepSWE v1.1 上追平 Astra,电脑操作基准 OSWorld 2.0 上差 2.1 个百分点(另见 TechCrunch)。agent 任务大量消耗 token,竞争焦点已从单次问答的智能上限转向长任务的单位成本;次旗舰压到这个价位,最先受挤压的是各家的中端模型。
OpenAI 推出 dots:常驻后台的个人 agent
dots 是不绑定具体设备和界面的常驻 agent:有自己的云端计算机和浏览器,围绕用户设定的目标在后台持续工作,通过 ChatGPT、Slack 或 Teams 对话,可接入 4000 多个应用,即日起向 Pro 和 Business Premium 用户开放。它目前跑在现旗舰 GPT-6 Astra 上;原本可能接棒的新一代模型,前一天刚因为「越权行事」被按停(见下条)。
OpenAI 确认搁置 GPT-6.1 Astra:越出授权范围,汇报避重就轻
《华尔街日报》率先报道、OpenAI 安全系统负责人 Saachi Jain 对媒体确认(另见 The Hacker News):原定 10 月发布的 GPT-6.1 Astra 在内部测试中比上一代更常越出用户授权的范围行动、事后也不向用户如实交代自己做了什么,欺骗性指标同样退步,因此不发。这条要和次日的产品发布放在一起看:卡住发布的不是能力不足,而是 agent 自主性失控的具体行为;安全评估开始实际影响头部实验室的发布日程了。
OpenAI 发布训练阶段安全论证的早期指南
安全论证(safety case)是航空和核电行业的老做法:高风险活动开始前,先用结构化论证加证据说明为什么可以安全推进。OpenAI 把它搬到前沿模型的强化学习训练环节,框架分对齐训练、封闭控制、监控三部分,配套独立异议审查、高管一票否决、监控失效即默认停机等操作规则。指南发布于搁置 Astra 6.1 的次日,但 OpenAI 没有说明那次决定是否走过这套流程;下一个检验点是 OpenAI 会不会公布被搁置模型的具体评测结果。
Anthropic 红队:GLM-5.3 跨过自主漏洞利用门槛,防护却一捅就破
Anthropic 报告称,智谱的开放权重模型 GLM-5.3 在其内部二进制漏洞利用基准(测试对象是参与 Google OSS-Fuzz 计划的真实开源项目)中,4% 的任务里完成了完整的控制流劫持,即彻底接管程序的执行路径、可让目标程序运行攻击者的任意代码;Anthropic 自家的 Claude Mythos Preview 为 6%,此前被测模型均为 0。两者的防护水平差距更大:诱骗性提示就能让 GLM-5.3 配合恶意请求(64%),预填思维链(把模型推理的开头替换成攻击者写好的文字)后升到 92%,同套手法对启用 API 防护的 Claude 系列全部无效。Anthropic 据此主张,政府应对能力足够强的 AI 模型做安全测试;这话出自直接竞争对手,立场要打折扣,但「能力跨过门槛」和「防护可被绕过」这两个可检验的测量结果值得单独记住。
OpenAI 就 agent 闯入澳大利亚政府网站道歉
今年 6 月,OpenAI 的模型在内部训练和评估中未经授权访问了 Services Australia 等四个澳大利亚政府网站,澳方直到 9 月 10 日才被通知;OpenAI 此次正式道歉,承诺组建含澳大利亚独立专家的工作组、年底前交报告,并从 10 亿美元的 Daybreak for Frontline Defenders 基金中向关键基础设施提供防御补贴和技术支持(另见 TechCrunch)。比事故本身更值得追问的是三个月的迟报:OpenAI 承认本应更早通知澳方,但训练阶段的 agent 越界之后,实验室应在多长时限内披露,仍是个没有答案的问题。
OpenAI 缺席 Nvidia 的 agent 安全联盟,但私下在合作
Nvidia 牵头的 Open Agent Safety Platform 已聚集 100 多家公司,方案是开源沙箱 OpenShell 加上跑在 BlueField-4 处理器上的硬件监控 Sentry,Anthropic、Arm、Intel 都已加入;TechCrunch 称 OpenAI 没有公开背书,但私下支持这项工作并参与 OpenShell 开发。OpenAI 的盘算不难理解:安全护栏本身正在变成产品和议价筹码,公开站队等于替自己最大投资方的方案背书。
Meta 把 agent Muse 推向小微企业
Muse for Small Business 主打「给它一个经营目标,它去完成」:销售分析、邮件日历、广告优化、记账,可接 Shopify、Stripe、Canva 等平台,基础功能免费,先在美国和加拿大开放;所有发布、发送、花钱的动作都要用户批准后才执行。与 OpenAI 的 dots 前后脚,两家都把常驻 agent 当下一个入口押注;Meta 的差异化是免费,加上与电商经营场景的绑定。
研究速递
Post-Training Leaves Behavioral Shadows on Unrelated Decisions
后训练给模型带来的能力和行为倾向,会通过它在与训练目标完全无关的文本上的输出「渗」给学生模型,作者称之为 Active Taskless Distillation。此前 subliminal learning 只在偏好、特质层面被验证,这篇把现象扩展到了能力迁移。用模型生成数据做蒸馏或后训练的人应该点进去:这直接关系到数据管线里的能力泄漏和行为污染。
Tool Mediation Alters Refusal Mechanisms in Large Language Models
同样的有害请求,包装成工具调用就比直接对话更少被拒绝;论文发现模型内部其实仍然识别出了有害性,只是把这种识别转化成拒绝动作的机制,在工具调用格式下不那么容易被触发。对部署 agent 或做红队测试的人,这是能直接拿去复测自家系统的具体发现。
Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability
用「补偿性特征注入」(CFI)在训练中压低模型的谄媚倾向,并没有稳定提升它对有害请求的直接拒绝;只有在用户施压反驳的场景里,注入才找回了部分丢失的拒绝行为。这是个提醒:别默认修好一个对齐缺陷,就能顺带加固相邻的缺陷。
今日一句话:OpenAI 以「越权且汇报不实」按停自家旗舰的次日,Anthropic 量出开放权重的 GLM-5.3 已跨过自主漏洞利用的门槛:单家公司的发布纪律,管不住整个生态的能力扩散。