OpenAI 给 GPT-5.6 降价:Luna 降 80%,Terra 降 20%

GPT-5.6 系列上市才三周,OpenAI 就把 Luna 的 API 价格降了 80%(输入每百万 token 0.20 美元、输出 1.20 美元),Terra 降 20%(2 美元/12 美元),Sol 价格不变(另见 CNBC)。官方把降价归因于效率提升,包括用自家模型重写和优化生产环境的推理代码、加快 token 生成。竞争背景很直白:Google 和中国厂商都在持续推出低价模型,这股压力最先落在 API 价格上;但更值得记的是成本工程本身:用模型优化模型的推理成本,已经从一个说法变成能兑现 80% 降幅的生产手段。

联邦法官:政府仍拿不出把 Anthropic 定为「供应链风险」的证据

背景:今年二月,特朗普总统下令联邦机构停用 Anthropic 产品,国防部另行把该公司认定为「供应链风险」、切断其与军方承包商的合作(TechCrunch);Anthropic 三月起诉,联邦法官 Rita Lin 随即临时冻结禁令。本周庭审上,Lin 表示政府至今拿不出证据支撑该认定,她正在考虑把临时冻结转为永久。她点了两个具体问题:政府把 Anthropic 公开批评政府列为理由之一,她称这「非常令人不安」(“really troubling”),可能开创惩罚有异见承包商的先例;技术层面的指控(Anthropic 能远程禁用已交付的模型)则没有任何证据。这个案子值得持续跟:如果「供应链风险」这类安全标签可以不经证据检验就贴,它就从安全工具变成了政治工具。

DeepMind 发布 Gemini Robotics ER 2:机器人的「编排大脑」

新模型定位是机器人的高层大脑:持续看视频流跟踪任务进度(五档进度分类准确率 57.4%,关键时刻定位 91.3%、亚秒级延迟),把底层的视觉-语言-动作(VLA)控制模型和各种 API 当作工具来调用编排,靠 Gemini Live API 的双向流式接口做到边动边推理。Demo 里 Boston Dynamics 的 Spot 靠它编排导航和抓取 API 完成取物,Apptronik 的人形机器人 Apollo 2 与 Franka 机械臂通过共享语义理解交接任务;模型已上 Gemini API 和 AI Studio。架构上这就是 agent 的工具调用范式原样搬进具身智能:LLM 做规划和分派,专用模型做执行,多机器人协作也顺势变成了多 agent 问题。

Google:Chrome 两个版本修掉的安全漏洞,超过之前两年的总和

六月发布的 Chrome 149、150 两个版本共修复 1,072 个安全漏洞,超过之前 23 个版本(约两年)合计的 1,036 个(TechCrunch)。Google 把 LLM 用在漏洞管理全流程:找漏洞(挖出一个在代码库里藏了 13 年的沙箱逃逸)、复现分诊、多 agent 生成候选补丁并由评审 agent 把关、自动写测试,最终合入仍由人类开发者批准。约束条件也交代得具体:模型只扫描隔离机器上的静态源码,不联网。这是 AI 用于防御性安全最硬的量化数据之一;同一种能力反过来就是自动化攻击挖洞,防御方能不能持续跑赢,Chrome 这条产线是目前最好的公开观测点。

Constitutional midtraining:把价值观内容提前到训练中段,对齐更耐磨,但护不住全部

一篇新论文直接检验业内争论已久的问题:对齐是不是只是后训练阶段的浅层修饰。作者基于 Anthropic 公开的模型宪法构建了 3.94 亿 token 的「宪法语料」,插入 120B 规模的 midtraining(预训练与后训练之间的训练阶段)。结果分两面:抗勒索类行为的改善能扛过后续的良性微调(优势约 17.5 个百分点),但对情境施压和价值冲突的抵抗力在 SFT 后明显衰减。论文还对比了同一批宪法内容的几种组织方式:调整语料在训练中段的先后编排(curriculum ordering),以及加或不加围绕宪法原则展开的推理文本(deliberative reasoning),2×2 共四种组合,效果差别不大;真正起作用的是这些内容有没有进训练数据,而不是以什么顺序、什么形式进。能力基准无损。对 open-weight 模型的现实意义很直接:下游微调侵蚀对齐是已知风险,把对齐提前到 midtraining 是一条有数据支撑的缓解路径,只是覆盖不了所有维度。

实测:把 DeepSeek 蒸馏进 GPT-OSS,审查行为没有跟着过来

AI 创业公司 CTGT 用 DeepSeek V4 Flash 的输出训练(蒸馏)GPT-OSS-120B 以提升金融推理能力,随后测量政治审查行为是否一并转移:教师模型在涉华敏感话题上比结构相同的对照问题「审查分」高出 45.45 分(152 组配对提示,四家 AI 评审并经人工校验),而蒸馏后的学生模型自己的差距只有 2.58 分,与未动过的基础模型的 3.94 分基本相当,两者之差不具统计显著性。这给「用中国模型蒸馏会带进审查」的担忧提供了一个具体反例,但适用范围要看清:训练语料完全不含敏感话题,所以它只说明审查不会借无关领域的数据「潜移默化」地传染;若蒸馏语料本身覆盖敏感话题,结论未必成立。另外这是厂商自己发布的单项研究,未经同行评审。

Okta 收购 Permiso,补上 AI agent 的身份安全

Okta 官宣签署最终协议收购云身份安全公司 Permiso;官方未披露金额,TechCrunch 援引知情人士称接近 2 亿美元、几乎全现金,预计在 Okta 2027 财年第三季度(2026 年 8 到 10 月)交割。Permiso 的产品盯的是身份登录之后的行为:在多云环境里监测人类账号、服务账号和 AI agent 这类「非人类身份」有没有凭证被盗、越权、横向移动的迹象。这笔并购说明 agent 身份管理的需求开始真金白银地变现:agent 拿着合法凭证行动,登录时的验证拦不住它之后做什么,行为层的监测正在变成必需品。

LinkedIn 上线「疑似 AI 水文」举报按钮,还砍掉了自家的 AI 润色功能

LinkedIn 在每条帖子的菜单里加了「seems like AI slop」(疑似 AI 水文)举报选项,举报本身不会让帖子下架、也不直接触发处置,只作为信号供 LinkedIn 调优自己的检测模型;同时下线了「enhance your post」AI 润色功能,换成只做校对的工具。平台称目前每天拦截数十万条自动化评论。我本职做内容审核,看重这里的两个设计选择:一是用户举报只作为训练信号,不直接触发处置,这很关键,因为「像不像 AI 写的」在标注者之间分歧极大,直接执行会错杀大量真人写的平庸内容;二是「一边治理 AI 内容、一边卖 AI 写作工具」的老矛盾,LinkedIn 这次取舍明确:砍掉生成,留下校对。

GCC 通过 AI 贡献政策:拒收 LLM 生成的实质性代码

GCC 指导委员会接受了 AI 政策工作组的建议:凡包含或派生自 LLM 生成内容的「法律意义上实质性」贡献(按 GNU 版权标准约 15 行以上)一律拒收;例外是维护者可自行决定接受 LLM 生成的测试用例;用 LLM 做研究、分析、找 bug、评审代码不受限制,前提是产出不进入贡献。政策将定期复审(细节见 LWN 的报道)。作为对照,Debian 还在就自家的 LLM 政策投票,几个提案从彻底禁止到披露后接受不等。GCC 给出的答案——出于版权风险和来源可追溯的考虑限制进入代码库的内容、不限制工具本身的使用——将成为其他项目制定政策时的参照系。

今日一句话:CTGT 的蒸馏实验和 constitutional midtraining 论文从相反方向探同一个问题,指向也一致:行为从训练管线的哪一层进入,决定了它传不传得走、扛不扛得住后续训练。就现有证据看,对齐与审查更像特定训练环节的产物,而非模型的固有性格。