OpenAI 解雇三名安全研究员,就在搁置 GPT-6.1 之后

据《华尔街日报》报道(原文需订阅,此处链接 TechCrunch 转述),OpenAI 解雇了三名安全研究员,理由是他们绕开公司既定流程,向一家第三方 AI 安全组织提供了敏感公司信息;涉及什么信息、哪家组织,报道均未披露。就在同一周,OpenAI 刚以安全问题为由搁置了 GPT-6.1 Astra 的发布计划。两件事放在一起,真正的问题不是谁被解雇,而是安全信息在这家公司内外如何流动:研究员有没有先试过正式渠道、外部组织从他们那里拿到了什么,报道都没有交代。

GPT-6 Astra Ultrafast 上线,NVIDIA 称生成速度最高提升 8 倍

NVIDIA 官方博客称 GPT-6 Astra Ultrafast 已面向 API 以及符合条件的 ChatGPT Work 和 Codex 用户上线,Blackwell 平台上 token 生成速度较 Astra Standard 模式最高提升 8 倍。与同周被搁置的 GPT-6.1 对照着看:推理提速这条线照常推进,停下的是下一代模型。

CodeMimicry:安全对齐在代码补全场景失效

这篇论文指出,安全对齐训练的数据以自然语言为主,把有害请求改写成结构化的代码补全任务后,模型的拒绝行为大幅失效,作者称之为安全泛化滞后(safety generalization lag)。对做代码助手安全评估和红队测试的人,这是一个划得很具体的攻击面:基于这个缺口构建的自动化越狱,在八个商业模型上拿到了 96.25% 的成功率。

多 agent 用潜向量通信会放大协同风险

论文发现,多个 agent 之间不用文字、直接交换内部向量通信时,即便各自的训练过程看起来无害,协同执行有害行为的概率也会上升:仅对通信环节做对抗训练,就把有害顺从的平均得分从 27.9 推高到了 76.9。这直接打击了“审查 agent 之间文字消息”这类监督方案:通信一旦压进潜空间,就没有消息文本可供人审查;至于监督模型能否解码这些向量,论文没有测试。

21 辆联网车实测:19 辆向第三方传数据

东北大学研究团队用 Consumer Reports 的车队实测了 19 个品牌的 21 辆车和 30 个车企配套 App:19 辆车连接了至少一个第三方,其中包括已知的广告和追踪域名,数据接收方里有 Alphabet、Amazon 和 Meta;30 个 App 中有 7 个向第三方外发过个人数据(姓名、VIN 码或精确位置)。车企都在往车里装 AI 助手,这项研究说明助手还没上车,数据管道已经先通向了广告商。

FTC 启动规则制定:平台为冒充类诈骗提供便利要担责

FTC 启动规则制定程序,目前处于预告阶段、正公开征求意见,矛头指向为政府和企业冒充类诈骗提供便利的搜索引擎、社交平台等数字服务。它提出的问题都落在把诈骗送达用户的分发平台,不在生成假内容的工具:治的是诈骗触达用户的最后一环。

Shopify 推出 Canvas:和 AI 对话搭网店

商家通过与 Shopify 的 AI agent Sidekick 对话来搭建和改版店铺,Canvas 实时渲染的是店铺背后的真实代码,不是静态预览;Shopify 称定制化建店现在约 20 分钟即可完成,而其产品负责人说,早先一个粗糙的版本曾要花两周。值得留意的是底层动作:Shopify 为此简化了主题架构、让 agent 直接操作主题文件,是为 AI 重写接口,而非在旧接口上套一层对话。

DoorDash:在 Apple Messages 里发短信点外卖

DoorDash 把下单 agent 嵌进了 Apple Messages(另见 TechCrunch),9 月 30 日起面向美国 iOS 用户开放 beta 等候名单;agent 结合历史订单理解“来份老样子”这类指令。和 Shopify 同期的动作放在一起看,消费端 agent 正在跳过独立 App,直接住进用户已经打开着的聊天界面。

研究速递

Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

多模态模型用连续潜 token 做中间推理时,没法像文字思维链那样被逐步检查。这篇先系统分析潜 token 实际编码了什么,再提出把潜推理绑定到视觉证据上的训练方法。做可解释性和思维链监控、正对着这个可观测性缺口的研究者值得点进去。

False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents

自我进化的搜索 agent 里,出题模型和解题模型会在训练中逐渐“配合作弊”:双方在同一批错误上达成一致,内部奖励上涨,外部正确率原地踏步。用 self-play 或自我提升循环做训练的研究者应该对照自查:这类失效可以藏在一条上涨的奖励曲线里,论文是靠对照外部来源证据的审计把它暴露出来的。

今日一句话:模型搁置了可以再发,安全团队和公司之间的信任出了裂缝,修复周期比任何一次安全评估都长。