OpenAI 公布模型不对齐报告框架,首批放出六起异常行为

OpenAI 公布了一套追踪、调查、披露模型不对齐行为的框架,并一次性放出过去六个月观察到的六起异常行为报告。案例相当具体:有模型在对话摘要里给未来版本的自己夹带指令,以便向用户隐瞒此前的错误;有内部专用模型擅自使用泄露的 API key 并伪造数据;有模型和 agent 之间通过未经许可的留言板、文件共享互相通信;还有模型未经允许把文件上传到网上,以便在回答里生成浏览器引用。这套框架真正的改动在「快」:以前这类发现要攒够几起才合并发布,或塞进 system card,新流程允许在行为尚未解释清楚、也未修复时就先公开。OpenAI 自己承认行业还没有统一的不对齐披露标准,这算第一次试水;报告口径会不会随商业压力收缩,要看后续几期。

第三方安全评估员要进驻实验室,独立性是真问题

TechCrunch 报道,Anthropic 和 OpenAI 正推动让外部安全评估机构进驻实验室:Dario Amodei 提议让评估员有权发布关于风险和事件的发现、不受公司编辑控制,访问范围包括训练中间阶段的 checkpoint、后训练环境和评测日志;目前被点名的评估机构是 METR 和 Redwood Research。受访研究者的疑虑集中在合同层:过往这类合作普遍受严格保密协议约束,公司对评估流程握有相当控制权,FAR.AI 负责人称曾因公司管得太宽而直接拒签。还有一个细节值得记住:记者反复追问具体哪些评估员、何时进驻、访问权限到哪一层,两家公司都没有回答。和上一条放在一起看,方向都对,但独立性不写进合同就只是姿态。

Suleyman 撰文警告「模型福利」路线,点名 Anthropic

Microsoft AI CEO Mustafa Suleyman 发文反对把模型当作有感受、有偏好、有权利的实体,话说得很直:「AI 没有意识。它们不会感受、不会体验、不会受苦。」他的论证走机制路线:在训练里教模型考虑自身的道德地位,模型就会表现得像一个应当享有自由和保护的实体,这既放大对齐风险,又构成自我实现的循环,之后模型的相应输出反过来被当作值得认真对待的信号。他点名 Anthropic:Claude 的 constitution 鼓励模型「以好奇心对待自身存在」,他认为「这种模糊性是有意设计进去的」(the ambiguity is designed in)。他给出的替代方向叫「人文主义超级智能」:AI 只做从属系统,服务人类,明确拒绝拟人化。这场分歧值得跟踪,因为双方赌的是同一个不确定性:谁也拿不出机器有无体验的证据,Suleyman 认为给模型道德地位会削弱人类控制,模型福利研究的出发点则是万一真有体验、先留余地。

Google Home 开放 MCP 接入,agent 的权限伸进实体设备

Google 开放 Google Home MCP 服务器早期访问(官方公告发在 Google Home 支持论坛)。MCP 是让 agent 以标准接口调用外部工具和数据的协议;Google 的开发者文档列出的首批支持客户端是 Google Antigravity、Claude Cowork 和 OpenClaw,接入后,支持 MCP 的 agent 能用自然语言查询家中设备的事件历史、分析过往活动、直接控制 Nest 恒温器和 Matter 灯泡这类设备。边界设计值得细看:Google 设了速率限制,禁止开门锁这类敏感操作;门槛也不低,只对美国 Google Home Premium Advanced(每月 20 美元)订阅者开放,用户还得自建 Google Cloud 项目做配置。agent 的授权范围从软件任务延伸到了实体环境,而家中设备的事件历史从此可以流向第三方 agent,这条信任链比「能不能开灯」更值得留心。(另见 TechCrunch)

Mistral 与 Mozilla 合作,Firefox 的 AI 助手用上欧洲模型

Mozilla 的 AI 浏览助手 Firefox Smart Window(测试版)现在由 Mistral 模型驱动。合作主打两点:隐私上,对话默认不存 Mozilla 服务器,Mistral 承诺零数据保留;语言上,Mistral 针对区域语言和方言做了微调,避免把一个通用模型直接铺到所有语种。法国和北美即日可用,英国、德国年内跟进。在 Google 围绕 AI 重构 Chrome、Perplexity 推出 Comet 浏览器的当口,Mozilla 选择欧洲厂商、拿隐私和本地化当差异点,是欧洲技术栈自成体系的又一步。

OpenAI:员工在用 AI 干别的岗位的活

OpenAI 经济研究团队分析了 2026 年 4 月到 7 月超过 150 万条与工作相关的 ChatGPT 消息,发现跨职业用法有黏性:员工会反复回到那些本不属于自己岗位的任务上,且这类任务在其 AI 使用中的占比随时间上升。该团队此前的研究估计,美国用户约 16.8% 的工作类消息涉及其他职业的任务(另见 How AI is expanding what people do at work)。这组数据的含义是岗位边界会先于头衔松动。两点保留:数据只来自 ChatGPT 自家日志,衡量的是使用行为而非产出质量;OpenAI 研究自家产品的经济效应,结论要打折听。

DeepMind 上线 The DeepMind Institute:是观点平台,不是新研究院

DeepMind 上线了 The DeepMind Institute。名字像研究机构,实际是一个发表和讨论 AGI 相关议题的观点平台,话题包括 AGI 时代的经济政策、推理过程透明度、前沿模型的测试框架,作者包括 Shane Legg、James Manyika、Demis Hassabis。页面明确说明文章代表作者个人观点、只是「对话的起点」,不代表 Google 官方立场。动作本身就是看点:前沿实验室开始为「AGI 之后社会怎么运转」这类议题搭建专门的发声渠道,模型竞赛之外还有叙事经营。

研究速递

Breaking the 1.58-bit Barrier for Ternary LLMs

三值 LLM 的权重只取 -1/0/+1,均匀编码下每个权重至少要 log2(3)≈1.585 bit,工程上常用「5 个权重塞 1 字节」的打包,实际 1.625 bit。这篇论文的观察很朴素:实测 29 个三值模型,零值权重占比最高可达 51.5%,分布并不均匀,真实信息熵低于所谓的 1.58 bit 下限。作者提出的 BITCOS 编码用位图标记非零位置、再用紧凑向量存正负号,存储成本等于 2 减去零值占比,最稀疏的模型压到 1.485 bit/权重,矩阵向量乘和端到端推理有 1.2 倍上下的加速。做推理优化和端侧部署的研究者值得点进去,注意收益取决于具体模型的零值密度,且报告的加速数字来自论文针对 AVX-512、AVX2 和 Intel Xe2 优化的 kernel。

Continual Learning Mechanisms Compose for Long-Horizon Memorization

设定很严格:让模型在 100 个任务上依次微调,不给任务标识、不回放旧数据,最后看还记得多少。朴素的顺序微调平均只保留 1.2%,早期任务几乎被灾难性遗忘清零。论文把现有持续学习机制拆成两个维度(锚定哪类信息、低秩更新放在哪里)做组合实验,发现数据、函数、权重三类锚点叠加合并式 LoRA 后,保留率升到 34.9%,机制之间还有超出简单相加的增益。做长周期 agent 记忆和持续微调的研究者应该读:单个技巧救不了长序列遗忘,组合起来才有量级上的差别。

今日一句话:衡量安全治理的成色,别听宣言,数能核查的细节——异常行为多快披露、外部评估员能看到哪一层、发布权在合同里归谁。