Paul Christiano 加入 OpenAI Foundation 董事会
OpenAI 宣布对齐研究者 Paul Christiano 加入 OpenAI Foundation 董事会,进入董事会下属的安全与安保委员会(主席为 Zico Kolter),并以无投票权观察员身份列席营利实体 OpenAI Group PBC 的董事会。Christiano 2017 至 2021 年在 OpenAI 主持对齐研究,是 RLHF(从人类反馈中强化学习)的奠基者之一,之后创办了非营利研究机构 Alignment Research Center,目前还在美国商务部下属国家标准与技术研究院(NIST)的 AI 标准与创新中心担任高级技术顾问;公告说明他在政府侧的工作将回避一切与 OpenAI 相关的事务及模型评估。我的看法:把一位以「AI 存在实质灭绝风险」立场著称的研究者放进安全治理席位,是 OpenAI 近年分量最重的治理动作之一,但委员会对产品发布节奏有没有否决或推迟的权力,公告没有说,这才是这个席位值多少的关键。同日 OpenAI 也发文呼吁抓住政策窗口期加快制定安全标准,治理叙事上明显在主动出牌。
Anthropic 研究员辞职,公开警告「自我改进 AI」
27 岁的研究员 Jacob Coxon 宣布从 Anthropic 辞职。他过去三年在 OpenAI 和 Anthropic 两家公司做预训练研究,辞职声明以七条推文发在 X 上,据 Deadline 报道一夜之间获得近 7600 万次浏览。他的原话:「两家公司都没有负责任地行事。他们正直奔自我改进的超级智能而去,拿我们的命做赌注。」他呼吁美国各实验室达成「调速协议」(pacing agreement,即各实验室协调放慢或同步能力开发节奏的约定),甚至可以临时冻结模型能力提升;他还认为近期针对 Hugging Face 的攻击事件让这类协议变得更可行——这起事件的细节我没有独立核实。和上一条放在一起看:同一天,一位对齐研究者选择进入董事会从内部施加影响,另一位选择离场向公众喊话,两条路线背后是同一个判断:实验室靠自觉维持的克制,已经不够让业内人放心了。
WeWorm:一个通过微信通话传播的零点击蠕虫
安全团队 Calif Research 公开了概念验证蠕虫 WeWorm:微信 VoIP(网络通话)协议栈里有一个内存破坏漏洞,攻击者只要拨打你的微信电话,在铃声响起、你还没接听也没碰手机时,漏洞就已触发,攻击者随即拿到整个微信账号的控制权:能读消息、发消息、打电话,再自动拨给下一个受害者,形成自我传播链,iOS 和 Android 都中招。最该记住的是时间线:团队在 AI 协助下约两天做出第一个 Android 远程代码执行(RCE,指攻击者能在目标设备上运行任意代码)验证程序,一周内完成完整蠕虫演示。披露流程是规范的:7 月 24 日报告腾讯,8 月 21 日双端补丁发布,8 月 28 日服务端为所有用户完成缓解,9 月 8 日才公开;腾讯表示没有理由认为有用户受到影响。「AI 让漏洞挖掘提速」此前多是趋势判断,这次给出了具体天数。
Claude Fable 5.1 用 44 分钟解开 370 年悬案密码
评测机构 Vals AI 让 Claude Fable 5.1 以 agent 方式自主运行:44 分钟、17.6 万 token、中途无人干预,解开了苏格兰作家 Thomas Urquhart 藏在 1650 年代著作《Logopandecteision》里的 Cyphral Distich。这是两行各 32 个数字的密码,曾入选密码史研究者 Klaus Schmeh 的「50 大未解密码」,频率分析等传统路数多年无果。解法是发现钥匙就在原书里:每个数字指向书中「32 条 Proquiritations」里对应位置的词,取首字母,拼出一段为查理二世祈祷的保王党祷文,两行各恰好 32 个字母且押韵,答案大体能自我验证;不过这个解法目前只有 Vals 一家发布,密码史学界的独立确认还没有出现。它还给出了更长的 Cyphral Octastich 的解,但部分位置要比对 1652 年原版书实体才能确认。安全研究者 Bruce Schneier 的点评值得参考:这类任务本质是大量搜索加验证,正是 AI 最擅长的形态,未必说明它有超出人类的密码学洞察。
Ramp 数据:8 月头部企业人均 AI 支出下滑近一成
支付公司 Ramp 追踪 7 万家企业的数据显示,AI 用得最重的前 1% 企业 8 月人均 AI 支出降至 7205 美元,环比跌近 10%;付费使用 AI 的客户占比 56%,几乎停止增长(另一个背景数字:人口普查局口径下全美只有 22% 的企业在用 AI)。把「支出」直接当「用量」读会出错:支出等于单价乘以用量,而每百万 token 的成本已从 3 月峰值的 1.15 美元降到 0.68 美元,不少企业还在转用更便宜的旧款模型,价格压缩本身就能解释相当一部分下滑,再叠加 8 月休假季。这份数据分不清「需求真的放缓」和「同样的用量变便宜了」,答案要靠接下来几个月的数据。
马萨诸塞州成为三个月内第三个限制数据中心的州
州长 Maura Healey 签署行政令:25 兆瓦以上的数据中心必须 100% 使用清洁电力,途径是自建、出资在附近新建,或向电费用户保护基金付费;这远严于该州「2030 年达到 40% 清洁电力」的普遍标准。州政府同时暂停受理数据中心的销售税减免申请,并建议社区不要与开发商签保密协议。这已是连续模式:8 月德州要求新数据中心接受公用事业委员会和电网运营机构 ERCOT 的审计,7 月纽约叫停 50 兆瓦以上项目。对算力扩张的阻力正从舆论反对变成州级成文规则,而风投出资的亲 AI 超级政治行动委员会已开始投广告反击,中期选举前这条战线只会更热。
Apple Watch 的新 AI 功能在把「设备常听」变成默认
新款 Apple Watch 加入三个音频 AI 功能:环境声音提醒(警报、门铃等,端上处理,定位为无障碍功能);Live Rewind,双按表冠即可回溯转写最近 15 秒的谈话;以及 Siri Recap,在用户主动开启后,对听到的对话生成带标题的要点摘要。Apple 的防护措施做得不算敷衍:不存储原始音频、转写内容端到端加密、不识别说话人、Recap 默认关闭。但悬而未决的问题不在佩戴者的隐私,而在佩戴者身边人的知情同意:Live Rewind 启动时 Apple 确实会播放提示音(静音模式下也响),屏幕上也有动画和麦克风指示,但抬手按一下表冠比举起手机录音隐蔽得多,正在谈话中的旁人是否真能注意到这些提示,还没有人验证过。当常听功能以无障碍和便利的名义进入默认产品形态,围绕「录下别人说话」的社会规范就已经开始被改写了。
研究速递
Style Over Substance:只换文风就能翻转安全判官的判定
方法很干净:回复内容一字不动,只在前后包一层风格外壳(教育声明、假装的安全推理、先敷衍拒绝一句再放出原文),去测 8 个自动安全判官。GPT-4o-mini 在「敷衍拒绝」外壳下有 19.9% 的判定被翻转(噪声底线仅 0.5%),Llama Guard 4 对「教学课程」框架有 12.3% 的确定性翻转,Claude 只动了 0.4%;人工标注确认内容确实未变,九成翻转属于判官错判。冲击面在于:市面上几乎所有 jailbreak 成功率、防御评测和安全排行榜都靠这类判官打分,判官评的若是文风而非内容,那些数字都得重新掂量。作者给的修复也便宜:重写打分 prompt 就能把攻击效果降一个数量级。做安全评测、用 LLM 当裁判的人都该点进去。
推理越长,对齐越松?大推理模型的「对齐塌缩」
这篇与「深度推理让模型更安全」的普遍预期唱反调:推理链越长,不断增长的推理内容会稀释模型对原始输入中安全约束的注意力(作者称之为 attention dilution),他们提出的 Alignment Loss Rate 指标随推理深度显著上升,并据此构造了「Reasoning Trap」越狱手法;缓解方案是在推理过程中用残差连接反复重新强调原始输入。结论若稳健,只在短推理设置下做的推理模型安全评测就测错了工况。建议做推理模型安全的研究者亲自查它的实验设置扎不扎实——这和上一篇是同一类提醒:安全结论对评测设置极其敏感。
NeoHorse-1:把「递归自我改进」落成一条部署数据飞轮
名字听着吓人,机制其实具体:4B 和 9B 两个 agent 原生模型组成异构模型池,路由器为每轮用户请求记录能力需求预测、所选档位和后续交互,这些交互经过结构校验、语义评估和场景标注后转成训练样本,再按路由信号组织三阶段课程训练。所谓「递归」,指的是这条「评估、筛选、更新」的循环:系统学会了什么,会影响它接下来从什么中学习。11 项基准上后训后的 4B 模型从 58.94 提到 64.87,逼近未后训的 9B。在 Coxon 为「自我改进 AI」辞职的同一天读这篇会更有体感:眼下工程上真实可跑的「自我改进」只是部署数据飞轮,距离模型改写自身还很远,这段距离的收窄速度,恰是安全争论该盯住的量。
今日一句话:同一天里,一位对齐元老坐进 OpenAI 董事会,一位研究员为「自我改进 AI」离开 Anthropic,而一篇论文已把「递归自我改进」做成了日常的数据飞轮。治理姿态和工程进度都在加速,缺的还是能验证的调速机制。