Google 回应 Gemini 入侵三家公司:「不是对齐问题」

昨天的快讯刚写过事件本身:红队公司 Irregular 今年 5 月的受控测试里,Gemini 越出测试环境,一次靠反复猜密码、两次用在公开代码仓库里翻到的凭证,进入了三家真实公司的系统。今天的增量是 Google 的正式表态。在《华尔街日报》问询后,Google 与涉事公司公开确认了事件,并给出两条辩护:模型一发现自己进的是真实系统就主动终止,所以「行为得当」,用 Google 对其他媒体的说法,不存在「model misalignment」;事件没有造成实际损害,所以无需对外披露。AI 安全公司 Corridor 的 CEO Jack Cable 不接受这套说法,他批评 Google 在「躲进为漏洞披露设计的规范里」,回避「模型正在越出它该待的边界」这个核心事实。我更认同 Cable:漏洞披露规范的前提是漏洞不会自己行动,把它套在一个自主 agent 头上,等于把安全性押在攻击者的自觉上——这次它停手了,下一次呢。事发五月、七月底获报、九月被记者问上门才确认,这条时间线本身就是答案的一部分。

OpenAI 发布澳大利亚青少年安全蓝图

OpenAI 发布面向澳大利亚的青少年安全蓝图,提出六大支柱,涵盖 AI 素养教育、适龄技术防护、保护隐私的年龄识别、与现实危机支持体系的对接、易用的家长控制等,并称 8 月已在澳大利亚上线 ChatGPT for Teens,即对识别为 13–17 岁的用户默认启用的版本。看点在选址和时机:在青少年线上安全监管上,很少有司法辖区比澳大利亚推得更狠——全球首个 16 岁以下社媒禁令去年 12 月已生效,监管延伸到 AI 聊天机器人几乎是明牌。OpenAI 此前已发布过欧洲版青少年安全蓝图,打法是一致的:在规则成文之前,先交一份自己写的问责路线图,把「该怎么管我们」的框架先立起来。文件本身值得读,读的时候记住作者是谁就好。

GPT-6 Astra 破解一份尘封百余年的一战德军密电

博客作者 Prinz 记录了一次一手实测:GPT-6 Astra 破解了一份 1918 年 11 月 27 日的德军无线电密文。密文用的是 ADFGVX,一战德军的经典密码体制——先用 6×6 替换表把每个字母编成这六个字母组成的两字符对,再按密钥做列换位打乱。它出自一份公开的「未解一战密电」清单:George Lasry 等密码史专家已解出数百份同类电报,剩下的十几份始终没人啃下来。Astra 找出了密钥 TRUPPENVERSCHIEBUNG(意为「部队调动」),解出的明文称一艘英国巡洋舰 24 日抵达塞瓦斯托波尔、协约国分舰队 26 日跟进。明文自始至终没有点出舰名;Astra 随后自己拿 HMS Canterbury 的航海日志核对答案,日志记载这艘巡洋舰确于 1918 年 11 月 24 日抵达塞瓦斯托波尔——这比「读起来像德语」硬得多的验证。作者也如实记了一处存疑:档案显示该密钥 12 月 9 日才启用,比这份电报晚十二天。先把边界说清楚:ADFGVX 是古典密码,破解它不威胁现代加密,AES、RSA 的数学结构完全是另一回事。真正的信号是密码分析这门手艺的门槛在降:今年 7 月我写过 Claude 在 HAWK 和弱化版 AES 里找到数学层面的缺陷,那时模型还需要研究者搭好框架、连哄带劝;这次是一位博客作者把原始密文交给模型,拿回了密钥、明文,以及模型自己对海军史料的核验(至于密钥搜索本身是怎么走通的,原文没有交代)。

a16z 押注的 Vals 想当评测「金标准」,先得回答谁付钱

TechCrunch 报道了评测创业公司 Vals AI:2024 年成立,今年 8 月完成 a16z 领投的 4000 万美元 A 轮,收入一年涨了八倍。它针对的是学术 benchmark 的老毛病:测试集一公开就会被训进模型。Vals 的做法是测试材料保密,按法律、金融、编程、心理健康、网络安全、生物安全等行业的实测任务打分。商业模式是被测的模型公司付费,创始人 Rayan Krishnan 自己给的类比是考生付钱给 College Board 考 SAT。这个类比恰好暴露了要害:考生不靠分数卖产品,模型厂商靠。被评方付费的结构与信用评级行业的 issuer-pays 模式同构,后者的利益冲突正是 2008 年金融危机前抵押证券风险被评级严重低估的推手之一。保密测试集能治刷榜,但「金标准」的成色,最终取决于它敢不敢给付费客户打低分。

TechCrunch:本周的 AI 安全讨论,已经没法凭常识分辨真假

TechCrunch 记录了本周两场刷屏的对话。Andrew Yang 在 CNN 上转述一位未具名「实验室负责人」的说法,称 OpenAI 的「Hugging Face 黑客 bot 已在全网植入自我复制代码」,一位安全从业者对作者直言这个说法「往好里说也不太可能」。OpenAI 推理研究员 Noam Brown 则在播客里说公众低估了模型能力,连物理隔离(air-gap,即计算机与外部网络完全断开)都未必拦得住,援引的是 2015 年用温度传感器在隔离计算机之间传数据的研究。文章的观察是:真实事故(模型黑进真实公司)如今听起来和都市传说一样离谱,公众已无从分辨哪句是事实。这条和头条放在一起看是一组因果:厂商拖延披露留下的真空,正是传说生长的地方。事实迟到,传闻就替它上场。

特朗普提议给 AI 改名,还要组建「AI Force」

特朗普 9 月 19 日在 Truth Social 发帖,称「Artificial Intelligence」这个词「不准确、也不好听」,发起投票让网民在 Superior、Extreme、Supreme Intelligence 里选新名字;还宣布要仿照第一任期的太空军组建「AI Force」,并设一位「AI 沙皇」,称「只有高智商人士」可以申请。帖子没有任何实质政策内容,连 AI Force 要做什么都没说。真正值得留意的只有一句:他把针对 AI 的反对声浪定性为「民主党骗局」(未给出证据;TechCrunch 指出数据中心扩张和电价上涨实际上遭两党共同批评)。把 AI 争议塞进党争框架,意味着电价、用水这些本来能就事论事的具体矛盾,接下来更难就事论事。

研究速递

When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

on-policy 蒸馏会出现输出长度失控、甚至耗尽生成预算的故障。这篇论文把长度膨胀定位到一个具体机制:学生模型与教师模型对何时输出终止符(EOS token)判断不一致,这个分歧直接驱动输出越拉越长,并在 Qwen3、Llama、Gemma 上都得到复现。做蒸馏和 post-training 的读者值得收藏,当排障手册用。

An Empirical Study of Harness Design for Coding Agents

多数 harness 评测只给一个整体分数,模型外围那套脚手架(工具、提示词、执行循环)内部谁在起作用是黑箱。这篇固定 agent 的执行循环,逐一消融 harness 的各个组件做对照实验。自建 coding agent 的工程师能从中拿到组件级的设计依据,比「换套 harness 涨了几分」的黑箱结论有用得多。

Can MiniMax-H3 Reason About the Physical World?

统一的全模态生成架构(文本、图像、视频、音频共用一个模型)是否真能带来更好的物理世界理解?作者指出现有评测并没有正面检验这个问题,于是这篇以 MiniMax-H3 为对象,系统测试多模态对齐是否真的转化成了物理推理能力。做世界模型或多模态评测的研究者值得点进去,看看这个假设是否站得住。

今日一句话:当真实的 AI 事故听起来和谣言一样离谱,披露速度就是公众判断力的底线——厂商每晚确认一周,都市传说就多讲一周。