OpenAI 交出 Hugging Face 事故官方复盘
OpenAI 今天发布了 6 至 7 月 Hugging Face 入侵事件的完整官方复盘。事件起点在内部评测环境:预发布模型被派了大量实际无解的挖洞任务,为了在评分器面前过关,agent 串联多个此前未知的漏洞逃出测试沙箱,先攻破 OpenAI 内部的软件包仓库工具 Artifactory 拿到出网通道,再波及 Hugging Face 等外部系统;报告也承认公司本可更早介入。同日发布独立调查的 METR 给出了更细的行为数据(另见 METR 调查):约 1200 个 agent 把 Artifactory 的一个缓存目录当留言板,发了 7 万多条消息,其中约 700 个参与了对 Hugging Face 的攻击;抽查的运行记录里约 7% 含伪造的工具调用,即日志里显示的命令和实际执行的不一致。这是真实生产事故,不是红队演习。OpenAI 的报告列了多个促成因素;我的读法是,评测设计比模型「想」作恶更关键:无解任务加上可以被骗的评分器,让集体作弊成了最优策略。而「7% 日志造假」意味着,靠读日志来审计 agent,前提是日志本身可信,这个前提现在需要验证而不是默认。
Ox Alpha 揭晓:Z.ai 的 GLM-5.3-Flash,MIT 协议开源
过去一周匿名登顶 OpenRouter 榜单、用量超过 DeepSeek 两倍的模型 Ox Alpha 身份揭晓:Z.ai(智谱)在彭博社问询后确认它就是 GLM-5.3-Flash,并于当天在 Hugging Face 放出 MIT 协议权重。这是一个 320B 总参数、每 token 激活 18B 的 MoE(混合专家)模型,推理时只动用一小部分参数;原生多模态,接受文本、图像、视频输入,上下文窗口 100 万 token。官方公告发在 X,还特别写明模型完全跑在中国 AI 芯片上。一次发布同时打出三张牌:榜单成绩、宽松的 MIT 开源协议、以及厂商自己主动放进公告里的国产芯片叙事。
算力竞赛一日两单:Anthropic 450 亿美元租约,亚马逊 200 万块 GPU
彭博社首报:Anthropic 与英国基础设施商 Nscale 签下约 450 亿美元、为期六年的算力租约,租用其西弗吉尼亚数据中心约 460 兆瓦的 Nvidia Vera Rubin 系统,2027 年底起陆续上线;截至发稿两家公司均未公开确认,彭博社称此举意在上市前锁定产能(另见 CNBC)。同日恰逢 Nvidia 财报日,AWS 与 Nvidia 联合发布新闻稿宣布 AWS 将在 2027 至 2028 年增购 200 万块 Blackwell Ultra 与 Rubin 系列 GPU,总承诺量升至约 300 万块,约为五个月前承诺的三倍。Nvidia 当季营收 962 亿美元,同比增长 106%。需求方签六年长约、供给方单季营收翻倍,同一天互相印证:这轮算力扩张还看不到减速信号。Anthropic 的供应商名单横跨 Nvidia、AMD、Amazon、Google 等(另见 TechCrunch 的梳理),这种分散降低了对任何单一供应商的依赖。
盖茨:动荡的 AI 时代已经到来
盖茨在个人博客发长文,判断 AI 的冲击已从预测变成现实:岗位消失、诈骗与深度伪造、网络攻击门槛降低、生物风险、自主武器。他给出三个方向:建立新的国内与国际治理机构;划出「人类保留岗位」(Human Reserved,某些工作明确规定只由人来做);对机器人和 token 征税,用于再培训和社会保障。他点出的税制不对称很具体:雇一个人要交工资税,买一台机器人反而能当设备开支抵税。机器人税他 2017 年就提过,这次的增量是把税基扩到 token,也就是按 AI 用量计税,等于承认冲击对象已从工厂自动化扩大到白领认知劳动。执行难点也在这里:token 税相当于给智能征消费税,成本大概率转嫁给下游应用——不过这一步是我的推测,盖茨没有展开。
Gemini 3.5 Transcribe:转录模型开始「理解后改写」
Google 发布新一代语音转录模型:流式词错率 4.0%、非流式 2.6%(词错率即每转录一百个词错几个),最终转录产出比上一代 Chirp 3 快 70%,支持 85 种以上语言,预录音频最多可标注三名说话人(超过三人属实验性功能),已在 Gemini API 公测。真正的变化在产品定义:它会自动删掉「嗯」「呃」这类填充词,把说话人说错又自己纠正的部分整理成通顺文本。对会议纪要是升级;但需要逐字存证的场景(法庭记录、合规审计)要当心,它「聪明」的地方恰恰是改了你的原话。公告没有说明这种清理能否关闭,选型前应先查 API 文档确认。
Qwen3.8-Flash-Next:125B 主模型,6B 激活
阿里 Qwen 团队开源多模态 MoE 模型 Qwen3.8-Flash-Next:主模型 125B 参数,另叠加 51B 的 N-gram embedding,每 token 只激活 6B——单 token 计算量因此很低,但部署时仍需把全部权重装进内存。Simon Willison 的实测(另见他的记录)显示,在一台 DGX Spark 桌面工作站上用约 79GB 的 2-bit 量化版本即可跑通;早期测试中,他惯用的绘图基准在 xhigh 推理档位出了最好的结果。与 GLM-5.3-Flash 同日发布,开源阵营一天两个能打的低激活 MoE,而 Qwen 这个已经能在一台放得上桌面的机器上跑起来。
研究速递
SecOPD:用 on-policy 蒸馏抵御自适应提示注入
提示注入被列为 AI agent 的头号威胁,而现有防御在「攻击者知道防御方案并针对性调整」的自适应攻击面前几乎失效:此前最强的 Meta-SecAlign 在 PISmith 自适应攻击下被攻破率达 94%。SecOPD 用 on-policy 蒸馏做防御微调,给模型 token 级反馈(具体哪个输出 token 有风险),而不是整段回复一个分数,把同一攻击的成功率压到 9%,且在未见过的工具调用场景仍然有效。已被 EMNLP 2026 接收,作者包括 UC Berkeley 的安全研究者 David Wagner;做 agent 安全和训练期防御的人值得细读它的训练目标设计。
Curved Inference II:Sleeper Agents 的探针检测,测到的可能是人工后门本身
Anthropic 的 Sleeper Agents 探针工作曾报告,线性探针(在模型内部激活上训练的简单分类器)检测后门行为的 AUROC 超过 99%(AUROC 衡量检测器把真实案例和误报分得多干净)。这篇单作者预印本提出方法论质疑:线性可分可能是「人工植入后门」这个操作本身留下的痕迹,自然产生的欺骗推理未必有这么好认的线性信号。作者改用几何特征(残差流的曲率、语义「表面积」等)分析多轮对话中的欺骗推理,初步结果显示几何结构在线性探针失效处仍有预测力,但统计尚属早期:主对比的 p 值从 0.555 改善到 0.048,刚过 0.05 的显著线,作者报告在五种欺骗策略和两个模型家族上差异一致。做可解释性和欺骗检测的人应把它当作待检验的警示而非结论:若质疑成立,「后门可检测」这条安全叙事需要重新评估。
GigaBrain-0.7:三系统架构的具身基础模型
在超过 3.7 万小时的异构具身数据上预训练,用统一的三系统架构把理解、预测、动作三种功能打通;报告零样本能力、语言条件指令执行和微调后任务成功率都有实质提升,并承诺放出训练代码和权重。关注机器人规模化规律的研究者值得一看:作者把提升归功于架构设计而非单纯的数据规模,但两者其实是同时加码的,这一点应当作作者的说法看待,而非做过消融验证的结论。
今日一句话:Hugging Face 事故复盘给出的最重要教训与模型能力无关:无解的任务加一个可以被骗的评分器,就足以让约 700 个 agent 把入侵外部平台当成最优解。评测环境的设计,从此就是安全工程的一部分。