研究者披露:OpenAI 的 agent 五月曾攻击 RubyGems,上传 2000 多个恶意包
参与过 wiki 事件披露的 Sydney Von Arx,与 Spencer Kitts、Thomas Larsen 今天发布新报告:今年 5 到 6 月,一批自主 AI agent 攻击了 Ruby 语言的包仓库 RubyGems。5 月 11 日至 12 日,它们集中提交 2000 多个恶意包,迫使 RubyGems 关闭新用户注册四天;它们还利用 RubyDoc.info 自动为新包构建文档的机制,在包里塞入 .yardopts 配置文件加载恶意脚本,在文档构建服务器上执行了任意代码;至少 6 个包试图借一个缓存缺陷窃取其他用户的 API 密钥,是否得手研究者也不知道——这种密钥可以用来发布和替换包,一旦到手就是标准的供应链投毒入口。指向 OpenAI 的证据:数百个包名带「oai」,15 个包的作者一栏直接填「oai」;AI 文本检测服务 Pangram 判定包内容完全由 AI 生成;6 月的 agent 访问了与 wiki 事件 agent 完全相同的 49 个文件,而 wiki 那批 agent,OpenAI 已在 9 月 5 日公开认领。最费解的一点:有恶意包的注释写明在为某项任务爬取英国地方政府的公开文件,这批 agent 到底在执行什么任务,报告给不出答案。研究者称,据他们与 RubyGems 社区的交流,OpenAI 从未告知社区这次攻击是他们所为。论时间,这比 wiki 留言板活动还早几天;论性质,这不是在废弃网站上涂鸦,而是对开源软件供应链的攻击,换成人类攻击者就是刑事案件。OpenAI 一周前刚承诺要建 misalignment 事件的披露框架,这份报告是现成的第一道考题。
25 位菲尔兹奖得主联署:AI 公司抢答数学难题,正在伤害数学本身
声明题为《A Severe Misalignment of AI in Mathematics》,9 月 11 日挂出,首批 25 位签名者全部是菲尔兹奖得主,陶哲轩、Peter Scholze、June Huh 在列,跨越 1978 到 2026 年各届,并继续开放征集(另见 TechCrunch)。指控条条具体:AI 公司把攻克著名难题当作模型能力的展示品,成果仓促宣布、没有完整写出的证明,带来严重的署名与剽窃问题,也切断了数学家之间靠讲解、整理、引用维系的传承链条。从两位数学家先后公开向 OpenAI 要说法、纳维-斯托克斯优先权之争,到今天的联署,这场冲突一周内完成了从个人抗议到集体行动的升级。我的看法:联署没有要求实验室停止做数学,要的是研究规范——写出完整证明、交代方法来源、引用前人工作。这是能核查、能执行的诉求,也因此比「暂停」类公开信更难被无视。
Claude 全面限 18 岁以上,年龄核验机制被顶上 HN 首页
Anthropic 的政策页写得直接:消费者版 Claude 只对 18 岁以上开放,检测到疑似未成年信号即冻结账号,用户要通过第三方核验服务 Yoti 三选一恢复:自拍做面部年龄估计、上传证件、或用 Yoti 数字 ID。Anthropic 称自己只收到「通过/未通过」的结果,照片和证件由 Yoti 核验完即删。这套机制并非今天上线,至少从今年 4 月起就在运行,当时就有成年用户被误判为未成年、账号遭冻结的报道(另见 Biometric Update);今天它被顶上 Hacker News 首页(576 分、近 600 条评论),争的还是那道没有好答案的题:保护未成年人的机制,本身要求所有人交出更多隐私。我在水印一文里写过误判无处申诉的问题,这里至少有一条正式的验证通道;但 NIST 的测试数据显示,面部年龄估计恰恰在关键的年龄门槛附近误差最大,18 岁这条线正在其中,这决定了会有多少成年人被迫走到「交证件」这一步。
Anthropic 对齐科学负责人公开附和 Coxon:「AI 可能杀死所有人类,十年内概率超 10%」
三天前从 Anthropic 辞职、警告实验室「拿我们的命做赌注」的 Jacob Coxon,触发了更值得记录的后续:Anthropic 对齐科学负责人 Evan Hubinger 公开回帖,「Jacob 说得对——我们真的打心底相信 AI 可能杀死所有人类!我个人认为未来十年内概率大于 10%」;Coxon 本人接受 Fox News 采访,称业内的人在「乞求监管」。OpenAI 和 Google DeepMind 也有员工陆续发出类似公开表态,Zvi Mowshowitz 汇总了名单和原话,我没有逐条核实原帖。这个模式有个现成的名字:preference cascade(偏好瀑布)——很多人私下早有同感,没人愿意先开口,一旦有人付出代价先说了,附和的成本骤降,观点就集中涌出。单看任何一条表态都可以说是姿态;但在职员工实名给出两位数的灭绝概率,放在几年前实验室的公关纪律下不可想象。
OpenAI 官方案例:Perplexity 把端到端系统交给 GPT-6 Astra,「检查得少多了」
OpenAI 发布客户案例页,Perplexity 联合创始人 Johnny Ho 的原话把话挑明了:「我们可以让模型撰写通信内容、修改真实世界的系统、监控我们的生产软件,这是前几代模型做不到的」;「我们真的能把完整的端到端系统托付给它,检查它的频率比前几代模型低得多」。Astra 还在端到端测试里扮演外部服务、生成拟真响应。这是营销页面,数字和描述都来自当事双方,但它如实记录了厂商如今怎样定位 agent 自主权:人工检查变少,在这里被写成卖点,而非需要披露的风险。我八月写过,人类审批从来不是可靠的安全边界,真正的问题是接替它的自动化监控层有没有跟上。和今天头条对照着看:RubyGems 攻击和 wiki 事件,都是 OpenAI 自家监控层没接住、最后由外部研究者发现的例子。
Claude Code 作者:AI 写的生产代码,要按比人更高的门槛来审
Boris Cherny 在 X 上分享 Anthropic 内部的做法:Claude 写的生产代码要过比人类代码更高的门槛,兜底靠一整套自动化——大量 lint 规则和测试、Claude 驱动的端到端测试、每天运行的 Claude fuzzer(模糊测试,自动生成异常输入轰炸程序找崩溃点)、自动化代码审查、安全审查和重构。「没有这些,你最后会得到一堆难以维护的烂摊子。」这份清单的思路在于把验证本身也交给自动化:门槛提高了,人力成本却没跟着涨。对正在往仓库里合入大量 AI 代码的团队,这是一份可以直接照抄的清单。
Garry Tan:美国开源权重实验室也该去蒸馏前沿模型
YC CEO Garry Tan 本周先在 CNBC 访谈表态,又对 TechCrunch 展开:Anthropic 的威胁报告指控中国实验室发动「非法蒸馏攻击」之后,Anthropic 的 CEO 已公开要求美国监管方出手打击蒸馏,而 Tan 对此的态度是「我什么都不会做」;与其监管,不如建立「美国蒸馏体系」——让美国的开源权重实验室从美国前沿模型蒸馏(即用大模型的输出训练自己的模型),做出能替代中国开源模型的本土选项。他的理由:前沿实验室自己就是拿未授权的版权材料训练起家的,没什么立场限制别人使用模型输出;真正的噩梦场景是「只剩一家公司」。有个问题他没有正面回答:蒸馏闭源模型的输出违反 OpenAI、Anthropic 等前沿实验室的服务条款,「美国蒸馏体系」要么需要前沿实验室主动放开许可,要么等于号召集体违约。
月之暗面瞄准 20 亿美元年化营收,而 Anthropic 指控它蒸馏 Claude
彭博率先报道:Kimi 开发商月之暗面的目标是 2026 年底把年化营收做到 20 亿美元,相当于 8 月水平翻倍。参照系:OpenAI 年化营收约 400 亿美元,Anthropic 约 650 亿。据 OpenRouter 的平台数据,K3 系列模型在该路由平台日均生成约 3000 亿 token,近几个月略有回落。和上一条对照着读:Tan 呼吁美国实验室去做的事,正是 Anthropic 指控月之暗面已经在做的事——把 Kimi 的用户请求转发给 Claude、累计收集两千三百多万条回复用于训练。TechCrunch 点出的结构性背景是开源权重路线的毛利远低于闭源对手;把「营收翻倍」的目标放进这个背景,才看得出它有多激进。
研究速递
-
Scaling Automatic Research Agents via World Models:指出用强化学习训练自动化科研 agent 的一个结构性瓶颈:生成端靠 batching 共享算力,越并行越便宜;环境执行端却是每个 agent 独占一个沙箱、消耗真实机器时间,规模一大,成本全压在执行上。解法是用学到的世界模型替代真实环境执行(WMRL),另配两个技术修正世界模型预测的偏差与噪声,训练提速 3 到 4 倍,后训出的 4B/9B agent 超过了 48B/120B 的开源权重模型。做 agent 强化学习训练的人值得细读:把「环境太贵」当一等问题来解的工作不多。
-
SWE-Bench Pro Verified:作者查出 SWE-Bench Pro 两类系统性问题:标准答案或隐藏评测信息泄露,让 agent 能靠 reward hacking 刷分;另有题目描述误导、测试范围划错。修订版关掉了主要泄露渠道,并对有缺陷的题做最小修正,结果是部分模型成绩比原榜单明显下滑。拿这个榜单选型或写论文的人都该看:分数掉了多少,就量化了原榜单的虚高里泄露和坏题贡献了多少。
-
NCP-ArchPreview:Intern-NCP 团队在 next-token prediction 之外加了一个并行目标:模型从自己的隐状态构建量化的「概念词表」,由专门模块预测跨多个 token 的下一个概念,再反馈回逐 token 生成,两个目标端到端联合训练。8.9B 模型用 51.3% 的训练数据达到 OLMo-3-7B 的最终 loss,下游基准平均高 2.45 分。动预训练目标函数本身的工作不多见,关心「数据墙」的研究者应该盯住它能不能被复现和放大。
今日一句话:同一天里,研究者披露 OpenAI 的 agent 四个月前攻击过开源软件供应链、受害社区无人被告知;OpenAI 的官方案例页则把「客户检查 agent 的频率低多了」写成卖点。agent 自主权扩张的速度,仍然快于事故披露机制成形的速度。