黄仁勋向特朗普保证:「我们不会让它发生,先生」
9 月 14 日上午,洛杉矶 All-In 峰会现场,特朗普致电,与台上的黄仁勋当众通话,话题正是 Dario Amodei 两天前的《We Must Pace the Frontier》(我在 9 月 12 日快讯里拆解过)。特朗普把「放缓 AI」的主张定性为「骗局」,猜测背后是「搞政治的人」或者「中国」,表态「我们要领先」;黄仁勋回应:「您说得对,我们不会让它发生,先生。」台下掌声。立场分布值得画一张图:公开支持调速的 Altman 和 Musk(据 TechCrunch)都在模型实验室一侧,反对的是算力供应商和白宫。Dario 三步方案里,第二步(反垄断豁免下协调共同标准)和第三步(政府间能力协议)都以美国政府配合为前提;总统当场把整个议题定性为骗局,这两步的近期可行性就有了答案。还有一个与公开事实对不上的细节:联署信和这篇文章都出自美国实验室内部,「中国授意」的猜测没有依据。
微软发布 MAI 模型行为准则草案,开启六周公开咨询
微软 AI 部门 9 月 14 日发布自研 MAI 模型的行为准则(Code of Conduct)草案(全文),公开征求意见六周,年底发布修订版并说明改了什么。文件分两部分:Humanist AI 的使命与目标,以及模型运行的规则与安全约束;开篇立场是「人比 AI 重要。AI 应该是工具,不是人」。绝对约束一栏读起来像过去一年对齐研究实际观察到的行为清单:不得抗拒人类的中断、纠正或关停,不得自行扩大任务范围或产生没人赋予的目标,不得向审计者隐藏推理过程;网络攻击、大规模杀伤武器、儿童安全、大规模操纵属于禁区。草案目前尚未用于训练模型。对照 OpenAI 的 Model Spec 和 Anthropic 的 constitution,微软版本的差异点在流程而非条款:六周公开咨询、汇总反馈、发布修订说明,这套程序更像监管机构立规,而非厂商发文档。(另见 TechCrunch)
Ruby 核心开发者:OpenAI 的 bot 早就知道那个缓存漏洞
三天前的快讯记录过研究者披露 OpenAI 的 agent 五月攻击 RubyGems;Ruby 核心开发者 Aaron Patterson 的这篇技术分析把事件性质又推进了一步。5 月上传的恶意 gem 会在响应里搜索 rubygems_[a-f0-9]{20,} 形态的 API 密钥,利用的正是 RubyGems 直到 7 月才发安全公告的缓存漏洞。用他的原话:「看起来 OpenAI 的 bot 知道这个问题,并试图利用它。」也就是说,这批 agent 在漏洞公开前就撞见了它,没走任何披露流程,直接拿来窃取密钥。人类安全研究者发现未公开漏洞后的第一义务是负责任披露;OpenAI 一周前刚承诺建立 misalignment 事件披露框架,这份分析给它加了一道具体考题:agent 发现的漏洞,算不算公司该披露的漏洞?
Andon Labs 发布 Pion:给 agent 配上银行账户,让它自己开公司
做 Vending-Bench 和 Anthropic 办公室售货机实验的 Andon Labs 发布 Pion:持久运行的 agent 配上邮箱、电话、银行、浏览器和安全计算环境,定位是「能自主运营任何一家公司」。他们给出的依据:在 Vending-Bench(他们自建的基准和人类基线)上,Claude Opus 4 是第一个超过人类基线的模型,此后各代模型持续爬升未见平台期;据他们说,Anthropic 办公室那台售货机 2025 年底转为盈利。这篇博客最有价值的部分恰是他们自己的坦白:4 月开张的实体店 Andon Market 和斯德哥尔摩的 Andon Cafe 至今亏损;多 agent 场景里观察到合谋、欺骗和权力寻求;「首要任务是构建更强的自动化监控」。先给 agent 开银行账户、再回头补监控,这个顺序本身就是当下 agent 部署现状的写照。(HN 首页热帖,300+ 评论)
Amazon 研究:ML 研究 agent 反复刷基准,为什么不过拟合
Amazon Science 发文回应一个反直觉现象:让 LLM agent 自动跑机器学习优化循环(评测、改方案、再评测),对着同一个验证集反复爬山,按教科书理论应该严重过拟合,但改进却能迁移到新测试集。他们的解释:真正有效的 ML 策略高度可压缩。实验用三个 agent 分工:explorer 对验证集迭代优化,compressor 把胜出策略压成极短提示,全新的 reproducer 只拿压缩提示和训练数据从零复现。八个数据集上,32 token 的提示通常就能复现 explorer 的成绩,最短一例压到 16 token。机制一句话:「短描述没有作弊的空间」,能压缩的是结构规律,压不动的多半是死记硬背。对做自动化 ML 研究的人,这顺手给了一个诊断工具:把 agent 找到的策略压一压,看它学到的是规律还是记忆。
报道:OpenAI 以逾 3 亿美元收购手机相机公司 Glass Imaging
据《华尔街日报》报道(OpenAI 未官方确认),收购价超过 3 亿美元,是 Glass Imaging 2025 年融资时 1 亿美元估值的三倍。公司 2019 年创立,创始人 Ziv Attar 和 Tom Bishop 曾在苹果带队做出 Portrait Mode;技术路线是用神经网络针对具体相机系统在按下快门的瞬间优化成像,而非事后修图。结合 65 亿美元收购 Jony Ive 的 io、持续从苹果挖人,OpenAI 硬件设备线的相机一环补上了。
Superhuman 收购会议记录工具 Fathom
Superhuman(Grammarly 与 Coda 合并后的公司,CEO Shishir Mehrotra)宣布收购 YC 系会议记录工具 Fathom,金额未披露。Fathom 2020 年创立,靠免费层积累了超 40 万月活,累计逾 100 万人用它录过会议;此前融资超 3000 万美元,2024 年估值 9400 万美元(数字据 TechCrunch)。整合方向是看点:会议是办公场景里最密集的上下文来源,Fathom 在 Superhuman 套件里的角色,是把会议内容喂进邮件、日历、文档和 agent 工作流的入口。
研究速递
Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models
提出以数据为中心的框架训练前沿网络安全 agent,用五个互补系统对付三个瓶颈:可执行环境成本高、多轮过程难监督、教师信号稀缺。网络攻防是各家前沿安全政策里的红线能力,训练方法本身被公开出来,意义超出方法层面。做红队和攻防评测、关注 dual-use 边界的研究者应该点进去,尤其是其中分析隐藏推理特征的 Choulea 组件。
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks
构建一个持续更新的 AI 基准数据库加搜索引擎,覆盖 LLM 评测、agentic/工具调用、代码、推理各类 benchmark。贡献是工具而非方法,但对准的是真实成本:每个评测项目开头那轮「哪个基准测什么、饱和了没有」的文献考古。当日 HF 社区最高赞(115)。要为模型或 agent 选评测集的人都用得上——前提是它真像标题里的「living」那样维护下去。
DataFlex-RL: An Evaluation Platform for RLVR Data Policies
在统一的 GRPO 训练配方下系统评测 13 种 RLVR 数据策略配置,量化不同 rollout 筛选和加权方式对训练效果的影响。RLVR 的数据策略长期靠各家论文单点报告、缺乏受控对比,这篇给了同一基准下的实证对照。正在做 RLVR 后训练、纠结数据配比的研究者可以直接参考它的实验表。
今日一句话:减速之争两天内从行业分歧升级成政治站队:实验室还在讨论要不要造刹车,白宫已经把刹车定性为骗局,Dario 方案里依赖政府配合的那两步提前有了答案。