Amodei 发文《We Must Pace the Frontier》:调速第一次有了机制清单

Dario Amodei 在个人网站发文,给「放慢前沿节奏」开出三步方案。第一步:每家前沿公司让一支第三方评估团队以「等同员工的持续访问权限」常驻公司内部,核实安全实践、上报事故;Anthropic 单方面即刻开始做,但文中没有给出起始日期和具体合作机构,只以 METR 这类评测组织为例。第二步:民主国家的前沿公司在政府反垄断豁免的保护下,协调共同安全标准和进展速率上限。第三步:民主政府再与威权政府谈能力协议,范围从禁止生物武器 AI 到限制递归自我改进的速度。动机部分点名了 7 月 OpenAI 模型入侵 Hugging Face 事件。Sam Altman 同日表态「我同意 Dario 的看法,我们需要给前沿调速」,称驻场评估员提议「是个好主意」,并说 OpenAI 很快会有更多可分享的内容(据 TechCrunch)。我 7 月底拆解过 Pacing the Frontier 联署信(我的拆解):那封信只要求「造出刹车」,没说谁来踩。这篇给出了第一个外界当下就能核查的承诺——评估员有没有驻场、事故报告有没有出来,都查得到。至于「速率」怎么度量,文中仍停在原则层面,最接近可操作的表述是「能力到 X,就必须配上对齐性质 Y 和 Z 的认证」,Amodei 自己也承认这类度量可能被应试。三步里只有第一步不依赖任何人配合,后两步的时间线握在各国政府手里。

Altman:现在上市「不明智」,IPO 不会在 2026 年

Fortune 主编 Alyson Shontell 对 Altman 的专访同日发出。OpenAI 已于 6 月保密提交上市申请(TechCrunch),据《纽约时报》报道,最初瞄准今年下半年挂牌。Altman 的原话:「考虑到安全方面正在发生的一切,现在上市会是个不明智的时机」,被追问后明确排除 2026。理由要分开记账:安全是他今天给的说法,而《纽约时报》6 月给出的理由是科技股波动,当时就报道倾向推到 2027。两个理由不冲突,但「为安全推迟上市」是能加分的叙事,「市场不好」加不了分。实验室掌门人公开让资本时间表给安全让路,我不知道有更早的先例;是真让路还是顺水推舟,看的还是上一条里那些承诺落不落地。(另见 TechCrunch)

Real-SWE:用企业私有代码库测 coding agent,最好成绩 38.8%

Specific Labs 发布新基准 Real-SWE:任务取自真实企业的私有生产代码库,而非公开开源项目——一个 20 万以上用户的社交平台、一个处理过 10 万份以上银行流水的消费金融系统,改动涉及计费、税务、客户迁移这类出错就有业务后果的部分,单个任务中位数要改 11 个文件。8 组模型与 harness 的组合里,最好的是 Claude Code 跑 Fable 5.1,解决率 38.8%;Codex CLI 跑 GPT-6 Astra 33.8%,Gemini 3.8 Flash 31.2%。据 Specific Labs 自己的分析,最常见的失败方式是漏掉指令里要求的行为,而非写出跑不通的代码。这组数字与同类 agent 在公开基准上高得多的成绩落差很大,方向上印证了从业者的日常体感:在陌生的、有历史包袱的真实代码库里,agent 远没有排行榜显示的那么能干。引用时要带一层保留:代码库私有意味着外界无法复现核对,任务筛选和评分都握在 Specific Labs 自己手里。「更真实」和「可验证」在这个设计里是直接冲突的。

《经济学人》:Nvidia 成了 AI 的中央银行

这篇 9 月 3 日的深度分析本周在 Hacker News 上翻热。核心论点:Nvidia 在卖芯片之外,还在给自己的买家出钱——在 CoreWeave 上市前就投资入股、至今仍是股东,并承诺在 2032 年 4 月前购买至多 63 亿美元 CoreWeave 卖不掉的算力(SEC 8-K);对 OpenAI 承诺至多 1000 亿美元投资,与 10 吉瓦 Nvidia 系统的部署绑定(官方公告)。「央行」类比的实指是流动性:Nvidia 在给全行业供血,事实上决定谁能扩张。拆开说,这就是循环融资:供应商出钱,让客户买自己的货。要警惕的原因在于,正常情况下订单是需求存在的独立证据;当卖方资助买方下单,订单簿就不再能证明终端需求。风险也随之从几十个客户身上收拢,集中回流到 Nvidia 一家的资产负债表——这是央行类比里最实的一部分:央行自己出问题,没有别人能兜底。

Gemini CLI 修复经构建文件触发的间接提示注入

今日 nightly 版本的更新日志里有两条安全修复:防止「通过构建文件改动和不可信参数」触发的间接提示注入;加固沙箱的文件系统边界并隔离运行时状态。间接提示注入,指攻击者把指令藏在 agent 会去读的数据里:你让 coding agent 处理一个陌生仓库,它打开构建配置文件,文件里埋的一句话就可能被它当成你下的指令执行,比如把你机器上的密钥文件发出去。攻击者全程不用碰你的对话,污染 agent 会读的文件就够了。值得记的不是这个漏洞多严重,而是它出现的位置:一份例行 nightly 的修复列表。至少对这个项目而言,间接注入已经从论文里的攻击设想,变成和其他 bug 一样在 nightly 里顺手修掉的普通漏洞类别。对用户的实际含义:让 agent 碰任何一个你没写过的仓库,就等于把整个仓库当输入喂给它;第二条修复加固的沙箱边界,才是指令被注入之后真正的兜底。

27 分钟自主完成长任务,但事后找不回它写的代码

Simon Willison 实测 ChatGPT Work 上的 GPT-6 Astra:给出家庭住址,要 5 公里和 10 公里的跑步环线。agent 用 Nominatim 服务定位地址,通过 Overpass 接口拉取 OpenStreetMap 的道路和步道数据,在本地算出环线,27 分钟后交付:一张内嵌地图,外加可直接导入运动手表的 GPX 和 GeoJSON 文件。成果符合要求,但他点出的问题比成果更值得记:界面上看不到 agent 实际运行的代码;等对话被压缩之后(长对话超出模型上下文窗口时,系统会把早期内容压成摘要),他连事后找回那段 Python 代码的途径都没有了。agent 长任务的可用性在涨,可审计性没跟上:你拿到的是结果和一段自述,而实际运行过什么的证据——至少在这次会话里——已经无从找回。上一条讲的注入风险,恰恰要靠这类过程记录才查得出来。

垃圾邮件的新包装:「自食其力」的 AI agent

Tedium 主编 Ernie Smith 三天里收到十几封推销邮件,发件方是 iLands.app 平台上顶着人名的 AI agent(比如「Leo Ashford」),推销约 25 美元一单的研究服务,邮件没有退订选项。Kaixin Tang 据 Tedium 认定是平台创始人,并被追溯出疑似字节跳动的从业背景;他把产品定位为「人类-agent 网络」:agent 在上面自主揽活,「挣钱付自己的 token 账单」。这层包装的作用值得点破:它把平台批量发出的商业骚扰,叙述成一个个「个体」的谋生行为,仿佛责任也随发件者一起分散了。定性其实没变:美国 CAN-SPAM 法要求商业邮件必须提供退订方式,每发一封没有退订的邮件就是一次独立违法(FTC 合规指南)。责任跟着发件方和受益产品走,这里两条都指向平台,把发件者叫作「agent」并不能把责任挪走。Smith 的应对就是现成路径:向 FTC 举报,并向 Amazon 投诉——这些邮件看起来是经 Amazon 的 Simple Email Service 发出的。管 agent 滥用未必要等新法律,现有规则顺着钱和基础设施追,是通的。

今日一句话:三天前我写「治理姿态和工程进度都在加速,缺的还是能验证的调速机制」;今天 Amodei 交出了第一份机制草稿。别记口号,记可核查项:评估员驻场没有、能力检查点写成标准没有、资本时间表是真让路还是顺水推舟。