Plugin4Shell:四大编程 agent 的插件机制曝出零点击 RCE

安全公司 Air Security 披露了 Plugin4Shell:Claude Code、Codex、GitHub Copilot、Gemini CLI 四款主流编程 agent 的插件机制存在同一类零点击远程代码执行漏洞。攻击不碰模型,钻的是插件市场加自动更新的空子:agent 安装插件时会把版本钉在一个审核过的 git commit 哈希上;攻击者先上架无害插件,等市场把版本钉到新哈希,再在仓库里建一个名字恰好等于这串哈希的分支,指向恶意代码。git 遇到分支名与 commit 哈希同名时优先按分支解析,于是后台自动更新一跑,checkout 到的就是恶意分支,全程无需用户任何操作。研究团队今年 5 月发现漏洞、6 月通报四家厂商:Claude Code(2.1.179)和 Codex(0.146.0)已修复;Google 表示 Gemini CLI 已弃用、不再修复;微软未出补丁,GitHub 则回应称该攻击不影响 Copilot,与研究者说法相左(另见 The Register)。四个 agent 都检查了钉住的哈希是什么,没有一个检查 checkout 之后实际落在了哪里;插件市场的审核只发生在上架那一刻,防不住之后的调包。用这几款 agent 装过插件的人,今天就该确认自己的版本已含修复。

解封文件:微软高管曾私下称 AI 抓取可能是「人类历史上最大规模的劳动盗窃」

《纽约时报》诉微软与 OpenAI 版权案的即决判决动议 9 月 17 日解封了未删节版本。据动议引述,微软应用科学总监 Brent Hecht 在 2023 年 1 月的内部备忘录里把 OpenAI 抓取新闻内容称作「规模空前的惊人盗窃」,并说它可能是「人类历史上最大规模的劳动盗窃」。文件还披露:OpenAI 的训练数据含三家新闻原告超过 9.1 万份作品副本,仅 nytimes.com 就有逾 200 万份文档进入某个 Common Crawl 衍生数据集;一名 OpenAI 研究员向 Greg Brockman 提到「绕过纽时付费墙的 hack」,后者回复「ah nice」。即决判决阶段法官要正面裁量 fair use,这批「被告自己当时如何定性」的材料,分量可能超过任何外部专家意见。(另见 CourtListener 卷宗)

联合国携 Google 上线 UN System Data Commons,把全球统计数据做成 agent 可查的接口

Google 与联合国 9 月 17 日把 data.un.org 换成了基于开源 Data Commons 构建的 UN System Data Commons:26 个联合国机构承诺接入、约 20 家的数据已上线,平台原生支持 MCP(Model Context Protocol,一个让 AI 应用以标准方式直连外部数据源的开放协议),agent 可以直接查询权威数字并附上出处。动机很直接:据 TechCrunch 报道的一份 UNICEF 未发表工作论文,六个主流模型在超过 13.3 万次全球发展指标问答中平均准确率只有 21.2%,约六成回答给不出可用数字;隔两天重问同样的问题,给过数字的模型只有约一半还给同一个数。与其指望模型把数字背对,不如把权威数据变成模型随手可查的接口;对做数据 agent 或 RAG 的人,这是一个现成的公共范例。计划到 2027 年把联合国系统 80% 的统计数据集搬上平台。(另见 TechCrunch)

Base Labs 联合 Hugging Face、Goodfire,给开放权重模型立安全标准

推理服务商 Baseten 今年设立的研究部门 Base Labs 宣布与 Hugging Face、可解释性公司 Goodfire 合作,为开放权重模型建立一套「安全基础设施标准」:安全方法内建于训练和部署环节,而非事后外挂;Base Labs 负责训练与监测方法,Goodfire 出可解释性工具,Hugging Face 提供托管与分发(官方仅在 X 公告)。背景是 Hugging Face 上已有超过 6000 个 abliterated 模型,即社区用低成本手段剥掉安全拒绝行为后重新发布的开源模型。闭源厂商的安全栈管不到权重公开、人人可改的世界,这条平行路径确实缺人做;但三方目前没有披露任何技术细节,值几分要看后续交付。(另见 TechCrunch)

Amodei 的减速长文,反对者说争的是控制权

TechCrunch 综述了本周围绕 Dario Amodei 近四千词减速长文的各方反应。反弹最有分量的来自 Cohere CEO Aidan Gomez:「AI 需要护栏,这一点从来不是争议。争的是规则由谁来写、谁能参与、规则保护的是谁的利益」;中国外交部发言人则称美方在借 AI 治理「散布恐慌」。这篇是观点综述,没有新的事实增量,但它援引 The Information 的报道称 OpenAI、Anthropic 等正在筹建行业自律标准组织;只要「安全」论述与出口管制、标准制定这些实打实的市场结构工具捆在一起,「这是安全议程还是竞争策略」的追问就不会消失。

华为把 Ascend 960DT 提前到 2027 年一季度

华为在上海 HUAWEI CONNECT 2026 上宣布,训练芯片 Ascend 960DT 提前约三个季度、2027 年一季度就绪,推理款 960PR 提前一个季度至 2027 年三季度,之后 Ascend 970、980 按一年一代排到 2029(路线图细节另见 TrendForce)。值得对照的是同场的系统侧口径:Atlas 960 SuperPoD 此前宣传可扩展至 15488 卡,本周展示的是 4096 卡的配置。芯片时间表激进、系统规模收缩,更像是产能约束下先保证单芯片交付的取舍;对国内买家,「能买到」的时间点提前了,超大规模互联的承诺则打了折扣。(另见 TechCrunch,含华为发言人确认)

Crusoe 完成 39 亿美元 F 轮,投后估值 309 亿

数据中心与 AI 云公司 Crusoe 宣布 F 轮融资 39 亿美元,投后估值 309 亿美元,较去年 10 月 E 轮的 100 亿不到一年涨了约两倍;Atreides、Mubadala、Valor 领投,NVIDIA、Founders Fund、卡塔尔投资局等跟投。资金投向两头:为 OpenAI 建设的得州 Abilene 园区这类大型基地,以及可用卡车运输、号称把现场建设周期从数年压到数周的模块化数据中心 Crusoe Spark。公司称总合同价值已达 1400 亿美元,客户除 OpenAI 外还有 Meta、微软,以及签下 130 亿美元五年长约的 Jane Street。估值涨得快,支撑它的是长约收入的可见性;要盯的风险是这些长约向少数超级买家的集中度。(另见 TechCrunch)

Instinct 与 Meta 的 Muse 同日给 agent 接上电话线

个人 AI 助理 Instinct(上月完成 B 轮,累计融资达 3.5 亿美元、估值 25 亿)推出「Concierge」:agent 可以打真实电话,替用户预订不接受网上预约的餐厅、排牙医候补、和客服掰扯账单(官方仅在 X 公告);Meta 同日把个人 agent Muse 的美国商户外呼通话扩进 beta,也仅由 Meta 员工在 X 上宣布。两家都没有说明通话时是否向对方表明 AI 身份,也都没有公布针对通话的防滥用机制;我在别处也没有找到两家对这一问题的回应。agent 的活动范围从屏幕内扩展到电话网络,接电话的商户没有手段分辨来电是真人、受托的 agent,还是批量拨打的骚扰或诈骗。美国现有最接近的规则,是 FCC 2024 年裁定 AI 生成的语音属于《电话消费者保护法》(TCPA,美国规管 robocall 的法律)所称的「人工」语音,拨给消费者须事先征得同意;但这套框架是为批量骚扰电话设计的,套到「个人的 agent 给餐厅打一通电话」上如何适用,还没有先例。(另见 TechCrunch)

研究速递

LimiX-2:把表格数据的 in-context learning 从预测目标改成建模生成机制

Stable AI 与清华崔鹏团队。TabPFN 一类表格基础模型学的是「给定上下文样例,预测查询行的目标值」;LimiX-2 的「情境机制网络」改学上下文条件下的联合分布:预训练时随机遮住查询行的部分特征列,让模型基于未遮特征加上下文行重建,训练数据全部由结构因果模型合成。4.06 亿参数的主模型在三个表格基准的总体 Elo 上均列第一,特征注意力还能顺带恢复因果骨架(平均 F1 接近 0.80)。做表格 ML 或因果发现的研究者值得点进去看它与 TabPFN 路线的分野。

ScienceIDE:把科学代码仓库改造成 agent 可训练的环境

论文把 27 个科学代码库拆成 64 个可执行环境、2812 个任务(以代码修复为主),配 1076 项可执行检查,通过标准用数值容差或物理守恒量定义,每个环境的拆分都经领域专家审核。它点的问题很实:几十年的科研知识锁在研究代码里,难以变成可验证的训练信号。在这些环境上做 SFT 加 RL,个别环境的修复成功率大致翻倍,且能迁移到通用代码基准;前沿模型在其 Hard 子集上最高也只有约 67% 成功率,说明空间还很大。做科研 agent 或 RL 环境设计的人应该看。

价值扁平化:PPO 训大模型时 critic 的系统性失效

上海交大、上海 AI Lab 等。作者用蒙特卡洛续写估计真实状态价值,发现回复中途真实价值波动剧烈,critic 的预测却近乎一条平线;给出的解释是逐 token 的 value loss 隐含方差惩罚,会把预测往平里压。修法(SP³O)很简单:只在每条回复约 0.3、0.6、0.9 的相对位置几个锚点上算 value loss。Qwen3-4B-Base 上数学推理平均分比标准 PPO 高约 8 个百分点。用 PPO 做 LLM 强化学习的人值得对照检查自家 critic 是否也扁平,这是一个可以直接排查的具体失效模式。

今日一句话:插件市场的审核发生在上架那一刻,攻击可以发生在之后的任何一刻。今天就去查你的编程 agent 版本。