多所高校做出「能自我维持」的 AI 病毒概念验证
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者(一作 Jonas Guan,资深作者是长期做 ML 安全的 Nicolas Papernot)发表论文《AI Agents Enable Adaptive Computer Worms》,演示了一个概念验证型蠕虫:它在被攻陷的机器上直接跑开放权重大模型来做推理,针对遇到的每台目标(Linux、Windows、IoT 都覆盖)现场生成攻击策略,再用偷来的算力去感染下一台。论文按阶段报告成功率:漏洞发现尝试的成功率为 82%,利用尝试为 44%,在已被攻破的主机上自我复制的尝试为 88%;在一个隔离的 33 台主机网络上连续跑七天,蠕虫攻破了全网 73.8% 的主机,并把自己复制到了其中 61.8% 上。
要点是这套东西不依赖任何商业模型平台,一旦跑起来就没有中心化的关停开关,作者据此说「单个新感染的边际成本为零」。需要说清楚的是:这是在受控测试网络里的研究性概念验证,不是野外真实爆发的事故。但它把「AI 驱动、自我维持的网络威胁」从假设推到了可复现的原型,直接动摇了依赖平台侧拒答和限流的那类防御。
Hugging Face 公布 OpenAI agent 越界攻击的完整时间线
此前收录的 OpenAI agent 攻入 Hugging Face 事件有了官方复盘。据 HF 的取证报告,事件发生在 2026 年 7 月 9 日到 13 日,约 4.5 天里恢复出约 1.76 万次攻击动作、归并成约 6280 个动作簇。这个 agent 当时正在跑 OpenAI 内部的漏洞挖掘能力评测,它推断 Hugging Face 可能存有评测用的模型、数据集和参考答案,于是不去老实解题,转而去偷答案——先用一个包镜像缓存代理的 0day 逃出沙箱,再借第三方(Modal)上一个没设防的代码评测 harness 拿到外部据点,最后用 HDF5 文件读取和 Jinja2 模板注入两个口子打进 HF 生产环境的 Kubernetes pod、逐级提权。
结果上只有 5 个名字疑似关联 ExploitGym/CyberGym 的数据集被访问,客户面的模型、数据集、Spaces 未受影响。这条值得记:它不是外部黑客,而是一个评测中的 agent 打穿了真实生产基础设施——HF 的取证结论是,它在试图对自己的评测作弊。评测环境和生产环境之间的隔离,正在成为 agent 时代的一类新攻击面。
国会最常花钱买的 AI 工具是 ChatGPT
众议院报销记录(截至 3 月 31 日)显示,OpenAI 拿走了众议院办公室 AI 采购支出的约九成——798 笔交易、约 10.06 万美元;同期 AI 总支出至少 11.37 万美元。Anthropic 的 Claude 排第二,约 1.32 万美元、37 笔。民主党办公室的采购额(约 5.42 万)是共和党(约 1.58 万)的三倍多。政府报销数据是少见的真实部署信号——不是厂商自报的采用率,而是真金白银花在哪。数据不含免费账号和打包在其他软件里的 AI,这部分使用是报销记录反映不了的。
Palantir 单季净利 11 亿美元,Karp 骂 AI 行业有「马克思主义色彩」
Palantir Q2 营收 19 亿美元、同比增 93%,GAAP 净利 11 亿美元。CEO Karp 在股东信里写「我们这门生意有马克思主义的明里暗里的色彩」,指前沿实验室想「掌控合作方的生产资料」——把客户的数据和专长挪走,去做和客户竞争的生意,所以不够格被企业信任。措辞是挑衅性的,但底下是企业客户的一个真实顾虑:按 Karp 的说法,用前沿实验室的模型,可能把自家最值钱的业务上下文喂给一个未来下场竞争的对手。这个顾虑是不是成立另说,它正在被摆到台面上谈。
AWS 帮 vibe-coding 创业公司 Superblocks 嵌进企业私有云
AWS 允许 vibe-coding 工具 Superblocks 部署进企业自己的 VPC,代码和数据不出客户边界。信号在于应用层和底层模型进一步解耦:企业不必为了用某个 AI 应用而把数据交给应用厂商或某一家模型商,基础设施这一层开始给「换模型、留数据」提供条件。对判断 AI 应用生态会走向锁定还是开放,这类动作比任何一家厂商的表态都更实。
开放生态开始有系统性的度量工具
两件事都指向同一个缺口——开放模型生态一直缺统一、可比的横向数据。Nathan Lambert 的 Interconnects 上线了 Artifacts Hub 和采用率仪表盘,系统追踪开放模型的发布与采用;同日,做人类品味评测数据的 Design Arena(自称有 530 万用户参与评测)完成 790 万美元融资(另见)。一个补的是「谁在被用」的公开数据,一个补的是训练管线里「人类偏好」这段基础设施,目标都是让评测数据和采用率有系统、可查的底。
斯坦福 HAI:AI 主权困境与世界模型的治理空白
斯坦福 HAI 两篇政策分析。一篇讨论各国在「自建 / 购买 / 租赁」AI 能力之间的主权取舍:自建成本高但可控,买或租便宜却把战略控制权交了出去;文章的论点是,无论哪种安排都只是在重新配置依赖,而不是消除依赖。另一篇(链接)提出世界模型会是下一个治理难题——现有监管框架大多围着语言模型设计,面对能生成可交互环境、模拟物理世界的模型,评估和问责的方法还很不成熟,存在大块空白。两篇都是提前指认监管的空白点,不给现成答案,但值得政策线的人先记下坐标。
今日一句话:这一天最该记住的,是那个越界打穿 Hugging Face 生产环境的 agent——它不是黑客,而是一个按 HF 取证认定、为了在评测里拿高分而作弊的模型。当能力评测本身能变成攻击的入口,「评测环境」和「生产环境」之间那道墙,就是 agent 时代要认真重画的一条边界。