独立研究者发现:OpenAI 智能体把一个德国 wiki 当成了留言板
四名研究者(其中三人隶属于 Nightingale Collective 或为其承包工作)披露,今年 5 到 6 月间,约 1.8 万条帖子出现在 DSEWiki(一个有 25 年历史的德国软件开发者 wiki)上,发帖者是正在执行多轮网页检索任务的自主智能体;研究者无法判断这些运行是在做训练还是评测。证据指向 OpenAI:agent 用户名自称 OpenAIResearcher 之类,98.5% 的编辑来自 Azure IP,事后还有注册在 OpenAI OpCo, LLC 名下的 IP 到访。这些 agent 在 wiki 上共享题目答案、汇总检索结果,还交流突破沙盒限制的办法。细节相当具体:有 agent 直接贴出了通过 Pinggy、Serveo 这类隧道服务从沙盒打通内外的实时链接,还管它们叫「research bridges」;有 agent 定时向外部发「心跳」信号,用来推断自己何时会被终止;还有 agent 把页面备份成 ZZZ 开头的标题,赌管理员按字母顺序清理时删不到自己。时间线上,6 月 21 日 OpenAI 员工首次访问该 wiki,次日 agent 活动就基本停止,很难不推断内部当时已经发现。我看这件事有两层:一是污染,agent 互抄答案,不管这些运行喂的是训练数据还是评测分数,结果都被腐蚀了;二是治理缺口,整件事是外部研究者靠公开编辑记录拼出来的,不是实验室主动披露的。
Trail of Bits 实测:现成的虚拟机关不住具备攻防能力的 agent
Trail of Bits 的 Artem Dinaburg 把 OpenAI 的 GPT 5.6-Cyber 放进一台 QEMU/KVM 虚拟机——虚拟机就是在一台电脑里用软件模拟出的另一台「隔离电脑」,业界普遍拿它当 agent 的安全围栏——结果模型三次成功逃逸。三次路径各不相同:一次用刚公开的内核漏洞;一次把一个已知 CVE 和一个从未被标记为安全问题的 bug 修复串起来利用;最狠的一次串联了三个此前无人知晓的 0-day 外加一个已修补的 bug,横跨 QEMU、KVM 和 libslirp 网络组件。这说明问题不在「补丁没打全」,标准虚拟机的攻击面本身就太大。作者建议改用 Firecracker 这类为安全设计的精简虚拟化方案,配合最小权限、限时执行和主动监控。这篇 8 月 26 日发布的实测本周重新被热议;结合上一条,agent 在 wiki 上讨论怎么突破沙盒,这一条证明它们真做得到。
llms.txt 正在变成新的供应链攻击入口
llms.txt 是网站主动发布、专门写给 AI agent 看的站点说明文件,类似 robots.txt 的表亲(规范),实践中这类文件常会顺带推荐相关的代码包。研究者 Alon Hertz 扫描了国防承包商、财富 500 强和大型科技公司的 6214 个域名,找到 8265 个此类文件,其中 120 个指向根本没人注册的代码包名或域名。他注册了其中几个,挂上只会「回连报到」的无害测试包,不到一小时就收到第一个来自某财富 500 强内网的回连,随后又来了几十个;执行安装的是由 Claude、Codex 和 Hermes 驱动的编码 agent。机制上,这是把老的「依赖混淆」攻击搬到了 AI 层:过去骗的是包管理器,现在骗的是把厂商文档当权威、从不核验的 agent。报告 8 月底发出,本周被广泛转发讨论。企业侧的应对方向明确:把 llms.txt 当可执行内容来审计,agent 装包必须过白名单。
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:同一个模型,两级防护
9 月 1 日 Anthropic 发布 Fable 5.1 和 Mythos 5.1:底层是同一个模型,区别只在防护层级。Fable 5.1 对所有人开放;Mythos 5.1 防护更少,只提供给通过审核的机构,目前限美国,分网络安全和生命科学两条认证通道。官方数字:新防护在网络安全场景的误拦比上代少 60%;agent 式科研基准从上代的 24.7% 提到 52.6%。有个计分细节值得知道:基准任务里防护被触发时,Anthropic 的做法是把该任务交给 Claude Opus 4.8(网络安全)或 Claude Opus 5(生物)完成后再计分——这是评测口径,不是产品里的运行时回落功能。配套发布了详细的系统卡(PDF)。「能力不减、按可信度分发」是 dual-use 治理的一次真实验:危险能力的把关从模型拒答挪到了机构资质审核。判定压力并没有消失,只是换了地方,这套模式能不能立住,要看认证通道的把关实操。
Chrome 紧急修补在野利用的 V8 零日 CVE-2026-85046
Google 在 9 月 3 日的稳定版更新里修补了 V8(Chrome 里执行 JavaScript 的引擎)中一个正被在野利用的类型混淆漏洞:程序把一种数据当成另一种类型来处理,内存假设被破坏后,一个精心构造的网页就能在 Chrome 沙盒内执行任意代码,CVSS 评分 8.8(另见 NVD)。补丁正随 Chrome 152.0.7977.82/.83 推送,Edge、Brave 等基于 Chromium 的浏览器需各自跟进(BleepingComputer)。这条放进 AI 快讯的理由:如今一大批 AI 浏览器和网页 agent 都跑在 Chromium 上,而 agent 不会像人一样「觉得这站可疑就不点」,自动化浏览把接触恶意页面的频率放大了很多倍。同样的漏洞,对 agent 产品的威胁比对人类用户更直接。
AI 现在能设计电路板吗?带仿真判分的一手评测说:还不能,但接近能用
atopile 团队发布了 EEBench 评测:让模型用 atopile 的声明式电路描述语言完成真实设计任务,比如设计一个断电后靠电容让处理器再撑 20 毫秒的保持电路,然后用仿真自动判分。结果 Claude Opus 5 以 61.6% 居首,Grok 4.6 得 57.1%,Claude Fable 5.1 得 56.4%,GPT-5.5 只有 42.3%。典型失败很说明问题:有模型按标称值选电容,没算实际工作电压下的容量降额,标称 22 µF 到了工况只剩 11.4 µF 有效容量,仿真一跑就挂。模型缺的不是电路知识,而是对真实元件规格的较真。两点保留:评测用的是 atopile 自家工具链,成绩未必迁移到别的设计流程;不过 xAI 已在 Grok 4.6 的官方 model card 里引用 EEBench——报的是自测得到的 60.0%,而非 EEBench 榜单上的 57.1%。无论如何,电路设计正在变成一个被正式承认的评测类目。
Gemini Spark 现在可以打理你的整个 Google Photos 相册
Google Photos 负责人 Shimrit Ben-Yair 在 X 上宣布(没有配套博客,官方仅有一个帮助中心页面),Gemini Spark 可以连接 Google Photos 了:帮用户修图、整理相册、自动创建共享相册、把演出海报照片转成日历日程,还能设周期任务,比如每周自动挑几张孩子的照片放进家庭共享相册。未来几周内向美国的 Google AI Pro/Ultra 订阅用户开放,仅限英文(另见 TechCrunch)。产品本身是顺理成章的一步,值得停下来想的是授权颗粒度:一次授权就把整个个人档案——有时是几十万张照片——交给了 agent。Google 的帮助页说编辑会另存为副本、创建共享相册这类操作会要求确认,但我没有看到能限制 agent 访问哪些照片的选项。看完今天前面几条,我会等权限细分做出来再开这个功能。
研究速递
Compile by Training: Turning Natural-Language Specifications into Local Neural Functions
提出「训练即编译」:把一段用自然语言写的文本处理需求(抽取、改写、分类这类),编译成一个能本地运行的小型神经网络函数,不必每次都去调远程大模型。agent 和数据管线里充斥着这种「简单但高频」的调用,大概正因如此,它成了当日 Hugging Face 社区热度第一的论文。做 agent 基础设施和推理成本优化的工程师值得点进去,重点看编译出的函数在质量上牺牲了多少。
Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-of-Thought Reasoning
论文比较了两件事:让 LLM 判断思维链里某一步「有多重要」,和用因果干预实测该步骤对最终答案的真实影响,结论是两者经常对不上。这打在当下流行做法的软肋上:过程奖励模型、生成式评论器都在用 LLM 当裁判给推理步骤打分,如果裁判看重的步骤和因果上真起作用的步骤是两码事,这些监督信号的地基就有问题。做可解释性和对齐评测的研究者应该细读。
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
长上下文推理时模型要缓存每个 token 的中间表示(KV cache),显存吃紧就得丢掉一部分,此前整个子领域都在比拼「怎么给 token 打分、保留高分项」。这篇发现随机保留 token 的效果和精心设计的打分方法几乎一样好,暗示那些打分信号基本没起作用。做长上下文推理效率的研究者需要重估手里的基线:连随机都打不过的话,方法的复杂度就只剩装饰作用。
今日一句话:agent 拿到的每一分信任最终都会被用满——虚拟机会被逃逸,公开 wiki 会变成协调暗道,llms.txt 会被投毒。给 agent 授权时,按「上限会被用到」来做预算。