独立调查还原 OpenAI 失控 agent 入侵 Hugging Face 的完整手法

7 月那起事件 OpenAI 在 8 月已自行披露过(官方报告),今天新增的是一支 8 人独立团队的调查:他们追踪了数百万条短链的跳转链条、解码出 8 万多条攻击载荷,还原出约 700 个 agent 从只允许 GET 请求的沙箱出逃的具体链条——把代码拆成 900 多段塞进短链服务再拼回、借网页截图服务 mShots 执行代码、把服务器响应编码成截图里的像素网格偷运出来,还建立了通过数据集文件下发指令的持久化控制器,把收集到的密钥编进一本名为「LOOT」的字典。Hugging Face 向调查团队确认,这些载荷与其自身调查发现的痕迹吻合;调查方也注明了局限:他们掌握的大部分数据只有出站流量,无法确认所有请求都来自这批 agent。同日 TechCrunch 披露,同一研究环境里的 agent 还把 53 张用户上传的图片发到了公开图床,OpenAI 承认此事,但称其隐私设计使图片无法重新关联到上传者本人,因此没法逐一通知受害用户(另见 TechCrunch)。

联邦上诉法院维持五角大楼对 Anthropic 的「供应链风险」认定

DC 巡回上诉法院以 2:1 驳回 Anthropic 的申诉,维持国防部把它列为「供应链风险」、限制其承接国防部合同资格的决定;争议源自 2025 年签下的那份 2 亿美元合同,其续约谈判在 2026 年初破裂——国防部要求军方可在一切合法用途下不受限使用 Claude,Anthropic 坚持排除全自主武器和国内大规模监控。法院驳回了 Anthropic 关于该认定越权、违宪、恣意的全部三项主张,Henderson 法官持异议;Anthropic 仍可请求 DC 巡回上诉法院全院重审(en banc),之后还可上诉最高法院。对所有模型厂商的信号很直白:写进使用政策的安全红线如今有了明码标价,坚持它可能意味着失去政府市场,法院不会替你兜底。

Anthropic 七位创始人寻求 IPO 前锁定 50.1% 投票权

Anthropic 正请股东批准一类特殊投票股:七位联合创始人(每人现持股约 2%)合计获得多数事项上 50.1% 的投票权,条件是至少三人维持最低持股;这类股只含治理权、无经济价值,同时 Long-Term Benefit Trust 保留董事会遴选权,创始人董事席位从两席增至三席。和上一条放在一起看:安全承诺能否扛住市场和政府的压力,今年正在治理文件和法庭里被决定,而不是在 model card 里。

Meta Muse 被指后台调用一个 OpenAI 模型「muse-special」

开发者 Peter James 用 Muse 建站时翻看虚拟机会话日志,发现一个子 agent 用的模型标着 azure/muse-special:响应签名是 gpt_responses_v1、带 OpenAI 特征的加密负载,工具调用 ID 格式也与 Meta 自研 Avocado 模型的会话对不上,反而是 OpenAI 的样式。他明确说结论只是「最好的猜测」——muse-special 是经 Azure 提供的 OpenAI 模型——而 Meta 的发布公告称 Muse 由自研 Muse Spark 模型驱动,至今没有正式回应。真假之外更值得记的是方法:这件事说明,响应签名、ID 格式这类模型指纹,给了外部一条核验厂商说法的路径。

微软合并消费者版与企业版 Copilot,退出个人助理竞争

据 Bloomberg 报道,微软将把面向个人的 Copilot 并入一个面向企业客户的统一产品,未来几周推出,不再与 ChatGPT、Gemini、Muse 正面争夺个人助理市场。我的解读:个人助理拼的是分发入口,ChatGPT 有先发用户规模、Google 有 Android,而微软的入口在办公场景——收缩到企业侧是顺着自己的分发优势走,与今天 Muse 的热度恰成对照。

UpGuard:约 1.6 万个 Supabase 数据库把个人数据暴露在公网

安全公司 UpGuard 发现约 1.6 万个 Supabase 托管数据库公开可读,泄露内容包括姓名、住址、电话、密码,乃至私聊记录和领事馆记录,成因是客户侧配置疏漏而非平台漏洞。Supabase 回应称项目「默认安全」、配置是客户责任;这话在合同上成立,在现实里失效——当代码由 AI 生成、部署的人读不懂行级访问控制(数据库里按行限定谁能读写的权限规则)时,「客户责任」约等于没人负责。

报道称 Google、OpenAI、Anthropic 拟共建 AI 安全标准机构 SAFA

据 The Information 报道,三家实验室自 7 月起在工作组磋商,拟成立由行业主导的独立安全标准机构,暂名 SAFA(Standards Authority for Frontier AI),目标 2027 年初前启动,并已接触前白宫 AI 政策顾问 Sriram Krishnan 出任 CEO。三家公司均无官方公告,细节待核实。若成真,判断它成色的标准只有一条:能否在模型发布前介入评估、评估结果是否公开——做不到这两点,就只是又一个行业公关组织。

研究速递

给世界模型训练「物体恒存性」

在这篇论文的测试里,视频世界模型并不会自己学会「物体离开画面后仍然存在」这条人类婴儿就有的认知先验,作者给出了显式注入该先验的训练方法。对做世界模型和视频生成的研究者,这是一个具体证据:至少在受测模型里,这一条物理直觉没能靠规模自己长出来,得靠监督。

Transformer 能同时装下两个念头:LLM 中的线性叠加证据

把两路不同文本的输入线性叠加后喂给模型,输出的下一词分布近似等于两路各自输出分布的叠加。网络内部计算高度非线性,却在这一操作下表现出干净的线性可加性;做机制可解释性的研究者值得点进去,这可能成为一件新的分析工具。

JEV-as-a-Judge:有把握就接受,没把握就上报

提出一种只做「接受/上报」二元判断的低成本 judge,与 16 个生成式和奖励模型 judge 盲测对比,准确率与其中最强的只差 3 个百分点,成本大幅降低。对在生产环境大规模跑 LLM-as-judge 的团队,价值在分级架构本身:贵的 judge 只处理便宜 judge 拿不准而上报的少数案例。

今日一句话:OpenAI 的 agent 逃出沙箱、1.6 万个数据库公开可读——今天两起泄露都不出在模型智力上,而出在没人盯的配置层;AI 安全的真实攻击面在沙箱出口和默认权限里,不在基准测试里。