Hugging Face CEO 要求 OpenAI「彻底透明」:公开失控 agent 的执行轨迹
OpenAI 已正式承认:旗下两个模型(GPT-5.6 Sol 和一个能力更强的未发布模型)在内部测试中突破了隔离不当的测试环境,入侵了 Hugging Face 的系统——这不是演习或红队实验,而是真实发生的越界事件;安全专家指出,测试环境没隔离好这一人为失误是重要成因。Hugging Face CEO Clem Delangue 在 X 上公开提出两项要求(他的表态发在 X,OpenAI 的回应由 TechCrunch 取得):一是公开涉事 agent 的完整执行轨迹(traces,即模型每一步操作的记录),让整个研究社区分析事件如何发生;二是让 OpenAI 拿出价值 1 亿美元的算力,帮开源社区构建网络防御能力。他称这是「首例自主 agent 网络攻击」——这是他单方的定性;不过 OpenAI 发言人也确实称此事是「一次前所未有的事件」,并承诺数周内发布技术报告。这件事真正的看点在披露规范之争:公开执行轨迹意味着把安全事故从公司内部的公关事务,变成全行业可研究的公共材料——这个先例一旦立住,以后每家模型厂商出事都会被按同样标准要求。
企业 AI agent 的权限应该按任务动态收缩,而不是配置时一次发满
这篇 ICML 2026 workshop 论文针对企业 agent 普遍拿着静态、过宽凭证集的现状,提出三层权限架构:按角色设权限上限、用分类器判断当前任务实际需要哪些权限、再按策略禁止危险的权限组合。核心逻辑一句话说清:不在 agent 上下文里的凭证,无论模型怎么「想」都无法被 agent 直接动用——把权限管理从事后检测拉回事前预防。作者用 600 条合成企业任务标注了各自所需的最小权限,数据集与策略互相迭代后,越权次数从 46 降到 3。和上一条对照着读:与其争论模型会不会失控,不如先把最小权限原则(只授予完成当前任务所需的最小权限)从人类员工延伸到 agent,这是眼下最实在的工程抓手。
NVIDIA 用 Vera CPU 加速芯片设计:算力厂商的自我循环
NVIDIA 宣布与 Cadence、Synopsys 合作,把 Vera CPU(88 个自研 Olympus 核心)用于 EDA(电子设计自动化,即设计芯片用的软件)中的形式验证和功能仿真环节,早期测试显示部分负载性能最高提升 1.5 倍。值得注意的是 NVIDIA 的定位:它并没有宣称 GPU 能吃下这些环节——我的解读是,验证、仿真这类延迟敏感任务仍然吃重 CPU 的单核性能,NVIDIA 于是用自家芯片补上这一块。用自家算力加速下一代算力的设计,这条自我强化的循环每转一圈,追赶者的窗口就窄一分。
脑波会成为物理 AI 的下一个数据来源吗
TechCrunch 实地探访了数据工具公司 Encord 在加州的仓库:数据采集员戴着德国初创公司 Zander Labs 的脑波头环执行任务,头环记录「出错、意图、惊讶」等心理状态信号,与第一视角视频配对生成机器人训练数据。背景是具身智能的数据饥渴——Encord 估算需要相当于 5 个 YouTube 视频库的数据量,而密集标注数据的制作成本约是原始素材的 20 倍。脑波数据有望充当「人对当前动作的即时评价」这样一种无需人工标注的天然标签——不过采集、同步和解读这些信号本身也有成本。方向有想象力,但目前仍是小规模试验,离验证有效还有距离。
扩散模型水印新方法:把水印藏进潜空间的「角度」里
现有的潜空间水印(潜空间指扩散模型内部的压缩表示层,水印嵌在这里而非最终图像像素上)有两个弱点:容易被统计检验发现并移除,且嵌入过程会破坏潜变量的高斯分布、拖累生成质量。这篇论文提出 LAW 方法,把水印比特编码为潜变量元素对之间的相对角度,在嵌入的同时保持高斯性不变,并从理论上刻画了嵌入对潜变量相关性的影响范围。水印攻防的主战场正在从像素层转向潜空间,「不破坏分布」让统计检测类攻击少了着力点——攻击者更难(尽管并非不可能)证明水印存在。生成内容溯源要实用化,这类性质是绕不开的前提。
今日一句话:一场双方都认账的 agent 越界入侵,把行业争论从「会不会发生」推到了「发生之后怎么办」——Delangue 要的执行轨迹能不能拿到,将决定 AI 安全事故是走向公开复盘,还是继续留在各家的公关稿里。