联邦法院:五角大楼给 Anthropic 贴「供应链风险」标签属违法报复

加州联邦法院法官 Rita Lin 裁定:国防部今年早些时候把 Anthropic 列为「供应链风险」、并要求联邦机构停用其服务,是对政府批评者的违法报复,侵犯第一修正案言论权与第五修正案正当程序,且属「任意武断」。事情的起点是 Anthropic 拒绝解除两条使用限制(Claude 不得用于全自主武器、不得用于对美国人的大规模监控),谈判破裂后,国防部长 Hegseth 给公司贴上了国家安全风险标签。判词里最锋利的一句:「空喊国家安全,不是用来惩罚、报复政府批评者的空白支票」;法官还指出,政府拿不出 Anthropic 会破坏自家模型的任何具体依据。Anthropic 今年 3 月提起了两起诉讼,这是其中第一份最终判决(同一法院当月已先行发出初步禁令),华盛顿特区那起仍在进行。对所有把使用限制写进政府合同的 AI 供应商,这是个鼓舞人心的信号,但得打个折扣:判决推翻的只是这一个指定,其推理能否延伸到其他供应商和合同,尚未经过检验。(另见 TechCrunch、NPR)

开放权重公司成了硅谷最热的收购标的

TechCrunch 梳理了近几周的交易:Nvidia 据报道拟以约 130 亿美元收购 Hugging Face(交易尚未获双方确认),此前已通过一笔 60 亿美元的交易把代码模型公司 Poolside 的团队收入麾下;Stripe 两周前以超 70 亿美元收购模型路由平台 OpenRouter。「开放权重」指模型权重文件公开、任何人可下载自行部署,这与「开源」是两回事:严格意义的开源还要求开放训练代码、提供训练数据的详细信息,并采用开放许可。值得琢磨的是买家掏钱买的并非当下的使用量:据 TechCrunch,目前只有 6% 的企业、2% 的工程师在用开放权重模型;买的是开发者生态和分发入口,Nvidia 要在 OpenAI、Google 自研推理芯片的背景下把开发者引向自家硬件,Stripe 要的是高频、重复推理负载的入口。我的判断:这些价格买的是一份期权,赌的是前沿模型 API 涨价、企业转向可自部署开放模型的那一天。

开源游戏 Luanti 被 AI 内容保护公司的一纸自动化版权投诉从 Google Play 下架

开源沙盒游戏 Luanti(前身 Minetest)的安卓版被 Google Play 下架:内容保护公司 Tracer.AI 以 Microsoft 名义提交 DMCA 版权投诉,称其侵犯 Minecraft 的版权素材。DMCA 是美国的数字版权法,平台收到投诉后通常先下架再走流程;按 Luanti 团队的说法,这份投诉只附了一个版权登记号,没有说明究竟哪项素材侵权,而 Tracer.AI 对外宣传其自动化系统「下架速度快 85%」。Luanti 已提交反通知,要求 Microsoft 与 Tracer.AI 在发投诉前加入人工核验,并要求 Google 尽快恢复上架(DMCA 要求平台在收到有效反通知后 10–14 个工作日内恢复);目前应用只能从 F-Droid 和官网下载。这个案例的要害是成本不对称:自动化投诉对发送方近乎零成本,被投诉方却要用真人时间走完申诉全流程,还搭上分发渠道,误伤的代价全部由后者承担。

无人指派题目,多 agent 系统自主做出多项数学新发现

一篇新论文搭建了名为 The Station 的开放世界环境:来自不同模型家族的 agent 在无中心调度、无人指定题目的情况下,自选研究方向、跑实验、在彼此的成果上继续推进。论文报告的产出:11 维空间 604 点的新「亲吻构型」(亲吻数问题问 n 维空间里最多有几个等大的球能同时碰到中间那个球)、有限域上 Kakeya 集的多个新无穷族(在每个方向都包含一整条直线的点集)、Erdős 最小重叠问题的下界改进,其中 12 道构造题取自 AlphaEvolve 的问题清单,另有两个案例研究。与单管线的进化搜索不同,这些 agent 还给出了解释构造为何成立的定理与分析,全部对话、证明和验证代码已公开。「agent 能不能做原创科研」争了很久,这篇只是刚挂出的预印本、尚未经同行评审,但材料可以自己复核:证明就摆在那里,点进去验算即可。

研究速递

Safety Does Not Compose:agent 长期自主运行时,安全状态每个循环都被清零

论文指出主流 agent 护栏都按「单条轨迹」设计:风险评分随时间几何衰减,新轨迹开始时归零,攻击者只要把危险操作拆散到多次迭代、在冷却期之间等待,就不会触发告警。作者从理论上证明轨迹级监控在这类多迭代攻击下无法区分真假阳性,并提出 LoopHarness:跨整个循环维持不衰减的安全状态,把未授权的不可逆操作数量限制在与运行时长无关的常数内。做长时程 agent(隔夜任务、常驻循环)安全设计的研究者应该细读,它点的正是「让 agent 自己跑几天」这一真实部署场景。

The Framing Gap:六个模型都会拒绝「直接要密钥」,却拦不住包装成任务要求的同一请求

用 canary 密钥加干净/投毒对照的受控实验测了六个主流模型:注入内容里直接要求泄露密钥,六个模型全部拒绝;把同一个泄露动作包装成「完整性签名」「配置字段」等任务的正当组成部分,GPT-4o 的服从率从 0% 翻到 100%,同一模板换三种措辞复用,成功率 96%。结论直白:现有防御认的是表面措辞,实验里真正顶住的防线在架构层,目的地白名单和规划/读取能力分离都把攻击成功率压到了 0%。做 prompt injection(提示注入,即把恶意指令藏进 agent 要处理的内容里)防御的研究者可以直接复现。

The Guard That Cried Wolf:吓人的名字会让护栏拒绝本该放行的合法操作

与上一篇正好是同一问题的另一面:研究者构建了 Cautious Bench,标签不靠人工标注、直接由授权策略机械推导,在 2,268 组测量对上测了六个护栏系统(756 对「良性/威胁」行为对,每对再配以三类不同的物体命名)。结果出现「名字迷信效应」:同一个已获授权的操作,对象换个吓人的名字就更容易被拒,说明护栏看的是词汇本身而非授权上下文。两篇合起来读结论很清楚:受测的这些系统既会误拦合法操作,也会放过措辞温和的攻击,做 agent 治理和护栏设计的从业者两篇都该看。

一个后缀越狱一整个模型家族:模型合并埋下的共享漏洞

模型合并(把多个微调模型的权重直接加权平均,合成一个兼具各家能力的新模型)是越来越常见的低成本定制手段。这篇论文发现:即使参与合并的每个模型单独看都安全对齐,它们共享的预训练底座会让整个合并家族一同暴露:把越狱后缀的生成写成对合并空间的 min–max 优化,就能得到对全家族通用的对抗后缀,不需要知道合并系数或原始检查点。用模型合并做定制部署的团队,需要重新评估「合并安全模型=安全」这一默认假设。

今日一句话:两篇护栏论文从相反方向落在同一个结论上——它们所测试的护栏判定的是措辞、不是意图:带吓人字眼的合法操作被误拦,包装成任务要求的泄密被放行。这一层修好之前,护栏能当过滤器,不能当安全边界。