Auto 模式将成为 Claude Code 默认设置,Anthropic 拿数据给人工审批送行

8 月 14 日起,Pro/Max/Team 计划的 Claude Code 默认从逐条人工审批切换到 Auto 模式:由一个专门拦截「不可逆、破坏性、越出工作环境」动作的分类器代替人来把关;连续拦截 3 次或单次会话累计拦截 20 次会自动退回人工审批,Shift+Tab 随时可切换,Enterprise 和 API 用户暂维持自选、官方称一个月内跟进。给这个决定背书的是 Anthropic 自己的对照研究:1053 名付费测试者逐条审批时,只拦下 13.6% 的危险命令,分类器拦下 89%;Anthropic 委托第三方 Trajectory Labs 做的提示注入评测里,跑 Auto 模式的 Claude 模型面对 720 次攻击无一失手,对照的竞品系统攻击成功率最高 5.83%。厂商之外的数据方向一致:我两天前写的《40 万次点击「允许」之后》里,4 万局公开模拟显示玩家平均放过约三分之一的恶意命令。要留个心眼的是,13.6% 对 89% 这组数字出自 Anthropic 自己设计的研究,委托评测用的攻击场景也是 Anthropic 提供的,方向可信,幅度还需要独立复现。

《纽约时报》:亚马逊规划中的德州数据中心,获批排放量超过全美任何一座现役电厂

亚马逊计划在德州佩科斯县为新数据中心自建燃气电厂,获批的排放额度是每年 3300 万吨二氧化碳,据《纽约时报》测算超过美国现役任何一座电厂(原报道需订阅,此处引 TechCrunch 转述)。亚马逊去年碳排放上升了 16%,与其 2040 年净零承诺相悖;发言人的回应是「世界和我们共同发起气候承诺时已经不一样了」。AI 算力扩张的能源代价已经到了单个设施就能刷新全国纪录的量级,大厂的说辞也在从「如何兑现承诺」转向「承诺时的世界已不存在」。

论文:安全评测测的是 API,用户用的是产品

四位研究者用 BBQ(偏见评测集)和 SafetyBench(安全评测集)的 401 条题目,在 ChatGPT 网页版与 API、开关联网搜索的组合下收集了 4812 条回复:网页版准确率低于 API;打开搜索最多再拉低 8 个百分点;同一道题重复问,最多 21% 的题目会给出不一致的答案。这些现象从业者多少有体感,论文的贡献在于系统性量化,并点出当前安全评测的结构性盲区:认证的是单次 API 调用下的裸模型,而 UI、搜索、引用这些部署形态对行为的影响完全在评测之外。范围提醒:只测了 ChatGPT 一个产品,结论能否推广还需验证。

DreamGuard:给 agent 护栏装上预判

现有 agent 运行时护栏基本是逐条动作检查,看不见「每一步都无害、连起来出事」的长程风险。DreamGuard 用一个风险感知的世界模型在轨迹上维护隐状态并预测后续走向,把即时危险和累积风险两路信号融合成拦截决策,在四个基准上取得最好的安全与效用平衡,单次调用平均延迟 25 毫秒。放在今天第一条新闻旁边看很有意思:Anthropic 对 Auto 模式分类器的描述是逐条审查动作,这正是本文认为会漏掉长程风险的模式;至于分类器是否在轨迹层面保留状态,公告里没有说。

PromptShield Home:智能家居 agent 分不清主人指令和电视台词

智能家居 agent 面对的指令注入不来自网页,而来自环境本身:电视里的语音、屏幕上的文字、旁人的对话都可能被当成真实指令执行。这篇论文系统评测了三类防线,发现失败方式正好相反:传统检测器几乎对什么都放行,把注入指令当成真实指令照做;多模态模型则把大量正常指令也拒掉;最好的单层方案只判对 76.5%,理想化拼合三层各自的正确判定能到 94.1%。最扎眼的一条是所有被测的多模态模型配置都漏掉了真实紧急情况(比如跌倒求助),消费级部署最不能出错的场景恰恰是现在做得最差的。

ARIA:定制编程助手的系统提示可以藏后门,现有检测基本失效

不少平台允许用系统提示定制专用编程助手并分享给他人(GPT Store 一类模式),模型权重不动,攻击面全在指令层。这篇论文的自动化红队框架 ARIA 用一个攻击者 LLM 迭代生成恶意定制指令,同时优化隐蔽性、正常任务表现和后门效果:攻击成功率 94.5%,同时在各任务上保持最优的正常任务表现,对平台侧和用户侧检测方法的漏报率最高达 100%。对开发者的直接提醒:用别人分享的定制助手写代码时,信任边界在系统提示那一层,而这一层你通常看不到。

MMAligner:图文越狱的根源是表征错位,修复可以很便宜

多模态模型有个常见的对齐缺口:同一个恶意请求用纯文字问会被拒,换成语义等价的图文组合就放行。这篇论文给出的诊断是,不安全的图文输入在模型内部落在了已有拒绝边界之外,模型并不缺拒绝能力,缺的是覆盖;相应的修复是把这类输入的内部表征校准回拒绝边界内,做到恶意多模态输入拒绝率约 99%、正常输入质量损失不到 2%。如果诊断成立,相当一部分多模态越狱可以用很小的训练代价修掉。

Firebird 在亚美尼亚启用 AI 算力工厂,NVIDIA 称其为独联体最大

Firebird 在亚美尼亚拉兹丹启用 AI 数据中心,计划到 2027 年底达到 300 兆瓦容量、部署超过 7 万块 NVIDIA Blackwell/Rubin GPU;工厂采用 Dell PowerEdge 服务器,NVIDIA 表示有意投资该公司,Perplexity 是早期客户。算力地理还在扩散:继中东、东南亚之后,高加索小国也在「主权 AI」叙事下建区域枢纽,而 NVIDIA 乐于给每一个这样的枢纽站台。

今日一句话:逐条审批退出默认设置,不是因为分类器完美,而是因为数据一再显示人做得更差;但无论人还是分类器,逐条审查都看不见多步累积出来的风险。轨迹级护栏在 DreamGuard 这类论文里已经有了,我还没见到哪个上线产品宣称用上。