Anthropic:Claude 在两套加密算法里找到数学层面的弱点

Anthropic 的 Frontier Red Team 让 Claude(Mythos 预览版)在半自主的 agent 框架下做密码分析,找到了两处算法层面(而非代码实现层面)的缺陷:一是把正在参与 NIST 后量子密码标准化的签名方案 HAWK 的密钥强度砍掉一半——要维持原有安全水平,密钥尺寸得加倍;二是对削减到 7 轮的弱化版 AES(完整版为 10 轮)给出一种名为 Möbius Bridge 的新攻击,比已有攻击快 200 到 800 倍。成本值得记一笔:HAWK 一项花了一位研究者约 60 小时协作、约 10 万美元 API 开销;AES 一项 Claude 自主跑了三天实验,全程只需三次实质性人工提示。Anthropic 强调两项发现都无现实影响(HAWK 尚未部署,完整版 AES 不受波及),但也点出了真正的问题:哪天模型在正在使用的加密系统里找到能直接利用的漏洞,披露流程该怎么走——他们这次是先与政府和业界沟通后才公开的。

美国最大电网 PJM:不自带发电的新数据中心,2027 年起可被优先限电

覆盖美国 13 个州及华盛顿特区、6700 万用户的电网运营商 PJM 董事会 7 月 27 日宣布两项措施:一是加开一场一次性补充容量拍卖(9 月 30 日至 10 月 21 日进行),填补最近一次容量拍卖留下的缺口;二是建立大负荷用户框架——2027 年 6 月 1 日前未自带发电、也未另行锁定供电的新增大负荷设施,电力紧张时将先于常规应急措施被限电,两项都将提交联邦能源监管委员会(FERC)审批。背景数字很直白:PJM 预计到 2038 年大负荷用户新增 70 吉瓦需求,而 2022 年以来已有 15 吉瓦发电容量退役。此前对数据中心限电只是临时应急授权——今年 5 月高温天气期间,美国能源部就曾给 PJM 发过一次这样的授权(Utility Dive);这次要固化成常设规则——AI 算力扩张的硬约束,正从芯片供给转向电网容量(另见 TechCrunch)。

Cyera 拟以约 10 亿美元收购 Oasis Security,买的是 agent 的身份与权限管控

数据安全公司 Cyera 宣布收购 Oasis Security。Oasis 做的是非人类身份(non-human identity)安全——企业里的服务账号、密钥、token,以及数量正在急速增长的 AI agent 的身份、权限和行为监控;Cyera 称这类身份半年内增长了近 500%,计划把它与自家的数据安全能力合成一个平台,管住「每个 agent 能看什么、能做什么」。官方公告未披露金额;据 TechCrunch 报道,双方签署的是收购意向书,作价约 10 亿美元、大部分为现金、其余以股票支付,是 Cyera 今年第三笔收购(另见 TechCrunch)。agent 的权限治理从合规话题变成十亿美元级并购标的,说明企业侧已在为此真金白银付费。

OpenAI 上线 Codex Security:把安全扫描做成 CLI 和 CI 组件

OpenAI 在 GitHub 开设 codex-security 仓库:一个可经 npm 安装的命令行工具加 TypeScript SDK,用于扫描代码库漏洞、审查代码改动、跟踪历史发现,并能接入 CI 流水线自动运行,上线当天在 Hacker News 拿到超过 300 分。它与 Anthropic 同日发布的密码学研究正好是一件事的两面:模型找漏洞的能力,一边被产品化成防御工具,一边被当作需要谨慎披露的风险来管理。

Gemini API 给托管 agent 加上 hooks:拦截、审计、预算都成了 API 参数

Google 更新 Gemini API 的 Managed Agents(一次 API 调用即可在隔离云沙箱内完成推理、执行代码、安装依赖、管理文件和联网检索的托管 agent):默认模型换成 Gemini 3.6 Flash;新增环境 hooks——agent 每次执行代码或读写沙箱内文件的前后,自动运行开发者预先写好的一段脚本,由脚本决定放行、拦截还是记录,比如写一条 hook 检查 agent 要写入的文件路径在不在允许清单里,不在就直接拦下;也可用来自动校验输出、审计 agent 在沙箱里的动作(hooks 只覆盖沙箱的内建工具,不含外部函数调用和 MCP 工具)。这里顺带分清几个容易混的词:沙箱、Docker、Python 的虚拟环境(virtual env)解决的都是「隔离」——给代码圈一块独立的运行空间,让它折腾不到外面的系统,三者只是隔离程度不同(Docker 隔离出一整套操作系统环境;virtual env 只隔离软件包版本,防依赖冲突用的,谈不上安全防护;这里的云沙箱则是 Google 在云端提供的隔离环境);hook 不负责隔离,它是插在流程节点上的检查点。打个比方:沙箱是把 agent 关进一间独立工作间,hook 是守在门口的检查员,agent 每个动作都先过它的手——隔离决定 agent 在哪干活、碰得到什么,hook 决定每一步放不放行、留不留记录,两者互补。此外还新增 max_total_tokens 预算上限和定时触发器。值得注意的趋势是:拦截、审计、预算控制这些原本要开发者自己搭的治理层,正被平台吸收成 API 原语——上一条里 Cyera 花 10 亿美元买的能力,模型平台在用内建的方式提供另一个版本。

论文:越狱防御不是免费午餐,三类方法三种代价

这篇系统评测把 LLM 的越狱防御按机制分为规则类、自我反思类、多轮类三种,在主流开源模型和基准上量化了各自在安全性、过度拒绝(over-refusal,把正常请求也拒掉)和推理成本三个维度的取舍:规则类最能保住模型原有任务能力;保守的自我反思类误伤最重,正常输入频繁被拒;多轮类运行开销最高。单看这几条结论确实不新——「防御有代价」在从业者里近乎常识。这篇的贡献在量化而不在定性:防御方法通常由提出者在各自的模型、数据和指标下报告效果,安全收益之外的副作用少有统一口径的横向对比;这篇把三类防御放进同一批模型、同一套基准里测,把误伤率、推理开销、能力损失变成同一把尺子下可比的数字,并把这套评测本身发布为可复用的基准。论文也没有声称发现了新现象,其自我定位就是「评估防御副作用的基准,加上部署约束下选型的实用指引」。对部署者的用处在此:防御几乎不会提升模型能力,选哪种取决于你更怕漏放、更怕误伤还是更怕成本,如今这笔账有具体数字可查。这和内容审核里「同一个系统,有人抱怨误报多、有人抱怨漏报多」是同一类结构性权衡,没有全赢的选项。

OpenAI 实地报告:coding agent 进科研,瓶颈挪到了「验证」

OpenAI 发布一份实地报告(PDF),记录科研团队用 AI coding agent 改造老旧科研软件的八个项目:RNA 测序质控提速 60 倍;2 万行 C/C++ 基因组比对器用 Rust 重写、结果一致率 99.8%;合成基因组生成从 1610 秒压缩到 27 秒。报告里最值得留意的判断是:当工程人力不再是科研计算的瓶颈,瓶颈就变成了验证 agent 的产出——每个成功案例背后,都有一位科学家先定义了「什么算正确」并搭好验证机制,这一步 agent 自己做不了。给「AI 加速科学」的热度加一条脚注:加速的是写代码,不是判断。

今日一句话:电网把数据中心列进可限电名单,企业花十亿美元买 agent 的权限管控——AI 的约束条件,正在从「模型能做什么」转向「现实世界允许它做什么」。