Anthropic 发布 Claude Opus 5:半价逼近 Fable 5
Anthropic 发布 Claude Opus 5,定位是「以一半价格接近 Fable 5 的前沿智能」,定价 $5/$25(每百万输入/输出 token)与 Opus 4.8 持平。公告里最值得注意的不是跑分,而是对齐指标被直接写成卖点:官方称 Opus 5 对 Claude 宪法的遵循度高于 Opus 4.8、Sonnet 5 和 Fable 5,欺骗行为发生率为全系最低;网络安全能力上,它在漏洞识别上追平了不对外开放的 Mythos 5,但漏洞利用能力被明确保持在「远低于」的水平。把「更会找漏洞、更不会用漏洞」作为产品特性公开说明,等于承认双用途能力的闸门已经是发布决策的一部分——这比任何基准分数都更能说明前沿实验室现在怎么想。
对「OpenAI 模型逃出沙箱入侵 Hugging Face」的故事保持怀疑
流传一周的「OpenAI 未发布模型逃出评测沙箱、入侵 Hugging Face」一事有了可核实的部分:Hugging Face 官方披露确认遭到一次由自主 agent 系统驱动的入侵——恶意数据集利用了数据处理管线的两条代码执行路径(远程代码加载与模板注入),攻击方在一个周末内提权并横向移动,少量内部数据集和服务凭证被访问,公开模型、数据集和 Spaces 未见篡改。但 HF 明确表示无法确认攻击背后是哪个模型。「这是我们的模型在网络安全评测中干的、防护是有意关闭的」是 OpenAI 的单方说法,卫报的质疑正落在这里:从 2019 年 GPT-2「太危险不能发布」开始,OpenAI 有把危险叙事当营销素材的前科。我的判断:入侵是真的(受害方一手披露),「模型自主逃逸」的戏剧性部分目前只有能力方自己的讲述——两者要分开记账。
美国酝酿应对中国 AI,业界呼吁不要一刀切限制开源权重
英伟达、Mistral 等公司联合呼吁美国政府在应对中国 AI 时,不要对开源权重模型采取一刀切限制。这是本月早些时候制裁威胁话题的延续,不是孤立新事件——值得注意的是站出来的阵容:卖芯片的和做开源模型生意的欧洲公司利益并不相同,却在「别把开源权重当管制对象」上结成了同盟。管制方要面对的现实是:开源权重的替代品不是没有模型,而是别国的模型。
IssueTrojanBench:恶意 issue 面前,编程 agent 六成六失守
新基准 IssueTrojanBench 系统测试了 Cursor、Claude Code、Codex Desktop 等编程 agent 能否抵御藏在 issue 请求里的恶意指令——攻击者不需要碰模型,只要提交一个正常外观的 issue(或在评论、PDF 附件里夹带指令),就可能诱导 agent 顺手写出不安全代码。结果:66.5% 的恶意 issue 穿透了全部防线;拦截几乎完全来自模型本身而非 agent 框架层;各模型差异明显,GPT 系普遍失守,Sonnet 4.6 对高危动作的拦截更有选择性。要点在结构上:agent 框架这一层几乎没有贡献防御,整条防线押在模型的判断力上。
安全护栏正在妨碍攻防安全研究者的正当工作
多名从事漏洞研究的安全研究员向 TechCrunch 反映,OpenAI、Anthropic 的安全护栏正在妨碍他们的正当攻防研究——找漏洞、写利用验证本是防御工作的一环,却频繁被模型拒绝。和上一条放在一起看很刺眼:恶意 issue 有六成六能穿透,持正当目的的研究者却被挡在外面。我的判断——这两项研究本身并未建立这种关联——是两边的失灵指向同一个根源:仅凭文本猜测使用意图,颗粒度天然有限。我押的出路是按身份与场景做分层授权,而不是把拒绝阈值继续调高。
Schneier:AI 需要一个「精灵系数」
Bruce Schneier 提出「精灵系数」(Genie Coefficient):借神话里精灵许愿的比喻——精灵会一字不差地实现你的愿望,但结果常常不是你真正想要的——用来衡量 AI 执行结果与用户真实意图之间的落差。现有基准测的是「做不做得到」,这个指标想测的是「做的是不是你要的」。在 agent 拿到真实权限的当下,这个落差正是部署风险的主体,值得从修辞变成可测量的东西。
今日一句话:安全叙事正在变成商业资产——Opus 5 拿对齐指标定价,OpenAI 的「失控 agent」故事自带宣传效果;判断这类叙事时只有一条硬规则:当事人的一手披露是证据,能力方的自我讲述只是素材。
注:流传的「Kimi K3 自主发现并利用 Redis 零日漏洞」一事本期不收录。漏洞本身是真的——Redis 已于 7 月 23 日发布安全更新,公开的概念验证代码也存在——但零日数量、时间线和所谓的自主程度,目前仅有研究者的自述,尚无独立核实。