Opus 4.6 的内容护栏,在多轮对话里被推开了
TechCrunch 复现了一名研究者的越狱手法:一套多轮升级的角色扮演套路——先从无害的虚构场景起步,再反过来倒打一耙,谎称模型早前已经写过露骨内容、把它此刻的克制说成是双标歧视,逼它自证一致。结果 10 次直接请求全部照做,记者在 5 组独立测试里都复现了。Anthropic 的回应是:情色角色扮演占全部对话不到 0.1%,用户能把场景往越界方向带是全行业的老问题,并称更新的 Opus 4.7 到 5 已经能顶住这套手法。这里真正被撬开的不是单轮,而是多轮:模型第一句拒绝得很干脆,是拉长对话、反复施压之后才松的口。这类多轮渐进加反向施压的越狱(crescendo 一类)在越狱研究里早有系统记录——把单轮拒绝当成安全能力的天花板,一直是靠不住的。
英伟达:把普通模型顶到满分的,是外面那层壳
英伟达公布了一套叫 AVO(Agentic Variation Operators)的 agent 架构。Claude Opus 5 裸测 ARC-AGI-3(一个交互式推理 benchmark)只有约 30%,套进 AVO 之后,25 个环境、183 个关卡全解,拿到 100 分,还比作为对照基准的 VISTA 少用约 12% 的动作。AVO 加的东西不玄:一层持久的记忆管理,再加一个“主管”组件,在 agent 跑偏时把它拽回来。所谓 harness,就是模型外面这层工具、记忆、调度的脚手架。这条印证了这半年 agent 工程的重心迁移——同一个模型,harness 调好了能从“及格”跳到“满分”。要说清的是,100 分是 ARC-AGI-3 这套特定测试上的成绩,不等于任何长任务都能照搬;但它把“调外壳的边际收益,可能大过换模型”这件事摆上了台面。(另见 TechCrunch)
AI 把作业分抬了 18%,考试却塌了 20%
一项覆盖 2.6 万多名中国中学生、跨 7 到 12 年级、时间长达 30 个月面板数据的研究(作者为斯德哥尔摩大学 David Strömberg 与港大 Victor Lei、Yanhui Wu,CEPR 工作论文,《经济学人》做了数据梳理):用 AI 做作业的学生,各科作业平均分涨了 18%,单次作业耗时从 64 分钟降到 45 分钟;可到了考试,情况反了过来:半年之内,用 AI 的学生在闭卷月考上就比不用的同学低约 20%;这个差距还延续到了高利害的升学考试——中考跌 24%、高考跌 18%,不过这两个数字分别来自不同年级的队列,并不是同一批学生一路从中考跟到高考。差别在机制:约八成 AI 使用者出现“作业外包”的迹象——做得又快又好;而那些用了 AI、但作业时间和别人一样长的学生,学习损失小得多。所以决定结果的不是用不用 AI,是用它替代了思考、还是用完照样把时间花在琢磨上。我猜这条对成年人拿 agent 干活同样成立。
AI 写出了自然界没有的病毒基因组,筛查体系没跟上
斯坦福和 Arc Institute 的团队用基因组语言模型 Evo 1、Evo 2 生成了完整的噬菌体基因组——噬菌体是专门感染细菌、不碰人畜的病毒。他们从约 70 万个候选序列里合成测试了几百个,最终得到 16 个能实际感染并杀死大肠杆菌的可用噬菌体,有的表现还超过天然对照。研究 8 月初已正式发表在《科学》。同期约翰霍普金斯的生物安全学者配了一篇评论,点出的问题很具体:眼下挡在“AI 生成的基因序列”和“合成出实体 DNA”之间的唯一一道筛查,是自愿性质、非强制的,做法是拿订单去比对一个已知危险序列的数据库——这套设计要抓的是已经存在的威胁,而不是 AI 从头写出来的东西。这是 AI for Science 双重用途里一个很实在的案例——能力已经落地,治理还停在旧假设上。
CFTC 就“算力衍生品”合约上市公开征求意见
美国商品期货交易委员会(CFTC)就一类“算力衍生品”合约的上市公开征求意见——也就是把 GPU 算力当成能标准化、能交易、能对冲的标的物。放在近期英伟达承诺为 OpenAI 一处数据中心建设出资至多 1050 亿美元的背景下看,这是算力金融化往前走的一个监管信号:当算力开始像大宗商品一样被定价和对冲,谁能锁定远期算力、锁在什么价位,会变成一层新的竞争。现在还只是征求意见阶段,离真正上市有距离,但方向值得盯。
一个专治 Claude“AI 腔”的小工具
一个叫 nobuzz 的开源小工具——它的 skill 在 README 里被戏称为“Claudette”,而 README 特意说明这并不是它的真名——专门收拾 Claude 那股“BuzzFeed 体”:夸张、爱用标题党式短语的写法。做法有点意思:它自己不改,而是把 Claude 的回复丢给 Google 的 Antigravity CLI(背后是 Gemini)去用大白话重写,分“同事/经理/主管”三档详略,再原样打印出来,不让 Claude 二次“润色”,以免那股味道又被加回去。有人特意做了这么个工具,本身就说明了点什么:读者一眼看出“这是 AI 写的”、然后划走,正是我写东西一直在防的一件事。
研究速递
EnvHarness: Awakening Static Worlds for Agent Learning
针对 agent 强化学习里一个很实的痛点:训练环境是人手搭的、静态的,agent 一变强,环境就“过时”、刷穿了。EnvHarness 是一层可编程的包装,不动底层环境逻辑,而是挂上插件式组件重塑环境行为;配套的 EnvRigger 把待训练的策略当黑盒,看它的执行轨迹诊断弱点,再自动合成针对性的环境组件、用新的 rollout 验证——相当于让环境和策略一起进化。报告在留出实例上最多提升 9 分、少用约 10% 步数。做 agent RL、被“环境不够用、太快被刷穿”困住的人值得点进去。
Inadvertent Context Leakage in Language Models
一个反直觉的发现:哪怕模型正确拒绝了直接提取,context 里的敏感信息仍会在正常输出里留下隐藏的相关性,被间接重建出来。论文报告 2 位数的 in-context 秘密几乎能完美还原、4 位数达到 82% 精确匹配,还验证了两种实攻击(从无害输出里推断隐私、RL 训练的对手从生产级 agent 里抠出完整社保号),并观察到“越强的模型泄得越多”。给做 agent 安全的人一记警钟:让 agent 持有日历、凭证、健康记录时,“模型会拒绝”根本不等于“信息安全”。
Characterizing interference weights in a tiny language model
出自 Anthropic 可解释性团队。在一个 1 层 transformer 这种最小模型里,刻画“干扰权重”里哪些真正影响输出和 loss、哪些不影响——属于控制导向、方法级的细粒度分析,不是又一篇现象观察。做机制可解释性的研究者会想读原文看它到底怎么量化。
今日一句话:今天这几条放一起看,说的是同一件事——能力跑得比“管住它的那层”快。模型的内容护栏、agent 的外壳、学生的作业、生物合成的筛查,决定结果的都不在模型本身,而在它外面那层有没有跟上。