Anthropic 发布 Claude Opus 5.5,降价 20%
Anthropic 称 Opus 5.5 的表现达到 Fable 5.1 的水平、运行成本比 Opus 5 低四成,API 定价降到每百万 token 输入 4 美元、输出 20 美元(降 20%),缓存读取降 60%;Terminal-Bench 4.0 66.4%、OSWorld 2.0 81.8% 这些基准数字都是官方自报。公告把安全放在显眼位置:对齐测试引入 METR、Frontier Design 两家外部评估机构,网络安全和生物类任务默认受限、需通过身份验证程序解锁——生命科学的验证程序已经在运行,网络安全的未来几周逐步铺开。这是 Amodei 发文呼吁「调控前沿节奏」(我的分析)十天后 Anthropic 的第一个新模型:表态之后的第一步棋,是降价加速铺开。
OpenAI 同日推出 GPT-6 Sol 和 Luna,价格砍半
据 TechCrunch,OpenAI 的发布比 Anthropic 晚了约 90 分钟。VentureBeat 给出了定价:Sol 面向复杂编码和专业工作,定价每百万 token 输入 2 美元、输出 10 美元,是上代 GPT-5.6 Sol 的一半;Luna 面向高频轻量任务,定价 0.10/0.50 美元,较上代的 0.20/1.20 美元下调;OpenAI 发言人确认这是长期价格,不是促销。注意对位:GPT-6 Sol 的新价恰好是 Opus 5.5 刚降完 20% 之后价格的一半。Anthropic 的降价只维持了一个半小时,就被对手用 50% 盖过。
五角大楼调查:过度依赖 AI 是误击伊朗小学的原因之一
彭博援引参与五角大楼内部审查(报告未公开)的官员报道:2 月 28 日开战首日,两枚战斧导弹击中伊朗米纳布镇的一所小学,150 多人死亡、其中至少 123 名儿童;调查认定 CENTCOM 部分人员过度依赖 Palantir 开发的 Maven Smart System 目标平台,叠加过时的卫星图像。具体的失效链条是:一名分析员早在 2019 年就记录了该建筑是学校的迹象,但记录存在一个与目标情报主库不互通的系统里;此前五角大楼把平民伤害缓解团队裁掉约九成,CENTCOM 只剩 1 人,打击前没有任何人复核过这个目标。这是真实军事行动中的实弹误击,而非红队演练或评估实验——国际特赦组织已依据卫星图像、视频和目击证词独立核证了这次袭击;它和我写过的「人工逐条审批拦不住 agent」是同一类机制问题——人在回路失效的时间点远早于模型出错,因为能纠错的人和信息通道早已被组织裁掉。
GPT-6 Astra 破解了悬置 21 年的二战 Enigma 密文
Crypto Cellar Research 的一手记录:在研究者 Carter Leffer 的部署下,GPT-6 Astra 从一批未破译报文中自主选中 1941 年 7 月 10 日的德军报文 MVUEH(2005 年公开以来无人解出),自己用 Python 和 C++ 写出 Enigma 模拟器和 Bombe 程序,用重复地名「ROSENOW ROSENOW」作 crib(已知明文片段)系统搜索,恢复出密钥和明文,资深研究者 Frode Weierud 复核确认。破解还顺带解释了这条报文为什么难:原抄件有转录错误,且左轮恰好在第 72 个字母处走位,属罕见情况。和我 7 月写 Claude 做密码分析时一样,值得看的是模型自主完成「选目标、写工具、验证结果」的整条链;历史密码是无害的练兵场,安全研究者该默认同样的链条也会被指向现实中的弱密码系统。
Meta 承认 Muse 像 OpenClaw「不是巧合」
Meta Superintelligence Labs 产品负责人 Nat Friedman 在 X 上承认,Muse 在产品设计上深度借鉴了 OpenClaw:工作区文件命名照搬,定义 agent 人格与边界的 SOUL.md 文件内容也几乎一致;他的解释是「我们觉得 Peter 把这些东西做对了」(指 OpenClaw 作者 Peter Steinberger),但 Meta 坚称代码从零写起。Muse 眼下正居美区 App Store 第一(昨天的快讯刚写过它被亚马逊封禁、无法在 Amazon.com 上代购)。这件事说明 agent 产品层的设计差异极易复制:独立开发者先做对的东西,大厂拿走的成本几乎为零。
OpenAI 公布第三方安全评估的优先事项与原则
OpenAI 列出四个希望第三方深入评估的方向:整体安全论证、关键防护措施(越狱抵抗、错位监测、网络防御)、Preparedness 框架各风险类别的能力评估、重大错位事故的独立调查;配套原则包括预注册评估范围、按比例开放访问、利益冲突披露、发布前留修复时间。这与同日 Opus 5.5 公告点名 METR 是同一条线:两家都在把「第三方核查」写进发布叙事。真正决定独立性的有两条。访问深度上,文件确实给了承诺——深到足以让评估者挑战 OpenAI 自己的假设、得出独立结论——但附带法律、安全和知识产权方面的限制,还允许在直接访问「不可行」时改用替代方式。发布前修复窗口则没有设上限,会不会变成挡下关键发现的缓冲阀,仍是悬而未决。
研究速递
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
模型冻结,让系统迭代改自己的 prompt、控制流、工具和记忆,这类递归自我改进的通病是在训练任务上过拟合,换个分布就垮。RRSI 给进化过程加约束:提议端限制每个候选的编辑预算、参照历史避开重复轨迹,筛选端用 critic 预审加剪枝器删掉收益微小或已过时的改动,整体偏向可复用机制而非榜单特化。训练分布最多提升 14.1 分,五个分布外基准仍有最多 4.7 分,策略 token 用量降三成;做 harness 自动优化、担心自改系统跑偏的 researcher 值得读它的约束设计。
WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
视频世界模型的老毛病是长时程、跨视角不一致:镜头转一圈回来,场景变了样。WorldCrafter 把历史观测压缩成按请求相机视角检索的隐式 3D 记忆 token,在去噪前注入,不依赖显式的深度对应关系,支持分钟级的场景探索。长时程一致性和相机控制精度都有明显提升;做世界模型或可控视频生成的 researcher 可以看它「视角决定压缩哪些证据」的记忆设计。
今日一句话:呼吁调控前沿节奏十天后,得到的回应是一场同日价格战;两家公告里的安全承诺还剩多少约束力,短期内最可核查的指标只有一个——第三方评估者实际拿到多深的访问权限。