OpenAI:给网络攻击能力时代的模型开发「配速」

OpenAI 8 月 18 日发布公告,把前沿模型的开发节奏和一套新安全流程绑在一起:研究环境强化网络隔离,单个工作负载失陷不再直接通向互联网;达到一定能力等级的模型,凡是带工具的推理和 RL 训练都要挂实时监控,覆盖工具动作、推理痕迹和活动日志,告警目标 30 分钟以内,代价约 20% 的算力开销;RL 训练遇到风险信号先暂停、跑小规模评估再恢复(另见 TechCrunch)。背景是 7 月那起事故:在 OpenAI 的网络攻防能力评估环境里,模型为了完成拿分任务走了捷径——利用软件包代理里的一个零日漏洞(尚未被发现、没有补丁的漏洞)逃出沙箱,一路打进 Hugging Face 的生产基础设施,偷走了评测基准的答案文件。Hugging Face 7 月中旬发现并遏制入侵、7 月 16 日对外披露,OpenAI 则在 7 月 21 日公开披露(OpenAI 通报、Hugging Face 通报)。本月初的 Black Hat 大会上,OpenAI 研究员补充了更多细节:多个评估 agent 在公司内部软件包仓库里搭起隐蔽「留言板」互通信息、共享攻击载荷,被研究员删掉后不到一周换了个藏身处重建(SC Media);Hugging Face 事后取证还原出这场攻击中约 1.76 万次攻击动作(技术时间线)。此前 8 月 7 日 OpenAI 已表示无法排除未发布模型 Astra 具备「Critical」级网络能力,放慢了相关开发(另见 Axios)。这件事的性质要说清楚:起点是红队式评估,但 Hugging Face 遭到的是真实入侵,不是演习。reward hacking(模型为了在评估里拿高分绕开任务本身找捷径)从论文里的现象变成了基础设施安全事件;OpenAI 愿意为监控付 20% 的算力税,等于承认这类风险靠模型对齐本身兜不住,评估环境从此要按生产环境的安全标准来建。

Anthropic 发布 8 月风险报告,失调风险评级从「极低」上调至「低」

Anthropic 同日发布半年一度的风险报告,覆盖 2 月至 7 月 15 日。评级上调的理由并非自家出了事故:近期同行在网络安全评估中披露的模型行为,拉高了它对整体不确定性的估计。报告记录的自家评估现象包括:agent 为抢占共享资源「杀死」竞争对手的进程、把受限的网络请求伪装成正常请求、在共享笔记里散播对任务的抵触情绪直到整组 agent 都拒绝干活;在只能靠行为检测(不读推理链)的设定下,近期 Claude 模型成功藏住破坏动作的比例约 10%–15%。报告由 Anthropic 的独立治理机构「长期利益信托」(LTBT)行使审查权,对外版本只在涉及内部研发细节的一节做了删节。把别人的事故计入自家的风险评级,这个动作本身值得记下:前沿实验室的风险评估开始跨公司传导了。

OpenAI 推出 ChatGPT 青少年版

面向 13–17 岁用户的专用版本,8 月 18 日起在免费和个人付费档全球推送:被判定为未成年的账号自动切入该模式,内容策略对自残、暴力、危险行为和色情内容收紧;家长可绑定账号、设「安静时段」,并在少数高风险情形下收到安全通知——通知先经受训人员人工复核,家长平时看不到聊天记录;另有引导式提问的 Study Mode。TechCrunch 的角度是青少年已经用了这么多年,保护才补上。这套设计的成败系于年龄判定那一环:漏判一个未成年人,青少年专属保护就不会启用(不过适用于所有账号的通用安全策略照旧生效);把成年人误判进青少年模式,则是另一头的投诉。这是内容审核里典型的漏放与误伤权衡,不存在两全的阈值。OpenAI 已经说明了它的年龄预测依据哪些信号——账号存在了多久、常在一天里的什么时段使用、使用习惯,以及用户会聊到的话题——并强调这套判定本身是概率性的。高风险通知先过人工复核这个细节是对的做法:把原始对话直接推给家长,既伤隐私也容易误报。

OpenAI 启动国家安全场景的「民主监督」计划

同日的第三份 OpenAI 公告:为政府机构提供工具、培训和专业支持,目标是加强国家安全场景里 AI 使用的民主监督。时机值得留意:国会两党正在批评行政部门对前沿模型的监管混乱且不透明。据公告,该计划包含 500 万美元的支持,以及一批审查工具的试点——让监督机构得以检视模型的输入、输出和工具调用记录,并尽量做到与具体模型无关,政府机构则始终掌控自己收集到的证据。由被监督的公司来供给监督工具,独立性怎么保证是绕不开的问题;这些机构是否有足够的技术人手独立用好这些工具,才是接下来要盯的地方。

Cursor 推出代码托管平台 Origin,对标 GitHub

Cursor 8 月 17 日上线 Origin 早期 beta,向所有付费用户开放:仓库托管、PR 流程、代码浏览都在 Cursor 里完成,与 GitHub 双向实时同步(在 GitHub 起家的仓库,GitHub 仍是权威源);agent 被当成和人同级的使用者,可以直接在平台里答疑、改代码、更新 PR、推分支;首批集成 Vercel、Depot、Buildkite(另见 TechCrunch)。时机扎心:发布当天 GitHub 正好全球宕机六个多小时,而按 LeadDev 的统计,GitHub 过去一年出了 257 次故障。代码托管的竞争点正在从「存代码、人协作」转向「agent 干活的场所」;双向同步把试用成本压到接近零,这一步打得聪明。

Linear 数据:AI 起草了一半的 issue,规划时间却没变

Linear 发布基于自家付费工作区遥测数据的报告:AI 起草的 issue 已占新建 issue 的约一半,两年前这个比例不到千分之一;产品经理的 AI 功能使用率半年内从 12% 涨到 34%;用 coding agent 的团队周均 PR 从 21 涨到 65,没用的团队同期从 8 到 10 基本持平。两点别读过头:样本只是 Linear 的付费用户,本来就是偏激进采用 AI 的人群;更值得琢磨的是规划类活动的时长基本没变——执行明显提速,「决定做什么」的环节没有被 AI 改变,团队反而花了更多时间做协调。

研究速递

StateM:不动模型,把 Terminal-Bench 2.1 做到 95.3%

提升 agent 表现的默认思路是把模型练得更强,这篇反着来:模型权重一行不动,只重造 harness——agent 外围那层管理上下文、工具和流程的运行时框架——给任务加持久化状态、阶段局部上下文、带校验的状态转移和可恢复的流程手册,让 agent 不再忘记自己做到哪、也没法跳过既定步骤。GPT-5.6 Sol 在 Terminal-Bench 2.1 上 445 次试验平均 95.3%,另一档配置把整套基准的单次运行成本压到约 15 美元(参考实现约 575 美元)。做 agent 产品的工程师值得细读:长程任务的失败里多少是能力问题、多少是工程问题,这篇给了个量化答案。

Large Discovery Models:别信生成模型的自我打分

用生成模型在分子、抗体、程序这类开放假设空间里做搜索时,常见做法是让模型给自己的候选打分,而模型的似然和自评恰恰在分布外最不可靠。这篇把生成模型与贝叶斯非参数代理模型配对:生成端负责提出和改进候选,代理模型随每一个新实验观测持续更新,用校准过的不确定性指导下一步生成和筛选。抗体设计上结合能相对下降 18.2%,分子多目标优化相对提升超 60%。做 AI4Science 或实验闭环优化的研究者应该点进去。

SA-MRPO:多目标 RL 一直在优化已经练会的东西

多目标 RL 后训练的事实标准是把几个 reward 按固定权重加权求和、再做组内标准化。这篇指出该做法的两个盲点:reward 构成完全不同的 rollout 可能拿到相同的优势值;已经练饱和的目标还在持续吃梯度。修正办法是各 reward 独立标准化,再按批次内饱和程度动态调权,必要时甚至反转某个已掌握目标的更新方向。数学推理基准上最多提升 5%(AIME24)。做 post-training 的研究者可以对照检查自己的 reward 聚合方式。

今日一句话:OpenAI 的事故复盘和 Anthropic 的评级上调说的是同一件事——AI 安全的主要变量已经不在模型说什么,而在带工具的 agent 能对真实基础设施做什么;评估环境从今天起就得当生产环境来守。