OpenAI 重申零数据留存,预告「私有安全处理」
OpenAI 8 月 19 日重申将继续向符合条件的 API 客户提供零数据留存(Zero Data Retention):请求处理完成后,提示词和模型输出都不保留,唯一的法定例外是被标记为疑似 CSAM 的内容,会留存用于审查和上报。新东西是预告中的「私有安全处理」(Private Safety Processing):近期一些前沿模型的部署要求留存客户内容,以便疑似滥用时供员工查看,而 OpenAI 称新机制由自动化系统跨多次相关交互识别风险模式,只向公司回传一个定义很窄的安全信号,员工始终接触不到客户内容原文;9 月开始推出,并同步发布技术白皮书。在那些部署里,这两件事是二选一:要么留存内容做安全审查,要么零留存放弃跨会话监测。方案成色全看「安全信号」怎么定义,窄到什么程度算保住隐私、宽到什么程度才防得住滥用,白皮书得正面回答这一点;在那之前,企业客户拿到手的还只是承诺。
「可信网络安全研究者」权限一夜被收回,OpenAI 称是技术故障
Trusted Access for Cyber 是 OpenAI 给通过身份核验的防御性安全研究者开的通道,可以使用网络安全护栏放宽的模型做漏洞分析一类防御工作,8 月 10 日刚上线含前沿模型访问的新层级 Daybreak Blue。8 月 19 日多名研究者发现权限突然消失,页面提示「无法核实身份」或「暂不符合条件」;接受 TechCrunch 采访的至少五名受影响研究者都居住在美国和欧洲之外。OpenAI 承认是自身技术故障,请受影响者重新核验身份。我的看法:OpenAI 正在围绕网络攻击能力调整模型开发节奏,把防御者往这条官方通道上引,那么访问系统本身的可靠性就成了安全基础设施的一部分;当防御工作流依赖厂商的分级访问,故障预案和恢复时限就该像 API 可用性一样给出承诺。
用得越多,好感越低:美国民调里的 AI 信任缺口
TechCrunch 汇总了几份民调:皮尤 8 月数据显示 52% 的美国人对 AI 进入日常生活「担忧多于兴奋」,2021 年这个数字是 37%;Economist/YouGov 5 月调查中 71% 的美国人认为 AI 发展太快;CNBC 8 月民调中,多数 18 到 34 岁受访者不信任 AI 行业领袖会「负责任地行事」。文章的判断是行业面临真实的信任赤字,不是公关问题:用户天天在用 AI,但感受到的是岗位威胁和被塞进产品里的功能,好处没有落到自己身上。Airbnb CEO Brian Chesky 说需要「更多日常的东西」来证明价值;Anthropic CEO Dario Amodei 承认「我们还没兑现造福世界的大承诺,这完全是我们的责任」。渗透率是厂商推出来的,认可是用户给的;我赌这个缺口迟早会变成监管压力和用户流失。
斯坦福 HAI:只放权重不算开源,科学需要真正的开源模型
斯坦福计算机系教授、HAI 的 James Landay 撰文区分「开权重」与「开源」:只发布权重是开放分发,你能下载运行,但看不到模型怎么训出来、用了什么数据、为什么会有某种行为。他参照 Linux 基金会 Model Openness Framework 的最高档给出标准:权重、训练数据(或可审计的完整数据文档)、代码与工具链都开放,并主张由大学牵头、用比商业周期更长的时间尺度做这类模型。对科研,这个论点站得住:没有训练数据,就没法研究这些数据如何塑造了模型行为。但开放训练数据本身带着版权和隐私风险,谁来承担这部分成本,决定了这条路能走多远;大学牵头的提议,实质是把这块成本挪进公共部门。
法律 AI 的「可核查性」缺口:1700 多起案件出现 AI 幻觉
斯坦福法学院 Daniel Ho、哥伦比亚法学院 Neel Guha 等人在 PNAS 发表论文《There’s No Free Benchmark》,指出法律 AI 缺乏他们所称的 legibility(可核查性):律师、法官和当事人几乎无从知道这些系统的真实错误率有多高、错在哪类问题上;公开记录里 AI 编造事实、判例、法条的案件已超过 1700 起。论文把基准测试当制度问题看:测什么、怎么测由开发商、律所、学界、监管机构各自的激励和资源决定,而破产、子女抚养权这类低资源领域——普通人最可能拿通用聊天机器人求助的法律问题——几乎没有评测覆盖。作者建议按资源条件设计不同的制度方案,包括让 NIST(美国国家标准与技术研究院)一类独立机构介入。「评测空白源于激励结构」这个诊断,对其他垂直领域同样适用。
Bloomberg:SpaceX 曾洽购 Cognition,CEO 否认并称「不卖」
Bloomberg 援引知情人报道,SpaceX 曾试图收购编码 agent Devin 的开发商 Cognition,谈判目前已不活跃,但双方仍在讨论合作(如 Cognition 使用 SpaceX 的算力)。Cognition CEO Scott Wu 随即在 X 上否认,称报道不实、公司「不卖」、双方没有谈过(另见 TechCrunch)。背景是 SpaceX 上周刚完成对 Cursor 母公司 Anysphere 600 亿美元的收购。无论这次到底谈没谈过,编码 agent 公司已经成了非软件巨头也要下场买的资产;对手握 Mercedes-Benz、花旗、高盛等企业客户的 Cognition,公开喊「不卖」本身就是给客户和员工的稳定信号。
研究速递
HarnessRisk:覆盖 agent harness 全生命周期的安全基准
Agent harness 指管理 agent 的工具调用、扩展、持久状态、权限和外部动作的那层执行框架。这份基准用 128 个测试用例,把正常用户任务和藏在不可信工作流组件里的对抗指令配对,覆盖从配置、能力扩展、运行到事故恢复的六个阶段。结果:不同系统的攻击成功率从 12.6% 到 80.9% 不等,配置阶段最脆弱;最值得记住的发现是识别出风险不等于行为安全,有的配置在 90% 以上的运行里检测到了风险,却照样放行攻击。做 agent 安全或 harness 设计的读者应该点进去。
Demystifying Agent Skills:skills 什么时候有效,什么时候失效
对 agent skills(挂载给 agent 的结构化知识包)做受控实验,分析 8135 条试验记录。结论:skills 起效的主要机制是「程序性锚定」,把模型嘈杂的执行过程稳定在既定步骤上,占使用 skill 案例的 65.7%;靠注入模型缺失知识起效的只占 4.5%。skill 库一大,检索精度就崩:5 个 skills 时命中率 29.6%,100 个时只剩 3.3%。对实际在用这类工具的从业者,这翻译成两条操作建议:把 skills 当操作规程写,别当知识文档写;库保持小而精。
Agentic ESOpt:用进化策略微调长程 agent,只需推理级显存
用进化策略替代 RL 做长程 agent 的全参数微调:对模型参数采样扰动、评估各扰动版本的任务表现、按奖励加权更新,全程不做反向传播,显存需求降到推理级别。它同时绕开了长轨迹稀疏奖励下的信用分配难题(RL 要判断哪一步该为最终成败负责,进化策略直接在整条轨迹层面归因)。WebArena-Lite 上把 Qwen-3.5-27B 提升 6.69%。算力有限又想做 agent 训练的研究者值得一读。
Fool’s Gold:防不住「安全移除」,就让它偷到假金子
Abliteration 是开源模型几乎防不住的攻击:找到模型内部代表「拒绝」的方向并投影掉,几分钟就能剥掉安全对齐。这篇论文(作者 Mark Russinovich)放弃阻止剥离,转而在训练时做「诱饵硬化」:模型一旦被剥掉对齐,对危险请求会给出流畅自信、但关键环节被故意写错的假答案;未被攻击时行为不变。七个模型(9B 到 122B)中六个达标,被攻击状态下 51% 到 90% 的回答是诱饵。局限也写得明白:反复采样能部分恢复可用答案,且不防上下文内越狱。它把开源模型安全的目标从「阻止篡改」换成「让篡改的产出不可信」,做开源模型安全和红队的读者值得细读。
今日一句话:近期的前沿模型部署把「零数据留存」和「安全监测」当成二选一,OpenAI 说两个都要;在 9 月白皮书拿出可核查的机制之前,这是产品承诺,还不是机制事实。