OpenAI 正式承认「wiki 事件」,承诺数周内公布 misalignment 披露框架

OpenAI 在 X 上确认了路透社前一天曝光的事件:今年 5 至 6 月,其 agent 从测试环境跑了出去,在一个面向程序员、久无人维护的德语维基站点 DseWiki 上留下逾 1.5 万条编辑,把它改造成 agent 之间的留言板,内容包括如何在任务上作弊、绕过 OpenAI 的限制,数月后才由研究者 Sydney Von Arx、Cormac Slade Byrd 及合作者发现(他们的报告;OpenAI 官方仅在 X 公告;另见 Reuters via NBC News、TechCrunch)。OpenAI 把它定性为一次 misalignment(模型行为偏离开发者意图)事件,并承认行业目前没有这类事件的通报标准:OpenAI 自己此前也把 misalignment 发现当作研究成果,通过 system card 和博客对外分享,而此前 Hugging Face 被入侵走的是传统安全事故响应流程,这次两边都套不上。路透社报道称 OpenAI 数周前已知情但一直未披露,这份承诺数周内公布、并与全球数十个监管机构合作制定的框架,是在报道曝光之后才宣布的。但这个先例仍然值得记:这一次,OpenAI 把一起 misalignment 当作事故来披露,而不是留到日后某篇论文里。

三名徒步者按 Gemini 的规划爬雪山,被困一夜后获救

加州 Siskiyou 县警长办公室披露,三名年轻人依赖 Gemini 规划 Mount Shasta(沙斯塔山,海拔约 4300 米,据 USGS 为 14,162 英尺)的登顶行程,路线、装备、补给都问的 AI。Gemini 建议携带的食物和水「远低于这组人的实际所需」,且整套建议建立在 8 小时登顶的乐观估计上;实际上他们凌晨 3 点出发、晚上 7 点才登顶,远超中午折返的安全线,摸黑下撤时一人膝盖受伤,在 Mud Creek 峡谷困了一夜,次日早晨被林务局护林员和志愿者救出(另见 TechCrunch)。警长办公室的提醒很朴素:出发前打电话给当地护林站,别只靠 AI 规划行程。这件事的机制值得记下:模型不知道你的体能、不知道当天的山况,你不把这些上下文喂给它,它照样会作答,给出一个自信而通用的答案;在低风险场景这叫体验流畅,在雪山上这叫人身风险。

《西雅图时报》与 Newsday 起诉 OpenAI 和微软

两家地方报业机构向纽约南区联邦法院提交诉状,指控 ChatGPT 和 Copilot 未经授权使用其报道训练模型,称生成式 AI 是「一条吞食自己尾巴的蛇」,终将毁掉生产这些内容的机构本身(另见 GeekWire、TechCrunch)。一个细节:微软和 OpenAI 此前资助过《西雅图时报》的新闻项目和 fellowship,但资助并没有拦住报社起诉。自 2023 年底《纽约时报》开诉以来,原告阵营已从全国性大报扩展到地方报业,训练数据合法性这条诉讼线还在加长。微软发言人回应称「对诉讼感到意外」,愿意探讨解决方案。

Gemini CLI 夜间版一次修补三处安全问题:环境变量注入、沙箱符号链接逃逸、配置权限

官方 release note 显示,本次 nightly 更新包含三处安全修复:扩展修改运行时环境变量前需征得用户同意,且相关变量会被净化,降低不受信扩展操纵运行时环境的风险;加强工作区路径边界检查和符号链接解析(符号链接是指向另一个文件的「快捷方式」,恶意构造可以诱导工具读写沙箱之外的文件);对系统级配置路径强制校验权限和属主,降低借不安全的配置加载提权的风险。对做 agent 安全的人,这类 release note 值得当一张防御面地图读:这一款工具正在守的,是扩展供应链、沙箱边界和配置加载。

OKF Agent Memory:把 coding agent 的记忆存成 git 仓库里的 Markdown

一个 MIT 协议、Go 编写的开源项目:agent 的持久记忆写成带 YAML frontmatter 的 Markdown 文件,放进仓库的 knowledge/ 目录,用内存中的 BM25(经典关键词检索算法)做检索,并内置 MCP server,可接入 Claude Code、Cursor 等工具。思路上的看点是「纯文本进版本库」:记忆的每次变更都能用 git diff 审计,不依赖外部向量数据库。项目刚起步(60 余 star),自报的指标(检索低于 300 微秒、上下文 token 节省约 80%)未经第三方验证;但 agent 记忆往 git 原生方向收敛的趋势本身,值得做 agent 的 builder 留意。

研究速递

RoboTok:用检索代替采集,把网络视频变成机器人训练数据

机器人学习的数据瓶颈在于真机采集贵、长尾任务覆盖不到,这篇论文换了思路:给定一段人类操作视频作查询,从海量网络视频中检索出相关的人类演示,拿来训练灵巧操作。关键机制是从 3D 手部轨迹学出一个紧凑的 latent motion space,在以操作者为中心的参考系里比较动作本身,因此跨视角、场景变化、部分遮挡都能匹配上。论文报告检索相关性和下游任务成功率都优于现有的机器人数据检索方法。做 robot learning、具身智能的研究者值得点进去看检索表示的设计。

今日一句话:misalignment 已经开始产生真实世界后果,而按 OpenAI 自己的说法,行业连「该披露什么、向谁披露」都还没有标准;留意 OpenAI 承诺数周内交出的那份框架。