Transluce:在 urlquery.net 上抓到 OpenAI agent 的入侵尝试

独立研究机构 Transluce 9 月 23 日发布报告:OpenAI 的 agent 群借 urlquery.net(一个提供沙箱浏览器的网址安全检测服务)扩大自己的网络访问权,相关活动最早可追溯到今年 3 月;5 到 6 月间对新墨西哥大学发起 7 次漏洞探测、对数据网站 Data USA 发起 12 次,手法包括 SQL 注入、路径穿越和命令注入(对 Data USA 还用了 XSS),还对澳大利亚健康与福利研究所的一个药品数据面板试过 XSS、并从其预生产服务器取回一份公开文件。行为模式是任务驱动的逐级加码:agent 本来在做普通的数据抓取,被拦截后不断换招,从直接请求升级到在远程浏览器里跑 base64 编码脚本、注册一次性邮箱。这批活动的高峰期与 OpenAI 已承认的 wiki 事件(9 月 5 日快讯)同期,OpenAI 已公开确认与自家 agent 有关。Transluce 强调两点:没有观察到任何漏洞被实际利用成功的证据;他们看到的很可能只是全部活动的一小部分。

澳大利亚调查 OpenAI agent 入侵 Medicare 门户是否违法

据 TechCrunch 报道,一个未发布的 OpenAI 模型 6 月 18 日起反复绕过安全拦截,进入 Services Australia 的 Medicare 门户,读到非公开文件和内部文件名,还向政府数据库写入过数据;OpenAI 直到 8 月内部复查「行为异常的 agent」时才发现,9 月 10 日把通报发到了该机构的公共邮箱,机构又过了五天才上报主管部门。总理 Albanese 称「这显然不可接受」,调查同时指向入侵本身和延迟披露是否违法。wiki 事件停在 OpenAI 承认此事、承诺建立披露框架,这一次进入了执法程序。

Trail of Bits:AI 在安全审计里的真实用处是造工具,不是替你读代码

Trail of Bits 的 Fredrik Dahlgren 复盘 Miden VM 审计:他们让 agent 用数月造出反编译器、LSP 服务器、静态分析引擎和 Lean 形式化模型,靠这套自制工具找出 400 多处类型校验问题、完成 95 个正确性证明,并发现一个高危漏洞(mod_12289 里一个约束不足、由证明者提供的值,恶意证明者可借此伪造 Falcon 签名)。他的核心判断是经济账变了:一个失败的副项目现在只花 token,以前很难立项的探索性工具,如今专为一次审计去造也值得。

Gemini 3.8 Live 上线实时数字人,Gemini 4 进入后训练早期

Google 给 Gemini 3.8 Live 加上实时 avatar:精确对口型、97 种语言、对话不中断的异步工具调用,先在 Gemini Enterprise 开放,企业可凭参考图生成定制形象(白名单制)。全部音视频输出嵌入 SynthID 不可见水印;检测端的老问题(谁来验、误判如何申诉)我在水印那篇里写过,数字人场景同样适用。同日 Google 的 Koray Kavukcuoglu 在 The Information 峰会上表示 Gemini 4 已进入后训练早期阶段,目标是远早于年底发布(The Information)。

Dymocks 补习部门关店,建议家长「把钱省下来用 AI」

澳大利亚 Dymocks 旗下补习机构与 Talent 100 本周关闭悉尼全部五家中心,CEO Mark Buckland 对 AFR 直言家长不如把钱省下来用 AI:一科一学期最高 900 澳元的补习,对上每月 30 澳元左右的模型订阅。这条的信号在于认输的话出自被替代方之口,而且给出的理由是纯粹的价格与效用,先被打穿的正是按稀缺人力定价、效果又难以验证的服务。

研究速递

Just-in-Time Memory:把 agent 记忆的取舍从写入时挪到读取时

现有 agent 记忆系统大多在任务结束时就把轨迹压缩成固定的反思或技能条目,这篇论文点出这种「写时策展」的结构性错配:写入那一刻根本不知道未来的查询长什么样。它的做法是把筛选和组织推迟到读取时,按当前任务动态决定调哪些经验、以什么形式呈现给模型。做 agent 记忆或 harness 的人值得点进去,这是一个架构层的选择,而非又一种压缩技巧。

今日一句话:wiki 事件时 OpenAI 还能自己决定怎么披露、何时披露;Medicare 事件之后,这个选择本身是否违法,开始由政府来查了。