数学家公开发问:研究者能放心把未发表数学交给 OpenAI 吗
德累斯顿工业大学群论学家 Andreas Thom 在 Mastodon 发帖讲述他的经历:几个月来他一直在 ChatGPT 里讨论 sofic 群相关的问题,随后 OpenAI 宣布构造出一个非 sofic 群——这样的群是否存在,是 Gromov 在 27 年前提出的公开问题——而据他描述,证明直接建立在他与 Gábor Kun 2019 年的论文之上。他已致信 Mark Sellke 与 OpenAI 的 Sébastien Bubeck,问了两个性质不同的问题:他的对话是否被用于模型训练;系统在构造证明的过程中是否访问过这些对话。目前唯一的回复是 Sellke 的一句话——「that did not happen」(Thom 已将其公开)——这一句到底覆盖了两个问题中的哪些部分并不清楚;OpenAI 没有正式的公开回应。但对行业来说,指控是否成立已经不是关键:只要研究者无法排除这种可能,就会把最重要的未发表想法从对话框里撤走。消费者版 ChatGPT 的对话默认可用于改进模型、需要手动关闭,零数据留存那样的条款只写给企业客户,没写给一个揣着猜想的教授。这是继本周 Navier-Stokes 署名争议后,同一信任裂缝的第二次扩大。
OpenAI 发布 Agents API:Codex 的 harness 变成一个 API 调用
9 月 10 日 OpenAI 开放 Agents API 公测。所谓 harness,指包在模型外面的那套执行机件:喂上下文、调工具、失败重试。过去这一层通常由团队自己搭,现在 OpenAI 把驱动 Codex 的那套托管版直接租给你:开发者提供指令、工具和 MCP 服务器,OpenAI 负责维持长会话、上下文写满时自动压缩、崩溃后恢复;会话内可以跑代码、改文件、搜网页、产出交付物、按并发上限拆子 agent,除 token 用量外不另收费。我的判断:agent 基础设施的竞争正从「谁的模型强」移向「谁替你管状态」。代价也明确——会话状态、压缩、恢复这层编排落在 OpenAI 手里,哪怕执行跑在你自己的环境里也一样,换供应商的成本从换一个 API 端点变成换整个运行时。
Anthropic 威胁情报报告:八个月,七类滥用
报告覆盖 2025 年 12 月至 2026 年 8 月间被封禁的滥用活动,分七类追踪:网络攻击、影响力行动、监控、诈骗、生物滥用、常规武器、模型蒸馏(蒸馏指用一个模型的输出去训练自己的模型,把能力复制走)。具体案例里有两个细节值得看:一个诈骗团伙用商业化的验证码代解服务批量注册交易所账号;一个影响力网络先建了约 1000 个社交账号、用「养号」逻辑(先发日常内容积累互动、让账号看起来像真人)再投入使用,配上 AI 生成头像的假记者署名跨大洲投放内容。报告还写明:所有滥用案例中,只有一起非法蒸馏案涉及 Fable/Mythos 级模型。我的判断:滥用者的门槛在流程工程而非模型能力——验证码代解和养号都是现成灰产,AI 只是补齐了内容生产那一环。而蒸馏与生物武器、网络攻击并列进入厂商的滥用分类,说明前沿实验室已经把「能力被偷学」当作安全问题处理,不只是商业纠纷。
Cognition 发布 SWE-2:拿 Kimi K3 后训练,贴近闭源第一梯队
SWE-2 是在月之暗面的开放权重模型 Kimi K3(2.8 万亿参数、混合专家架构)上做强化学习后训练得到的编程模型。按 Cognition 自己的评测,它在 FrontierCode 1.1 Main 上得 50.0%,与 Anthropic 的 Fable 5.1 差距不到 1 分,成本低 64%;即日起在 Devin 桌面版和 CLI 可用。这条新闻的信号不在分数,在配方:美国 agent 公司拿中国开放权重基座、加自家强化学习,就能以低得多的价格贴近闭源前沿。开放权重模型正在变成整个 agent 行业的公共地基,闭源实验室的领先要靠比后训练更难复制的东西来守。
「传闻即漏洞利用」:agent 把攻击窗口压到补丁发布之前
剑桥教授、OCaml 长期贡献者 Anil Madhavapeddy 实测发现:只凭对某个安全漏洞的大致传闻,他自己的 AI agent 就能独立把漏洞重新找出来并构造出可用的利用代码,时间早于公开补丁发布。这打掉的是开源安全流程的一个底层假设:协同披露(漏洞细节保密、等补丁就绪再公开)赌的是仅凭模糊线索,攻击者拼不出可用的利用代码;而在他的实测里,一条传闻加一个 agent,不到一分钟就拼出来了。这是从业者的单例实测,不是系统评测,但它点中的假设是每个开源维护者都在依赖的——今后补丁和披露必须同时落地,保密期本身不再提供多少保护。
水印装上了,但没人能验证
8 月 2 日起,欧盟 AI 法案第 50 条要求生成式 AI 的输出带机器可读标识。Anthropic 已在新 Claude 模型的模型层嵌入 SynthID-Text 的变体水印,全球生效、用户无法关闭(见官方说明);Google 的 Gemini 从 2024 年起就带 SynthID-Text。这种水印只改变生成时选词用的随机源:读者看不出差别,检测工具能读出统计信号。这篇论文的论点是:批评者担心的副作用和厂商承诺的检测效果,目前外界都无法核查——没有配对输出样本、不披露配置、没有第三方审计、各家检测工具互不兼容。合规已经完成,验证还不存在;论文认为真正的治理失败是后者,我同意,而且这正是内容标识条款最容易停在纸面的地方。
OpenAI 与 GSA:全美各级政府 0 许可费、用量五折
OpenAI 与美国总务署(GSA,联邦政府的集中采购机构)签下 27 个月协议(2026 年 10 月至 2028 年 12 月):联邦、州、地方、部落政府使用 ChatGPT 免许可费(标准价每人每月 15 美元)、按量费用五折,附带网络防御支持,约 2300 万公共部门雇员符合资格,州以下政府是首次纳入。此前每机构每年 1 美元的试用式协议,就此转成按 token 计量的长约(另见 Nextgov 报道)。定价从获客让利转向长期市场经营;对政府买方,真实成本从许可费移到了用量上——预算部门要开始学着估算 token 消耗了。
Astra 需求压紧算力:OpenAI 暂停 200 美元档 Pro 新订阅
GPT-6 Astra 上线(9 月 3 日)一周后,OpenAI 产品与平台副总裁 Thibault Sottiaux 宣布暂停每月 200 美元 Pro 档的新注册,理由是「这一档对系统负载最重」,未给恢复时间表;其他订阅档和按量付费的 API 不受影响(官方仅由 Sottiaux 在 X 公告,无官网新闻页)。前沿模型的硬约束又回到了算力供给。对 builder 的实际提醒:生产系统别单点押在某一家的最高档订阅上。
研究速递
How Fragile Is Safety Alignment at Frontier Scale? A Single-Direction Attack on a 320B MoE
「拒绝方向消融」是一种白盒攻击:用几百条对比样本在激活空间里定位模型编码「拒绝」的那个方向,直接从权重里投影掉,全程不需要训练。此法此前只在中小型稠密模型上验证过,这篇把它推到 3200 亿参数的 GLM-5.3-Flash(混合专家架构)上:照搬会静默失效,但调整靶点后依然有效,七个有害行为基准上拒绝率降了 41 到 89 个百分点。做开放权重发布决策、防篡改对齐的 researcher 应该细读:规模没有自动带来更结实的对齐。
Arbitrary Cipher Attacks Against Large Language Models Do Not Require Fine-Tuning
业内此前认为,密码/隐写式越狱要靠微调 API 才能教会模型用密文对话。这篇证明新一代前沿模型只靠提示词和上下文学习就能学会任意密码,并在 Anthropic、Google、OpenAI 的模型上完成越狱;因为有害内容全程以密文传输,输出端的有害内容分类器也拦不住。做安全分类器和红队评估的人值得一看:把微调 API 管严,已经守不住这条攻击线。
Show-Harness: Just a VLM Agent Can Play Robots
提出一套离散的「语义动作单元」接口,把机器人控制翻译成通用视觉语言模型(VLM)熟悉的语义推理问题:闭源前沿 VLM 可以零样本直接控机器人,小型开源 VLM 花几个 GPU 时微调即可低成本部署,跨任务、跨机体的泛化优于代表性的 VLA 方案(VLA 指把控制能力直接训练进权重的视觉-语言-动作模型)。具身智能方向的 researcher 值得点进去:它挑战的是「机器人控制必须训进权重」这个默认假设。
今日一句话:模型每天都在证明自己能做什么,但让外界验证「它没做什么」——没读你的聊天记录、水印真的有效、保密期真的保密——的机制,整个行业还没开工。今天的头条、水印、漏洞三条新闻,缺的都是同一块。