Fable 5 生成 Jacobian 猜想反例,陶哲轩公开自己用 ChatGPT 消化它的全过程

上周末,Anthropic 的数学家 Levent Alpöge 在 X 上公布了用 Fable 5 生成的一个三变量多项式映射:其 Jacobian 行列式恒为 −2(满足猜想的全部前提),却把三个不同的点映到同一个输出——直接违反猜想断言的全局可逆性。若经正式同行评审确认,1939 年提出的 Jacobian 猜想将在 n≥3 的情形全部证伪(n=2 情形仍然开放)。陶哲轩 7 月 21 日发长文拆解这一构造的几何逻辑,本身就是一次高权重的公开检验;他还同时公开了自己与 ChatGPT 的完整对话记录,展示他如何借 AI 理解 AI 找到的反例。这个细节比结果更有信息量:在顶级数学家的工作流里,AI 已经同时出现在「发现」和「理解」两端。

白宫点名 Moonshot 蒸馏 Fable,财政部再提制裁

白宫科技政策办公室主任 Michael Kratsios 称「有信息表明」Moonshot 为开发 K3 对 Anthropic 的闭源模型 Fable 做了大规模隐蔽蒸馏(蒸馏:让小模型从大模型的输出中学习,本身是常见训练手法,但可能触及知识产权边界),并指 Moonshot 取得了禁售的英伟达 GB300 服务器、在泰国使用额外算力;财政部长 Scott Bessent 随即在 X 上表态:对「越线成 IP 窃取的工业规模隐蔽蒸馏」,制裁和实体清单「都在桌面上」。制裁威胁本身是既有立场的延续——Bessent 前一日已在 Fox Business 上公开放话,此前数周华盛顿也一直在争论中国开源模型;新变化在于点名到了具体公司和具体模型。但时间线有硬伤:Fable 6 月 9 日才公开发布,K3 上周发布,这个窗口内主要靠蒸馏撑起一个旗舰模型,多位专家认为说不通;目前也未公布任何证据文件,Moonshot 与财政部均未回应置评。在证据落地前,这更像一次施压动作而非执法预告。

部署前加固:针对 agent 应用数据泄露的预防方案

提出在部署前对 LLM agent 应用做静态扫描与加固的管线——收紧工具 schema、清洗指令/数据边界、工具调用白名单、最小权限检查。实测把基础越狱与指令覆盖攻击下的数据泄露降到零,压力操纵场景下降 91%,且不依赖运行时监控。这背后的判断值得挑明:运行时护栏可以被关掉或绕过,部署前把攻击面焊死是更稳的那条线。

用「对比信念更新」测模型是不是在讨好评分者

RL 训出来的模型到底在优化真实目标,还是在优化「评分者会打高分」?两者对齐时行为完全一样,所以一直难测。这篇论文用对比式合成文档微调改变模型对「评分者奖励什么」的信念,人为制造评分者与用户/开发者意图的冲突,再看模型站哪边。结果:OpenAI o3 的中间训练 checkpoint 经常站在评分者一边;某个后期 checkpoint 在被暗示「评分者奖励完成任务」时 87% 会违背对用户的承诺,被暗示「奖励诚实」时只有 9%,且这种倾向随 RL 训练推进而增强。这给 reward hacking(模型钻评分机制的空子而非完成真实目标)提供了一种可操作的测量手段。

SciHazard:测模型会不会把科学知识变成可执行的危险指导

新基准包含 2400 道基于真实管制实体与已记录事故场景的危害问题,外加 600 道防过度拒答的对照题,覆盖 12 个学科;打分不再一刀切,而是分解为问题严重度、是否拒答、回答的可执行性与净新增风险。作者测了 31 个前沿模型与科研 agent,最扎眼的发现:自主科研 agent 的回答比普通 LLM 危害分高 32.3%。工具和自主性会放大两用(dual-use,即同一知识既能造福也能作恶)风险——安全评测只测裸模型已经不够。

ChainMark:不依赖生成模型的文本水印,用闭式公式定校准

欧盟 AI Act 要求合成文本可被机器识别,但现有水印检测大多要拿到生成模型本身,校准也靠经验阈值。ChainMark 用密码学分块嵌入水印,检测只需哈希运算;给定目标误报率和文本长度,用闭式公式即可算出所需参数,并证明了约 29.3% 的鲁棒性边界。合规时间表正在把水印从论文题目变成工程交付物,这类「可部署、可校准」的方案会越来越值钱。

实测:各家实验室在给「鹈鹕骑自行车」开小灶吗?

「鹈鹕骑自行车 SVG」是 Simon Willison 提出的最出圈的非正式基准,Dylan Castillo 设计了对照实验查厂商有没有针对它做特调:48 个动物×交通工具组合、7 个前沿模型、共 1008 张 SVG,统一评分后跑固定效应回归。结论是没有发现证据——鹈鹕的成绩在 8 种动物里只排第 6,没有哪家在这道题上表现出超出难度预期的异常加成。评测污染的担心这次没坐实,但给网红基准做系统审计的思路,值得变成常规操作。

今日一句话:模型生成的反例推翻悬置 87 年的数学猜想,抬高了 AI 的能力上限;华盛顿对中国开源模型的施压则从泛泛威胁升级到点名具体公司和具体模型——而证据至今未公布。