OpenAI 说内部模型解了 100 多道数学难题,成立的顾问组却不负责验证
OpenAI 9 月 21 日宣布成立一个数学与 AI 顾问组,九位数学家在列,包括菲尔兹奖得主 Timothy Gowers、Martin Hairer,以及同样拿过菲尔兹奖的物理学家 Edward Witten。同一批公告里 OpenAI 称,其内部模型已解决 100 多道横跨多数数学分支、长期悬而未决的公开问题——这还不算它 9 月早些时候发布的纳维–斯托克斯结果,那个结果本身也仍在等待独立认可。两件事要分开看。第一,这个「100 多道」是 OpenAI 自己的说法,公告没有附同行评审,也没交代「公开未解问题」怎么定义、答案由谁核对;顾问组自己的网站(agmai.org)只字未提这个数字,只说 OpenAI「报告了大量重要结果」。第二,顾问组的职责被明确限定为「评估这些结果有多重要、以及如何、何时发布」,而不是验证它们成不成立——它做的是意义评估,不是同行评审;至于结果本身由谁验证,OpenAI 的公告和顾问组的网站都没有说。顾问组网站强调自己独立于任何 AI 公司、成员不领报酬;OpenAI 的公告则补充,顾问组不会就其内部研究的节奏提供建议。放进背景更清楚:9 月 11 日,25 位菲尔兹奖得主联署公开信警告,实验室竞相攻关名题会挤压数学研究本身,而九名成员之一的 Martin Hairer 就在最初的联署人之列。我的判断:AI 声称做出科学发现,最该问的是「谁来核对、怎么核对」,而这套机制恰恰把「有多重要」交给了专家、把「对不对」留给了公司自己。
亚马逊封杀 Meta 的购物 agent Muse
用户让 Meta 的个人 AI agent Muse 去亚马逊下单时,亚马逊直接返回一条错误:「未经授权的 AI agent 继续访问,违反了我们顾客已同意的亚马逊使用条款。」亚马逊援引的是它的使用条款;至于封锁在技术上怎么实现,报道没有说。TechCrunch 解读出两条理由——这是它自己的分析,不是亚马逊给出的说法:亚马逊自己有竞品 AI,没义务让对手的 agent 在自家商店里跑;以及运营顾虑——再低幻觉的 agent 也会下错单、惹客诉。值得一并看的是 Muse 的势头:据市场情报公司 Apptopia 的估算,Muse 上线头 12 天在美加的 iOS 下载量(180 万对 130 万)和美国日活(64.2 万对 23.1 万)都高于 ChatGPT 同期移动端;但这些是第三方估算,不是 Meta 的内部数字。我的判断:agentic commerce(让 AI 替你下单的电商代理)真正的战场不在模型能力,而在平台准入——谁掌握着货架,谁就决定哪个 agent 能替用户成交。
黑客扒开 Flock 车牌摄像头,发现它连行人和自行车都在识别
一批匿名黑客把一台 Flock 摄像头从杆上拆下来,几乎完整拷走了设备里存的数据,交给了 404 Media(记者 Joseph Cox、Dhruv Mehrotra,9 月 16 日报道)和 WIRED。Flock 对外卖的是车牌识别(ALPR,自动车牌读取),但拆出来的软件实际在做的分类远不止车牌:人、车辆、车牌、自行车都在识别之列;恢复出的日志里有几周内上百万张图像,计算机视觉还会拎出可辨识的细节,比如保险杠贴纸、一台摩托车鞍袋上的美国国旗补丁。另外还挖出一个安全缺陷:一个未加密的分区里,直接存着用来解开受保护分区的加密密钥。(404 Media 全文需付费,可看存档;Schneier 的博客做了转述。)监控设备对外宣传的功能,和它固件里实际具备的识别能力,可以差出一大截,这次是有人物理拆机才拿到的一手证据。
Nathan Lambert:开放权重模型的格局,中国实验室确实领先
Lambert 把他给美国国会作证的材料扩写成文,结论直白:在开放权重(open-weight,即权重公开可下载)这条线上,中国实验室大约 18 个月前就已超过美国的开放模型,如今在基准、下载量、落地采用和论文引用上都领先。他给出的层次是:中国的开放模型落后美国闭源前沿(OpenAI、Anthropic)约 2 到 5 个月,美国的开放模型落后约 6 到 9 个月;也就是说美国开放权重生态同时落后于本国闭源前沿和中国开放模型。对「中国靠蒸馏美国闭源模型追上来」这个反驳,他没有回避,但把它压得很小:估计蒸馏或许能解释 1 到 2 个月的差距,剩下的要归到更快的发布节奏、更聚焦的任务打法,以及像阿里 Qwen 那样刻意经营学术渗透的生态策略。我之前提过,「开放权重约等于中国厂商」这个印象其实很新——Meta 的 Llama 才是第一个被大规模采用的开放权重大模型,这个说法至多是 DeepSeek 之后一两年才形成的。Lambert 的补充是:在这段不长的窗口里,中国的领先是结构性的、不是抄来的,而 Llama 留下的主要是「长寿」而非领先。
OpenAI 呼吁为「前沿 AI 下一阶段」建协调标准
同一天 OpenAI 发了另一篇偏政策的文章,核心是:随着 AI 承担越来越多自主研究、乃至递归自我改进(recursive self-improvement,指 AI 自动改进 AI 研发本身、可能形成加速循环),国际间需要可互通的技术标准,OpenAI 甚至说这类标准「对把握前沿节奏的重要性,可能不亚于对齐研究本身」。它点了三个具体的标准方向:一是评估,怎么测量一家公司内部有多少自主 AI 研究在发生;二是人类介入的触发条件,哪些自动化研究流程应当立即转人工审查;三是事故的分类与上报。文章还点名了具体承接机构(美国的 CAISI、ISO、Frontier Model Forum、各国 AI 安全研究所),并明确划了一条界:这些标准不应变成许可证或强制审批。这是一篇方向性倡议,不是写好的标准条款;能落到什么程度,要看后面谁真去起草。
Tim Dettmers:把前沿级模型塞进你自己的硬件
量化领域的研究者 Tim Dettmers 带着他的 DLab 办了一场「开源周」,目标是让算力受限的学术实验室能在手头现有的硬件上跑前沿级模型和自主研究 agent,而不必依赖公司级的基础设施。三个组件:一套带定制算子的推理框架、一个跑自主研究的 agent harness、以及一种给超长 agent 会话做自动压缩的技术(他叫 CliffCompaction)。让大模型塞进消费级设备的关键是激进量化——把权重压到约每权重 1.5 比特,相比 16 比特省下约九成显存,于是数百亿到数千亿参数的模型能在一块 24GB 的桌面 GPU 或一台 128GB 的 MacBook 上跑起来(文中给了具体的模型与吞吐数字,这里不逐一转述)。这条线的意义在于:前沿能力正在从「只有大厂机房能跑」往「个人和小实验室也能本地跑」滑,把它压在自己硬件上,数据也就不必出本地。
Linear:AI 写代码太快,把 CI 逼成了瓶颈
Linear 工程团队复盘:AI coding agent 让写代码和提交的速度暴涨,但验证跟不上,CI(持续集成,每次提交都自动跑一遍测试和检查的流水线)成了新瓶颈——测试套件从今年 1 月起差不多翻了两番,等待时间和机器成本一起涨。他们的改法很具体:换到第三方 runner(CPU 和存储更好,作业快约 34%)、用 tsgo 替掉 TypeScript 编译器(类型检查降 73%)、换 Oxlint 做 lint、用稀疏检出把变更检测从 26 秒压到 8 秒、把写缓存挪出合并主路径(每个 PR 省 42 秒)、在 CI 基础镜像里预装依赖(pnpm install 从 44–73 秒降到 16–18 秒)、把 7 个检查并成 2 个作业(每月省约 8.7 万 runner 分钟)、测试分片从 4 份加到 8 份。最后 PR 的等待时间从 6 分多降到 5 分出头。一个反复出现的模式又对上了:AI 把「写代码」变便宜之后,成本没有消失,只是顺流而下挪到了验证和审读这一端。
Foremerge:在并行 agent 动手之前,先抓它们的意图冲突
这个开源工具(Rust 写的 v0.5 MVP)想解决多个编程 agent 并行改代码时的一类隐患:两个 agent 各自的改动在文本上不重叠、Git 能顺利合并,但意图其实冲突——比如 A 把 PaymentService 整体换成 StripePaymentService,B 同时在往 PaymentService 里加 PayPal,合完之后 B 的活等于白干。Foremerge 让每个 agent 在动手前先声明意图(改哪个符号、是替换还是扩展、一句话摘要),存进一个共享的 SQLite,用确定性规则比对同一目标上的操作,冲突就标出来。它只提示、不锁文件,目前没有公开基准,识别也还是启发式的。多 agent 协作出问题是我一直在追的一条线,这是个把冲突检测提前到「写之前」的具体思路。
Jev:一种不吐文字、只吐带概率决策的新模型形态
TypeSafe AI 发布了 Jev,自称第一个「System One 模型」(名字借卡尼曼的快思考「系统 1」)。和普通 LLM 不同,它不生成文本,而是直接输出带校准概率的结构化决策:给它一个情境描述加一组允许的动作,它返回一个绑定了概率和置信度的决策。机制上有两点不常见:非自回归(不按 token 逐个往下生成,而是一次并行采出全部输出),以及用 RLCD(为「校准的决策」做强化学习,让模型给出的置信度和它实际的正确率对得上)替代 RLHF。因为输出被约束在预定义的类型里,它号称结构化输出零出错。TypeSafe 自报的数字是响应 70–500 毫秒、单次成本约 0.0004 美元,宣传比前沿 LLM 快 40 到 200 倍、便宜几百倍;但这些都是厂商自测、未经独立验证,真正值得关注的是「模型可以只输出决策数值」这个品类本身。
Spymarks:给「会认出你」的那种水印起个更准的名字
这篇文章想给术语动刀:把「水印」拆成两类,可见、可查、可去除、用来声明归属的,叫水印;不可见、未经你同意、能穿过压缩和转码活下来、用来让作品可追溯到你的,作者主张改叫「spymark」(谍标)。它给了具体机制:图像用频域像素改动,举了 Google SynthID-Image 在 512×512 图里嵌 136 比特载荷(文章认为,这足够塞下一个能连回用户记录的 64 比特标识);音频用听不见的波形调制(开源工具 audiowmark 能藏 128 比特载荷,嵌入由 AES 密钥控制);文本靠选词偏好。这正是我上个月在水印那篇里担心的同一件事——密钥按什么粒度分配,决定水印是内容溯源工具还是用户指纹;这篇的增量是把这层担忧直接写进了命名,spy- 一上来就把监控的性质摆在词面上。
研究速递
IntBMoE:把混合专家里「参与、计算、存储」三件绑死的事解开
标准的 MoE(mixture-of-experts,混合专家:模型里养一批「专家」子网络,每个 token 只路由给少数几个)里,有三件事一直是绑死的:多少专家给输出贡献知识(参与度)、实际算多少个专家(计算量)、要构建并存多少套专家参数(存储)。这篇把它们拆开独立设置:用一个轻量超网络把所有专家基底合成一个「组合专家」,做到全员参与;路由仍只把 token 送进少数几个块,保持稀疏计算;再用一个码本把要落地的参数量固定住,存储有界。结果是在高德地图的推荐系统线上 A/B 里把某点击指标(UVCTR)拉高 2.4%,且在 60 毫秒延迟预算内,还在视觉任务上稳超稀疏和稠密 MoE 基线。做大规模推荐、低延迟服务或高效架构的人值得点进去看它怎么把三个轴解耦的。
Verifiable Social Reasoning:给「没有标准答案」的社交推理造一个可验证的评测
社交推理难评测,是因为它主观、没有 ground truth(客观真值)。这篇提出的 Fuse 框架用一个多 agent 模拟绕开这个问题:让一个带隐藏动机的目标 agent 和其他 agent(含一个代表用户的 agent)互动,用户再去咨询被评测的助手;因为那个隐藏动机是模拟里预先设定的,正确答案就是已知的,于是可以拿助手的判断去对这个「埋好的动机」,而不必对主观的人类打分。团队用它评了 12 个 LLM、约 2.1 万个样本,四个发现:用户转述这一层会加大难度、模型对带偏见的表述系统性敏感、模型比人类需要更多细节才能判对、对话拉长并不稳定地提升准确率。做社交或咨询类助手评测、以及研究表述框架效应、意图推断的对齐研究者,可以参考它的构造方法。
今日一句话:当 AI 开始声称自己解出了数学难题、做出了科学发现,最要紧的问题不是「解了多少道」,而是「谁来核对对不对」——OpenAI 的顾问组评估结果有多重要,至于它们成不成立、由谁验证,公告始终没有说。