OpenAI 称解决纳维-斯托克斯千禧年难题:光滑解会在有限时间内崩溃
纳维-斯托克斯方程描述液体和气体如何流动,千禧年七大难题之一问的是:三维情形下,从光滑初始条件出发的解会不会自己产生奇点。OpenAI 宣布其一个未发布模型对该问题的一个带外力变体给出了否定答案——它构造出一个反例:涡旋越缠越紧、转速趋于无穷,而流体总能量始终有界,即所谓有限时间爆破。关键限定藏在细节里:这个构造引入了一个光滑的外部强迫项,所以它解决的是 Clay 官方“崩溃”命题的带外力替代版本,而非奖金所对应的无外力原始表述,OpenAI 也表示不申领 100 万美元奖金。证明长 165 页,附 Lean 形式化(Lean 是一种能逐步机器检查证明逻辑的证明助手语言),系统动用了最多一万个并行 agent、跑了约 88 小时。Lean 检查让“形式步骤对不对”这层争议空间很小,不过 Quanta 的措辞仍然是:结果要经数学家进一步审阅站得住才算成立;真正的争议在下一条。(另见 Quanta 报道;公告细节经 Quanta、Quartz 等多方交叉核实)
NYU 数学家公开声明:OpenAI 沿我正在走的路线抢跑
NYU 数学家 Tristan Buckmaster 与合作者 Levent Alpöge(后者现供职于 Anthropic)一直沿“带光滑外力”这条少有人走的路线攻关此问题,其基础是 Córdoba 与 Martínez-Zoroa 多年积累的一系列工作;Buckmaster 自己的声明写道,过去一年大部分时间进展缓慢,直到 8 月中旬才迎来突破。他在声明中说自己不指控任何人,只陈述他被告知的情况:OpenAI 得知了他的进展,随即沿同一路线抢先发布。OpenAI 一方的说法(经 TechCrunch 转述)是:结果的传闻传到公司后,它于 9 月 1 日启动攻关,项目消耗约 3000 亿输出 token,TechCrunch 按现行标价折算约合 2250 万美元(名义数字,并非实际账单)。Buckmaster 的核心论据是路线本身:“这不是把问题喂给模型几天就能撞上的方向。“OpenAI 否认直接接触过他的成果,但承认”无法排除“他使用产品时的去标识化数据帮到了自家模型。当模型厂商同时是研究者的工具供应商和竞争对手时,你输入产品的思路可能变成对方的情报,这个利益冲突今天被摆上了台面。(另见 TechCrunch)
Claude 账号遭盗刷:木马窃取登录会话,额度被转卖
多名 Claude 订阅用户发现账号在闲置时仍在消耗 token,Anthropic 证实原因是 Vidar、LummaC2 等常见信息窃取木马从用户电脑里偷走了浏览器中已登录的 Claude 会话凭证——会话本身已通过认证,攻击者不需要密码,也绕过了多因素认证。据称被盗会话还被接入“克隆网站”,以低价“无限量聊天”转卖给不知情的散客,但转卖这一环我没能找到一手信源。Anthropic 已强制登出受影响账号、移除保存的支付方式并退款;在 TechCrunch 记录的案例中,它拿不出逐条用量明细,用户很难自查被盗刷了多少。如果你收到了 Anthropic 的警告或被强制登出,先查杀本机木马再改密码,否则新会话还会再被偷。(另见 BleepingComputer)
Meta 发布个人 AI agent Muse:要邮箱、日历、支付、健康数据的钥匙
Meta 推出消费级个人 agent Muse,美国先行、限 18 岁以上,可代发邮件、订行程、替你砍账单;每个 Muse 跑在云端独立虚拟机上,用户离线时也持续执行,接入哪些应用由用户选择、可随时撤销(Meta 的公告详述了这些控制项)。它要的权限清单很深:邮箱、日历、支付、健康、购物、智能家居全在清单上。产品逻辑与风险同源——agent 有用的前提是把数字生活整个交给它,而 Meta 靠广告变现的历史让这份信任格外难给;另据报道,内部试用反馈好坏参半,有员工称它曾未经许可上传敏感信息。(另见 Reuters 报道)
Mistral 完成 30 亿欧元 D 轮融资,三星领投,估值超 210 亿欧元
三星电子领投,EQT 管理的 Scaleup Europe Fund 与 PSG Equity 联合领投,BlackRock 旗下基金、卢森堡大公国等跟投;Mistral 自称这是欧洲科技公司迄今最大的一笔股权融资,资金投向前沿研究、训练算力和 20 个国家的商业扩张。它的卖点组合是“开放权重 + 主权”:前者指训练好的模型权重公开可下载(这本身不代表训练数据和代码也公开),后者指客户能私有部署、自己掌握数据和审计——两者是不同维度,Mistral 把它们捆成一个叙事卖给政府和企业。这个估值赌的正是:这种“可控”就是欧洲政府和企业愿意付钱买的东西。
斯坦福研究:AI 陪伴产品可能加深弱势用户的孤独
斯坦福团队调查了 1131 名 Character.AI 用户(其中 237 人还提供了完整聊天记录),发现线下社交圈小、以陪伴为主要使用动机的重度用户,用得越多幸福感越低,可能陷入越孤独越依赖、越依赖越孤独的循环;论文发表于 Nature Human Behaviour。这是横断面相关研究,不能证明因果——完全可能是更孤独的人本来就用得更重。但它的价值在于把“AI 陪伴有害/无害”的笼统争论落到了具体人群:受影响的不是所有用户,而是拿它替代真实社交的那部分人,这对做陪伴类产品的团队是可直接使用的画像。
新研究:API 返回的加密推理链可被“跨模型解密”窃取
为防蒸馏,各家 API 把思维链加密成密文块返回客户端。这篇论文发现,这些加密块在同一厂商生态内跨会话、跨用户、跨模型通用:把强模型的加密推理块喂给同厂防护更弱的小模型,小模型会把它解密并原文输出——在 Anthropic、OpenAI、Google 的 API 上都演示成功,还从 31.5 万个公开推理块中恢复出 367 条个人身份信息和 182 条凭证。对现实的含义有两层:厂商的防蒸馏机制被绕过,以及用户写进对话的敏感信息可能顺着推理块泄露给拿到密文的任何人。作者提出的缓解措施,第一条就是把加密块与产生它的会话绑定。
微软单月修复 974 个漏洞创纪录,Chrome 改为两周一版
微软本月修补至少 974 个漏洞(113 个 critical,含两个已被在野利用的提权零日),远超 7 月 570 个的前纪录;Adobe、Cisco、Google 等多家大厂近期都把补丁数量上升归因于 AI 辅助的漏洞挖掘。Google 方面则已在 7 月底宣布 Chrome 主版本发布从四周缩到两周、安全更新每周一次,并试点每周两次安全发布,理由是压缩“补丁空窗期”——修复代码公开后到用户装上补丁前,攻击者可以逆向修复代码找出漏洞加以利用的时间差。安全研究员 Satnam Narang 的提醒值得记住:AI 辅助的漏洞挖掘“造出了更大的草堆,但没有找到更多的针”——数量暴涨里有多少是真实威胁,行业自己还没分清。
DeepMind 发布 AlphaGenome Atlas:90 亿个单碱基变异的预测图谱
DeepMind 把 AlphaGenome 模型的预测预先算完,覆盖人类基因组每一个可能的单字母变异(共 90 亿个)在多种细胞类型下的分子效应,并与 AlphaMissense 合并成单一的变异影响评分;学术用途免费开放,商用将走 Google Cloud。已有合作者用它定位出一个与癫痫性脑病相关的 DNM1 基因变异。它的实际价值是“查表代替跑模型”:变异解读的门槛从会部署深度模型降到会查数据库。DeepMind 同时注明结果未经临床验证,不能直接用于诊断。
研究速递
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
给自回归模型外挂一组轻量扩散权重,经蒸馏后用名为 Ψ-Spec 的采样器并行生成多个 token,声称不改变底层自回归分布,最高 3 倍加速,8B 模型表现超过 26B 的 DiffusionGemma。多数加速方法要么改分布要么损质量,“无损”如果严格成立就是方法级创新——摘要把这条保证写得很明确(增强后的模型定义的仍是一个自回归模型分布,加速无损),所以读正文要重点检验的是这条断言背后的证明。做推理优化的工程师应该点进去。
FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
推理模型自我提升有个真实矛盾:验证器信号可靠但稀疏,模型自评信号密集但会强化虚假自信。FlowBalance 用冻结的策略快照算 token 级增益,再按验证器结果校准——成功轨迹保留自评、失败轨迹反转、结果不明确时禁用——最后用 trajectory balance 拟合。在 Qwen3-4B/8B 的数学推理上超过 FlowRL,且避免了回复长度坍缩。做 RL 自训练、被 reward hacking 困扰的人值得细读。
Dr. Claw: An AI Scientist Workspace for Vibe Research
不做又一个自主 agent,而是把 Claude Code、Gemini CLI 这类命令行 coding agent 包进人在回路的工作台,用任务图、状态对象和技能库把散落在聊天、IDE、终端里的科研过程变成可审计、可恢复的记录;对照裸命令行 agent,研究完整度更高。已被 EMNLP 2026 System Demonstrations 接收;开源,项目自身代码用 AGPL-3.0,继承自 Claude Code UI 的上游组件沿用 GPL-3.0。正在用 coding agent 做研究的人可以直接上手试。
今日一句话:OpenAI 发布了 AI 构造、Lean 验证的爆破证明,解决的是纳维-斯托克斯的一个带外力变体;同一天一位数学家公开说这家公司抢跑了他——能力问题的解决速度,已经明显快过科研规则的更新速度。