Google 发布 Gemini 3.7 Flash:三周迭代一版的轻量主力

Google 今天发布 Gemini 3.7 Flash,距上一版 3.6 Flash 只有三周,定位仍是 coding、agent 和知识工作的低成本主力:FrontierCode 1.1 从 34.4% 涨到 43.6%,DeepSWE v1.1 从 49.0% 涨到 65.3%。定价方式值得多看一眼:今年年底前是优惠价,每百万 token 输入 $0.75、输出 $3.75;2027 年 1 月起恢复标准价,直接翻倍到 $1.50 和 $7.50。用优惠价做成本测算的团队,按明年的价格算账才不会被动。轻量档三周一迭代,也说明各家把竞争重心压到了这个走量的价位段。

OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速至 14 倍

OpenAI 与芯片公司 Cerebras 合作推出 Ultrafast 服务层预览版,GPT-5.6 Sol 的输出速度最高 750 token/秒,约为标准模式的 14 倍——按这个倍数反推,标准模式约 53 token/秒(OpenAI 没有直接公布标准模式的数字,这是我自己换算的)。两家公司都称质量不降,但这是官方口径,不是独立基准测试;该服务层现通过 API 限量开放(另见 Cerebras 公告)。原理在芯片:GPU 逐 token 生成时要反复在片外存储和片上内存之间搬运权重,带宽是瓶颈;Cerebras 把一整片晶圆做成一颗芯片,单片带 44GB 片上 SRAM,再把模型各层流水线式分摊到多片这样的晶圆上,每颗芯片分到的那部分权重常驻片上,反复搬运就省掉了。对 agent 应用来说这不是锦上添花:一个任务要多次串行调用模型,每一步的延迟都会累加,速度直接决定成本和产品体验。官方页面还放了与竞品的速度对比,那是厂商自测口径,看看就好。

微软合并两个 Copilot 应用,退役一批不达预期的功能

微软开始把消费版 Copilot 与企业版 Microsoft 365 Copilot 合并为一个应用,移动端和网页版 8 月中旬起推送,Windows 和 Mac 版 9 月中旬跟进;个人账号与工作账号可以同时登录,数据互不打通。8 月 18 日起,消费版的播客(Podcasts)、Group Chats、Copilot Labs、吉祥物 Mico 和 Deep Research 一并退役(另见 GeekWire)。微软支持页面写明,已生成的播客音频届时将无法访问,此前只能在网页端逐集下载保存,没有批量导出。Deep Research 的替代品 Researcher 需要 Microsoft 365 Premium 订阅。微软没有公布这些决定背后的数据,但批量裁撤消费级 AI 功能这件事本身,比当初发布这些功能更能说明消费级 AI 的真实使用分布;「每个入口都塞一个 AI 功能」的阶段,看起来正在收尾。

Writer 发布 Palmyra X6:底座是智谱开放权重 GLM-5.2,省钱靠 harness

企业 AI 公司 Writer 发布旗舰模型 Palmyra X6,在智谱(Z.ai)开源的 GLM-5.2 上做后训练,架构原样保留:744B 参数的混合专家(MoE)模型,每个 token 只激活约 40B。同步升级的还有 agent harness,也就是模型外面那层负责调用工具、管理上下文、串起多步流程的执行框架;Writer 称两者叠加让其 agent 平台平均成本降 52%、速度快 48%(另见 VentureBeat)。两个信号:美国企业级厂商把旗舰押在中国开放权重上,这类选择正在变成普通的工程决策;Writer 自己的测试还发现,只改 harness 平均就能省约 40% 成本,公司称这个杠杆比换模型更可靠。

OpenAI 任命 Wiz 前总裁 Dali Rajic 为首席营收官

OpenAI 宣布 Dali Rajic 出任首席营收官(CRO),他此前是安全公司 Wiz 的总裁兼 COO,更早在 Zscaler 和 AppDynamics 负责销售与客户体系;据 Bloomberg 报道,前任 Denise Dresser 任职不足一年即被替换。一年内两度换 CRO,挖来的又是把 Wiz、Zscaler 两家企业安全公司销售体系带大的人,方向很明确:OpenAI 的企业业务要按传统企业软件的销售纪律来打,而且节奏压得很紧。

研究速递

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

研究者用对抗性强化学习训练「说服者」agent,目标只有一个:在单轮对话里让目标模型放弃原本正确的答案。优化后成功率从约 24% 升到 93% 以上,对未见过的开源模型迁移成功率 79% 到 83%(GPT-4o-mini 较难,25%,用课程学习即由易到难安排训练后升到 38%),学出来的手法包括伪造引用、编造权威信源。它和顺从性(sycophancy,模型顺着用户表态改口)研究测的是两回事:这里击穿正确信念的不是任何人的表态立场,而是被对抗优化过的论证,一轮之内完成。做安全评测的人应该把「劝说抵抗力」列为独立测项。

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

现有 agent 安全评测大多是静态的单次任务,这篇让环境本身演化:任务目标固定,攻击方只改环境状态,观察长流程(场景中位数 97 次工具调用)中累积的状态变化如何把 agent 引向不安全操作。75 个 agent 与模型组合上的合并攻击成功率 85%,环境越复杂,相对纯指令攻击的优势越大,从约 2% 拉开到 17% 以上。还有一个发现值得单独记:agent 的 runtime 实现(跑 agent 的那套代码和配置),在底层模型之外还能解释相当一部分安全表现的差异。做 agent 红队和评测的人值得细读。

On-Policy Self-Distillation without Any Supervision

后训练方法 U-OPSD 不用标准答案、不用环境反馈、也不用更大的模型当老师:让模型对同一道题采样多个答案,拿多数票结果当伪标签,再把与多数票不一致的推理轨迹朝它蒸馏,更新集中落在模型「自信但答错」的地方。Qwen3 4B 和 8B 在数学推理基准上分别提升 8.5% 和 10.7%,还略微超过了有监督的版本。有一个天花板是机制本身决定的,不过论文没有做跨领域验证:多数票得大概率正确这套才成立,在采样结果容易集体跑偏的领域未必管用。做后训练的 researcher 可以盯它向数学之外领域的迁移。

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

把蒸馏反过来做,而且不改权重:强模型在推理阶段为弱模型搭 harness(把不稳定的推理步骤改写成确定性代码、按基准定制路由、强制答案格式),在四个心智理论(Theory of Mind,指推断他人信念和意图的能力)基准上把弱模型平均分从 0.49 抬到 0.91。提升幅度很大,但手段相当「应试」,增益有一大块来自面向基准定制的路由和格式约束,而论文在这四个基准之外没做任何评测,能不能推广到开放任务还是未知数。想低成本部署小模型又不想重训的团队,可以跟踪这条脚手架路线。

今日一句话:Writer 只改 harness 平均省下 40% 成本,AI4AI 论文靠 harness 把弱模型分数抬近一倍,OpenART 发现 agent 安全表现的差异相当一部分来自 runtime 实现而非底层模型。就今天这几条来看,成本、能力、安全上最大的杠杆都落在模型外面那层软件里,而不在模型本身。