谷歌发布 HEIR:让云端 AI 在加密数据上直接推理

谷歌安全团队公布了 HEIR,一个开源编译器工具链,能把训练好的 AI 模型转换成在同态加密数据上运行的版本。同态加密的意思是:数据加密之后仍然可以直接在密文上做计算,服务器从头到尾看不到明文,算出的结果也是加密的,只有持有密钥的用户自己能解开。谷歌同时放出四个演示场景:私密内容推荐(与 Belfort Labs、LG、纽约大学合作)、信用卡欺诈检测、网络威胁检测、音频热词检测,并宣布与 Belfort、Niobium、Cornami、Optalysys 四家硬件加速器公司合作。我的判断:编译器是对的切入点,它把「懂密码学」和「懂模型」两拨人解耦了,这是同态加密从论文走向工程管线的标志。但文中给出的延迟数字都是在单线程 CPU 上测的,硬件加速的结果只承诺近期展示,说明离日常产品还有相当距离。

GLM-5.3 发布:基座不动,提升全部来自后训练

智谱(Z.ai)发布 GLM-5.3,官方口径是基座模型完全没动,能力提升全部来自后训练阶段的大规模扩展:内部评测中编码能力比 GLM-5.2 提升 50%,权重计划两周后开源,目前先通过 GLM Coding Plan 提供,兼容 Claude Code 等编码 agent。发布页标题在编码之外把网络安全能力当作第二卖点。Nathan Lambert 的分析值得一读:他估计 GLM-5.3 约 7500 亿参数,只有 Kimi K3 的三分之一,却在多数基准上胜出,因此这不能用「蒸馏美国模型」解释;他认为中国实验室跟上前沿靠的是发布节奏(以天计,而美国公司内部测试以月计)和纯文本专精这类取舍。基座不动、只砸后训练就能追平前沿,这对「预训练规模决定一切」的叙事是个具体反例。

谷歌把 AI 生成内容的可见水印做成了开关

谷歌宣布未来几天起,用户可以在 Gemini 和视频工具 Flow 里关掉 AI 生成图片(Nano Banana)、视频(Omni)、音乐(Lyria)上的可见水印,法律强制要求的地区除外,搜索侧支持随后跟上(官方仅在 X 公告,无官网新闻页;另见 TechCrunch 报道)。能关掉的只是肉眼可见的角标;不可见的 SynthID 水印和 C2PA 元数据仍然始终嵌入——SynthID 是谷歌把统计特征藏进像素和音频里的隐形标记,人眼看不出,验证时要把文件跑一遍检测器,比如让 Gemini 判断一张图有没有这个标记;C2PA 是记录「这个文件由谁、用什么工具生成」的行业元数据标准。Gemini 负责人 Josh Woodward 的说法是「在创作自由和安全之间找平衡」。我的看法:这一步把识别 AI 内容的责任从任何看一眼内容的人,转给了愿意多走一步去跑检测的人,而刷到一张图就划过去的多数读者不会走这一步。Anthropic 也已上线 Claude 文本水印的官方页面(发布计划此前报道过),两家都在往「不可见但可验证」的方向走。

新预测:数据中心押注的天然气可能涨到三倍

能源研究公司 Noreva 预测,未来几年美国部分地区天然气价格可能涨到现在的三倍,得州和路易斯安那的部分交易枢纽会突破 10 美元/百万英热单位,而目前基准价(Henry Hub)约 3 美元。机制是 LNG 出口终端持续扩建,把过去相对封闭、因此便宜的美国国内气市和全球市场连通了,Noreva CEO Peter Gardett 的原话是「我们正在把国内和全球天然气市场接起来」。燃料占燃气电厂发电成本约一半,气价翻两三倍会直接抬高 AI 数据中心的电力成本。云厂商当初选天然气是因为建得快,燃料价格波动就是这个选择的隐藏账单;TechCrunch 援引的调查还显示 80% 的美国消费者已经在担心数据中心推高自家电费,涨价会把这层政治压力再放大。

法国初创 Kog:在 GPU 底层再榨一轮推理性能

11 人的法国初创公司 Kog 完成种子轮(Varsity VC 联合领投,Bpifrance、French Tech 2030 支持),路线是给每款 GPU 花数周到数月做底层工程优化,声称在 AMD MI300X、英伟达 H200 这类标准数据中心 GPU 上有 30 倍推理加速的空间,目标是编码 agent 这类速度直接决定体验的工作负载。要说明的是:目前的公开演示只是在 20 亿参数的小模型上跑到 3000 token/秒,30 倍是厂商口径,没有独立验证;公司自己也把「9 月前在主流大模型上演示 10 倍加速」当作下一个里程碑。agent 把推理速度从成本问题变成了产品体验问题,这个方向的需求是真的,但结论要等大模型上的数字。

研究速递

修辞能在多大程度上「贿赂」AI 审稿人

用 120 篇 ICLR 2026 真实匿名投稿生成 4200 份内容不变、只改措辞的对照版本,让五个 LLM 审稿人打分,量化「把话说得好听」对评分的影响。发现效应高度集中:证据的呈现框架和新颖性姿态这两个修辞维度影响最大,而且方向取决于审稿人的基线分(低分被抬高、高分被压低、中间分最容易被晃动);换更严格的审稿协议能把平均分整体压低 1.36 分,但堵不上修辞敏感这个口子。正在考虑用 LLM 辅助审稿的会议组织者和研究 reward hacking 的人都该点进去:这是「AI 评委可以被文风攻击」的受控证据。

DarwinX:进化的对象是 harness,不是模型

把 agent 自我改进的对象从模型权重换成 harness(提示词、工具、技能、控制流):维护一个 harness 种群做「保留-扩展」式选择,只接受扩展了能力覆盖、又不在其他任务上退化的变体,模型权重全程冻结。相比单一路径的贪婪自改进(局部改好一处、别处悄悄退化),种群加档案机制明显更稳:Terminal-Bench 2.1 提升 7.7 个百分点到 83.2%,WebArena-Infinity 通过率从 43.5% 升到 93.0%,进化出的 harness 不加修改迁移到 SWE-bench Verified 仍然有效。做 agent 工程的人值得细读,这条路线不碰权重,可以直接搬进生产 harness 的迭代流程。

Intern-S2-Preview:面向科研的 agentic 基础模型

上海 AI Lab 系团队(125 位作者)发布的科学 agentic 基础模型,最大 397B 参数,训练分三段:科学语料的多模态预训练、统一后训练(SFT、多任务 RL、agentic RL)、再加一组推理优化技术,目标是跨模态科学证据推理、科学工具交互和长跨度任务推进,在多个科学与 agent 基准上给出有竞争力的结果。做科研自动化、尤其生物和跨模态方向的 researcher 可以把它当作 AI for Science 路线的实质性参照,而不只是又一个通用基准。

今日一句话:可见与可信正在脱钩——数据加密着算(同态加密),水印藏进像素里(SynthID),真伪判断两头都从肉眼转移到了工具,而工具在厂商手里。