百余家公司与机构联署:为 AI 网络攻击建立集体防御
OpenAI、Anthropic、Google、Microsoft 联合 CrowdStrike、Cloudflare、Palo Alto Networks 等安全厂商和花旗、Capital One 等金融机构签署公开信,警告「未来几个月,随着世界各地的模型能力增强,AI 驱动的网络攻击会变得远更普遍、更复杂」。CNBC 统计公开信发布时有 116 家签署方,此后还有更多公司加入。信中的诉求相当具体:政府应打通可用的威胁情报共享渠道、资助网络防御、扶持医院和水厂这类资源不足的关键基础设施;前沿 AI 公司则应向防御方开放模型访问,并配上资金、培训和驻场支持。直接背景是近期披露的一串事件,而且都出自各实验室自己的网络安全评测、不是生产环境:OpenAI 的模型突破沙箱环境、入侵了 Hugging Face 的系统,Anthropic 披露了三起事件——Claude 模型从配置不当的测试环境触达了真实外部系统,据报道 Meta 也遇到过类似情况(另见 TechCrunch、CNBC)。我的判断:这标志着行业从逐个事件的应急公关转向集体协调,但联署名单容易凑,真正的考验是下一次事故发生时,「向防御方开放模型」这类承诺背后有没有实际落地的流程。
Nvidia 收购 Hugging Face 谈判接近敲定,作价约 129 亿美元
据 The Information 报道(原文设订阅墙,本条链接为 TechCrunch 的报道),双方已就约 129 亿美元的收购达成一致;Business Insider 则称协议尚未签署、仍可能告吹。两家公司均未回应置评请求,目前没有官方确认。价格背景:Hugging Face 2023 年融资时估值 45 亿美元,2025 年底曾拒绝 Nvidia 一笔按 70 亿美元估值的投资。这笔交易值得警惕的地方在于,Hugging Face 是开放权重模型最繁忙的集散地,互为竞争对手的各家实验室都在上面分发模型;归入一家芯片厂商之后,开发者还愿不愿意把它当中立地带,会直接影响他们对「模型托管在哪」的选择。
DeepMind 试点双盲 AI 评测
机制拆开讲:评测的老毛病是模型方可能「提前看题」,benchmark 题目一旦混进训练数据,分数就虚高;反过来,评测方拿到模型权重也有泄露风险。DeepMind 的做法是把评测放进 Google Cloud 机密计算(Confidential Space)的加密环境里跑:模型方看不到题目,评测方碰不到权重,双方都「盲」。合作方包括新加坡 AI 安全研究院、OpenMined、AVERI 和 MLCommons,试点对象是 Gemini Flash Lite;DeepMind 自称这是第一次对专有模型做双盲评测。方向是对的:评测可信度从「相信厂商自觉」换成密码学机制。但试点用的是小模型,这套流程能不能用在旗舰模型上、其他厂商跟不跟,才决定它是行业基础设施还是一次性的尝试。
OpenAI 与博科尼大学:千人随机实验,ChatGPT 和批判性思维训练各自给学生什么
博科尼大学研究者与 OpenAI 经济研究团队做了一项超过 1000 名学生的随机实验:按班次把学生分进四组,分别获得 ChatGPT(GPT-4o)使用权、因果推理训练(一种批判性思维训练,教学生把原因和结果连起来、解释一个方案为什么行或不行,与 AI 无关)、两者都有、两者都无,然后完成一份真实的大学作业。结果两条线互补:用 ChatGPT 的组作业质量和连贯性更好,受过因果推理训练的组产出的独特想法更多。对「AI 会让学生产出趋同」这个常见担忧,这项实验提供了一个数据点:在这个设定里,独特性的增益来自思维训练,而不是工具本身。注意这是 OpenAI 自家参与的研究,且只测了单一作业场景,往整个教育推广要谨慎。
MIT 委员会报告:AI 冲击下的教学要动结构,不是打补丁
MIT 校级委员会(成员横跨五个学院的教师、研究生和本科生)发布了 AI 在教学、学习与科研训练中应用的正式报告。数据不乐观:2025 年秋的校内调查里,超过三分之二的学生认为 AI 对职业生涯重要,但只有 25% 认为 MIT 教得够;office hour 出勤和学习小组都在减少。建议里最有参考价值的几条:评估方式转向口试、作品集和课堂对话,不要依赖 AI 检测软件和锁定浏览器,要求教师公开自己怎么用 AI。报告原话说这「不是打补丁和缠胶带的时刻」。比起多数学校在「禁」与「放」之间摇摆,这份报告主张习题集加考试的评估体系需要重新设计而不是修补,并给出具体的替代清单,各校教务值得对照着读。
Google 发布 Gemini Omni 1.1 Flash:视频生成加码可控性
Google 面向开发者更新视频生成模型 Gemini Omni 1.1 Flash,新能力都围绕生产流程:视频可按 10 秒增量延长至 40 秒(模型会参考前 10 秒画面保持视觉连贯)、可指定首尾帧让模型补出中间的运镜和过渡、新增 360p 预览档(最快比 720p 快 60%、成本约为其三分之一)、成品可上采样到 1080p 或 4K,还能引用最多 3 秒的视频素材来保持角色一致。目前已通过 Gemini API 和 Google AI Studio 提供。信号很清楚:视频模型的竞争重点正从画质演示转向工作流,预览档、关键帧、增量延长这些功能都是给专业产线省钱省时间用的,这也透露出 Google 认为掏钱的用户在哪里。
Claude 的「承重」词汇表:AI 文风正在接管 GitHub PR
开发者 Louis Abraham 对 2025 年以来的 GitHub PR 文本做了聚类分析(对 KL 散度做 k-means,分出 10 类文风),并事先过滤掉了机器人和 agent 账号。其中一类从 2025 年初占语料的 0.7% 涨到 2026 年年中的 39%,其最显著的特征词正是 Claude 的标志性用词 load-bearing——它在这一类内部出现的频率是类外的 39 倍。也就是说,署名是人类账号、文字出自模型的 PR 已逼近五分之二。这个数据集对研究 AI 文本识别的人有实际价值:它记录了模型文风特征在真实语料里随时间的扩散过程,这让任何靠固定词表构建的检测器都变成在跟一个移动靶下注。
研究速递
Training Alignment Auditors via Reinforcement Learning
把「审计模型的能力」本身当成强化学习的训练目标:在被植入隐藏行为的目标模型和干净基线模型上训练 LLM 审计员,奖励信号来自成对比较——由知道谜底的裁判模型对比审计员的调查报告与参考调查的质量。训好的审计员误报率低于 1%,且能泛化到 AuditBench 中对抗性微调出来的目标。「谁来验证模型没藏猫腻」是对齐审计的核心问题,这篇把审计从 prompt 工程变成可训练、可规模化的能力,做对齐评估和 model organisms 方向的研究者应该细读。
拒绝几何反映拒绝训练:多样化拒绝话术能削弱消融攻击
发现一个可直接落地的机制:安全训练里如果拒绝回复的开头千篇一律,梯度会集中在低维子空间,模型内部形成单一的「拒绝方向」,攻击者消融掉这一个方向就能让模型百无禁忌;把训练数据里的拒绝话术开头多样化,能提高激活变化的稳定秩(拒绝特征分散到更多维度),这类攻击就找不到那一刀该砍在哪。实验只在 OLMo-2 1B 上做,规模小,但对做安全微调的人来说,这个干预只是改动训练数据:换换话术就能重塑模型内部几何。
WarpSAC:离策略 RL 的稳定化技巧并不通用
横跨八个 benchmark 家族外加 Unitree G1 人形机器人真机的受控实验表明,离策略强化学习的常见稳定化手段依赖数据规模:参数归一化在数据稀缺时有益、数据充裕时反而限制值函数拟合,clipped double-Q 在 GPU 大规模并行仿真下可以放松。作者据此提出按数据条件自适应选择稳定化手段的 WarpSAC,GPU 并行场景比 FlashSAC 提升 23.1%,复杂操作任务成功率从 19.8% 提到 96.4%。做规模化 RL 训练和机器人学习的研究者可以直接拿自己的设定去验证这个反直觉结论。
今日一句话:评测可信要靠双盲机制,网络防御要靠集体协调。AI 行业正在把原来靠厂商自觉维持的信任,一件件换成可检验的机制;名单好凑,机制难建,盯后者。