Meta 发布 Muse Glimmer:30B 开放权重,Apache 2.0

Meta Superintelligence Labs 8 月 10 日发布 Muse Glimmer:30B 稠密模型,多模态,128K 以上上下文(model card),权重已上 Hugging Face,许可证是 Apache 2.0。官方给它的定位是本地 agent 底座:端到端完成 agent 任务、可靠调用工具、支持 100 多种语言、推理力度可调,量化后 20GB 以内,一块消费级 GPU 就能跑;Zuckerberg 在随发布刊出的公开信里把它框成「个人超级智能」承诺的兑现(TechCrunch)。

两个点。一是许可证:Llama 系用的是 Meta 自定义的社区许可,带商用门槛和使用限制,这次换成标准 Apache 2.0,没有附加条件。二是尺寸方向:各家旗舰已经迈过万亿参数线(下一条的 DeepSeek V4 Pro 总参数 1.6T),Meta 押的是小到能常驻个人电脑的端侧 agent。开放权重的竞争点正在从「谁最强」移向「谁成为本地默认」。

DeepSeek V4 Pro 结束 preview 转正,权重是否开源暂无说法

DeepSeek 旗舰 V4 Pro 的正式版 0813 于 8 月 12 日出现在 OpenRouter:MoE 架构,总参数 1.6T、每 token 激活 49B,上下文 1M token,最大输出 384K;定价每百万输入 $0.435(缓存命中 $0.003625)、输出 $0.87。该模型 4 月下旬以 preview 形式上线(官方发布记录),转正用了约三个半月。

一处信息空白:截至发稿,DeepSeek 官方 change log 的最后一条还是 7 月 31 日的 V4-Flash 更新,Hugging Face 主页上也没有 0813 的仓库。preview 版权重本身是开放的,以 MIT 许可挂在 Hugging Face;正式版 0813 是否会同样放出,官方没有说法,这点我没能核实到。

Hinton、李飞飞、吴恩达同台:开放路线的三种辩护词

Las Vegas 的 Ai4 大会上,三位重量级研究者都站在「留在开放这一边」,理由各不相同。吴恩达反对让少数公司当守门人(「我不希望有守门人……那会限制所有人获取 AI」),并警告若中国的开放权重模型在性价比上胜出,换来的是它在亚非发展中国家的软实力。Hinton 的立场最微妙:他原本反对放出权重,理由是开放权重不同于开源软件——开源软件公开的是可审读的代码,开放权重公开的是训练好的参数,拿到参数就能微调掉安全防护、转用于网络攻击一类用途;但他承认「这一仗已经输了,开放权重模型已经存在」。李飞飞拒绝二元站队,主张分层处理,参照系是核物理:论文公开,材料管制。三人的共识只有一条:需要某种监管框架。

放在 Meta 回场、DeepSeek 转正的同一周看,这场辩论的「该不该开」部分确实已被现实略过,剩下的是李飞飞那个更难的问题:哪一层开,哪一层管。

有人批量伪装成 ClaudeBot 等 AI 爬虫,扫描网站漏洞

运营 Agentic Web Index 的 Known Agents 基于 5000 多个网站的流量数据披露:一场大规模扫描活动正冒用 AI 爬虫的名义找漏洞,扫描目标包括 /.claude/settings.json/.aws/credentials 这类 AI 编码工具和云命令行留下的凭证文件路径。判定「冒用」的依据是身份验证:请求头里的 User-Agent 只是一行自报家门的文字,谁都能填,真伪要靠比对该爬虫官方公布的 IP 段或 HTTP 消息签名来核验;自称 ClaudeBot、GPTBot、Googlebot 却通不过验证的就是冒牌,数据里被冒充最多的是 Googlebot,占全部流量的 0.5%。

受害者有两类。网站主按 User-Agent 封禁或放行,等于凭自报姓名开门;AI 公司则被借了品牌当攻击掩护,漏洞扫描会被服务器日志记到 Anthropic、OpenAI 头上。爬虫身份的密码学验证(公示 IP 段、Web Bot Auth 一类的签名机制)原本是礼节问题,现在成了安全问题。

把提示注入反过来用:一段埋好的文本,让攻击 agent 自我关闭

安全公司 Tracebit 把这招叫「context bomb」:在攻击者必经之路上(诱饵密钥、环境变量、DNS 记录)埋一小段文本,内容是引导读到它的模型去做一件会触发自身安全护栏的事;正在自动化渗透的 AI 攻击 agent 读到后就会拒绝继续、自行终止。实测覆盖 Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro、Kimi K2.6 五个模型共 152 次运行(完整结果):管理员提权成功率从 57% 降到 5%,整条攻击路径的成功率从 91% 降到 15%;原本 93% 的运行都能拿到管理员权限的 Opus 4.8,遇到 context bomb 后一次都没成。这项研究 7 月中旬就已发布,本周经 Bruce Schneier 转引又被讨论起来。

机制上这是攻防的镜像:提示注入是 LLM agent 的原生弱点,攻击方一旦用 LLM 干活,就把这个弱点一并继承了。但要看清它依赖什么——护栏。它防的是有安全对齐的模型被拿去攻击,对护栏被剥掉的模型无效;而且和蜜罐一样,套路公开后攻击者可以在自己 agent 的系统提示里预先打招呼,让它别理会这类文本——这两种情况实验都没有覆盖。

Claude 水印上线后,第一波反弹来自用户自己

昨天的快讯刚报过 Anthropic 为满足欧盟 AI 法案透明度准则、给 Claude 生成文本嵌入隐形水印(官方说明);TechCrunch 报道了用户端的反应:不少人担心职场和课堂里的 Claude 使用会因此暴露。反对的理由主要两条。一是归属:「指令、语境、决策和无数次修改都是我给的,Claude 只是工具」,凭什么成稿整体被标成 AI 生成;二是不对称:存心绕的人改写一遍或换个服务就能去掉水印,被抓住的只会是普通用户。社区大多并不同情,一条高赞回应是:「你不想要它的唯一理由就是想骗人。」

昨天划过的边界在这里正好用上:官方自己说,水印只证明「Claude 可能处理过这段内容」,不证明「Claude 是作者」。但在老师和雇主那里,这个区别大概率不存在,检测器亮灯就是定论。内容审核里早有同款问题:分类器给出的是概率信号,到了执行现场就被当成二值判定。水印真正的争议会发生在检测器的使用端,而不是嵌入端。

Twitch 默认用主播内容训练 Amazon 的生成式 AI,除非主动关闭

Twitch 8 月 12 日上线新设置:频道内容——直播、录播、剪辑、聊天记录、频道里的文字和图片——将用于训练母公司 Amazon 的生成式 AI 模型,默认开启;主播要自己进账号设置的「安全与隐私」页,翻到底部找到「Training for Generative AI」关掉。官方公告发在 Twitch Support 的 X 帐号并附帮助页链接(另见 TechCrunch)。被 TechCrunch 问到此前的内容是否已被用于训练时,Twitch 首席产品官的回答是:「我其实不知道这个问题的答案。」

默认开启本身就是新闻,而这位高管自己说得很直白:「如果做成 opt-in,没人会开。老实说答案就是这样。」一个没人会主动选择的设置,替所有人开好了。和文字语料不同,直播内容里是人的声音、脸和实时行为,主播靠这些可辨识特征谋生,反弹也正集中在这里:被拿去训练的恰好是「这个人之所以是这个人」的部分。

OpenAI 企业报告:头部企业的 agent 用量拉开 8 倍差距

OpenAI 发布报告《From assistance to execution》,数据来自自家企业客户的用量:用量前 10% 的「前沿企业」,每活跃用户产出的 token 是典型企业的 8.3 倍;截至 6 月,企业客户中 Codex 产出的 token 已占 Codex 与 ChatGPT 合计的 64%,代码 agent 的产出超过了对话。报告给企业的建议是把 agent 接上公司语境和工具、配好权限与审查流程、把个人跑通的工作流沉淀成团队的。

两条保留意见:这是卖 agent 的公司用自家数据论证「agent 拉开差距」,口径由它定;token 产出量也不等于业务价值,8.3 倍的 token 不能读成 8.3 倍的产出。相对扎实的信号是那个 64%,但它也要打个折扣:agent 跑一个任务产出的 token 远多于一次聊天问答,token 占比会高估用法实际迁移的幅度。方向仍然清楚:在这些企业内部,越来越大的一部分 AI 产出来自委托执行,而不是问答。

低资源语言的安全对齐是表面功夫:拒绝信号不足英文的 10%

一篇新论文构建了 LoDNA 数据集,覆盖契维语(Twi)、豪萨语、阿姆哈拉语、斯瓦希里语四种非洲语言,每条有害请求同时给出直译版和文化本地化版。除了常规的生成结果评测,作者还检查了模型内部表征:在大多数「语言 × 模型」组合里,有害请求在模型内部触发的拒绝信号不足英文同款请求的 10%;而这些请求的语义表征和英文版几乎重合(余弦相似度 0.95 以上)。模型明明理解了请求在说什么,只是这份理解没有接到安全机制上。

「低资源语言更容易越狱」本身是已知结论,2023 年就有研究用低资源语言翻译攻破了 GPT-4;这篇的增量在机制层面:探针结果提示,护栏挂在英文的表层模式上,而不是挂在语义上。对多语言部署的产品,按英文基准报出来的安全数字,说明不了这些语言的使用者实际得到的是什么——这次测的四种语言加起来就有几亿使用者。

新型 DoS:一段听不出异常的音频,让语音模型停不下来

针对端到端语音大模型(音频直接进模型、不经文字转写的那类),研究者展示了一种拒绝服务攻击:在语音里叠加人耳难以察觉的声学扰动,压低模型生成「结束符」的概率。自回归模型每步生成一个 token,靠采样到这个特殊符号才停下;结束符被压住,模型就一直说下去。扰动只加在有人声的片段里以保持隐蔽,在三个开源语音模型上攻击成功率稳定,输出长度和 GPU 消耗被显著拉高。

文本侧早有诱导超长输出、耗尽算力的攻击手法(sponge examples 一类),这篇把攻击载体挪到了声学信号层:一段听起来正常的语音,文本过滤和内容审核都看不到它。论文止步于演示攻击,没有评估防御;对上了语音入口的服务,我会先从最大输出长度、单会话算力配额这类朴素的工程限制做起。

今日一句话:Hinton 承认开放权重「这一仗已经输了」,同一周 Meta 带着 Apache 2.0 回到牌桌、DeepSeek 把旗舰转正;争论的重心已经移到谁的开放模型会成为世界各地的默认底座,这正是吴恩达说的那场软实力之争。