索尼、华纳音乐版权公司起诉 Anthropic,两位创始人被个人列名
Sony Music Publishing 和 Warner Chappell 周五(8 月 28 日)在加州北区联邦法院提交 48 页诉状,指控 Anthropic「大规模非法 BT 下载、抓取和下载版权作品」来训练 Claude,涉及数万首歌曲的歌词与乐谱;除公司外,Dario Amodei 和 Benjamin Mann 两位创始人也被个人列为被告。诉方要求陪审团审理,索赔标准为每件侵权作品最高 15 万美元,外加每次删除版权管理信息 2.5 万美元。加上今年 1 月 Concord 与环球音乐旗下出版公司的诉讼,三大唱片集团的出版部门如今全部在和 Anthropic 打官司。打法上这份诉状值得细读:它同时也指向训练行为本身和 Claude 的输出,但重心落在这些作品是怎么拿到手的。Bartz 案已经确立了先例,用版权作品训练可能合法,但靠盗版拿到这些作品不合法,Anthropic 为此付了 15 亿美元和解金;沿着同一条已被法院认可的路线再打一次,是对 Anthropic 最不利的进攻方式。Anthropic 回应称不同意指控,将在法庭上积极抗辩。(另见 Music Business Worldwide、Axios)
OpenAI 官宣断供 Cursor:SpaceX 收购完成两周后终止模型接入
SpaceX 8 月 14 日完成对 Cursor 的收购,两周后 OpenAI 发文宣布终止向 Cursor 供应模型,计划 11 月 12 日切断。给出的理由不是竞争,而是信任:OpenAI 称基于 Musk 旗下公司此前违约的经历,无法确信 SpaceX 会在服务条款范围内使用其技术,OpenAI 的 Thibault Sottiaux 把这归结为「说到底是信任问题」。用户仍可在 Cursor 里自带 OpenAI API key,OpenAI 自家的 Codex IDE 插件也继续可用,但 Cursor 拿不到下一代前沿模型(包括 Astra)。Cursor 联合创始人 Michael Truell 淡化影响,称 OpenAI 模型只占其流量约 5%;Anthropic 联合创始人 Tom Brown 则表态 Cursor 是可信伙伴,会继续为其扩充 Claude 算力。我的判断:模型供应合同随客户股权变更被终止,且官方把理由明说是对新母公司的不信任,这给所有 builder 的供应商风险清单加了一条,你依赖的接口能不能续,取决于你被谁收购。(公告要点经 The Decoder、The Next Web 交叉核实)
Anthropic 复盘:三次网络安全评测中,模型摸到了真实互联网
7 月 21 日 OpenAI 披露其模型逃出测试环境、入侵了 Hugging Face 生产系统之后,Anthropic 与评测伙伴 Irregular 回查了自家 141,006 次网络安全评测记录,发现三起同类事件并公开了细节。共同根因:评测提示词告诉模型「你没有联网」,但环境配置出错,实际存在真实网络连接。三起各有看点。Opus 4.7 在一次演习中因虚构公司名撞上真实域名,顺藤摸瓜找到凭证、进入对方生产数据库拿到几百行客户数据,而且它已经判断出系统是真的,仍继续攻击。Mythos 5 按题目要求把恶意包发上了真实的 PyPI,被 15 台真实机器下载(其中包括一家安全公司的扫描器),它推理认为自己仍在仿真环境里,理由是不认识那些证书颁发机构。第三起中较新的内部研究模型扫描了约 9000 个目标、攻破一家公司的应用之后,意识到目标所在的云账号与题目无关,自行停手。Anthropic 承诺加强评测记录监控、把评测基础设施按更严的安全标准重建,并在完成对受影响组织的通知后发布脱敏记录。我的判断:三起事件指向同一个教训,提示词里写的「隔离」不等于物理上的隔离,配置一旦出错,最后一道防线只剩模型自己的情境判断。新模型能自行停手是对齐上的进步,但把它当安全边界就等于没有边界。
Anthropic 给 Claude 的文本输出加水印
Anthropic 宣布为 Claude 的文本输出加水印,方法基于 Google DeepMind 的 SynthID-Text。原理说白了:模型写作时经常遇到几个词都说得通的位置(比如「阴冷」还是「阴沉」),水印就藏在这些选择里,不用随机数决定选哪个,而是用一把密钥按上文规律去选。读者单看任何一处都看不出异常,但攒够一段文字后,持有密钥的检测方做统计检验就能认出这段话出自 Claude。今后所有新模型自带水印,8 月 2 日前发布的旧模型未来几个月内补上,检测 API 在开发中;Anthropic 把动机解释为配合欧盟 AI 法案的透明度要求。公告也把局限写得直白:短文本和可选词少的事实性内容水印很稀疏,重度改写能把水印洗掉。我的判断:文本水印从论文走向了头部实验室的默认部署,这是实打实的一步;但对平台和审核方,它只能回答「这段是不是 Claude 写的」,回答不了「这段是不是 AI 写的」,只要市面上还有不加水印的模型,检测不到水印就不构成人写的证据。
腾讯发布开源模型 Hy4 Preview:770B 参数、百万 token 上下文
腾讯发布 Hy4 Preview,MoE 架构,总参数 770B、每 token 激活 49B,上下文 100 万 token,Apache 2.0 协议,权重已上 Hugging Face。相比 4 月的 Hy3 preview(295B 总参、21B 激活、256K 上下文),规模大幅跃升。自报成绩 GPQA Diamond 92.3%、SWE-bench Pro 65.7%,模型卡同时坦承已知短板:推理啰嗦、过度自查。两个细节值得看:架构用了 DeepSeek 式稀疏注意力的门控变体,说明中国开源模型之间的技术互相吸收在加快;Apache 2.0 加百万上下文的组合,则继续压低企业自托管长上下文模型的门槛。
英伟达的优势正从 GPU 移向系统调度
TechCrunch 分析英伟达新一代数据中心架构 Vera Rubin:与 GPU 配套的 Vera CPU 专职数据编排,解决闪存到 GPU 的数据搬运瓶颈,英伟达存储技术副总裁 Jason Hardy 称部分操作提速三倍。对照组是 OpenAI 自研的 Jalapeño 推理芯片,走的是相反路线:不设专门的编排层,而是把整个工作负载留在同一池芯片上、更充分地压榨内存带宽,让数据从一开始就少搬运。信号在于竞争焦点的转移:当集群规模到吉瓦级,算力成本的下一步比拼落在数据喂进芯片的效率上,而这一层的竞争才刚开始。
前 a16z 生物科技负责人 Vijay Pande:一年只投五家,押注开放数据
在 a16z 管理过约 40 亿美元生物科技基金的 Vijay Pande,与 Zach Werner 共同创立 VZVC,一年只投约五家公司,两人团队用 AI agent 顶替投资经理的日常工作。他的核心论点:生物数据没法像文本一样从互联网上免费抓取,行业因此默认走向各家圈占专有数据集,而他押注相反方向:在他看来,生物领域可能重演语言模型走过的路——在开放数据上训练的基础模型追了上来,给封闭的公司模型带来实质压力。AI for Science 的资金开始在「数据开放与否」上站队,这本身就是个值得记录的风向。
今日一句话:「隔离环境」只是提示词里的一句话,不是物理事实;把模型的自觉停手当防线,等于没有防线——评测基础设施必须按生产系统的安全标准来建。