Fable 5/Mythos 5 停服 19 天,始末写进了 Claude 的系统提示词

Anthropic 官方发布的 Claude Opus 5 系统提示词里,有一段专门交代出口管制事件的时间线:Fable 5 和 Mythos 5 于 6 月 9 日发布,6 月 12 日 Anthropic 为遵守美国商务部出口管制指令停服两款模型,6 月 30 日管制解除,7 月 1 日恢复访问(另见 Claude 系统提示词发布页)。停服当天的官方公告说,政府援引国家安全权限下达指令,但函件未说明具体关切;Anthropic 的理解是,政府认为找到了一个绕过 Fable 5 防护的办法(让模型读取特定代码库并修复其中的软件缺陷),而 Anthropic 评估已披露的潜在越狱「要么完全是无害的回应,要么只是不构成 Mythos 特有能力提升的轻微发现」。把时间线写进系统提示词的原因很实际:事件发生在训练数据截止之后,不写,模型会否认自己停服过。这件事有两层信息量:出口管制的执行已经细到指名停掉特定模型(这份指令只覆盖 Fable 5 和 Mythos 5 两款,别无其他);系统提示词成了厂商向模型「补课」合规事件的正式渠道。

OpenClaw 替主人抢课位,黑了健身房订课网站

据 ABC 报道(另见记者 Cam Wilson 的摘要),墨尔本一名男子让 AI 助手 OpenClaw 处理健身房订课,OpenClaw 在订课网站上找到一个漏洞,绕过预约限制,把候补名单上的另一名用户挤掉,让主人往前顶了一位。ABC 称这是澳大利亚已知首例 AI agent 自主入侵,这一定性出自 ABC,我没有逐一核对是否有更早案例。这件事的要点不在技术难度,而在动机结构:没有攻击者、没有恶意软件,只有一个想抢课位的普通用户和一个尽力完成任务的 agent,代价落在候补名单上一个不相干的真人身上。此前 OpenAI 的 agent 入侵 Hugging Face 发生在安全测试里,这次发生在日常使用里。

GitHub Models 正式退役

7 月 30 日起,GitHub 的免费模型平台 GitHub Models 全面下线,playground、模型目录、推理 API 和自带密钥功能一并停掉,存量用户也不例外。整个退役分三步:6 月 16 日停收新用户,7 月 1 日公告全面退役,7 月 16 日和 23 日做了两次计划性断服演练。GitHub 没有解释原因;连带地,依赖它做推理的 GitHub Spark 也从 8 月 4 日起停收新用户(另见 Spark 退役公告)。我的推断是账算不过来了:agent 时代的调用量比人肉点 playground 高几个数量级,拿免费 token 获客的模式撑不住这种消耗。

爆仓边缘的 Situational Awareness,向芯片初创 Source Foundry 投了 4 亿美元

据 TechCrunch 报道(《华尔街日报》率先援引消息人士披露,暂无官方公告),Leopold Aschenbrenner 的 AI 对冲基金 Situational Awareness 向隐身期芯片初创 Source Foundry 投资 4 亿美元,累计投入 5 亿美元;Source Foundry 由斯坦福研究者创立,据报道估值约 50 亿美元,目标是在 ASML 主导的光刻设备市场之外做出替代路线。这家基金 7 月底刚经历重挫,据报道已把公开市场持仓的大部分卖给 Citadel,只保留了 Anthropic 股份。公开市场翻车之后,把可动用的资金押进流动性最差的一级市场芯片资产,等于把基金的存续押在「算力瓶颈长期存在」这一个判断上,不再留退路。

论文:水印别当取证工具用,当测量工具用

Daniel Susser、John Thickstun 和 Gili Vidan 在这篇论文里给水印换了个定位:用它给单条内容「验明正身」不可靠,因为标记容易被去除、单条判定的证明力有限、对恶意传播者也没有约束力;他们主张把水印改用来测量合成内容在整个媒体生态中的累积占比和流向。内容审核行业里,逐条判定永远在和规避手段赛跑,而监管真正需要的答案往往是总量和分布:合成内容占了多少、集中在哪些场景。把水印从「逐条断案」改成「给生态测浓度」,对技术的要求低得多,给出的信息反而更接近监管想知道的东西。

开源小工具:用 git 历史标注每一行是人写还是 AI 写

us-vs-them 是一个基于 diff 的行级溯源工具:不在文本里嵌入任何标记,从 git 提交历史推断每一行的作者构成,输出 0 到 1 的得分,1 是纯人写,0 是纯 AI 生成,人写后被 AI 修改过的落在中间。它和上一条水印论文正好是互补的两条路:水印改动内容本身,这个工具把版本历史当证据链,代价是只适用于有提交历史的协作场景,管不了公开互联网上的零散文本。

论文:按国家测 LLM 价值对齐,会掩盖国家内部的分层

这篇论文用欧洲社会调查(European Social Survey)的数据,以 15 个社会人口变量加居住国,测了 10 个主流商用 LLM 的价值对齐。三个结论:模型对不同人群的对齐程度确实不平等,教育、收入、职业、宗教维度上都有差距;国别单独的解释力不弱,大致相当于 15 个社会变量之和;但两类因素互补,各自权重随问题而变。对眼下流行的「模型价值观世界地图」类评测,这是个具体的方法论提醒:一国内部按教育和收入拉开的差距,可以和国家之间的差距一样大,按国别打出的对齐分数不能直接当成该国用户的实际体验。

今日一句话:AI 治理正在变得具体,上到商务部给特定的两款模型下停服令,下到一个 agent 为了帮主人抢课位、把候补名单上的真人挤下去。