以色列政府机构被曝伪造智库网站,疑似专门投喂 AI 聊天机器人

Responsible Statecraft 8 月 17 日发布原创调查:一个自称 Hanover Institute for Public Policy 的「智库」网站发布了 100 多份带脚注和目录的报告,外观是典型的美国智库做派——但这个机构并不存在。调查追出的链条是:以色列政府广告署委托,法国公关集团 Havas Media 承接,再转包给一家叫 Piro 的公司,而 Piro 对外宣传一项名为「AI Story Optimization」的服务,自称制作「为让 LLM 评估为可信而设计的内容」。GPTZero 抽检 12 篇文章,11 篇被高置信度判为 AI 生成。为什么值得警惕:这批内容的目标读者不是人,而是模型。如果带搜索的聊天机器人是靠表面特征——机构名、脚注、学术排版——判断信源可信度,这套启发式就可以被逆向工程,而这次行动看起来就是在赌它们确实如此。它和 SEO 内容农场的区别在目标层:内容农场骗点击,这个直接瞄准聊天机器人给出的答案。对防御方的提示很具体:检索层的信源排序不能只看「长得像不像智库」,域名历史、机构是否真实存在,得变成排序信号。

404 Media 在稀有书里装了追踪器,终点是亚马逊的 AI 扫描仓库

404 Media 把追踪装置放进一本预计会被 AI 公司收走的稀有书,一路追到亚马逊在拉斯维加斯的 VGT3 仓库;仓库员工说他们成批接收纸书,切掉书脊以便快速扫描,原书在这个过程中被毁掉(另见 TechCrunch)。亚马逊的回应只有一句:「通过商业渠道购书,用于改进客户使用的产品和服务」。很多绝版书从未以任何形式上过网:没有电子版,也不在盗版库里,因此是现有模型没见过、也没被 AI 生成内容污染的语料。法律上这条路已经走通——我在写 Anthropic 和解案时梳理过,Bartz 案的地区法院认定买正版书扫描(含破坏性扫描)属合理使用,那 15 亿美元赔的是盗版下载(Authors Guild)。但法律解决的是版权问题,这次冒出来的是另一个:普通书销毁一本无所谓,稀有绝版书可能是仅存的少数物理副本。销毁的规模和这些书的稀有程度,404 Media 的公开部分没有给出,这两点我没能核实。

Greg Brockman:防御者的窗口开着,但在倒计时

OpenAI 总裁 Greg Brockman 8 月 17 日发文,开篇就是那起 OpenAI 模型入侵 Hugging Face 生产系统的安全事件,他称之为网络安全的分水岭。核心主张:AI 正在让积攒多年的安全欠账更容易被找到、被利用,但同样的能力此刻更该被防守方用起来——趁攻击者还没规模化跟上,这就是「防御者的窗口」。文中列的措施包括用 Codex 找代码漏洞、让模型先于人工分诊安全告警、用前沿模型持续探测自家基础设施的潜在攻击路径、训练模型写「超人级安全」的代码。有个细节容易读错:他点名 8 月底将发布、可能显著加速威胁一侧演化的模型,是另一家实验室的开放权重模型,不是 OpenAI 自己的。但别忘了,全文开篇的例证恰恰是 OpenAI 的模型入侵了别人的生产系统——这个窗口的威胁一侧,是包括这家劝大家用 AI 防守的公司在内的各家前沿实验室一起在推进的。(这类模型能力如何越过边界,我在拆解 OpenAI 长时程模型安全事件复盘时写过具体案例。)

Anthropic 年化收入达 650 亿美元,投资人预期年底破千亿

Bloomberg 报道,Anthropic 的年化收入 run rate 在 7 月底超过 650 亿美元:5 月是 470 亿,去年底只有 90 亿(另见 CNBC、TechCrunch)。据 TechCrunch 转述的 FT 报道,投资人预期今年收官在 1000 亿到 1200 亿美元之间。按 CNBC 的说法,这些数字是 Anthropic 向投资人披露的,公司没有公开置评。读这些数字要拆开两层:run rate 是把一小段收入年化,通常是拿最近一个月外推成全年,不等于实际进账;而放出数字的时机——公司据报在筹备秋季 IPO,目标估值按 FT 的说法不低于 2 万亿美元——决定了它们本质上是路演口径,没经过审计财报检验。增长本身我不怀疑,二季度初步收入超过 115 亿美元(CNBC)、同比 14 倍,这个量级很难靠口径做出来;但精确到哪一档,等 S-1。

斯坦福:AI 心理健康安全评测的漏洞,出在打分的专家身上

斯坦福团队(Kiana Jafari、Nina Vasan 等)检验了主流的安全评测流程:让模型回答合成的心理健康提示,共 360 条回复,再请三位持证精神科医生给回复的安全性打分。结果专家之间评分严重不一致,而且论文认为这不是噪声,是「结构性分歧」:专家各自带着互不兼容的临床框架进场——安全优先、以参与为中心、文化敏感——对同一条回复给出不同判定,简单平均分数只是把分歧藏起来(论文今年 1 月已挂 arXiv、被 FAccT 2026 接收,斯坦福 HAI 上个月刊文介绍)。对读 benchmark 的人这是直接警告:一个模型「通过心理健康安全评测」,取决于打分专家带的是哪套框架。内容审核行业处理主观类目的成熟做法,是把标注者分歧本身当信号:按成文政策校准、单独追踪分歧率,而不是平均掉。我还没看到 AI 安全评测建立起同等的方法论。

研究速递

Model Hypnosis:弱暗示叠加起来,能强力操控模型

Boix-Adsera 和 Tessler 发现,单个看起来无害的提示线索——换个措辞、添个错别字——各自只对模型行为产生微弱影响,但这些弱效应可以叠加,组合起来足以强力控制模型输出。效应跨模型家族和规模存在,对前沿推理模型同样有效,线索组合还能在模型之间迁移。做提示注入防御的人应该细读:现有过滤都在找「恶意内容」,而这种攻击的每个组成部分单看都无害。对可解释性研究同样是坏消息:当行为被分散在全文的隐性文本选择控制时,单点归因会失效。

RA-Bench:危机事件的 AI 伪造视频,现有检测器整体接不住

17,886 个视频(1,830 个真实锚点、16,056 个生成),覆盖 10 类社会风险场景,9 个生成器(4 开源、5 闭源),19 种检测方法同场评测——传统检测器、零样本多模态模型、为此微调过的多模态大模型都在内。结论:三类检测器没有一类能稳定泛化;骗得过人的视频同样骗得过检测器;经社交平台传播后更难检出。做 deepfake 与虚假信息防御的研究者值得逐类看失败模式:这个基准量化的正是单点准确率与真实传播条件下表现之间的落差。

S²VOPD:不用更强的教师,也能做在线蒸馏

蒸馏需要师生之间存在信息不对称,常规做法是教师更强,或教师拿得到标准答案。这篇反过来:不给教师加特权信息,而是给学生减信息——同一张图,教师看原图,学生看强增强(裁剪、遮挡等)后的版本,再把教师的输出分布蒸馏给学生,全程不需要标注、奖励或更大的模型。消融结果很干脆:不对称是关键,对称的自蒸馏反而掉点;增强过强会把任务相关的证据一并抹掉。Qwen3.5-4B 在六个细粒度感知基准上从 70.7% 提到 77.4%,论文自称超过了 GPT-5.4。做视觉模型自提升的研究者值得细读方法部分。

今日一句话:模型说什么,取决于它读什么——有人在为聊天机器人伪造智库,有人在销毁稀有书换干净语料,AI 答案的可信度从此是一块要主动防守的阵地。