你问 AI:年薪 8.5 万美元,在纽约买房能贷多少?助手一边回答,一边替你把这轮对话总结成一个标题挂在侧边栏,比如「Salary 85k NYC: Mortgage of 280-350k」。这个标题不只是给你看的。论文合著者 Jorge García Herrero 举的正是这个例子:在多款产品里,这类 AI 自动生成的标题会随着页面数据一起发给 Meta、TikTok、DoubleClick 的追踪脚本。

这来自 IMDEA Networks 牵头、马德里卡洛斯三世大学研究者参与的论文 Prompt like a Butterfly, Sting like a Tracker(标题戏仿拳王阿里的「轻盈如蝶、蜇人如蜂」),据合著者说明已被隐私技术会议 PoPETs 2027 接收。9 月 29 日它冲上 Hacker News 首页,截至写稿时四百多个赞。团队实测了九款助手:ChatGPT、Claude、Gemini、Copilot、Grok、Perplexity、Le Chat(Mistral)、DeepSeek、Meta AI,覆盖网页端和 Android 端、免费和付费档、接受和拒绝 cookie 的各种组合。

结果:九款全部至少集成一个第三方广告或追踪服务;九个网页客户端里有六个、八个可测的 Android 应用里有三个,把对话 URL、标题、prompt 或截图泄漏给第三方,而且通常连着持久标识符(cookie、账户 ID,有些情况下还有邮箱哈希)一起发。也就是说,追踪器拿到的不是匿名的「有人在问房贷」,而是能和广告体系里既有用户画像对上号的「你在问房贷」。

老基建,新语义

论文里没有一项发现依赖新技术。Meta Pixel、TikTok Pixel、Google Analytics,都是网站装了多年的东西:网页里嵌一段第三方脚本,把当前页面的地址、标题和你浏览器里的广告 cookie 一起发回广告商服务器,用来把「你看了什么」和「你是谁」对上号。

变化在于喂给这套基建的数据。普通电商网站上,页面标题是「某某牌跑鞋」,追踪器知道你在逛鞋。而在聊天产品里,页面标题是模型刚替你生成的对话摘要:你的健康疑问、财务状况、法律麻烦,被压缩成一句话,恰好塞进了追踪脚本例行上报的那个字段。论文把这称为一个新的隐私攻击面:泄漏源不是用户自己发的内容,是服务商加工出的「对话工件」。九个网页客户端里有三个把这种 AI 生成的标题发给了包括 Meta、TikTok、DoubleClick 在内的九个第三方。

Grok 走得最远。它的对话永久链接默认公开、需要手动关闭;分享时,研究团队的项目网站记载,消息原文会被写进网页的 Open Graph 元数据(本来是给社交平台生成预览卡片用的字段,包括标题和图片说明),于是读取这些字段的 TikTok 脚本连标题、prompt 带截图一起收走。

永久链接这个坑我不陌生:8 月我写过 Claude 分享链接是怎么进 Google 搜索的,问题出在「拿到链接就能看」的 capability URL 一旦流出就等于公开。这篇论文把同一条链路又推进一步:链接根本不用流出去,页面里内嵌的追踪脚本当场就把它读走了。Perplexity 的访客对话同样始终公开。

最扎心的数字在同意机制这一节:拒绝全部非必要 cookie 后,80.8% 的第三方追踪器照常工作,九款服务里四款继续向第三方发数据。

一部分原因是追踪转移到了用户看不见的地方。以 Claude 为例,论文测到 Anthropic 经由 Segment 的转化接口,把用户事件从自家服务器直接转发给 Facebook、LinkedIn、TikTok、Reddit、Google 等 11 个广告平台。这叫服务器端追踪:数据不经过你的浏览器,adblocker 和隐私浏览器拦的都是浏览器里的脚本,对这条路径无从下手。

Android 端更直接:多数应用压根不弹 cookie 选择框,要用就得先接受服务条款,「拒绝」这个选项不存在。而移动客户端联系的各类端点里,71% 来自应用内嵌浏览器(WebView),网页端那套追踪原样搬了进来。网页端也有不给选的:Le Chat 必须整体接受服务条款和隐私政策才能用。

能做什么,不能指望什么

用户侧还有几件事值得做。拒绝非必要 cookie 依然有意义,它砍不掉八成追踪器,但能砍掉两成:论文测到 Claude 在用户拒绝后,Meta Pixel 和那 11 个服务器端转发目标都没有激活。别用对话分享和永久链接功能,Grok 用户应手动关掉默认公开;分享过的链接去设置里撤销。真正敏感的话题,用不登录的访客模式反而危险(Perplexity 访客对话公开);完全离线、不带遥测的本地部署则能绕开论文测到的这整套第三方传输。

但读完论文的判断是:这不是用户侧能解决的问题。服务器端转发用户根本看不见,同意机制形同虚设,论文作者自己给的建议也全部指向平台,别默认公开永久链接、别让自动生成的标题进入第三方可见的字段。值得记下的一个先例是:据项目网站记载,Perplexity 在一起集体诉讼立案后,于 2026 年 4 月 3 日移除了 Meta Pixel。项目网站的措辞很谨慎,只说这「可能是对诉讼的回应」;如果推测成立,推动平台改掉做法的,是一纸诉状。

这一年围绕 AI 隐私的讨论,注意力几乎都在模型层:训练数据、模型记忆、对话会不会被拿去训练。这篇论文测的则是包在模型外面那层普通 web 产品,用的全是最老一代的广告技术,只是没人在把聊天框接上这套基建时重新问一句:现在流过这里的数据,和当年的商品浏览记录还是一回事吗?接下来值得盯的是欧盟的动作。论文的法律分析认为,向第三方披露对话工件这类处理需要事先知情同意,也很难拿「履行合同」当合法依据,这让这种做法与 GDPR 和 ePrivacy 指令处于紧张关系,不过作者并未断言它违法。这套实测是 2026 年 5 月在西班牙完成的,九款产品都向欧盟用户提供服务,这个问题现在摆在欧盟监管者面前。

参考来源