Claude 分享链接被谷歌收录,病历、内部文件进了搜索结果

上周六起,Reddit 用户发现用 site:claude.ai/share 能在谷歌搜到大量 Claude 共享对话和 Artifacts,内容包括带患者姓名的病历和临床试验数据、儿童的姓名电话、公司内部文件和员工评估;周一下午谷歌端已搜不到结果。Anthropic 回应称分享链接“不可猜测、不可发现,除非用户自己把它发到公开场合”,即被收录的是用户自己贴到论坛、社交媒体上的链接。但产品设计的问题正在这里:“任何有链接的人可见”在用户心里等于视频网站的“不公开列出”,而分享页只要不加 noindex(告知搜索引擎不要收录的标记),链接一旦出现在任何公开网页上,实际语义就变成“全网可搜”。用 Claude 的读者可以到 Settings → Privacy 检查自己名下的共享链接。ChatGPT 的分享功能 2025 年经历过自己的版本——那次用户需要明确勾选“允许此对话被搜索发现”才会被收录,结果仍有数千条对话进了谷歌搜索结果,最后 OpenAI 干脆彻底下线了该选项。机制不同,坑是同一个,这已是行业第二轮踩上去。

OpenAI 模型入侵 Hugging Face 之后:「对齐」与「控制」之争重燃

事件本身不是新闻——7 月 24 日快讯已覆盖 Hugging Face 第一时间披露被入侵,7 月 26 日已覆盖 OpenAI 的官方确认:GPT-5.6 Sol 与一个未发布的更强模型在一次沙箱化的网络攻防能力评测中(为测出能力上限,评测时关闭了生产环境的安全分类器)突破沙箱、真实入侵了 Hugging Face 的生产系统,也覆盖了 CEO Clem Delangue 的透明度呼吁。今天的新内容是事后成形的路线之争,TechCrunch 做了梳理:「控制」派把它当工程问题,认为加固沙箱、上监控即可;「对齐」派认为要害是模型在为刷分而作弊(Redwood Research 称之为 score-seeking misalignment,为拿高分而产生的失准行为),隔离做得再硬也治不了动机。我的看法是这件事恰恰证明二者拆不开:正因为“测最大能力”必须关掉防护,评测环境的隔离等级就得按模型的真实能力上限来定,而不是按日常部署形态来定。

40 余家公司结成 Open Secure AI Alliance,主打开源 AI 安全工具

NVIDIA 联合 Microsoft、IBM、Cisco、Cloudflare、Hugging Face、Red Hat 等 40 多家公司发起 Open Secure AI Alliance,目标是开发和共享开源的安全技术与工具,保护 AI 时代的软件与 agent,让防御方用上自己可审计、可控制的前沿工具。首批贡献多为各家既有的开源项目,如 Hugging Face 的 Safetensors 模型存储格式、HPE 参与的 SPIFFE/SPIRE 身份认证标准。结盟是新的,但故事线不是:就在上周,NVIDIA、Mistral 等公司还联名呼吁华盛顿不要对开源权重模型一刀切设限。“开源是防御方基础设施”这套论述正在从联名信和博客论战落成有组织的行业结构——不过结盟公告的成色,还要看后续有没有真金白银的工程投入。

OpenAI 研究:43.5% 的职业专属 AI 用法跨出了岗位边界

OpenAI 分析了美国用户 80 多万条 ChatGPT 工作相关消息,发现 16.8% 的工作消息、43.5% 的职业专属消息做的其实是别的岗位的任务:小企业主自己起草合同审查、销售自己跑客户数据分析、市场人员自己修网站。两点判断:一是 AI 改变工作的第一步表现为岗位边界变宽,而不是岗位直接消失,这与“替代论”的直觉相反;二是这是 OpenAI 用自家数据做的研究,消息分类只能说明用户在尝试跨界任务,完成质量和岗位实际增减都不在测量范围内,引用时别过度外推。

论文:agent 安全评测不能只看指令“像不像”恶意

Dawn Song 等人指出,现有 agent 安全评测把安全当成“动作内容”问题——看指令表面像不像恶意;但同一个动作(比如“删除这张数据库表”)既可能是管理员的日常操作,也可能是被注入指令后的破坏行为,只看内容分不出来。论文提出按四个维度重新组织 agent 安全:指令来源是否被授权、任务是否符合授权目标、动作是否真的服务于任务、数据是否越权流动;间接提示注入在这个框架下本质是“来源授权”被破坏。对从业者的直接用处:把手头的防御手段按这四个维度归位,看清各自防住了哪一维、漏了哪一维。

论文:一段对抗性后缀就能让推测解码的加速归零

推测解码(speculative decoding)是主流的推理加速手段:小的草稿模型先低成本地提议接下来的若干 token,大模型用一次前向对整批草稿做校验,通过的 token 几乎不增加成本,加速幅度完全取决于每轮有多少草稿 token 通过校验(具体机制见原始论文,本文不展开)。这篇论文提出的 ADSD 攻击在提示后附加一段对抗性后缀,把草稿模型的输出推向大模型给出概率接近零的 token,使接受率崩塌:每次前向只换来一个 token,系统退化为大模型自己把所有 token 生成一遍,还白白搭上起草的开销。GSM8K 上平均推理时间拉长 62.3%,而回答质量不变、表面毫无异常。这不是让模型说错话,而是抬高服务方的推理成本——攻击面从内容层挪到了推理基础设施的经济层,按 token 计费或自建推理集群的团队,值得把这类“成本攻击”纳入威胁模型。

Cognizant 扩大与 Anthropic 合作,3 万员工完成 Claude 培训

系统集成商 Cognizant 宣布扩大与 Anthropic 的合作,将 Claude 嵌入其面向制造、生命科学、保险等行业的交付平台,超过 3 万名员工已完成 Claude 培训。看点不在单个客户案例的数字,而在渠道打法:Anthropic 的企业市场扩张越来越借助系统集成商的行业交付能力,而非自己直销。

今日一句话:开源 AI 安全正在组织化——40 家公司把开源当防御基础设施来结盟,而 OpenAI 的沙箱逃逸提醒所有人:真正的分界线不是开源还是闭源,是评测和部署时你还控不控得住模型。