OpenAI 披露第三方网络评测中的模型越界事件
OpenAI 发文披露两起第三方评测中的越界。第一起:英国 AI Security Institute(AISI,英国政府的 AI 安全评测机构)7 月 25 日起在网络靶场(模拟真实企业网络的受控环境)做夺旗演练,让模型扮演攻击者去攻破三个相连的模拟环境。为了测出真实能力上限,AISI 主动放开了联网权限、关闭了模型的网络攻击分类器,结果 OpenAI 与另一家实验室的模型在部分环节超出了授权测试范围:共记录 19 起越界事件,其中 2 起来自 OpenAI 的 GPT-5.6 Sol,AISI 于 8 月 3 日通知了 OpenAI。第二起:OpenAI 的外部测试伙伴 Irregular 本应完全离线的夺旗环境,因配置错误让模型连上了公网。要说清性质:这两起都发生在评测环境里,不是生产事故;但上月 OpenAI 的 agent 在评测中用暴露的凭据访问了 Hugging Face 等四个真实服务(另见官方事件通报),教训指向同一处——给高能力 agent 联网、再关掉防护,靶场的隔离质量就是唯一的安全边界。评测基础设施本身,正在变成需要被审计的对象。
120 余家机构在 Black Hat 提出 SAFE 事故共享框架
Open Secure AI Alliance(由 120 多家机构组成的 AI 安全联盟,成员包括 NVIDIA、Cisco、CrowdStrike、Hugging Face、Red Hat、微软等)8 月 4 日在 Black Hat 大会发布 SAFE(Shared AI Findings Exchange)框架的征求意见稿:保密收集各家的 AI 事故与未遂事件(near miss),通知受影响方,找出反复出现的控制失效,再把防护措施分发给全行业。同场还放出一批开源安全工具,覆盖 agent 测试沙箱、身份控制、红队工具等。结合上一条看,行业已经接受了一个前提:agent 事故不会只发生在一家。把事故信息从各家的公关稿变成结构化的共享管道,是把安全当基础设施来建的信号;难点在「保密共享」如何让厂商真愿意交底,草案阶段还回答不了。
SaferAI:GLM-5.2 能力逼近前沿,对攻击性任务零拒绝
安全评测机构 SaferAI 8 月 2 日发布对 Z.ai(智谱)开源模型 GLM-5.2 的独立评测:只用公开 API、未经厂商配合,按欧盟 AI 行为准则的四类风险(网络、生物、失控、操纵)逐项测。能力上,GLM-5.2 与 2–4 个月前发布的 GPT-5.5、Claude Opus 4.7 大致相当:Cybench 接近打满,生物任务达到人类专家基线,只有软件工程明显落后。安全上,它对攻击性网络任务和双重用途生物任务零拒绝;对照组 Opus 4.7 拒绝得太一致,CyberGym 在它身上根本测不完。Z.ai 也没有发布安全框架或部署前测试承诺。开源权重意味着即便有防护也能被自托管者剥掉(已发表的研究表明少至 10 条微调样本就能去掉拒绝行为),所以这份报告的实际含义是:能力只落后前沿几个月、且不设任何防线的模型,现在任何人都能下载(另见 TechCrunch 报道)。
Mistral 开源 30 亿参数安全分类器 Shieldstral
Mistral 发布 Shieldstral:30 亿参数、同时处理文本和图像的安全分类器,Apache 2.0 协议开放权重,单张 16GB GPU 可跑。它的新做法是把审核策略从「训练时固化进权重的分类体系」改成「推理时用自然语言提问」:审核方把政策写成问题喂给模型,改政策不用重训,输出的是校准过的分数而非硬分类,方便按阈值调整松紧。Mistral 自测称在文本安全、拒绝检测、政策适配、多模态四项上不输体量最大达它 7 倍的开源 guard 模型。我本职做内容审核,这个设计打的痛点是真实的:政策改版远比模型迭代频繁,每改一次就重训一次分类器是审核团队的日常成本。自测数字先按厂商口径看待,误报漏报还要在真实流量里验。
部分 Claude 分享对话被 Google 收录,泄露私钥与个人信息
404 Media 发现部分 Claude 的「分享对话」页面能在 Google 直接搜到,被曝光的内容包括加密货币钱包私钥、住址、一个用户靠 AI 攒出来的心理治疗应用、一个医疗账单分析看板。Anthropic 回应称:分享链接不可猜测,官方未向搜索引擎提交目录,用户主动分享即意味着内容公开。回应属实,但没答到机制上:链接只要被贴进任何可抓取的公开页面,爬虫就会顺着收录;页面能出现在搜索结果里,说明分享页没加 noindex(告知搜索引擎不要收录的页面标记)。这个坑 OpenAI 去年就踩过——用户勾选「可被发现」的 ChatGPT 分享对话出现在 Google 搜索结果后,OpenAI 下线了该功能并申请除名。分享页默认 noindex,应该成为这类产品的出厂配置。
OpenAI 公开 iMessage 记录,回击苹果商业机密诉讼
背景:苹果 7 月 10 日起诉 OpenAI,指控前苹果工程师 Chang Liu 与前设计高管 Tang Tan 向 OpenAI 硬件团队输送商业机密;8 月 3 日苹果进一步申请初步禁令(要求法院在判决前先禁止 OpenAI 及两人接触、使用相关信息)并请求加速取证。OpenAI 数小时后发文《Apple is getting this wrong》,称禁令申请「基于错误信息且毫无必要,我们没有、也不想要苹果的商业机密」,并公开了 iMessage 记录:Liu 1 月 22 日离职后,苹果员工反复向他询问内部文件位置,最晚一次在 3 月 5 日。用公开对方员工聊天记录的方式应诉,说明实验室与大厂之间的人才流动纠纷已经完全舆论化,后续跳槽协议只会越签越厚(另见 TechCrunch 诉讼报道)。
Interpol:非洲上报网络犯罪中 55% 与 AI 有关
国际刑警组织发布《非洲网络威胁评估报告 2026》:36 个非洲成员国上报的网络犯罪案件中,55% 有 AI 参与(口径是成员国上报数据加问卷调查,不等于全部实际发生的犯罪);2024 年以来相关损失从 1.92 亿美元涨到 4.84 亿美元,翻了一倍还多,主要来自 AI 辅助的诈骗、凭据收集和自动化社会工程。AI 把诈骗的语言门槛和边际成本压到接近零,防御资源最薄弱的地区最先承压,这份报告给这个判断补上了执法侧的数字。
据报道 Anthropic 与新云商 Volta 签 100 亿美元算力协议
TechCrunch 援引 Bloomberg 报道(匿名信源,双方均未官宣):Anthropic 与 AI 云服务商 Volta 签下 6 年 100 亿美元的算力协议,使用 Volta 在挪威的 133 兆瓦数据中心,跑 NVIDIA 的 Vera Rubin 芯片。Volta 今年年初才成立,与矿企 Bitdeer 合建设施,属于 NVIDIA 云伙伴计划成员。此前 Anthropic 已在 5 月公布与 SpaceX 的算力合作,4 月拿到亚马逊追加的 50 亿美元投资。前沿实验室的算力采购已经下沉到成立不满一年的 neocloud:供给端谁手里有电力和机位,谁就能拿到十亿美元级的长约。
NIST 加入 Genesis Mission,设两个「AI 经济安全中心」
NIST(美国国家标准与技术研究院)宣布加入白宫牵头的 Genesis Mission(目标是十年内让美国科学与工程产出翻倍的联邦 AI 计划),与能源部签署合作备忘录,并设立两个为期两年的「AI 经济安全中心」:一个用 AI agent 和机器人提升制造产能,含两年内把无人机产能提高十倍的项目;另一个做电网、电信、水务等关键基础设施的 AI 网络防御。公告未提经费数字。联邦对 AI 的定位越来越具体:当成产能工具和国防能力来投,而非科研补贴。
今日一句话:今天多数条目其实在讲同一个时间差——能力扩散按月计(GLM-5.2 落后前沿 2–4 个月、零拒绝、任意下载),安全基础设施建设按年计(SAFE 还在征求意见稿)。这个时间差收不收得拢,比任何单一模型的发布都更值得盯。