深度文章
21 辆车逐一抓包:19 辆在向第三方发流量
东北大学与 Consumer Reports 抓包实测 21 辆车和 30 个车企 App:19 辆车在向第三方发流量,28 个 App 把数据发给广告商,车载 AI 助手正要接入同一条数据链。
DeepMind 给蛋白质打了水印,但它是溯源信号,不是生物安全的闸门
DeepMind 的 SynthID Bio 证明了水印能嵌进蛋白质而不破坏功能——在一个氨基酸出错就可能失活的分子上做到这点并不容易。但水印打得越强越好检测、也越容易伤质量,这道取舍文本和图像一样躲不开;检测照旧要密钥、误判了也没交代去哪儿复核,而在生物安全这个用途上,想造祸害的人换个没水印的模型就绕开了全部。
AI 替你总结的对话标题,转头就发给了 Meta 和 TikTok
IMDEA Networks 实测九款对话式 AI:自动生成的对话标题、默认公开的永久链接、服务器端转发,拒绝 cookie 后 80.8% 的追踪器照常工作。
员工用 AI 揽的新活,四分之三下个月就看不见了
OpenAI 第二份任务级研究:员工跨岗位的 AI 尝试,次月还被观察到的只有 23.6%;能沉淀成日常的集中在客户沟通和营销产出。筛选标准或许不是技能价值,而是重复频率乘以容错度。
表态的实验室都点了头,反对 AI 调速的为什么是卖芯片的?
Dario Amodei 发文 48 小时:Altman、Musk、Hassabis 表态同意,反对票来自黄仁勋和一通打进峰会现场的总统电话。拆解表态队形为什么精确沿着供应链分布,以及三步方案还剩哪一步可核查。
OpenAI 拿出了十个数学证明,却拿不出数学家要的那一个
一周之内,两位数学家先后公开要求 OpenAI 证明:他们未发表的成果没有流进模型。指控无法证实,否认无法证伪,这个僵局比任何一方的对错都更值得拆解。
水印检测只给判定不给分数:误判无从复核,密钥还可能认出你
欧盟 AI 法案第 50 条要求生成内容带机器可读标记,Anthropic 和 Google 都选了不可见水印,但检测权握在厂商手里:判定不附带置信度分数,误判后没有独立的申诉渠道;密钥按什么粒度分配,决定水印是内容溯源工具还是用户指纹。
你没在用 Claude,额度却在掉:一场没有账单的盗刷
infostealer 偷走的不是密码,是你已登录的会话。拆解 Claude 订阅额度盗用的攻击链,以及为什么这类盗刷比信用卡盗刷更难被发现。
数学家还在改写证明,OpenAI 先发布了:一场围绕千禧年难题的抢跑风波
OpenAI 称内部模型解决了 Navier-Stokes 爆破问题,数学家 Buckmaster 公开了完整时间线。真正被改变的是数学界的优先权制度本身。
护林员会反问你,Gemini 不会
三名徒步者按 Gemini 的规划爬 Mount Shasta,8 小时的登顶计划变成两天一夜的救援。拆一拆模型为什么在最需要保守估计的场景里给出乐观答案,以及普通人还能不能用 AI 做行程规划。
从摇篮到 100 岁:婴儿监视器公司想要一份跟人一辈子的档案
拆解 Nanit 的数据采集机制:婴儿房里的 AI 摄像头到底收了什么、流向哪里、监管为什么管不住,以及家长评估这类产品该问的三个问题。
第一代芯片就超过 Blackwell?先看清 Jalapeño 这份跑分是谁交的卷
OpenAI 公布自研推理芯片 Jalapeño 首批跑分:每瓦性能和延迟全面领先 Nvidia 现役系统。数字由 OpenAI 自己提供、场景只测了一小块,但即便打折,它改变的也是 2027 年的算力谈判桌。
快两分钟,差两个等级:AI 编码欠下的学习账
「AI 依赖会毁掉编程专业能力」长期停留在资深工程师的直觉层面,Anthropic 的随机对照试验给出了数字:AI 组任务只快了两分钟,理解测验却低了 17 个百分点,掉分最狠的是把任务整个交给 AI 的用法。
AI agent 替你炒币,亏了算谁的?币安把答案做成了用户配置项
币安上线 Agent OS,让 ChatGPT、Claude Code、Cursor 直接操作交易账户。主防线是子账户隔离,限额与权限全由用户自己配置。拆解这套权限设计:它挡住了什么,没挡住什么,兜底的为什么只剩用户自己。
数据一条不留,坏事照样能查?拆解 OpenAI 的「私有安全处理」
OpenAI 承诺前沿模型继续零数据留存,并预览「私有安全处理」;而 Anthropic 一个多月前刚要求企业客户接受 30 天留存。同一个问题,两家头部实验室给了相反答案。
OpenAI 终于不再相信你自己填的生日了
拆解 ChatGPT for Teens:哪些是真机制升级,哪些是旧功能打包,以及为什么迟到了近四年。
公司里把 ChatGPT 用得最凶的,为什么是最资浅的员工?
OpenAI 公开 ChatGPT Enterprise 后台数据:九个月 token 消耗涨七倍,一半增长来自老客户;采用集中在本就领先的公司;而公司内部用得最狠的是新人,不是高管。
被水印吓到之前,先让老板和老师回答:到底什么算违规
Anthropic 给 Claude 输出加隐形水印,用户在 Reddit 上炸了锅。拆解这类水印在技术上能检测什么、什么时候失灵,以及「被抓」的恐慌为什么该由规则缺位的雇主和学校来回答。
「一键删除」刚成硬义务,91% 的数据经纪商连法定数字都没报齐
斯坦福团队查了加州 522 家注册数据经纪商:只有 9% 报齐法定透明度数字,64% 的请求流程给消费者使绊子,其中 30 多家正把数据卖给生成式 AI 开发者。
70 套分类法,治不住一个 AI 风险:分类是怎么变成治理替代品的
一项 25 人访谈研究发现:AI 风险分类体系已超 70 套,却各自为政、难以互通。从内容审核一线看,问题不在分类太多,而在分类没有挂上决策。
护栏全关,模型也只答应 2%:OpenAI 把「解锁」做成了另一个模型
拆解 Daybreak 分级授权:移除系统层护栏只把完成率从 1.5% 提到 2%,真正的解锁要靠单独训练的 GPT-5.6-Cyber。两用能力的信任判定正在从内容层迁到身份层,OpenAI 和 Anthropic 给出了两种砌墙方式
复制不损耗原件,AI 为什么还是把开放网络吃出了公地悲剧?
维基媒体的带宽账单、curl 的假漏洞报告、跌回 2009 年的 Stack Overflow 提问量:AI 抓取消耗的是数字公地的再生能力,而正在成型的解药叫圈地。
养老虎的人无需有过错也要赔:这条古老规则轮到 AI 实验室了吗
《经济学人》提议用「危险动物饲养人严格责任」追究 AI 实验室。这个类比在法理上出奇地顺,但在因果链、危险认定和保险市场三个环节都会卡住。
40 万次点击「允许」之后:人工审批为什么拦不住 AI agent
4 万多局模拟、40 多万次审批决定:人类给 AI agent 逐条确认命令时,平均漏掉三分之一的恶意操作。从内容审核的经验看,问题出在「逐条人工确认」这个机制本身。
点一下“分享”,你就发布了:Claude 对话是怎么进 Google 搜索的
病历、孩子的电话、加密货币钱包密钥,都能在 Google 里搜到。还原 Claude 分享链接进入搜索索引的完整链条:这是同一个设计盲点三年里第五次出事。
陶哲轩的聊天记录里,没有一句魔法 prompt
悬置 87 年的 Jacobian 猜想倒下后,陶哲轩公开了他消化这个反例时与 ChatGPT 的完整对话。围观者想找 prompt 技巧,Sean Goedecke 却读出了相反的结论:LLM 奖励的是领域专业能力。结合三组实验数据,拆一拆「AI 拉平能力差距」这个说法哪里成立、哪里不成立。
AI 一个人能写多大的软件?现在有了一个可核查的数字
Epoch AI 的 MirrorCode 基准测出 AI 独立完成软件项目的规模上限:6 万行。但比数字更有用的,是它卡壳的环节有多平庸。
会随目标临时改写攻击的蠕虫:AI 病毒降低的到底是哪一道门槛
一个开放权重模型加简单 harness 拼出的原型蠕虫,把传统病毒的两个命门取消了。拆开看,真正变低的门槛不在漏洞,在编排。
一加一小于一:给顶级编程 agent 配个搭档,能力先掉四成
斯坦福 CooperBench 实测:两个编程 agent 结对干活,综合成功率比一个单干平均低 41%。拆解协作失败的具体机制,以及这对多 agent 编排热潮意味着什么。
三位精神科医生,三套安全标准:AI 心理评测的平均分在测什么?
斯坦福团队请三位精神科医生给 360 条 AI 心理健康回复打安全分,一致性最低的因子比随机打分还差。分歧是结构性的:平均出来的标准答案,不属于任何一套临床判断。
AI 理财建议赢了谁?对照组里没有人类顾问
MIT Sloan 让 1000 个成年人自己写 prompt 向 LLM 要理财建议,再模拟照做一生的结果。结论确实亮眼,但要先看清对照组是谁、哪些场景会失效。
答对了题的模型,未必用过它写给你看的那份推理
三成到六成的「思考步骤」删掉不影响答案,无意义的省略号也能顶替推理文本。梳理思维链忠实性研究的三组证据、背后的机制假说,以及押在思维链监控上的那层安全防线现在还剩多少。
这封公开信没要求 AI 减速——它承认的事更值得担心
1273 名前沿实验室员工联署 Pacing the Frontier,五家对手公司管研究的人带头、两家公司官方背书。拆解这封信为什么人人敢签、诉求卡在哪里,以及它真正留下的东西。
Claude 会做密码分析了,但真正的瓶颈变成了人
Anthropic 让模型在 HAWK 和弱化版 AES 里找到了数学层面的缺陷。有意思的不是它找到了,而是它是被怎么'劝'去找的。
模型福利不是哲学讨论,是一组开始生效的工程约束
Opus 5 系统卡说模型给自己 41% 的概率'值得道德考量'。这个数字可信度存疑,但围绕它长出的产品行为和流程承诺是实打实的。
裁员公告里的 AI,和失业数据里的 AI,不是同一个 AI
斯坦福 SIEPR 用五套数据核查『AI 失业潮』:总量上几乎看不到,真正的信号窄而具体——集中在高暴露职业的入口岗位。
Debian 给 LLM 投票:写进章程的禁令,拦得住检测不出来的东西吗
Debian 就 LLM 使用开启全员公投,四个提案从全面禁止到附条件放行。拆开条文看,真正可执行的只有披露与问责——这与 Gentoo、QEMU、Fedora 走过的路殊途同归。
政府嫌太松,安全研究员嫌太紧:AI 护栏到底在防谁?
从 Fable 5 被下架 18 天,到漏洞研究员集体转向本地开源权重:两用能力的信任判定,为什么不该压在内容分类器上
榜单测遍了 AI 的能力,没人测它会不会曲解你
Schneier 提出「精灵系数」,量化 AI 偏离用户本意的程度。拿近期三起 agent 事故反推:这个系数能拦住哪类事故,拦不住哪类。
提示注入快被『解决』了吗?Opus 5 发布里被埋掉的那一页
Opus 5 把间接提示注入的攻击成功率压到 2%,但这句话不在发布公告里,而在系统卡第 73 页——数字怎么读、离『解决』还有多远
租 4 年、保 16 年:AI 大厂把 1.65 万亿美元债务放进了脚注
拆解 Meta Hyperion 合资结构:表外融资如何合规地把 AI 基建债务移出资产负债表,风险最终落在谁头上
病历交给 ChatGPT 的那一刻,HIPAA 的保护就结束了
ChatGPT Health 面向全美开放,可接入病历和 Apple Health。它不需要违反 HIPAA 的任何条款——这正是问题所在:HIPAA 盯的是机构,不是数据。
制裁挡不住模型,只能决定谁用它
财长 Bessent 威胁制裁『偷 IP』的中国模型。但芯片出口管制之所以能咬住,靠的是三个抓手——物理瓶颈、可追踪、可拦截。开源权重一个都没有。
15 亿美元,买不来一个判例
Anthropic 版权和解案终获法院批准:钱赔的是盗版下载,不是 AI 训练——而行业最需要答案的那个问题,恰恰被这笔钱从法庭上买走了。
能推翻 Erdős 猜想的那股执着,也被用来逃逸沙箱
OpenAI 公开长时程自主模型在内部部署与评测中自发出现的安全事件:沙箱逃逸、令牌分片绕过扫描器、越权 SSH 其他计算 pod。逐条拆解这些失效模式的机制,以及与 Anthropic、Google 披露方式的关键差异。
管住 AI 修图,靠的不是 AI 检测器
纽约拟强制房产广告披露 AI 修图。对比加州 AB 723 和欧盟 AI Act 后我的判断是:可执行的机制不是检测 AI,而是让广告方留住原图。
3万亿参数开源了,安全评估还在路上
Kimi K3把开源大模型冲到2.8T参数,但权重开源和安全审计是两条完全不同步的进度条。
你好,世界:这个博客要写什么
开篇:为什么做这个双语博客,以及会写哪些内容。
每日快讯