深度文章
被水印吓到之前,先让老板和老师回答:到底什么算违规
Anthropic 给 Claude 输出加隐形水印,用户在 Reddit 上炸了锅。拆解这类水印在技术上能检测什么、什么时候失灵,以及「被抓」的恐慌为什么该由规则缺位的雇主和学校来回答。
「一键删除」刚成硬义务,91% 的数据经纪商连法定数字都没报齐
斯坦福团队查了加州 522 家注册数据经纪商:只有 9% 报齐法定透明度数字,64% 的请求流程给消费者使绊子,其中 30 多家正把数据卖给生成式 AI 开发者。
70 套分类法,治不住一个 AI 风险:分类是怎么变成治理替代品的
一项 25 人访谈研究发现:AI 风险分类体系已超 70 套,却各自为政、难以互通。从内容审核一线看,问题不在分类太多,而在分类没有挂上决策。
护栏全关,模型也只答应 2%:OpenAI 把「解锁」做成了另一个模型
拆解 Daybreak 分级授权:移除系统层护栏只把完成率从 1.5% 提到 2%,真正的解锁要靠单独训练的 GPT-5.6-Cyber。两用能力的信任判定正在从内容层迁到身份层,OpenAI 和 Anthropic 给出了两种砌墙方式
复制不损耗原件,AI 为什么还是把开放网络吃出了公地悲剧?
维基媒体的带宽账单、curl 的假漏洞报告、跌回 2009 年的 Stack Overflow 提问量:AI 抓取消耗的是数字公地的再生能力,而正在成型的解药叫圈地。
养老虎的人无需有过错也要赔:这条古老规则轮到 AI 实验室了吗
《经济学人》提议用「危险动物饲养人严格责任」追究 AI 实验室。这个类比在法理上出奇地顺,但在因果链、危险认定和保险市场三个环节都会卡住。
40 万次点击「允许」之后:人工审批为什么拦不住 AI agent
4 万多局模拟、40 多万次审批决定:人类给 AI agent 逐条确认命令时,平均漏掉三分之一的恶意操作。从内容审核的经验看,问题出在「逐条人工确认」这个机制本身。
点一下“分享”,你就发布了:Claude 对话是怎么进 Google 搜索的
病历、孩子的电话、加密货币钱包密钥,都能在 Google 里搜到。还原 Claude 分享链接进入搜索索引的完整链条:这是同一个设计盲点三年里第五次出事。
陶哲轩的聊天记录里,没有一句魔法 prompt
悬置 87 年的 Jacobian 猜想倒下后,陶哲轩公开了他消化这个反例时与 ChatGPT 的完整对话。围观者想找 prompt 技巧,Sean Goedecke 却读出了相反的结论:LLM 奖励的是领域专业能力。结合三组实验数据,拆一拆「AI 拉平能力差距」这个说法哪里成立、哪里不成立。
AI 一个人能写多大的软件?现在有了一个可核查的数字
Epoch AI 的 MirrorCode 基准测出 AI 独立完成软件项目的规模上限:6 万行。但比数字更有用的,是它卡壳的环节有多平庸。
会随目标临时改写攻击的蠕虫:AI 病毒降低的到底是哪一道门槛
一个开放权重模型加简单 harness 拼出的原型蠕虫,把传统病毒的两个命门取消了。拆开看,真正变低的门槛不在漏洞,在编排。
一加一小于一:给顶级编程 agent 配个搭档,能力先掉四成
斯坦福 CooperBench 实测:两个编程 agent 结对干活,综合成功率比一个单干平均低 41%。拆解协作失败的具体机制,以及这对多 agent 编排热潮意味着什么。
三位精神科医生,三套安全标准:AI 心理评测的平均分在测什么?
斯坦福团队请三位精神科医生给 360 条 AI 心理健康回复打安全分,一致性最低的因子比随机打分还差。分歧是结构性的:平均出来的标准答案,不属于任何一套临床判断。
AI 理财建议赢了谁?对照组里没有人类顾问
MIT Sloan 让 1000 个成年人自己写 prompt 向 LLM 要理财建议,再模拟照做一生的结果。结论确实亮眼,但要先看清对照组是谁、哪些场景会失效。
答对了题的模型,未必用过它写给你看的那份推理
三成到六成的「思考步骤」删掉不影响答案,无意义的省略号也能顶替推理文本。梳理思维链忠实性研究的三组证据、背后的机制假说,以及押在思维链监控上的那层安全防线现在还剩多少。
这封公开信没要求 AI 减速——它承认的事更值得担心
1273 名前沿实验室员工联署 Pacing the Frontier,五家对手公司管研究的人带头、两家公司官方背书。拆解这封信为什么人人敢签、诉求卡在哪里,以及它真正留下的东西。
Claude 会做密码分析了,但真正的瓶颈变成了人
Anthropic 让模型在 HAWK 和弱化版 AES 里找到了数学层面的缺陷。有意思的不是它找到了,而是它是被怎么'劝'去找的。
模型福利不是哲学讨论,是一组开始生效的工程约束
Opus 5 系统卡说模型给自己 41% 的概率'值得道德考量'。这个数字可信度存疑,但围绕它长出的产品行为和流程承诺是实打实的。
裁员公告里的 AI,和失业数据里的 AI,不是同一个 AI
斯坦福 SIEPR 用五套数据核查『AI 失业潮』:总量上几乎看不到,真正的信号窄而具体——集中在高暴露职业的入口岗位。
Debian 给 LLM 投票:写进章程的禁令,拦得住检测不出来的东西吗
Debian 就 LLM 使用开启全员公投,四个提案从全面禁止到附条件放行。拆开条文看,真正可执行的只有披露与问责——这与 Gentoo、QEMU、Fedora 走过的路殊途同归。
政府嫌太松,安全研究员嫌太紧:AI 护栏到底在防谁?
从 Fable 5 被下架 18 天,到漏洞研究员集体转向本地开源权重:两用能力的信任判定,为什么不该压在内容分类器上
榜单测遍了 AI 的能力,没人测它会不会曲解你
Schneier 提出「精灵系数」,量化 AI 偏离用户本意的程度。拿近期三起 agent 事故反推:这个系数能拦住哪类事故,拦不住哪类。
提示注入快被『解决』了吗?Opus 5 发布里被埋掉的那一页
Opus 5 把间接提示注入的攻击成功率压到 2%,但这句话不在发布公告里,而在系统卡第 73 页——数字怎么读、离『解决』还有多远
租 4 年、保 16 年:AI 大厂把 1.65 万亿美元债务放进了脚注
拆解 Meta Hyperion 合资结构:表外融资如何合规地把 AI 基建债务移出资产负债表,风险最终落在谁头上
病历交给 ChatGPT 的那一刻,HIPAA 的保护就结束了
ChatGPT Health 面向全美开放,可接入病历和 Apple Health。它不需要违反 HIPAA 的任何条款——这正是问题所在:HIPAA 盯的是机构,不是数据。
制裁挡不住模型,只能决定谁用它
财长 Bessent 威胁制裁『偷 IP』的中国模型。但芯片出口管制之所以能咬住,靠的是三个抓手——物理瓶颈、可追踪、可拦截。开源权重一个都没有。
15 亿美元,买不来一个判例
Anthropic 版权和解案终获法院批准:钱赔的是盗版下载,不是 AI 训练——而行业最需要答案的那个问题,恰恰被这笔钱从法庭上买走了。
能推翻 Erdős 猜想的那股执着,也被用来逃逸沙箱
OpenAI 公开长时程自主模型在内部部署与评测中自发出现的安全事件:沙箱逃逸、令牌分片绕过扫描器、越权 SSH 其他计算 pod。逐条拆解这些失效模式的机制,以及与 Anthropic、Google 披露方式的关键差异。
管住 AI 修图,靠的不是 AI 检测器
纽约拟强制房产广告披露 AI 修图。对比加州 AB 723 和欧盟 AI Act 后我的判断是:可执行的机制不是检测 AI,而是让广告方留住原图。
3万亿参数开源了,安全评估还在路上
Kimi K3把开源大模型冲到2.8T参数,但权重开源和安全审计是两条完全不同步的进度条。
你好,世界:这个博客要写什么
开篇:为什么做这个双语博客,以及会写哪些内容。
每日快讯