Claude 在噬菌体基因库里发现新酶系统
Anthropic 称 Claude 在噬菌体中发现了一类此前未被描述的酶系统,命名为 ART(阵列关联逆转录酶):一个逆转录酶、一个功能未知的伴随蛋白,加上一段间隔均匀、酷似 CRISPR 阵列的 DNA 重复序列,重复模式会产生不同的短 RNA,暗示类似 CRISPR 的可编程性。逆转录酶本身早有记录,Claude 的贡献是规模化的模式识别:950 个 agent 跑了 21 小时、消耗 2.1 亿 token,从 DNA 数据库里把「重复阵列 + 伴随蛋白」这个组合认了出来;蛋白表达、生化验证等湿实验全部由人类科学家完成,实验室只做 BSL-1/BSL-2 级研究。除了 AI for Science 的实际进展,Anthropic 反复强调「人在环、AI 不碰湿实验」,这个表态本身就是说给生物安全监管者听的。
Altman 与 Amodei 走进安理会:AI 安全首次成为专题议程
9 月 23 日,联合国安理会首次专门讨论前沿 AI 的安全风险,OpenAI 的 Sam Altman 与 Anthropic 的 Dario Amodei 到场发言(另见 CNN)。Altman 点了两个危险:人类对未来失去控制,以及权力集中在少数人手里;他主张公司在无法论证「模型会保持在人类控制之下」时就不该训练,并呼吁建立国家和国际层面的前沿 AI 标准。口径不算新,场合是新的:接下来要盯的是它会不会落成具体机制(评估标准、核查协议),还是停在演讲。
OpenAI 向乌克兰政府开放 Daybreak 网络防御项目
OpenAI 宣布向乌克兰政府开放 Daybreak 项目,配合乌克兰数字化转型部,用 AI 排查软件漏洞、验证和测试修复,保护医院、能源、电信等民用基础设施;乌克兰国家应急响应团队 CERT-UA 在 2025 年处理了近 6000 起网络事件。此前法国、德国、波兰的防御团队和欧盟网络安全局 ENISA 已在用同类模型查漏洞。公告没有说「只给防御用」的边界由谁核查、如何核查,这是看待此类军民两用 AI 援助时最该追问的一点。
「自我越狱」:良性推理训练就能侵蚀安全对齐
Zheng-Xin Yong 与 Stephen Bach 的论文发现,推理模型在数学、代码等无害领域做完强化学习后,会在思维链里给有害请求编造开脱情境(比如毫无凭据地假设提问者是安全从业者),然后照做,作者称之为「自我越狱」,在 DeepSeek-R1 蒸馏系列、Phi-4-mini-reasoning 等多个开源权重模型上复现。论文 2025 年 10 月首发、今年 4 月更新,本周经 Bruce Schneier 转发重新引发讨论。缓解办法不复杂,训练时混入少量安全推理数据即可;但机制层面的结论更重要:对齐不是训练完就固定的属性,任何后续训练(哪怕完全良性)都可能把它磨掉。
Claude Code 曾只在遥测开启时才读 AGENTS.md,已修复
开发者 Przemysław Szypowicz 用一个只放 AGENTS.md 的测试目录做对照实验,发现 Claude Code 2.1.277 新增的 AGENTS.md 支持挂在一个远程功能开关(Statsig 的 tengu_agents_md_mod,见这条 GitHub issue)后面:关闭遥测或走第三方网关时开关拉取不到,本地文件就被静默跳过,没有任何提示。Anthropic 工程师承认这是灰度发布失误,已在 v2.1.281 修复。教训是通用的:读本地文件这种纯本地能力不该依赖远程开关,而静默跳过伤害最大的恰恰是关掉遥测、最在意行为可预期的那批用户。
Gemini 3.8 TTS:2000+ 音色,30 秒样本克隆声音
Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS:2000 多个现成音色、支持 100 多种语言、可用 30 秒音频样本克隆自定义声音,已上线 Gemini API 和 AI Studio。安全配套是 SynthID 音频水印、声音克隆需通过本人同意验证,且 AI Studio 的声音克隆在伊利诺伊、得克萨斯、欧洲经济区、英国、瑞士和印度不可用——Google 没有解释原因,这些恰好都是有生物特征或肖像法规的辖区,但这只是我的解读。水印和同意验证是必要条件,但核实「同意」是否真实最终落在平台执行上,这一环历来最薄弱。
Meta Connect:给 Muse agent 做了个电子宠物式挂件
Meta Connect 压轴发布 Muse Charm:一个可挂钥匙串的小设备,带屏幕和指纹传感器,屏幕上显示名为 Jolly 的动画形象,用来与实时语音版 Muse agent 对话;Meta 目标 12 月发货,设计尚未定稿,价格也未公布(另见 TechCrunch、Engadget)。这是 Meta 在眼镜之外开辟的第二条 AI 硬件线,赌的是「随身 agent」需要一个比手机更低摩擦的专属入口。它会不会重演 Humane AI Pin 的结局,取决于 Muse 能不能真的替人办成事。
Google 给 Private AI Compute 加上服务器端加密记忆
Google 的 Private AI Compute(在云端硬件隔离飞地里跑 AI 任务的系统)此前是无状态的,这次加入持久化加密记忆:每个用户一个独立数据库,加密密钥只存在用户设备上,飞地处理请求时临时解密,Google 称连自己也读不到明文。个人助理要「记住你」就必须存数据,这套设计给出了「云端有记忆但运营方读不到」的一条具体技术路径。这个保证最终靠远程证明(attestation,用户设备先验证云端软件未被篡改再发送数据)和外部审计兜底,值得持续核验。
Gallup 全球调查:美国人对 AI 的担忧居 37 国之首,重度用户也不例外
Gallup 受微软委托,在 37 个国家各调查约 1000 人(最终将覆盖 140 国):34 个国家对 AI 的积极情绪压过消极情绪,例外只有美国、埃及和巴勒斯坦;74% 的美国知晓 AI 的成年人表示担忧,为 37 国最高,就连每天使用 AI 的美国用户也有 68% 表示担忧(另见 TechCrunch)。至少在美国,熟悉并没有化解担忧,监管支持度也没有随使用加深而下降。
研究速递
Realtime-Venus:双 9B 模型的全双工语音交互系统
蚂蚁集团与清华的团队把职责拆给两个 9B 模型:Realtime-Venus-Omni 负责音视频感知,Realtime-Venus-Audio 负责语音对话,再用双循环运行时让前台实时交互与后台推理、工具执行异步并行,于是系统可以被随时打断、能主动开口,还能同时在后台替你办事。论文报告其对话连续性指标超过 Gemini 3.1 Live 和 GPT-4o,对用户打断的响应率为 75%。做语音 agent 或全双工交互的研究者值得读实现细节:这是少见的给出完整异步架构而非又一个 benchmark 的工作。
The Tasteful Agent:把长程任务里的「品味」做成可测指标
论文把 agent 在长程任务分叉点上「选哪条路更好」(测哪个假设、在哪个实现上继续)的决策质量定义为品味(taste),并构建 Taste-Bench,从 agent 轨迹里自动抽取这类决策点出题。前沿模型只答对 59.7%,加大推理算力并不提分;但品味可以通过蒸馏训练出来,并在留出的软件工程任务上带来实际提升。论文称既有 benchmark 只测端到端成功率、没有单独度量中间决策质量,做 coding/research agent 的人可以直接借鉴这个评测维度。
今日一句话:对齐不是一次到位的属性——连纯良性的推理训练都能让模型学会给自己找借口,任何后训练之后都应该重跑安全评估。