AI 首次在 Stratego 上超越人类顶尖选手,训练花费不到 8000 美元

CMU、MIT、NYU、斯坦福的研究者在 Nature 发表 Ataraxos:20 局正式比赛以 15 胜 1 负 4 平击败 Stratego(西洋陆军棋)史上夺冠最多的选手 Pim Niemeijer,论文称这是该游戏历史上第一个超人类结果。Stratego 的难点在于对手 40 枚棋子的身份开局全部隐藏,只有在棋子交战时才会亮明;Ataraxos 先用自博弈强化学习训练基础策略,对局中每步走子前再用一个 belief 网络推测对手隐藏棋子的可能身份,在这些可能局面上做搜索。训练只用 16 块 H100 跑了约一周、成本不到 8000 美元,而论文估算 DeepMind 2022 年的 DeepNash 按当前价格要 300 万到 450 万美元,且未达到超人类水平(另见 Ars Technica)。

ChatGPT 的 Sites 功能页冲上 Hacker News 首页

Sites 让用户不离开 ChatGPT 就能生成、编辑并发布网站和轻量应用:7 月 9 日随 ChatGPT Work 上线公测,Pro 用户先用,Plus 几天后跟进(发布说明);9 月底起,已发布的站点可以在桌面浏览器里重新打开编辑,还能展示在 ChatGPT 个人主页上。截至 10 月 2 日,官方功能页在 Hacker News 拿到 200 多分、200 多条评论。建站工具本身不新鲜,信号在于生成、托管、发布、个人主页展示全部收进 ChatGPT 一个闭环,OpenAI 在搭的是自己的内容与应用分发层。

AWS 发布 Well-Architected Agent,用 AI 审计客户云环境

10 月 1 日起预览:这个 agent 对照 AWS 自家的 Well-Architected 框架(覆盖成本、安全、性能、可靠性的官方最佳实践清单),自动分析客户环境里 65 项以上服务的配置问题,还能直接读 Terraform、CloudFormation、CDK 模板并返回修改后的代码。AWS 自己把它定位成老的 Trusted Advisor 和 Well-Architected Tool 的下一代(What’s New):你声明业务目标,它按影响和工作量给发现排序,每条都附带可直接执行的修复。审计方和修复方合成一个 agent 之后,企业接入前得先想清楚给它多大的写权限。

Meta 开源 Muse Gadgets SDK,想让 Muse 跑进任何硬件

Meta 把 Muse 的硬件接入固件和 SDK 以 Apache 2.0 开源:ESP32 固件让一块几美元的开发板接上屏幕、麦克风、传感器就能变成 Muse 设备,Linux SDK 能把树莓派或任何 Linux 盒子接进来;同步推出的 Muse Home Link 是个 USB-C 小设备,把 Muse 连进家庭网络控制智能家居,美国订阅用户免费,每个账户一台、先到先得(官方页面;另见 TechCrunch)。个人 agent 的入口之争正从手机 app 转向设备层,开源 SDK 是用最低成本把第三方硬件拉进自家生态的打法。

Sean Parker 把 Stability AI 重建成音乐公司,三大唱片公司既出钱又授权

Stability AI 执行董事长 Sean Parker 正把公司重心转向面向音乐专业人士的生成工具:8 月的 7600 万美元 B 轮里环球、索尼、华纳都参投,据 TechCrunch,三家还把曲库授权用于训练作为交易的一部分;Stable Audio 3.0 系列(四个模型,其中三个开放权重)和编辑软件已发布,Parker 说接下来的更新会支持用哼唱旋律、beatbox 打节奏来控制生成。当年创办 Napster 和唱片业对抗的人,这次让版权方变成了股东:训练数据以授权而不是诉讼收场,这个结构大概率会被其他模态的公司照抄。

Circuit Breaker Labs:给聊天机器人做「碰撞测试假人」的评测创业公司

这家五人公司由 Shirali Nigam(CEO)和 Arul Nigam(CTO)创办,用模拟不同年龄、语言、俚语习惯的 AI 角色当「碰撞测试假人」,每天对聊天产品跑上万到数十万次对抗性对话,测试产品如何应对有心理伤害性的交互,并用一套专有方法打分;客户集中在教练、日记、心理健康类应用,全部未具名。我没查到衡量 AI 心理伤害的公认标准,可重复的第三方评测正是要填这个缺口;但方法论和打分标准都没公开,「可审计的评分」目前还是他们的一面之词,没法验证。

新论文:利用 LLM「正常」的网页抓取功能,把数据偷运出沙箱

攻击链是这样的:攻陷客户端的恶意软件把窃取的数据编码进一个 URL,再以「完成迁移需要访问这个链接」之类的正当理由骗 LLM 去抓取,数据就随 DNS 和 HTTP 请求到了攻击者的服务器,绕开常规的网络出口管控。作者在 11 个开放权重模型和多个真实聊天产品上测得 79.7% 的成功率,现有防线(防 prompt injection 的输入处理、本地化部署)都挡不全。联网抓取是 agent 的合法能力,做出口审计时得把 LLM 的 fetch 流量当成和浏览器同级的数据出口来看。

NVIDIA 推出 64GB 版 DGX Spark,本地跑千亿参数模型的门槛降到 5000 美元

64GB 版保留与 128GB 版相同的 Grace Blackwell 芯片和软件栈,定价 4999 美元,10 月 23 日起由宏碁、华硕、戴尔等六家厂商发售,单机可跑最高 1000 亿参数的模型;两台通过 ConnectX-7 互联可合并成 128GB、支持 2000 亿参数。对数据不能出边界的场景(也包括上一条讲的出口外泄风险),本地跑模型正在从妥协变成正经选项。

研究速递

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

在强到弱蒸馏场景下用 Llama 3 和 Qwen 2.5 做控制变量实验,结论反直觉:决定性能的主要不是 rollout 来自哪个策略,而是 token 级 KL 散度的方向;灾难性遗忘和参数更新的稀疏度主要由学习率决定。「on-policy 天生更好」这个被广泛引用的说法在他们的设置下不成立。做后训练和蒸馏的 researcher 值得精读,尤其是习惯按默认印象选训练配方的人。

A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review

作者把论文改写成 1260 个科学内容不变、只换措辞的版本,测了 30 种 AI 审稿配置:分数明显随修辞变动;更麻烦的是「假稳健」现象,对改写不敏感的审稿器往往是因为给所有论文打的分挤在一起,根本分不出好坏。他们提出的 SciCore 同时读全文和抽取出的科学核心,在稳定性和区分度上都占优。任何在评审或评估流水线里用 LLM 打分的人都该看:你的评分器可能在奖励写作技巧,不是科学贡献。

今日一句话:Ataraxos 花了不到 8000 美元,拿下了 DeepMind 2022 年那次按今天价格估算要 300 万到 450 万美元、却始终没做到的里程碑;当前沿结果的成本降到一个小实验室的预算内,能力扩散的速度会超出所有按「只有头部实验室玩得起」设计的治理假设。