GPT-6 Astra 正式发布
OpenAI 发布 GPT-6 Astra,主打电脑操作:模型直接在浏览器、表格和桌面应用里填表、改记录、查资料、搭网站、测应用。上线节奏分层:企业通过申请制的 Trusted Access Program 先行,API 和 ChatGPT Plus/Pro/Business/Enterprise 几天内跟上,同时上架 AWS。API 定价每百万 token 输入 10 美元、输出 50 美元,上下文窗口 105 万 token(另见官方模型与定价页)。Greg Brockman 说「欢迎来到 AGI 时代」,这话记在他个人名下即可;这次发布真正的新闻在安全评估里,见下一条。
安全评估:网络安全能力首次达到「关键」级
OpenAI 在 system card 里白纸黑字写明:Astra 是其首个在 Preparedness Framework 下达到网络安全「Critical(关键)」级别的模型(另见 system card 原文)。这个级别大意是:模型能在无人干预下,对加固过的真实系统找出并写出可用的零日漏洞利用(即利用厂商尚不知晓、无补丁可打的漏洞的攻击代码),或者只凭一个高层目标就设计并执行完整的新型攻击。配套措施包括模型权重加密加更严格的访问控制、对完整运行轨迹(含思维链)的全程监控、高级网络安全用途走白名单——先小范围 alpha 测试,再经 Daybreak Blue 扩展到防御用途。此前这套框架的最高分级只存在于纸面;今天第一次被一个正走向广泛部署的模型触发——企业先行、ChatGPT 数日内跟进——治理承诺兑不兑现,从现在起可以拿事实检验。
Daybreak for Frontline Defenders:10 亿美元投向防御端
同日 OpenAI 承诺投入 10 亿美元(未说明投放年限),向美国基础服务运营方提供补贴价的模型访问、培训和技术支持,覆盖水务、电网、州和地方政府、社区银行、非营利组织和开源维护者,首个试点与 MS-ISAC(多州信息共享与分析中心,美国州和地方政府的网络安全协作机构)合作,未来几周扩展到伙伴国家。OpenAI 自己的判断是:未来几个月,AI 驱动的网络攻击会大幅增多、更加复杂。这条要和上一条合在一起读:达到「关键」级网络安全能力的模型正在上线,开放变量是防御端的采纳速度。另外注意是补贴价,不是免费。
ARC-AGI-3 实测:62.7% 还是 99.9%,取决于 harness
ARC Prize 团队独立测了 Astra 在 ARC-AGI-3 上的成绩。这个基准是交互式游戏型环境:没有说明书,agent 要自己探索、摸清规则、设定目标。用标准 harness(harness 指模型与环境之间的执行框架,决定模型怎么观察画面、怎么执行动作),Astra 得 62.7%,花费 26,098 美元;换用厂商提供的适配 harness,得 99.9%。如果你看到 98.6% 的引用,那是同一适配 harness 开到最高推理档位的成绩;无论取哪个数,头条分数都来自适配 harness,而非标准 harness。ARC 团队自己也强调,刷满这个基准不构成 AGI 的证明。对做评测的人,这是 harness 敏感性的一个极端样本:从 62.7 到 99.9,模型没变,变的全是脚手架。
Nvidia 官宣 129.3 亿美元收购 Hugging Face
传闻坐实:Nvidia 官方确认收购 Hugging Face,Clem Delangue 给出的精确数字是 12,930,300,000 美元(另见 Delangue 的 X 原帖)。Nvidia 承诺平台保持开放、多云、不绑定自家算力,🤗 品牌保留,据 CNBC 报道,三位创始人全部加入 Nvidia。承诺写在公告里,检验在交割后:Hugging Face 托管着超过 300 万模型、50 万数据集,它的中立性过去靠独立身份保证,今后要靠收购方的自我约束。
Abliteration.ai 把「拆护栏」做成了生意
创业公司 Abliteration.AI 把开源社区的 abliteration 手法商业化。这个手法是定位并移除模型权重里的「拒绝方向」,让模型不再拒绝请求;此前是爱好者自己动手的玩法,现在变成基于 Z.ai 的 GLM-5.3 等开放权重模型的网页版和 API 服务,公司自称已与多家大型云厂商达成合作。官方口号是「Unrestricted. Not ungoverned」:把内容政策的决定权从模型层交给开发者。问题出在验证环节:据 TechCrunch,其客户审核只有信用卡记录,在这个条件下「开发者自定政策」约等于没有政策层。红队和防御研究确实需要不设限的模型;变了的是获取门槛——现在只剩一个结账页面。
Meta 给 Muse Spark 最高约 95% 折扣,换你的 prompt 和输出数据
Meta 面向编程和 agent 场景的 Muse Spark 1.3 推出「contributor」档:同意让 Meta 收集 prompt 和模型输出用于训练未来模型,输入价从每百万 token 1.25 美元降到 0.10 美元,输出从 4.25 美元降到 0.20 美元,最高约 95% 的折扣。我没找到 Meta 为此单发的公告;条款写在其定价文档里。这等于给「你的使用数据」公开标价。普林斯顿的 Arvind Narayanan 指出,企业客户通常多花钱买数据保护;补贴一旦明码,一部分公司会重新算这笔账。
Thinking Machines 传洽谈 10 亿美元融资,估值 400 亿美元
据 The Information 消息(Accel 与公司双方均未回应置评),Accel 正洽谈领投 Mira Murati 的 Thinking Machines 新一轮 10 亿美元,估值 400 亿美元;上一轮是 20 亿美元种子轮、估值 120 亿。知情信源称其年化营收已超 1 亿美元,即便如此这仍是数百倍的收入倍数:基础模型赛道给的还是期权定价,离现金流定价很远。
DeepMind 发布 WeatherNext 3
新一代全球天气模型把关键地表变量的分辨率从 25 公里提到 5 公里,更新频率从每 6 小时提到每小时,并直接吸收静止卫星的实时观测,省掉传统数值预报初始化流程带来的约 6 小时延迟。降水预报相对卫星观测基准 IMERG 的 CRPS 误差指标最多改善 60%。成果直接进产品:Google 搜索、Gemini 应用、地图及其天气 API,研究者可经 BigQuery 和 Earth Engine 取数。AI for Science 各条线里,这是离普通人日常最近的一条。
旧闻新热:申真谞受让二子击败 KataGo
这条今天在 Hacker News 上讨论热烈,但事情发生在 7 月:世界第一人申真谞九段在受让二子的三番棋中 2:1 战胜 KataGo(7 月 17 日至 21 日,首尔)。看结论前先看配置:KataGo 每手限时 20 秒、关闭后台思考(pondering),跑在 4 张 RTX 3090 上;申真谞用时 5 小时(限时与硬件见 KED 对第二局的报道,后台思考设置见 KataGo 项目的讨论串)。该讨论串里几位职业棋手的解读——我也认同——是「限时配置下,人类顶尖仍能与让二子的 AI 周旋」,不是 AI 优势逆转。它真正的提醒在于:「AI 远超人类」这类判断都绑定具体配置,时间预算一换,结论就可能跟着变。
研究速递
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
点出研究 agent 的一个真实缺口:模型知道方法,却不知道怎么在具体环境里把方法跑通,这层「操作知识」散落在仓库和论文里,此前没人显式建模。作者的 DisCo 系统把 1,000 个常用 ML 仓库蒸馏成 5,000 多个经过验证的可复用技能;固定同一 GPT-5.5 底座和执行预算,挂上技能库后 MLE-bench 成绩提升 134.3%。做 ML agent 或 agent 技能层、记忆层的研究者值得细读。
Language Models Can Control Their Own Attention
不用训练的纯推理时协议:模型在思维链里像发工具调用一样声明自己接下来要看全局、聚焦某段还是只看近期输出,推理引擎照声明跳过大部分 KV cache 读取。现成模型零样本可用,15 个长上下文任务上被关注的 token 数减少 31% 到 52%,代价是 1 到 3 个百分点的准确率下降,模型越大掉得越少。做长上下文推理优化的工程师应该看:控制权交还给模型本身,不再依赖外置代理打分预筛。
Improving Evaluation Realism with Inference-Time Compute and Deployment Scaffolds
对齐评估的一个核心失真源,是模型认出「这是测试」后表现走样(evaluation awareness)。这篇给出两个可直接上手的手段:一是花推理时算力反复打磨模拟环境里的每个动作,让它更像真实部署;二是把被测模型包进模仿真实部署的 SWE-agent 执行框架。两个手段可叠加,而且比单纯拉长审计时长更划算。做安全评估的研究者可以直接借走方法。
今日一句话:OpenAI 同一天说了两句话:我们的模型触发了自家框架的最高网络风险级;我们出 10 亿美元补贴防御方。前一句是能力事实,后一句是在和 OpenAI 自己的预测赛跑——按这份预测,未来几个月 AI 驱动的攻击会大幅增多、更加复杂。