一个名字,两个产品:ChatGPT Work 到底是什么

Simon Willison 发文实测拆解 ChatGPT Work——OpenAI 今年 7 月发布的、定位是接手整段工作流的 agent:基于 Codex 技术、由 GPT-5.6 驱动,能跨应用、跨文件行动,把一个目标拆成小步骤连续执行几个小时,产出文档、表格、幻灯片这类成品,还配有定时任务和插件目录,可接入 Slack、Google Drive、CRM 这类办公工具,已面向 Plus、Pro、Business、Enterprise、Edu 各付费档位开放(官方 X 公告也是 7 月发布时的)。最容易搞混的一点,也是 Willison 重点厘清的:它其实是两个产品。Work Cloud 跑在 OpenAI 服务器上,网页、移动端、桌面端同步;Work Local 在新版 ChatGPT 桌面应用里执行本地任务——Codex 应用正被并入这个桌面应用,但在里面仍保留独立视图——经用户授权可以直接操作本地文件和本地程序。Willison 的实测发现云端版比普通 Chat 多出一整套 agent 底座:带完整 Chrome 实例的浏览器工具、可联网的代码执行环境、跨会话保留的持久工作文件夹、多个 subagent 并行工作。他同时指出官方文档对这些机制交代含糊,并点出安全隐患:一个 agent 同时能读你的私密数据、会处理来路不明的网页内容、又有对外发送信息的通道,攻击者只要在网页里埋一段指令,就可能诱导它把看到的数据发出去,这正是 prompt injection 的典型高危组合。我的判断是,把 Work 建在 Codex 技术栈上,意味着 coding agent 攒下的底座(沙箱执行、浏览器、长时任务)正在被泛化成人人可用的办公 agent,攻击面也在随能力一起扩散;在授权它碰本地文件之前,最好先按上面这三个条件自查一遍。

卡特彼勒把矿场自动化的经验搬进企业 AI 部署

卡特彼勒首席技术官 Jaime Mineart 在 Ai4 大会上接受 TechCrunch 采访,讲这家重型机械公司怎么把几十年矿场自动化的积累用到 AI 上:现场技术员用语音向 Cat AI 助手调取维修程序、排查故障、识别零件;用数字孪生(给实体工地或产线建一份实时更新的虚拟副本,用于模拟和分析)扫描工地、分析制造运营;内部则用 AI 改造遗留代码、生成并测试新软件。家底也可观:全球 160 万台联网设备、16 PB 结构化数据,未来五年还要投 1 亿美元培训 11.8 万名员工。Mineart 点出的迁移路径值得记下:矿场流程封闭、变量可控,先在那里把自动化跑通,再推向工地、采石场这类公司自己形容为动态得多的环境。先封闭场景、后开放场景的顺序,加上「难点不在技术本身,而在把技术嵌进客户的工作流」这个判断,对做企业 AI 落地的人有直接参考价值。

研究速递

连续扩散语言模型为何卷土重来

DeepMind 研究科学家 Sander Dieleman(Imagen、Veo 背后的生成模型研究者之一)发长文,梳理用扩散模型(先加噪再逐步去噪还原数据的生成方法,是图像生成的主流路线)做语言建模这条线的兴衰。作者自己说明这是对既有工作的更新梳理,不是新方法。看点在机制:语言是离散 token,主流的离散扩散靠掩码或随机替换来加噪;连续路线则把 token 嵌入连续空间后加高斯噪声,2023 年后一度沉寂,如今重新活跃。转折点是流图(flow map)方法让步数蒸馏变得可行,即训练模型只用几步去噪就得到成品,理论上甚至一步到位,采样速度和后训练都因此受益。关注自回归之外替代架构的 researcher 值得一读,这相当于领域内部人画的一张路线图。

今日一句话:coding agent 攒下的全套底座正在变成通用办公 agent,能力在泛化,prompt injection 的攻击面也在同步泛化。