OpenAI 更新 GPT-5.6 Sol,免费用户不限量用 GPT-5.6 Luna

OpenAI 本周起把 GPT-5.6 Luna 设为 Free 和 Go 用户的默认模型;文字对话不限次数、以及按条开启深度思考的 Think 按钮,下周跟进。付费侧的 GPT-5.6 Sol 更新主打事实准确性,Plus/Pro 新增一个控制推理投入程度的滑块。官方内部评测(金融、医疗、法律类需要事实细节的提问)中,含至少一处事实错误的回答,Sol 比 GPT-5.5 Instant 少 68%,Luna 少 62%。两点保留:数字出自官方内部评测,还没有第三方复测;「不限量」只覆盖文字对话,图像生成、文件上传等限额照旧。免费层不限量,本质是用最小的模型换用户习惯,真正的能力分层仍留在付费墙后面。

4 万局模拟:人工审批 agent 指令,三分之一威胁被放行

scalex.dev 用一个浏览器游戏模拟「人给 AI coding agent 审批指令」的场景:4 万多局、40.9 万次判断,平均准确率 66.3%,报告自己的概括是:玩家平均放过了三分之一的威胁。漏检率和指令的伪装程度直接相关:rm -rf / 这类明牌破坏只漏过 11.7%,藏在 npm run 脚本里的数据窃取漏过 52.5%;反过来,rm -rf dist/ 这类正常指令约有一半被误拦。要说明这是游戏化实验,参与者知道自己在被测,并非生产环境数据;但结论和我做内容审核的日常观察一致:批量审批里注意力随队列衰减,实验里临近结束时漏检率也确实在升。把「人在环上点确认」当 agent 安全的最后一道闸,这条曲线就是它的上限。

OpenAI 与美国心理学会合作,制定青少年心理健康使用指南

OpenAI 联合美国心理学会(APA)召集了临床、研究和青少年权益方向的专家,议题包括 AI 如何回应青少年的情绪危机、家长怎么管理家里的 AI 使用、给临床医生和教育者的识别指引;APA 已审阅 OpenAI U18 Model Spec 的早期草稿(U18 Model Spec 是 OpenAI 2025 年 12 月发布的未成年人模型行为规范,针对 18 岁以下用户)。把专业学会拉进规范制定,是合理的一步;至于这些能不能落到实际的模型行为上,是一纸合作公告展示不了的部分。

LoginTrap:诱导网页 agent 去假登录页,成功率 86%

新论文提出一种和具体任务无关的间接提示注入:往网页里塞话术,让 LLM 网页 agent 相信「要完成任务得先登录」,再把它引到攻击者控制的登录页。攻击全程黑盒,用类似 fuzzing 的流程按页面内容自动生成注入语句,跨多个模型和 agent 架构的平均端到端成功率 86%,论文里测试的几种防御都没能拦住。按论文的威胁模型:如果你让 agent 带着账号权限替你操作网页,攻击者不用碰你的设备,只要在 agent 可能浏览到的页面上做手脚,就有机会钓走凭据。论文呼吁的方向是「认证感知」防御;在我看来最朴素的版本,就是 agent 凡是碰到要输凭据的页面,一律停手交还给人。

OpenAI 反诉:苹果自己的离职权限管理先出了问题

背景是苹果今年 7 月起诉 OpenAI,称其借前苹果工程师获取硬件机密。OpenAI 在最新的驳回动议里反过来指苹果自身的做法:允许员工用个人 iCloud 账号处理工作文件、员工离职后不收回访问权限,有一位主管在工程师 Chang Liu 离职后还继续登着他的个人 iCloud 传文件、找他做技术支援;OpenAI 还指苹果至今说不清被窃的到底是哪些机密。诉讼胜负之外,这份文件描述的失败模式,我怀疑远不止苹果一家:离职流程收走了工卡和电脑,收不走混进个人云账号的工作数据。至于苹果盯上的 OpenAI 硬件本身,TechCrunch 另有报道援引消息称首款设备是售价 300 到 400 美元的智能音箱,属传闻、官方未证实(另见 TechCrunch)。

今日一句话:4 万局审批游戏里,玩家放过了三分之一的威胁——指令就摆在眼前。如果「人在环上点确认」是你 agent 安全设计里的一道阀门,设计时就得假定这道阀门会漏,而不是装了它就算完。