智能体 / 机制解读

OpenAI DevDay 2026:从单次推理到持续任务,开发者该区分哪些层

OpenAI 的正式回顾称,DevDay 2026 带来超过 20 项公告,覆盖 ChatGPT、Codex、模型和协作方式。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 比罗列功能更重要的是区分:模...

主题机制示意图,非产品截图或实测数据
机制示意 · 非实测数据

OpenAI DevDay 2026:从单次推理到持续任务,开发者该区分哪些层

OpenAI 的正式回顾称,DevDay 2026 带来超过 20 项公告,覆盖 ChatGPT、Codex、模型和协作方式。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 比罗列功能更重要的是区分:模型能力、托管执行、协作界面和权限治理并不是同一个产品层。某一层的演示成功,不能证明其他层的生产责任已经被解决。

先把价格与性能口径分开

官方将 GPT‑6.1 Sol 描述为 GPT‑6 Sol 的升级,重点包括 agentic coding、computer use 和专业工作;“五分之一”对应的是 Astra 的标准输入及输出 token 单价,而不是任意上一代旗舰,也不是完成每个任务的总费用。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 原回顾并没有支持旧稿所写的“稳定性提升 42%”,也没有给出将降价归因于稀疏注意力和推测解码的架构证明。

我们的分析:一个 Agent 任务的账单不仅受 token 单价影响,还取决于上下文长度、输出量、工具重试和任务持续时间。即便单价更低,反复失败的长任务仍可能更贵。对采购和模型路由,应该比较通过同一验收标准的任务成本,而不是把价格倍率直接当成生产效率倍率。

另一个容易混淆的项目是 Ultrafast。官方把它定义为速度档位,列出 Codex 与 API 的不同提升口径,并说明 GPT‑6 Astra Ultrafast 当时可用、GPT‑6.1 Sol Ultrafast 尚待推出。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 因此不能把它写成所有用户、所有模型自动获得的同一种加速。

Dots:责任持续,不代表权限无限

回顾将 Dots 定位为持续工作的 Agent,并列出 Pro、Business Premium 的可用范围;Enterprise、Edu 和 Healthcare 的 beta 需管理员开启,默认关闭。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 这说明可用性本身就是产品设计的一部分:能否使用与账号套餐、地区和工作区设置有关。

我们的分析:把任务从一次对话改成长期责任,最大变化不是“能跑多久”,而是目标过期、授权撤销和重复执行如何处理。以持续跟踪供应商报价为例,读取新报价、生成比较表和真正下单应是不同权限。读者不能仅凭“always-on”就推断系统具备某种容器保活、跨天持久化或人工审批状态机;正式回顾提供的是产品定位,而不是这些实现的完整规格。

Codex 与 Agents API:执行环境开始产品化

官方介绍 Codex 的云端运行与可复用开发环境,强调团队可共享经批准的设置和权限。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) Agents API 则把 computer use、多 Agent、tool search、tool calling 和 context compaction 等能力带入应用,并由 OpenAI 运行底层基础设施。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 两者关联,但不能简单说“Codex CLI 全部被搬到了云上”。

我们的分析:可复用环境的价值在于减少“模型会写,但无法复现依赖”的问题。工具搜索与上下文压缩解决的是长任务的信息管理,不代表每次压缩都保留了所有关键约束。使用者仍需要在任务外保留验收标准、权限配置和关键产物;否则模型写出的“已完成”可能成为唯一状态记录。旧稿中“秒级拉取百 GB 仓库”没有被这份回顾支持,应该删除。

有限答案 API 与开放任务的区别

回顾中的 Decisions API 使用 Luna,面向开发者预先定义的有限答案问题,输入可包含文本或图片,输出可用于分类、路由或选择 Agent 下一步动作。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 这和让开放式 Agent 自行设计计划是不同接口:前者收紧答案空间,后者允许更广的行动序列。

我们的分析:客服分流、内容分类适合先评估有限答案接口;跨网站研究并整理报告更像持续任务。答案格式稳定不代表业务判断一定正确。上线前应单独评估未知类别、证据不足以及多个选项都不合适的情况,并保留人工接管,而不是强迫每个输入都有一个自信答案。

共享界面与隐私承诺不能互相替代

Pages 被官方定义为人和 Agent 协作的文档;ChatGPT Space 的可用范围还区分桌面、网页和移动端功能。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 同一回顾介绍 Zero Data Retention with Private Safety Processing,并把 Private Inference 标为稍后推出的预览方向。[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) 已上线能力与预告不能合并成“所有工作流都有同一种隐私保护”。

采用顺序|我们的分析

先选一个有清晰结束条件的任务,确定它需要模型、执行环境还是共享文档,再检查具体产品的套餐、地区、管理员开关和数据政策。接着设计只读演练、可撤销写入和人工批准三个阶段,记录失败行为与总成本。本篇仅依据官方回顾解释产品边界,没有实测这些服务,也不为其吞吐、长期稳定性或节省人力作保证。真正的变化是工具分层更丰富了,开发者仍需为组合后的系统负责。

Sources

[[3] DevDay 2026 Recap | OpenAI](https://openai.com/en-US/index/devday-2026-recap) https://openai.com/en-US/index/devday-2026-recap — DevDay 2026 Recap | OpenAI

文章讨论

No comments yet