Technical note
ChatGPT和Codex为什么必须合并:Tibo谈OpenAI下一步
上一篇刚把OpenAI的ChatGPT和Codex两条产品线捋了一遍,很多判断还是从入口、额度和组织变化里反推出来的。随后看到Matthew Berman对Tibo的这场访谈,正好把其中最重要的问题说透了:ChatGPT和Codex为什么要合并。
答案不是少维护一个客户端,也不是把Codex改个名字塞进ChatGPT。Tibo在谈到两条产品线合流时说了一句很直接的话:
未来的模型要求我们合并。
这场访谈有44分钟,话题从DeepMind、OpenAI文化、下一代Harness,一直聊到Ultra Fast、额度重置、安全暂停和递归自我改进。真正贯穿全场的主线却很简单:OpenAI想做的已经不是几个分别负责聊天、编程和长任务的AI产品,而是同一个能够理解用户、调用工具并完成工作的个人Agent。
合并不是为了统一菜单
在14分27秒谈到ChatGPT和Codex合并时,Tibo的解释比产品公告清楚得多。
未来的模型会同时具备很强的编程能力、通用工作能力、多模态能力和语音交互能力,底层又使用相同的Harness。到了这个阶段,再要求用户先判断“这件事应该交给ChatGPT还是Codex”,反而成了产品自己制造的负担。
Tibo设想的终点不是一套给开发者、一套给普通人的界面,而是同一个会根据用户自动变化的入口。他甚至说:“你和你妈妈会使用同一个东西。”两个人连接的工具、提出的任务和需要的细节完全不同,但背后都是各自的Personal AGI。
这也解释了为什么现在的ChatGPT和Codex看起来一边合并,一边又没有完全合并。模型和Harness已经开始共用,历史记录、权限、额度和运行环境却还保留着两条产品线各自成长的痕迹。上一篇一份订阅,两套额度,三个入口:我把OpenAI的产品线捋了一遍里看到的那些接缝,更像迁移中的中间状态。
从这个角度看,Codex不会消失。它更可能从一个单独的编程产品,变成ChatGPT整套Agent能力里的执行底盘。
下一代Harness最好让人感觉不到Harness
访谈里让我最有共鸣的,是Tibo对当前Agent使用体验的评价。
今天真正把Agent用到复杂工作里的用户,往往要自己维护Skill文件,反复提醒记忆,手动安排子Agent,再处理子Agent之间的上下文和结果。我们已经习惯这些东西,甚至会把它们当成能力的一部分,但Tibo认为这种体验仍然很笨重。
理想状态下,Agent应该长期理解用户、目标、日常工作和所在团队。它既能回应明确指令,也能在合适的时候主动提供帮助。用户不需要知道某一步是主Agent做的、某一步交给了子Agent,更不需要为了维持任务而不断管理幕后结构。
Tibo把这种状态称为不要“打破幻觉”。这里的幻觉不是欺骗用户,而是让工具、记忆、并行任务和后台执行都退到后面,前面只剩一个自然连贯的协作对象。
这和现在的Agent Harness方向很像,只是目标比“把工具接好”更进一步:最成熟的Harness,可能恰恰是用户几乎感觉不到Harness存在。
他还提到一个容易被忽略的限制。今天的笔记本电脑是围绕人的输入速度设计的,人一次只能操作有限的应用、阅读有限的信息。未来的Agent可以同时探索多个方案、运行测试、编译代码并调用许多工具,真正限制它的可能不再是人的键盘,而是云端计算、网络和工具执行速度。这也是为什么Agent能力最终不会只停留在一台本地电脑里。
个人Agent和自动化系统是两条路线
谈到开发者工作流时,Tibo没有把所有Agent都归为一种产品,而是区分了两类目标。
第一类是个人Agent。它需要深入理解一个人,尽量减少切换工具和重复说明,让技术工作与非技术工作都可以从同一个入口开始。重点不是把所有任务完全自动化,而是管理好人的注意力,让技术适应人,而不是让人去适应技术。
第二类是自动化系统。它面向的是持续运行的复杂流程,例如观察生产日志、优化性能、发现回归、修复安全问题,再把真正高风险的操作交给人确认。这类系统不一定需要时刻和用户聊天,更像一套能够自己发现问题、执行处理并保留审计边界的智能基础设施。
这个区分很重要。现在谈Agent时,很容易把“数字助理”和“无人值守自动化”混为一谈。前者追求的是理解用户和自然协作,后者追求的是稳定执行、权限边界和异常恢复。它们可以使用相同模型和Harness,但产品设计完全不同。
Ultra Fast改变的是工作节奏
访谈的另一大主题是Ultra Fast。它最直观的变化当然是快,但Tibo关心的不是跑分,而是速度怎样改变人的工作方式。
普通Agent需要等待时,用户会自然切去做别的事情;模型足够快以后,语音、思考、生成和修改可以留在同一个连续过程里。Tibo自己已经很依赖语音:早上直接对着手机描述任务,让ChatGPT调用工具继续处理,而不是先把想法整理成一份完整提示词。
OpenAI内部会在故障响应、关键截止日期和Dev Day前的快速原型中使用Ultra Fast。它能让参与者围绕同一个问题持续工作,而不是发出任务后先离开。不过Tibo也明确说,并不是所有员工都能随时使用这部分算力,大多数容量仍然留给客户。
速度提高以后,瓶颈会继续向外移动。模型生成Token很快时,工具调用、网络请求、CPU、编译和测试反而占据主要时间。因此下一步不只是让模型吐字更快,还要让它并行探索假设、同时运行验证,并减少完成同一件事所需的Token。
Tibo提到,除Ultra Fast之外,普通推理速度相比三个月前也已经提高约60%;Sol比Terra更节省Token,下一代模型还会继续提高效率。他预计一两年后,今天这种速度可能接近默认体验,只是最前沿的高速档位仍会保持一定溢价。
这意味着未来的Agent差异不只来自“谁更聪明”,还来自整套系统能否把模型、工具和基础设施一起跑快。
那个额度重置按钮真的存在
整场访谈里最有八卦感的一段,是23分37秒开始聊额度重置。
Codex早期有些体验会出问题,或者没有达到用户预期。OpenAI最初重置额度,是为了补偿这部分损失:产品没有把事情做好,就把用量还给用户。后来重置也逐渐变成庆祝里程碑和鼓励大家尝试新功能的方式。
更离谱的是,OpenAI内部真的做了一个物理按钮。Tibo说自己感觉时机合适就可以按,并不会先和市场或财务团队开会协调。
这当然不是什么重要的技术路线,却很能说明Codex早期的产品文化。额度不是只由一套精确的商业模型管理,它也被当成和用户建立关系的一种方式。产品出错就补偿,有值得庆祝的事情就一起重置,多少带着一点创业团队直接面对用户的味道。
递归自我改进已经开始了
谈到Recursive Self-Improvement时,主持人问的是一个很宏大的问题:模型什么时候能够帮助开发下一代模型。
Tibo给出的答案没有那么科幻。他说,这件事已经在发生,只是不一定表现为一个模型独立训练出另一个模型。
OpenAI正在用模型优化推理基础设施、CUDA Kernel、云端Agent和产品交互。这些工作位于整个AI系统的关键路径上:基础设施更快,模型服务就更高效;云端Agent更强,人类研究者和工程师的产出又会提高;这些能力还可以继续用于改进下一轮系统。
他的概括是:“这是一个整体系统。”
这个说法比单独盯着模型参数更接近实际。真正的自我改进可能不是一次突然发生的智能爆炸,而是模型开始参与优化承载自己的每一层,再由这些改进反过来放大模型和人的能力。
OpenAI和DeepMind最大的差别是能不能交付
访谈开头,Tibo回顾了自己在Google DeepMind的经历。大约在ChatGPT发布一年前,内部已经出现了LM Chat这样的产品想法,模型也让人明显感觉到“这东西很特别”。
但在Tibo看来,当时的DeepMind并不是一个擅长交付产品的组织。OpenAI最不一样的地方,是研究和产品团队会很早一起构思、一起设计,而且有很强的发布倾向:能力出现以后,尽快让真实用户接触,再通过反馈继续调整。
他也把OpenAI描述成一个比较自下而上的组织。新想法不会先经过很长的层级审批,团队可以快速做出来。不过这种速度也有反作用力:产品不能因此变成一堆功能的拼盘,仍然要守住简单、性能、效率和使用愉悦感。
这段经历和前面的合并逻辑是连在一起的。模型能力增长太快,产品不能围绕现有菜单和收入结构慢慢等。新模型暴露出新的工作方式时,团队必须愿意打破自己刚做好的产品。
关于安全暂停,访谈没有给出内幕
在32分钟附近,主持人追问了OpenAI在前沿强化学习上的一次暂停,以及外界关注的安全事件。
Tibo没有透露具体经过,也没有给出足以还原事件的细节。他只说,随着能力提高,Alignment和安全投入会变得更重要;暂停的作用是让团队重新理解并加固系统中的各个部分,确认重新掌握全局以后再继续。
所以这部分不适合被写成“OpenAI到底害怕了什么”的内幕故事。访谈能够支持的结论只有一个:OpenAI确实会在认为系统边界不够清楚时停下来,而且Tibo认为这种暂停可以在组织内部比较高效地执行。
Codex正在从产品变成能力
这场访谈没有公布下一版ChatGPT或Codex的具体路线图,但它把OpenAI正在做的事情讲得比任何界面更新都清楚。
模型会越来越通用,语音和多模态会成为自然入口;Harness负责记忆、工具、并行任务和长期执行,却尽量不让用户感受到复杂结构;个人Agent根据每个人自动调整,自动化系统则接管越来越完整的业务流程。Ultra Fast、Token效率、云端算力和递归自我改进,都是为这套体验服务的基础设施。
回头看现在的ChatGPT、Work和Codex,分开的额度、入口和历史记录仍然很明显。但从Tibo的描述看,OpenAI并不打算长期教用户理解这些产品差异。最终用户面对的可能只有一个持续了解自己、能够完成任务的Agent。
到那时,Codex也许不再需要以一个单独产品被普通用户认识。它不会消失,只是会变成所有人都在使用、却不必知道名字的那一层能力。