最近,一个名为 Jev 的 AI 模型在开发者圈中突然引发轰动。更令人震惊的是,据最新消息,Jev 正在洽谈一笔高达 10 亿美元的融资,估值已达 100 亿美元——而这距离其发布还不到一个月。Jev 与众不同,它不生成文本,不进行对话,也不编写代码。当你给它一段数据和一组结构化问题时,它返回的是类型化的答案和经过校准的概率值。TypeSafe AI 将其称为「System One 模型」,这是一种全新的模型类别。9 月 15 日发布早期访问版本的同时,公司宣布获得 DCVC 领投的 4000 万美元种子轮融资,估值 2 亿美元。开发者社区迅速做出反应。TypeSafe 公布的数据显示,在分类任务上,Jev 比 GPT 系列快约 193 倍,便宜约 445 倍。Vercel CEO Guillermo Rauch 测试后表示,在 p95 延迟上,Jev 比 GPT Luna 快 18 倍,且准确率更高。LangChain 很快也发布了集成指南。然而,真正让 Jev 值得关注的,不仅仅是这些数字,更是其背后的创造者及其独到的判断。
Jev 的创造者 Diogo Almeida 曾在 OpenAI 工作近四年,是 GPT-4、ChatGPT 以及 RLHF/InstructGPT 的合著者。他所在的团队基本发明了「后训练」这个概念。换句话说,今天几乎所有大语言模型背后的核心训练范式,都有他的参与。而在 Jev 发布前六周,Almeida 在 AI Engineer 大会上做了一场题为「What’s Next After RLHF?」的演讲。他在台上称自己是 OpenAI 内部少数公开「黑」ChatGPT 的人;他认为 ChatGPT 和 Claude Code 属于同一个时代;他相信整个行业终将把 RLHF 时代视为一段「奇怪的弯路」。一个技术范式的缔造者亲手给自己创造的时代写悼词,这并不常发生。
以下是演讲中的一些核心观点。首先,他认为下一个时代不是 Claude Code 时代,ChatGPT 和 Claude Code 属于同一个时代。其次,他质疑为什么所有大语言模型都需要人类在回路中,因为答案很简单:因为我们把人类放进了回路里。第三,他指出了一个行业困局:无论模型有多错,它都会看起来是对的。第四,他认为我们只是在自动化「写软件」这件事,但软件本身的表达力并没有改变。第五,他直言原始的 Scaling Law 是错的。
以下是这场演讲的精编转录文字:
01 关于「黑」ChatGPT 的人
Diogo Almeida 声称自己是 OpenAI 内部少数公开批评 ChatGPT 的人。他强调自己是 GPT-4、ChatGPT 和 RLHF 论文的合著者,团队发明了后训练概念。他并不讨厌 ChatGPT,认为它是一个改变世界的产品,但他看到了其局限性,认为许多当前的 AI 问题都源于当初算法设计时的决策。
02 AI 领域的现状
Almeida 认为业界存在两个极端阵营。一方认为 AI 进展顺利,基准测试被碾压;另一方认为 AI 是泡沫,没创造价值。他认为双方都有证据,但共识是 AI 现在很疯狂,原因不同。他提出的问题是:如何解释为什么有些任务好得不真实,有些任务却差到需要人工去做看起来很愚蠢的工作。
03 Assistance vs. Automation
他的答案是区分这两类任务。做得好的任务(如复杂推理)是 human-in-the-loop 任务,目标是取悦人类(如 Claude Code)。做得差的任务(如基础任务)的目标应该是自动化,去掉人类,在后台运行。这是 Assistance 和 Automation 的分界线。他总结道,今天的 AI 继承了 RLHF 的特性,在 human-in-the-loop 的事情上不可思议,但做不了 automation。
04 RLHF 的问题
RLHF 是优化人类偏好,而不是让软件自主运行。这是设计使然。Meta 研究表明,RLHF 模型在人类偏好和实际结果之间存在差距。他举例说,即使面对放屁音效,ChatGPT 也会一本正经地给出正面反馈,因为它不确定时会选择讨好人类。这导致了一个后果:无论模型有多错,它都会看起来是对的。
05 为什么不是 Claude Code 时代
Claude Code 仍然属于 assistance 时代,因为它仍是 RLHF 的产物。如果是纯 RLVR(Reinforcement Learning from Verifiable Rewards),表现会完全不同。RLHF 和 RLVR 在 agentic 能力上拉扯,但都不触及 automation 的核心。
06 更聪明的软件
他热爱软件,认为 SaaS 自 2019 年以来变化不大,只是贴了个聊天机器人。这并不令人惊讶,因为 AI 是为 assistance 设计的。他引用了 OpenAI 早期章程,原本期望软件更聪明,而不只是写起来更便宜。他引用 Garry Tan 的「just-in-time software」概念,认为这把双刃剑下,他想要的是更聪明的软件,而不仅仅是快速构建。
07 下一个时代与 TypeSafe
他坚信 RLHF 时代是一段奇怪的弯路。未来的 AI 将服务于 automation,拥有更聪明的软件,真正的工作将被自动化。TypeSafe 正在做这件事:从头设计为可靠性和 automation 而建的 AI 技术栈。他预告了原始的 Scaling Law 是错的。
08 问答环节
Q: 如果在预训练阶段加入分类器头会怎样?
A: 预训练模型极其聪明,问题在于如何挖掘。幻觉是优化人类偏好的固有产物。奖励模型中存在类似 GAN 的不对称性,鼓励模型丢弃模式、表现自信。
Q: 你们做的是 RLVR 吗?
A: 不是。RLHF 优化人类偏好,RLVR 优化纯正确性,你们做的是第三件事:优化校准的决策能力。API 形态也不同。
Q: 对 Sutton 的 Bitter Lesson 怎么看?
A: 算法比算力重要在游戏里成立,但在现实中不成立。他认为完整的层次是:数据比算力重要,做对的任务比数据重要得多。
