这两天,如果说最火的大模型非“Jev”莫属。它来自TypeSafe AI,创始人Diogo Almeida曾任职于OpenAI,深度参与过RLHF和InstructGPT的创造,正是这套让GPT学会“说人话”、催生ChatGPT和GPT-4的关键技术,让他成为了行业大佬。2024年初,他离开OpenAI创业,隐身两年后,终于推出了这款全新的模型——Jev。这或许是我近一年来见过的最独特的东西,它极大地激发了我对AI的想象,因为它与你过去见过的所有大模型都不同。
Jev只会做一件事:高频决策。它是一款2026年9月推出的模型,不能聊天,不能写代码,甚至不能生成文字。它只是一个纯粹的通用分类器,专门帮你做决策和判断。
这听起来可能有些玄乎,但最近X平台上有一个案例非常直观地解释了Jev是什么。开发者Marcel Pociot开发了一款浏览器插件,将Jev接入后台,用于过滤推特上你不想看的内容。你可以设定不想看引战贴、加密货币、NFT或政治争论。甚至可以说:“把那些故意激怒我、让我停下来吵架的内容都折叠掉。”
之后你就可以正常刷推了。每当出现新帖子,Jev就在后台瞬间判断:这条内容是否命中了预设的过滤分类?命中即折叠隐藏,未命中则正常展示。这个判断过程平均仅需380毫秒。也就是说,从Jev看到帖子到完成判断并输出指令,只发生在极短的一瞬间。
过去我们处理这种问题,通常会让大模型做判断。即使开启了JSON输出,它也很慢;如果开启了“思考”模式,那就更慢了,可能需要十几甚至几十秒。但我们其实根本不需要那么复杂的过程,只需要模型以最快速度给出“是”或“否”的判断即可。我们不需要它生成任何内容,只需要它帮忙做判断。Jev做的正是这件事。
这就是Jev最奇怪也最性感的地方。过去的大模型都在努力学习如何更好地回答人类。Jev直接换了个方向:如果最终需要的只是一个判断,比如代码执行中的“继续”或“停止”,或者“A还是B”,那为什么需要文采飞扬的解释呢?它只需要一个能直接执行的判断。
事实上,不仅代码,对于人类而言,世界上的绝大多数事物本质上也是决策判断。这件衣服要不要买?遇到Boss是格挡还是闪避?Token用完是重置还是摆烂?结婚时彩礼给还是不给?太多了。很多时候,我们根本不需要长篇大论的分析,只需要一个决策。
所以,Jev奔着这个目标一路狂奔,为了极致的决策效率,直接砍掉了文字生成。速度提升了20到200倍,近乎实时,打游戏时一秒可决策10次。成本也降低了40到400倍,每百万Token仅需0.042美元,便宜到离谱(输出Token几乎为0,所以免费)。
网上的大佬们已经玩疯了。有人用它玩马里奥,因为游戏本质就是按键判断,效果出奇的好。有人用它操控浏览器查询航班,7秒内全部点完,因为浏览器操作本质上也是判断决策。还有人用它搭建交易机器人,因为交易就是买或卖。应用场景数不胜数。
Jev拥有百毫秒级响应和批量判断能力,既实用又充满想象力。他们将其定义为“System One Model”,灵感来自丹尼尔·卡尼曼的《思考,快与慢》。卡尼曼将思考分为两种:系统1是快思考,自动且直觉,比如问1+2等于几,你不会沉思三分钟才报3;系统2是慢思考,需要一步步分析,如数学证明或写复杂代码。
现在的GPT、Claude和各种推理模型越来越像强大的系统2。Jev赌的是另一边:世界上存在海量不需要长篇推理的智能任务。因此他们重新设计了模型架构和并行采样器,并采用了名为RLCD的训练方法,即强化学习用于校准决策。就像RLHF优化人类偏好,RLVR优化可验证性(让数学和代码大跃进),RLCD优化的则是决定是否正确,以及模型声称的“我有90%把握”是否真的接近90%。如果你把AI塞进自动化系统,概率必须有意义。比如Jev置信度>0.90自动执行,0.7-0.90交强模型复核,<0.7交人决策。
在Jev的路线里,核心不仅是快和便宜,而是“校准”。它的输出非常爽快。最妙的是,所有判断可以一次性并行完成。比如扔进去一条AI新闻,可以同时问:是不是AI相关?是不是广告?是不是融资?归哪个分类?值不值得推?Jev可以一口气做完所有判断,速度极快。这与传统LLM逐个Token生成完全是两种思路。
目前可在官网申请,网址:https://typesafe.ai。若想急用,可在Vercel平台测试。我也第一时间用Jev测试了AIHOT的一些任务。比如一个预筛任务,每天几万条内容,通常用大模型精选很贵。现在用Jev做预筛,剔除无关内容,非常省钱。100道题测试中,GLM 5.3 Flash唯一全对,但最慢最贵。Jev综合表现最强,准确率第二但便宜,且空闲时比DeepSeek还便宜(因国内网络延迟,速度稍慢)。Qwen 3.7 Flash性价比最高,但正确率稍差。在并行判断任务上,Jev优势尽显:最高准确率、最快速度、第二低成本。在精度分类场景中,Jev性价比最高。Qwen虽便宜,但大任务正确率会下降7个点,无法使用。这只是第一代,若出到2.0,不敢想象其性能。
Jev之名源于经济学中的“杰文斯悖论”。19世纪,蒸汽机效率提高,理论上应少用煤,结果反而因使用更划算导致煤炭消费量暴涨。效率提升、单次消耗下降,但总消耗却上升。TypeSafe以此命名,赌的是智能也会发生杰文斯悖论。现在的模型越来越贵,但我们真的需要用到这么高智力的模型吗?也许有大量判断只需要Jev这样的模型。如果有一天,拥有不错语义理解的判断便宜到近乎免费,世界会怎样?AI为什么一定要生成东西?智能当然可以用来创造,也可以只用来判断。Jev可能代表了Agent时代另一块重要拼图,一个因ChatGPT成功而被忽视的方向。未来的轮廓,似乎逐渐清晰了。
