这两天,如果说最火的大模型非“Jev”莫属。它来自TypeSafe AI,创始人Diogo Almeida曾任职于OpenAI,深度参与过RLHF和InstructGPT的创造,正是这套让GPT学会“说人话”、催生ChatGPT和GPT-4的关键技术,让他成为了行业大佬。2024年初,他离开OpenAI创业,隐身两年后,终于推出了这款全新的模型——Jev。这或许是我近一年来见过的最独特的东西,它极大地激发了我对AI的想象,因为它与你过去见过的所有大模型都不同。

Jev只会做一件事:高频决策。它是一款2026年9月推出的模型,不能聊天,不能写代码,甚至不能生成文字。它只是一个纯粹的通用分类器,专门帮你做决策和判断。

这听起来可能有些玄乎,但最近X平台上有一个案例非常直观地解释了Jev是什么。开发者Marcel Pociot开发了一款浏览器插件,将Jev接入后台,用于过滤推特上你不想看的内容。你可以设定不想看引战贴、加密货币、NFT或政治争论。甚至可以说:“把那些故意激怒我、让我停下来吵架的内容都折叠掉。”

之后你就可以正常刷推了。每当出现新帖子,Jev就在后台瞬间判断:这条内容是否命中了预设的过滤分类?命中即折叠隐藏,未命中则正常展示。这个判断过程平均仅需380毫秒。也就是说,从Jev看到帖子到完成判断并输出指令,只发生在极短的一瞬间。

过去我们处理这种问题,通常会让大模型做判断。即使开启了JSON输出,它也很慢;如果开启了“思考”模式,那就更慢了,可能需要十几甚至几十秒。但我们其实根本不需要那么复杂的过程,只需要模型以最快速度给出“是”或“否”的判断即可。我们不需要它生成任何内容,只需要它帮忙做判断。Jev做的正是这件事。

这就是Jev最奇怪也最性感的地方。过去的大模型都在努力学习如何更好地回答人类。Jev直接换了个方向:如果最终需要的只是一个判断,比如代码执行中的“继续”或“停止”,或者“A还是B”,那为什么需要文采飞扬的解释呢?它只需要一个能直接执行的判断。

事实上,不仅代码,对于人类而言,世界上的绝大多数事物本质上也是决策判断。这件衣服要不要买?遇到Boss是格挡还是闪避?Token用完是重置还是摆烂?结婚时彩礼给还是不给?太多了。很多时候,我们根本不需要长篇大论的分析,只需要一个决策。

所以,Jev奔着这个目标一路狂奔,为了极致的决策效率,直接砍掉了文字生成。速度提升了20到200倍,近乎实时,打游戏时一秒可决策10次。成本也降低了40到400倍,每百万Token仅需0.042美元,便宜到离谱(输出Token几乎为0,所以免费)。

网上的大佬们已经玩疯了。有人用它玩马里奥,因为游戏本质就是按键判断,效果出奇的好。有人用它操控浏览器查询航班,7秒内全部点完,因为浏览器操作本质上也是判断决策。还有人用它搭建交易机器人,因为交易就是买或卖。应用场景数不胜数。

Jev拥有百毫秒级响应和批量判断能力,既实用又充满想象力。他们将其定义为“System One Model”,灵感来自丹尼尔·卡尼曼的《思考,快与慢》。卡尼曼将思考分为两种:系统1是快思考,自动且直觉,比如问1+2等于几,你不会沉思三分钟才报3;系统2是慢思考,需要一步步分析,如数学证明或写复杂代码。

现在的GPT、Claude和各种推理模型越来越像强大的系统2。Jev赌的是另一边:世界上存在海量不需要长篇推理的智能任务。因此他们重新设计了模型架构和并行采样器,并采用了名为RLCD的训练方法,即强化学习用于校准决策。就像RLHF优化人类偏好,RLVR优化可验证性(让数学和代码大跃进),RLCD优化的则是决定是否正确,以及模型声称的“我有90%把握”是否真的接近90%。如果你把AI塞进自动化系统,概率必须有意义。比如Jev置信度>0.90自动执行,0.7-0.90交强模型复核,<0.7交人决策。

在Jev的路线里,核心不仅是快和便宜,而是“校准”。它的输出非常爽快。最妙的是,所有判断可以一次性并行完成。比如扔进去一条AI新闻,可以同时问:是不是AI相关?是不是广告?是不是融资?归哪个分类?值不值得推?Jev可以一口气做完所有判断,速度极快。这与传统LLM逐个Token生成完全是两种思路。

目前可在官网申请,网址:https://typesafe.ai。若想急用,可在Vercel平台测试。我也第一时间用Jev测试了AIHOT的一些任务。比如一个预筛任务,每天几万条内容,通常用大模型精选很贵。现在用Jev做预筛,剔除无关内容,非常省钱。100道题测试中,GLM 5.3 Flash唯一全对,但最慢最贵。Jev综合表现最强,准确率第二但便宜,且空闲时比DeepSeek还便宜(因国内网络延迟,速度稍慢)。Qwen 3.7 Flash性价比最高,但正确率稍差。在并行判断任务上,Jev优势尽显:最高准确率、最快速度、第二低成本。在精度分类场景中,Jev性价比最高。Qwen虽便宜,但大任务正确率会下降7个点,无法使用。这只是第一代,若出到2.0,不敢想象其性能。

Jev之名源于经济学中的“杰文斯悖论”。19世纪,蒸汽机效率提高,理论上应少用煤,结果反而因使用更划算导致煤炭消费量暴涨。效率提升、单次消耗下降,但总消耗却上升。TypeSafe以此命名,赌的是智能也会发生杰文斯悖论。现在的模型越来越贵,但我们真的需要用到这么高智力的模型吗?也许有大量判断只需要Jev这样的模型。如果有一天,拥有不错语义理解的判断便宜到近乎免费,世界会怎样?AI为什么一定要生成东西?智能当然可以用来创造,也可以只用来判断。Jev可能代表了Agent时代另一块重要拼图,一个因ChatGPT成功而被忽视的方向。未来的轮廓,似乎逐渐清晰了。

最新快讯

2026年09月23日

15:46
鼓狮财经9月23日电,摩根士丹利发布报告称,阿里于2026云栖大会释出重点,该行认为2032年全球云端产能逾20吉瓦,可提供通往约2400亿美元云端收入产能的路径;同时通义千问快速变现支持需求,以及平头哥渗透率上升,应有助产能扩张及利润率上行。该行维持阿里巴巴美股“增持”评级及目标价180美元,并视为首选股。
15:46
鼓狮财经9月23日电,当地时间周二披露的文件显示,特朗普名下账户7月完成1156笔证券交易,总规模区间为7900万—2.7亿美元,买入至少4360万美元,卖出至少3560万美元,投资组合迎来大规模调仓。7月20日,账户分别卖出500万至2500万美元微软、亚马逊股票,为当月最大单笔交易。同日卖出100万至500万美元甲骨文股票,并买入50.001万至100万...
15:46
9月23日,A股主要指数涨跌不一,截至收盘,沪指跌0.39%报3936.52点,深证成指跌0.64%,创业板指跌0.6%,北证50涨2.6%,科创50指数跌0.25%。全市场成交额17831亿元,较上日缩量3705亿元,全市场超3500只个股下跌。 盘面上,AI硬件板块集体上涨,PCB、MLCC、存储芯片、CPO概念涨幅居前,澳弘电子9天7板,沃格...
15:26
刚刚,OpenAI 与 Anthropic 几乎同步发布了重磅新模型。OpenAI 推出了 GPT-6 Sol 与 GPT-6 Luna,而 Anthropic 则发布了性能逼近 Fable 5.1 的 Claude Opus 5.5。这场隔空对决的核心,似乎都指向了一个共同的方向:在保持强大能力的同时,大幅降低使用成本。 OpenAI 表示,新推出的 GP...
15:26
“万亿参数模型,竟惨遭 1% 规模的小模型倒挂? ”             最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出...
15:26
过去几年,AI行业的主流叙事是围绕“Scaling Law”展开的狂热竞赛。数据中心里GPU堆积如山,模型参数轻松突破万亿大关,玩家们在算力、数据和算法的牌桌上疯狂加注。然而,一个极其现实的问题浮出水面:这些庞然大物只能运行在数据中心,而现实生活中,各种终端设备才是最贴近消费者的产品。可惜,算力与应用之间,隔着一道物理鸿沟。好在,一股去中心化的力量正在蓄势待...
15:26
9月22日至23日,备受瞩目的S创上海2026大会在上海徐汇西岸艺术中心A馆盛大举行。本届大会以“Be in the game|别在时代边缘围观”为题,汇聚了来自全球60余个国家和地区的创业精英与投资人。Airwallex空中云汇中国区战略负责人曾悦受邀出席圆桌论坛,与昆仑万维、火山引擎及语核科技的代表们,共同探讨了“从AI助手到数字同事:Agent Nat...
15:11
鼓狮财经9月23日电,韩国国家数据处9月23日发布的“7月人口动向”资料显示,今年7月出生人口为2.4275万人,同比增加11.1%,创2019年以来同月新高。韩国今年前7个月累计出生人口突破17万人,为17.0079万人,同比增加14.7%,增幅创历年同期新高。7月总和生育率为0.89人,同比增加0.08人。
15:11
鼓狮财经9月23日消息,高盛最新分析指出,全球债券收益率的上行及各国央行近期的加息举措,正在对杠杆融资市场中的浮动利率借款人构成直接冲击。与固定利率借款人仅在旧债到期再融资时才面临成本上升不同,浮动利率借款人的融资成本会随基准利率的飙升而迅速增加。 该行预测,此前几个季度杠杆借款人信用指标的改善趋势可能就此终结。其中,软件行业的贷款到期再融资,以及房地产、汽...
15:11
据鼓狮财经9月23日报道,随着人工智能代理(AI Agent)的持续火热,全球管理咨询巨头麦肯锡向各企业发出预警:随着智能体变得越来越普及,企业的AI支出可能会进一步攀升。 相较于基于文本的人工智能工具,智能体的运行成本显著更高,因为它们需要执行实际任务。这类任务通常是多步骤流程,导致达成同一目标的方式千差万别,成本差异极为悬殊。麦肯锡的一项研究表明,不同智...