近日,AI 领域涌现出一个新名字:Jev。自 TypeSafe AI 发布以来,它在社交媒体、GitHub 以及 Agent 开发者圈层中迅速走红。从 40 秒内分析 724 条实时广告,到接入 Claude Code 进行上下文清理,再到作为 Agent 的验收裁判以及浏览器 Agent 的决策核心,Jev 展现了惊人的应用潜力。甚至连 LangChain 都迅速跟进,在 9 月 20 日发布了 Jev-as-a-Judge 实验,OpenAI 的「重置之神」Tibo 也为其背书。

Jev 到底是什么?简单来说,这是一种专门处理「判断题」的 AI 模型。9 月 15 日,TypeSafe AI 正式推出了 Jev,并将其定义为「System One Models」。这类模型能够接收程序状态或文本信息,并快速返回结构化的判断结果及其对应的概率。

发布初期,Jev 的热度已达到 3700 万次的推文围观量。以客服系统为例,面对一封收到的邮件,开发者可以让 Jev 同时判断:「这是销售线索吗?」、「用户情绪是否激烈?」、「是否需要人工介入?」、「属于账单、技术还是销售问题?」Jev 可能会返回一组概率值,例如:销售线索:0.91;需要人工介入:0.12;技术问题:0.83。应用程序便可据此立即进入后续流程。

Wasp 联合创始人 Matija Sosic 分享了一段 45 秒的演示视频。目前,Jev 提供三种核心判断形式:Noul(负责 Yes/No 判断)、Choice(从给定选项中择优)和 Score(根据预设标准评分)。每个结果都会附带概率或置信度,且支持对同一份输入进行多道问题的并发判断。

这种特性使其迅速成为 Agent 的「裁判」。现代 AI Agent 往往需要连续完成数十甚至上百个步骤,包括写代码、调用工具、搜索网页和修改文件。此时,系统需要判断任务是否完成。这正是 Jev 的强项。LangChain 的实验便采用了这一思路,让 Jev、GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 对固定的 Agent 输出进行反复评分。实验数据显示,Jev 平均每次调用耗时约 0.44 秒,成本仅 0.00035 美元,且在连续评分的一致性上表现优异。尽管 LangChain 强调这仍属早期小规模测试,但结果已颇具说服力。

Jev 在广告分析领域的表现更是令人瞩目。开发者 Matthew Berman 分享的实验显示,系统利用 Jev 分析了 37 个品牌的 724 条实时广告,对 Hook、形式、Offer、CTA、用户认知阶段及落地页一致性进行分类,共计产生 8724 次判断。整个过程耗时约 40 秒,Token 成本仅 9 美分,平均每条广告处理时间约 216 毫秒。该案例已被收录进 Jev 社区案例库。

此外,名为 fast-jev-compaction 的 Claude Code 插件也引起了广泛关注。该插件利用 Jev 评估工具调用和终端输出,筛选出与当前任务相关的内容,从而大幅压缩发送给模型上下文的 Token 数量。同时,浏览器 Agent 也成为了 Jev 的热门实验场。通过「读取页面—生成动作—Jev 决策—执行」的循环,一个公开的航班搜索 Demo 仅耗时 7 秒,成本约 0.004 美元。

Jev 受追捧的原因在于它解决了 Agent 开发中的高频决策痛点。无论是点击哪个按钮、调用哪个工具,还是判断信息相关性或任务完成度,这些决策每天可能发生数百万次,延迟和成本直接决定了系统的可行性。TypeSafe 在基准测试中宣称,Jev 在部分任务上实现了高达 193.6 倍的速度提升和 444.6 倍的成本优势。不过,TypeSafe 也指出这些数据处于预期的高端区间,且测试集由自家团队制作,仅供参考。

Jev 的命名蕴含了 TypeSafe 的野心。「System One」源自丹尼尔·卡尼曼《思考,快与慢》中的系统 1 概念,代表快速直觉的判断;「Jev」则取自经济学家威廉·斯坦利·杰文斯。TypeSafe 借用「杰文斯悖论」的隐喻:当资源利用效率大幅提升时,其总消耗量反而可能激增。在 AI 领域,这意味着当智能判断的成本和延迟降低几个数量级后,开发者便会在以前无法承受的场景中大量使用 AI。从一条日志的重要性到 Agent 的验收,这些微小的判断汇聚起来,将成为下一代 Agent 系统庞大的算力消耗。

目前 Jev 处于早期访问阶段,围绕它的浏览器、代码 Agent、广告分析等社区实验才刚刚起步。但它提出的一个问题引人深思:未来的 AI 应用中,真正消耗最多智能算力的,或许是隐藏在软件流程中成千上万个微小的「智能 if 语句」。而 Jev 正在试图成为这些判断背后的基础设施。大家尝试过 Jev 吗?感觉如何?

最新快讯

2026年09月20日

14:27
就在今天,整个硅谷都被Jev刷屏了!发布仅三天,它就被Vercel、Cloudflare和LangChain等主流平台迅速集成,有人说,我们即将迎来自动化智能的大爆发!而这场狂欢的主角,竟然是一个不会说话的大模型。9月16日,ChatGPT核心发明人之一、InstructGPT论文第四作者Diogo Almeida连发长推,直接向行业开炮,...
14:27
就在刚刚,全球顶级AI数学基准测试 FrontierMath 迎来里程碑时刻。一道自2017年以来悬而未决的“重大进展”级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克!更令人惊讶的是,这道题原本是悬赏寻找一个“反例”,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例压根就不存在!不仅如此,AI 还顺手发明了一套全新的“投...
14:26
2026世界制造业大会于9月20日在安徽合肥隆重开幕。工业和信息化部副部长辛国斌在致辞中强调,工信部将坚定不移地把新一代智能制造作为主攻方向,全面提升制造业的创新力、竞争力和综合实力,致力塑造中国制造的新优势。具体举措包括: 一是提升产业创新体系的效能。聚焦原始创新与关键核心技术攻关,强化企业在科技创新中的主体地位,优化产业创新平台的布局,加速推动科技创新成...
13:56
9月20日,上纬新材旗下的消费级具身智能品牌启元机器人宣布与腾讯WorkBuddy达成战略合作。启元Q1与T1两款机器人正式接入WorkBuddy平台,能够直接调用其中上万种Skill。这一合作将AI的理解与推理能力与机器人的语音及运动能力深度融合,构建起从“听懂指令”到“思考行动”再到“反馈结果”的完整智能交互闭环。 以往,机器人往往只能执行单一的预设动作...
13:56
Claude Code终于不再固执己见。就在刚刚,Claude Code团队核心工程师Thariq在社交媒体上发帖,短短一小时浏览量便突破百万。自2.1.277版本上线以来,如果项目文件夹中缺少CLAUDE.md,Claude会自动寻找并读取AGENTS.md。这一改动在GitHub的更新日志首行便已明确记录。 这条更新,开发者们已经苦苦等待了一年多。在Gi...
13:56
大模型做数学题做到「颅内高潮」,你见过吗?在大多数人的印象里,AI解题总是四平八稳、逻辑严密。即便是当前顶尖的推理模型,其思维链也无非是一段段机械的自语:第一步,设 x 为未知数;第二步,将两边同时平方……但今天这款谷歌大模型,彻底颠覆了人类对 AI 的认知。 近日,知名科技博主与爆料人 Lyra 在社交平台上晒出了数张谷歌内部评测模型的卡片截图。截图中,一...
13:55
鼓狮财经9月20日讯瑞银目前预计,2026年人工智能资本开支将接近1万亿美元,2027年进一步攀升至约1.4万亿美元,而这一增长背后的最主要原因是内存成本大幅上涨。 全球AI资本开支还将继续飙升 瑞银最新测算结果显示,今年全球AI资本开支总额为9980亿美元,几乎是2025年5060亿美元的两倍;预计明年支出将继续增长至1.447万亿美元,同比增幅达到约44...
13:34
据鼓狮财经9月20日消息,诺和诺德股东正敦促公司通过并购扩大产品组合,以降低利润对糖尿病药物Ozempic的依赖。Flossbach股东分析师Eugen Uretzki指出,诺和诺德现有资产的开发潜力“仍有待验证”。Baillie Gifford投资经理Julia Angeles则表示,公司需要阐明如何摆脱对Ozempic的单一依赖,可能的转型路径包括寻求合...
12:47
“回流药”是指通过医保报销渠道购得的药品,被药贩子低价回收后,再次非法转售至市场的药品。在网络售药平台上,不少售价远低于实体店的药品,实则暗藏“回流药”的风险。 广州医保部门依托“药品追溯码”大数据模型实施预警,对可疑人员的就医轨迹进行深入研判。经过缜密的摸排与连续蹲守,医保部门联合公安机关开展专项行动,成功打掉一个非法收药倒药的犯罪团伙。在查获的仓库内,执...
12:14
过去十年,医疗影像AI行业的叙事主要聚焦于算法能力,如肺结节识别、骨折检测等,各家比拼单病种辅助诊断的准确率和注册证数量。然而,进入2026年,行业竞争维度已发生根本转变。数据开始向云端迁移,接入医保网络,并在跨院调阅和检查互认的真实业务场景中发挥作用。AI影像的价值不再局限于“辅助医生看片”,而是开始重塑医疗数据的流通方式与定价机制。当行业仍在争论算法如何...