大模型行业的竞争格局正经历深刻变革。随着Agent(智能体)深度融入企业业务流程,模型调用频率呈现指数级增长,算力成本与投入产出比成为核心竞争力。全球头部厂商纷纷采取类似策略:谷歌持续迭代Gemini Flash系列,将3.8 Flash打造为兼顾性能、速度与成本的主力模型。云知声、智谱以及DeepSeek也做出了相同的技术抉择,U2-Flash、GLM 5.3 Flash、DS V4.1 Flash均是这一演进路径的产物。
9月15日,云知声发布新模型U2-Flash,将其定位为面向真实任务的新一代高性能主力模型。该模型总参数约266B,但单次推理仅激活约10B,激活比例不足4%,实现了从“大而全”到“精而强”的转变,升级为能解决实际问题的“主力智能”。对长期深耕产业AI的云知声而言,U2-Flash不仅是U2高智能密度路线的延续,更是撬动高频调用市场、推动收入结构升级的关键一步。
回顾U2奠定的技术底色,今年6月发布的通用基座模型U2跳出了单纯堆叠参数的路径。尽管拥有2600亿参数规模,其性能却达到了主流万亿级模型水平,Token成本更是降至稠密模型的十分之一。U2贯彻了云知声的核心价值主张:AI公司行业价值等于智能密度乘以Token价值。凭借更少的激活资源承载更强的能力,U2在长上下文理解、知识推理、指令遵循及复杂任务处理等主流评测中跻身全球第一梯队,验证了高智能密度的竞争力。
然而,随着Agent落地进入深水区,新的矛盾凸显:Token消耗不再是“对话量”的线性增长,而是“任务复杂度乘以执行时长”的指数级攀升。一个典型项目的Token消耗量可达百万级,比普通对话高出三个数量级。因此,如何让复杂任务“用得起、用得频”,成为大模型规模化落地的关键卡点,U2-Flash正是针对这一卡点给出的解决方案。
作为基于U2强化训练的产物,U2-Flash在推理、Agent执行及复杂任务能力上实现了全面升级,同时大幅提升了响应速度并降低了调用成本。在能力方面,其覆盖了工程代码、终端任务、办公处理、知识推理等核心环节。公开数据显示,SWE-Bench Pro得分61.6,较前代提升10.5分;DeepSWE v1.1得分64.6,较前代U2的32分翻倍;TerminalBench 3.0得分24.3,较前代2.7分显著提升;在WorkBuddy-Bench办公场景评测中,得分81,高于DeepSeek V4 Flash、DeepSeek V4 Pro和GLM 5.2。在速度方面,模型首字响应时间平均控制在3秒以内,峰值输出速度达300 Tokens/s;对比U2,U2-Flash在Agent任务执行中减少了20%至30%的迭代步数,任务执行周期缩短35%。
从行业视角看,U2-Flash在“能力-成本”曲线上确立了更优坐标:以远低于同能力级模型的Token消耗,维持第一梯队的复杂任务执行能力。其商业价值不在于追求“绝对最强”,而在于成为“最具性价比的强”。更重要的是,U2-Flash将重构Token生态的供需格局。需求端,模型具备高频调用的经济基础,成为可规模化落地的智能基础设施;供给端,U2-Flash围绕主流国产算力平台完成全栈适配,软硬件协同调优后,国产平台的吞吐、时延、并发与集群扩展能力持续提升,与主流GPU的差距不断缩小,部分场景甚至接近NVIDIA表现。单卡提效与多元算力接入共同释放供给弹性,为高频调用时代筑牢了产能底座。
技术进化最终需回答核心商业命题:能否转化为收入结构的质变。过去两年,中国市场日均Token调用量暴增超千倍,但公有云MaaS(模型及服务)营收仅停留在30亿元量级,需求尚未完全转化为账面收入。云知声的Token业务则实现了爆发式增长:上半年收入近3000万元,同比激增760%,二季度环比增长超500%,毛利率超过60%。这是公司增长最快的板块,尽管占总营收比重仅约5%,但上半年客户复购收入占比超过60%,客单价显著提升。这表明云知声“强基模”能力已有效传导至应用层,模型被越来越多客户高频调用,真正进入核心工作流并形成粘性,Token商业模式的价值潜力加速兑现。U2-Flash的推出有望进一步推动Token业务放量。
U2-Flash更深层的差异化壁垒,在于云知声长期坚持的产业深耕路线,与Palantir异曲同工。模型能力再强,也需要扎根业务逻辑做分析推理;缺乏场景深度理解,输出的结论往往水土不服。Palantir的AIP(人工智能平台)成功核心在于构建认知框架、提供语义支撑并确保逻辑一致性,带来了业绩爆发。云知声在医疗、保险、交通、工业等场景十余年的落地积累,沉淀了深厚的行业know-how。这让U2-Flash从诞生起就不是悬浮的技术标杆,而是扎根真实场景的生产力工具。这种“从业务中来,到业务中去”的模型,进入企业可直接创造价值,更容易形成高留存、高复购的客户关系。
这带来的不仅是收入增长,更是公司估值逻辑的重构。Token业务本质上是平台型收入——按量计费、可复用、高毛利,客户的AI使用强度直接决定收入弹性。随着U2-Flash带动高频调用持续放量,云知声的收入结构将逐步从“一次性项目交付”转向“持续性调用收费”,估值锚点也自然向平台型AI公司迁移。
中国大模型在调用量上的优势能否转化为收入红利,核心取决于计价方式向Token迁移的速度以及垂直场景的变现能力。从这个意义上说,谁能把智能的使用门槛降到足够低、让更多场景实现高频调用,谁就能吃到规模化落地的红利。U2-Flash的发布,是云知声在这条路上的关键跃升——它将U2验证过的高智能密度优势,转化为面向高频调用的商业化动能,推动收入结构加速向持续调用服务升级。云知声的技术底子已经夯实,接下来的核心看点,是Token业务增长能否延续上半年的陡峭斜率。这既是云知声自身价值重估的试金石,也是观察中国大模型厂商差异化突围的重要样本。
