据《财经》报道,DeepSeek已重启第二轮融资,计划募资500亿元,投前估值约5000亿元,预计8月下旬完成签约。今年6月,DeepSeek刚刚完成首轮500亿元融资,创下国内大模型首轮融资规模纪录,投后估值超过3500亿元。仅时隔两个月,其投前估值便攀升约43%,两轮募资完成后累计金额将超千亿元。估值狂飙的背后,是DeepSeek正在改写行业规则的计费逻辑。权威模型测试媒体Artificial Analysis发布了一组实测数据,结果显示,DeepSeek V4-Flash 完成整套基准测试,平均每次任务成本仅需3美分。这一数据乍看平平,但将其与主流模型对比,差距便十分惊人。在同一基准下,Anthropic的旗舰模型Claude Opus 5平均成本为3.15美元,GPT-5.6约为1.86美元,DeepSeek的成本比Claude便宜了整整100倍。此外,DeepSeek V4-Flash 还具备极快的速度。实测数据显示,其输出速度约为113 tokens/秒,而Claude Opus 5仅为74 tokens/秒,约为1.5倍。这意味着当DeepSeek完成测试时,Claude才刚跑完一半。
然而,这种极致的性价比与效率并非毫无代价。Artificial Analysis的数据显示,V4-Flash在智能指数上得分为50分,与谷歌Gemini 3.6 Flash持平,仅落后旗舰模型约10分(Claude Opus 5为61分,Fable 5为60分)。也就是说,DeepSeek以100倍的价格优势、2倍的速度提升,换取了不到20%的性能损失。对于采购模型API的企业而言,这笔账需要重新计算。
01、过去几年,大模型行业的定价方式简单粗暴,即按Token数量收费。输入和输出每百万Token多少钱,用户就支付多少钱。这种算法比的是“原材料价格”,而非“成品价格”。就像去饭店吃饭,菜单上写着“大米5块钱一斤”,但用户只在乎“一碗米饭多少钱”。Token相当于大米,任务是米饭,而蒸米饭的工艺会直接影响最终价格。DeepSeek V4-Flash的官方定价为每百万输入Token 0.14美元,输出Token 0.28美元(人民币定价为输入缓存未命中每百万1元,命中每百万0.02元,输出每百万2元),这一价格本身已是行业第一梯队。但Token单价低不代表任务成本低,如果模型生成更多Token才能完成任务,便宜的Token单价可能换来昂贵的账单。Artificial Analysis所做的,正是将这层“翻译”工作完成。他们比的是“跑完同一套基准测试的花费”,即“每次任务成本”(Cost per Task),将Token用量、推理深度、缓存命中率、思考时间等变量揉合在一起,直接给出一个干完一件事到底要花多少钱的明确答案。
那么,DeepSeek凭什么能实现如此低成本?V4-Flash模型总参数达2840亿,但每次推理激活的仅130亿,不到总参数量的5%。此外,V4在注意力机制上进行了重大改进,设计了CSA(压缩稀疏注意力)和HCA(重度压缩注意力)交替排列的混合架构。这两套机制模拟了人类“近清楚、远模糊”的记忆规律:最近发生的事细节清晰,几天前的事只记得大概,几个月前的事仅留印象。CSA和HCA通过这种机制,随着上下文增长,保留重要信息,抹去不重要的,使得V4 Flash在百万token上下文下,单Token计算量仅为V3.2的10%,KV缓存仅需7%,且上下文越长优势越明显。
架构优化只是故事的一半。V4-Flash从预览版到正式版进行了“原地升级”,参数未变,核心区别在于后训练。DeepSeek采用了一套独特的两阶段后训练方法。第一阶段叫“分科培养”,数学、代码、Agent、指令跟随等领域各自单独训练专家模型,利用GRPO强化学习反复打磨。GRPO是DeepSeek团队在DeepSeekMath论文中提出的概念,相比传统PPO算法,它省去了价值函数模型的训练,既省显存又省算力,效果更佳。第二阶段叫“融会贯通”,利用On-Policy Distillation(在线策略蒸馏)将多个专家模型的能力合并。不同于传统先让高性能模型生成答案再让低性能模型学习,在线策略蒸馏是“学生先做题,老师边看边指导”。学生根据老师的反馈当场调整思路,边做边学。这种“在线”且基于“策略”的学习方式,使得DeepSeek V4-Flash在Terminal Bench 2.1测试中从61.8分飙升至82.7分,在9项Agent基准测试上全面碾压自家旗舰Pro预览版。
02、100倍的价差很可能改变企业对模型API的采购逻辑。过去企业选模型就像选供应商,比参数、跑分、价格,最后选一个“综合最优”的。这种思路的前提是模型价格差距不大。但在“每次任务成本”出现后,前提被颠覆。假设一家企业每天处理100万次API调用,用Claude每天成本为31500美元,用DeepSeek仅需300美元,一年下来差距达1130万美元。这对企业来说是生死攸关的问题。因此,企业的核心命题不再是“用哪家模型”,而是“怎么把任务分到最合适的模型上”,即模型路由(Model Routing)。模型路由的逻辑是:将高价值、高失败成本的复杂任务交给Claude Opus 5或GPT-5.6等旗舰模型(如架构设计、金融分析、法律审查),而将批量分类、代码初筛、数据清洗等“苦力活”交给DeepSeek,因为前者占据运营任务的80%。LMSYS团队在RouteLLM研究中发现,智能路由可在保持GPT-4 95%质量的前提下削减85%的成本。
路由策略决定了AI成本。粗糙的策略可能80%的任务都打到了旗舰模型上;精细的策略可能只有20%的任务需要旗舰模型,其余80%分流至高性价比模型。路由策略从低级到高级可分为:静态规则(如客服部门用便宜模型)、分类器(训练小模型判断任务难度)、以及“先试后升”(先用DeepSeek试,失败再升级)。这种策略下,即使DeepSeek失败率极低,综合成本也远低于直接使用昂贵模型。闭源厂商的日子将越来越难过。它们必须深耕更难、更复杂的任务,因为中间档位的模型既打不过旗舰,又打不过DeepSeek的价格。
03、Artificial Analysis制作了一张图,将所有主流模型置于“每次任务成本”与“智能指数”的坐标系中。虚线代表DeepSeek V4-Flash正式版的性价比斩杀线,任何处于虚线内的模型,都无法在DeepSeek可实现的任务中实现更低价格。此前以GPT-4o、Claude Sonnet等为基准的模型,斩杀线较低,但DeepSeek V4-Flash的推出将斩杀线抬高到了一个极高位置,全球近70%的模型处于被斩杀区域。另一边,V4-Pro正式版结合Harness框架,预计将进一步扩大斩杀范围,包括低推理强度的Fable 5和GPT-5.6在内,全球90%的模型在性价比上都面临被DeepSeek“满血斩杀”的命运。
DeepSeek还握有一张王牌——Harness。这是一个深度绑定V4系列模型的Agent运行时框架,类似于OpenAI的Codex和Anthropic的Claude Code,旨在减少Agent任务中的弯路和Token浪费。Harness能优化上下文组织、工具调用处理、任务规划及长会话压缩。DeepSeek已表示Harness将与V4-Pro正式版同步上线,届时同样的模型在相同任务上可能表现更高的成功率和更少的Token浪费。这意味着,随着V4-Pro性能提升和Harness框架的完善,斩杀线可能进一步上移。市场的终局正在收敛成一根“哑铃”:一端是少数几个能力最强的旗舰模型,卖的是极限智能;另一端是DeepSeek,把自己当AI基础设施来卖。中间那些既不够强又不够便宜的产品,终将成为这场价格战中被淘汰的牺牲品。
