**DeepSeek-V4-Flash API 正式上线:轻量模型在 Agent 基准测试中逼近 Pro 版本**
7 月 31 日午后,凤凰网科技监测到 DeepSeek 官网已正式上线 V4-Flash 版本的 API 公测。此次更新释放了一个强烈信号:在多项 Agent 基准测试中,V4-Flash 的表现已逼近甚至超越了三个月前的 V4-Pro 预览版,打破了以往“Pro 强、Flash 弱”的刻板印象。
根据官方更新日志,V4-Flash 正式版在 Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 得分 54.2,Cybergym 得 76.7,Toolathlon verified 得 70.3。相比之下,V4-Pro 预览版在 Terminal Bench 2.0 上的得分仅为 67.9。尽管测试集版本存在差异,但这组数据足以证明:在激活参数仅 130 亿的轻量级模型上取得如此成绩,后训练阶段的优化潜力远超单纯堆砌参数。
目前,V4-Flash 的公测仅开放给 API 用户,网页端和 App 暂未同步更新,V4-Pro 正式版预计将随后发布。官方明确指出,本次更新的核心在于“仅重新进行了后训练”,模型结构与预览版保持一致。DeepSeek-V4-Flash 总参数为 2840 亿,激活参数 130 亿;而 V4-Pro 总参数高达 1.6 万亿,激活参数 490 亿。两者规模相差一个数量级。Flash 能在 Agent 能力上追平 Pro,说明对于特定任务,训练方法和数据质量的权重正在上升。
值得注意的是,测试中采用了 DeepSeek 自研的 Harness 极简模式,这一细节暗示了 DeepSeek 不仅在模型本身,更在 Agent 框架层面进行了针对性优化。这也是 DeepSeek Harness 首次以正式名称亮相。梁文锋曾将 AGI 比作爬楼梯:语言模型是第一级,去年攻克了 CoT,今年迈入 Agent,未来则是持续学习——让模型像人一样积累经验,而非依赖完整上下文。实现这一目标的关键工程工具,正是 Harness。
Harness 团队由崔添翼挂帅,他是一位 90 后,毕业于浙江大学,手握 6 枚 ACM 亚洲区域赛金牌,曾在 Jane Street 担任九年量化交易员,今年 3 月加入 DeepSeek 后迅速扩充团队。据悉,Harness 的规划与 V4 正式版同步推出。
**Agent 战略与生态布局**
如果说 2023 年的竞争是拼通用能力,2024 年是拼长上下文,那么 2026 年的关键词无疑是 Agent。从 Terminal Bench 到 SWE-bench,Agent 能力正成为衡量模型实力的新标尺。目前全球第一梯队仍由 GPT-5.6 Sol、Claude Opus 等闭源巨头把持,国产模型如 GLM、Qwen 正在快速追赶。
DeepSeek 此次大幅拉升 V4-Flash 的 Agent 能力,战略意图十分明确:利用高性价比的轻量模型切入庞大的 Agent 市场。Agent 场景对推理速度和成本极度敏感,如果 Flash 能达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。官方内部测试集显示,DSBench-FullStack 得分 68.7,DSBench-Hard 得分 59.6,这印证了 DeepSeek 将其打造为开发者首选底座的定位。
在生态层面,DeepSeek 发起了一场正面交锋。V4-Flash 原生支持 OpenAI 推力的 Responses API 格式,相比传统的 Chat Completions,它更适配 Agent 场景,支持灵活的工具调用和多轮交互。同时,针对 Codex 的适配,则直接挑战了 OpenAI 在代码生成领域的传统优势。DeepSeek 的野心不仅在于做一个“便宜的替代品”,更要在 Agent 时代建立自己的生态位。
**融资背景与未来展望**
此次更新距离 DeepSeek 完成首轮外部融资不到两个月。约一个月前,DeepSeek 完成了近三年来的首轮融资,总额超 500 亿元人民币,创下行业纪录,投后估值约 520 亿美元,投资方包括腾讯、宁德时代、京东等产业巨头及国资基金。
7 月中旬,DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元,较首轮融资后上涨约 37%。从 520 亿到 710 亿,仅隔六周。高估值背后是市场对其技术实力和商业前景的押注。创始人梁文锋在首轮融资中出资约 200 亿元,牢牢掌握控制权。从“不融资不上市”转向积极拥抱资本,标志着 DeepSeek 正加速冲向商业化和 IPO。
V4-Flash 的上线是 DeepSeek 在资本加持下的一次技术兑现。但真正的考验还在后面:Pro 版本能否如期而至?Agent 能力能否转化为收入?在巨头夹击下,DeepSeek 如何发挥高性价比优势?Agent 战争的大幕才刚刚拉开,DeepSeek 用一个轻量模型的进化,给行业出了一道新题:当后训练红利被挖掘,效率提升抵消参数差距,大模型竞争逻辑可能将被重写。
