7 月 31 日午后,凤凰网科技查询 DeepSeek 官网发现,DeepSeek-V4-Flash 正式版 API 已上线公测。与以往“Pro 强、Flash 弱”的分层逻辑不同,此次更新释放出一个重要信号:Flash 正式版在多项 Agent 基准测试中的表现,已逼近甚至超越了三个月前的 V4-Pro 预览版。
官方更新日志显示,V4-Flash 正式版在 Terminal Bench 2.1 上取得 82.7 分,NL2Repo 得分 54.2 分,Cybergym 得分 76.7 分,Toolathlon verified 得分 70.3 分。相比之下,三个月前的 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。虽然测试集版本不同,直接对比尚不完全公平,但这一成绩已极具说服力。一个激活参数仅 130 亿的轻量版,能在 Agent 能力上跑出如此分数,足以说明后训练阶段的优化空间,可能比单纯堆砌参数更具杠杆效应。此外,DeepSeek 也特别说明,目前公测仅限 API,App 和网页端暂无法体验最新能力,V4-Pro 正式版将尽快发布。
01 仅重新进行了后训练
DeepSeek 官方在更新日志中明确表示,DeepSeek-V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 保持一致,仅对后训练阶段进行了优化。根据官方技术报告,V4-Flash 总参数为 2840 亿,激活参数 130 亿;V4-Pro 总参数则高达 1.6 万亿,激活参数 490 亿。两者在规模上相差一个数量级。若 Flash 能通过后训练将 Agent 能力提升至接近 Pro 的水平,这意味着在特定任务上,模型规模不再是决定性因素,训练方法和数据质量的重要性正日益凸显。
官方还特别指出,本次基准测试中的 Code Agent 任务采用了 DeepSeek Harness 极简模式。这个细节暗示,DeepSeek 可能在 Agent 框架层面进行了针对性优化,而非仅限于模型本身提升。这也是 DeepSeek 自研 Harness 首次以正式名称亮相。此前,梁文锋曾将 AGI 的实现路径比作爬楼梯:语言模型是第一级,去年解决了 CoT(思维链),今年的台阶是 Agent,而 Agent 之后必须解决的是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。“AI 现在不缺品位和直觉,它缺的是持续学习的能力,”他说,“投资人看 Agent,我们看怎么解决学习。”
持续学习虽是模型命题,但其工程落点却在 Harness 上。DeepSeek 的 Agent Harness 团队组建于今年 3 月,由崔添翼挂帅。这位浙大计算机毕业的 90 后手握 6 枚 ACM 亚洲区域赛金牌,曾在 Jane Street 任职九年,今年 3 月加入 DeepSeek 后迅速扩充团队。据悉,Harness 规划在 V4 正式版上线时同步推出。
02 生态层面的一次正面交锋
若说 2023 年的大模型竞争是“拼通用能力”,2024 年是“拼长上下文”,那么 2026 年的关键词无疑是 Agent。Agent 能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。从 Terminal Bench、NL2Repo 到 Cybergym、SWE-bench,一系列 Agent 基准测试正在重新定义好模型的标准。
从全球范围看,Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也在快速追赶。DeepSeek 此次大幅提升 Flash 的 Agent 能力,战略意图十分清晰:利用高性价比的轻量模型切入 Agent 应用的庞大市场。毕竟,Agent 场景对推理速度和成本极为敏感,一个需要反复调用工具、多轮推理的任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。若 Flash 能在 Agent 能力上达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。
官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)得分 59.6。这从侧面印证了 DeepSeek 的定位——把 Flash 打造成开发者和 Agent 应用的首选底座。
一场生态暗战也在悄然打响。正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。Responses API 是 OpenAI 力推的新一代 API 格式,相比传统的 Chat Completions,它更适合 Agent 场景——支持更灵活的工具调用、更复杂的多轮交互以及更精细的输出控制。DeepSeek 原生支持这一格式,意味着开发者可以更低成本地将基于 OpenAI 生态开发的 Agent 应用迁移到 DeepSeek 上。这将是二者在生态层面的一次正面交锋。对 Codex 的适配,则瞄准了代码生成与软件开发这一垂直场景。DeepSeek 针对性适配 Codex,等于直接在 OpenAI 的传统优势领域发起挑战。这些动作放在一起看,DeepSeek 的野心不止于做一个“便宜的替代品”,而是要在 Agent 时代建立自己的生态位。
03 500 亿融资之后:高估值下的时间窗口
此次更新,距离 DeepSeek 完成首轮外部融资不到两个月。一个多月前,DeepSeek 完成了成立近三年来的首轮外部融资,总额超 500 亿元人民币,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元(约合人民币 3500 亿元)。投资方阵容包括腾讯、宁德时代、京东等产业巨头,以及多家国资产业基金。7 月中旬,DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元(折合人民币约 4800 亿元),较首轮融资后的 520 亿美元估值上涨约 37%。
从 520 亿到 710 亿,间隔不足六周。高估值背后是市场对 DeepSeek 技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。据多家媒体报道,DeepSeek 创始人梁文锋本人在首轮融资中出资约 200 亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从“不融资不上市”转向积极拥抱资本,本身就是一个强烈的信号——DeepSeek 正在加速冲向商业化和 IPO。
Flash 正式版的上线,或许可以看作 DeepSeek 在资本加持下的一次技术兑现。但真正的考验还在后面:Pro 正式版能否如期而至?Agent 能力的提升能否转化为实打实的收入?在 OpenAI、Anthropic 等巨头的夹击下,DeepSeek 的高性价比路线将如何发挥优势?Agent 战争的大幕才刚刚拉开。DeepSeek 用一个轻量模型的大幅进化,给行业出了一道新题——当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。
