7 月 31 日午后,凤凰网科技查询 DeepSeek 官网发现,DeepSeek-V4-Flash 正式版 API 已上线公测。与以往“Pro 强、Flash 弱”的分层逻辑不同,此次更新释放出一个重要信号:Flash 正式版在多项 Agent 基准测试中的表现,已逼近甚至超越了三个月前的 V4-Pro 预览版。

官方更新日志显示,V4-Flash 正式版在 Terminal Bench 2.1 上取得 82.7 分,NL2Repo 得分 54.2 分,Cybergym 得分 76.7 分,Toolathlon verified 得分 70.3 分。相比之下,三个月前的 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。虽然测试集版本不同,直接对比尚不完全公平,但这一成绩已极具说服力。一个激活参数仅 130 亿的轻量版,能在 Agent 能力上跑出如此分数,足以说明后训练阶段的优化空间,可能比单纯堆砌参数更具杠杆效应。此外,DeepSeek 也特别说明,目前公测仅限 API,App 和网页端暂无法体验最新能力,V4-Pro 正式版将尽快发布。

01 仅重新进行了后训练

DeepSeek 官方在更新日志中明确表示,DeepSeek-V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 保持一致,仅对后训练阶段进行了优化。根据官方技术报告,V4-Flash 总参数为 2840 亿,激活参数 130 亿;V4-Pro 总参数则高达 1.6 万亿,激活参数 490 亿。两者在规模上相差一个数量级。若 Flash 能通过后训练将 Agent 能力提升至接近 Pro 的水平,这意味着在特定任务上,模型规模不再是决定性因素,训练方法和数据质量的重要性正日益凸显。

官方还特别指出,本次基准测试中的 Code Agent 任务采用了 DeepSeek Harness 极简模式。这个细节暗示,DeepSeek 可能在 Agent 框架层面进行了针对性优化,而非仅限于模型本身提升。这也是 DeepSeek 自研 Harness 首次以正式名称亮相。此前,梁文锋曾将 AGI 的实现路径比作爬楼梯:语言模型是第一级,去年解决了 CoT(思维链),今年的台阶是 Agent,而 Agent 之后必须解决的是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。“AI 现在不缺品位和直觉,它缺的是持续学习的能力,”他说,“投资人看 Agent,我们看怎么解决学习。”

持续学习虽是模型命题,但其工程落点却在 Harness 上。DeepSeek 的 Agent Harness 团队组建于今年 3 月,由崔添翼挂帅。这位浙大计算机毕业的 90 后手握 6 枚 ACM 亚洲区域赛金牌,曾在 Jane Street 任职九年,今年 3 月加入 DeepSeek 后迅速扩充团队。据悉,Harness 规划在 V4 正式版上线时同步推出。

02 生态层面的一次正面交锋

若说 2023 年的大模型竞争是“拼通用能力”,2024 年是“拼长上下文”,那么 2026 年的关键词无疑是 Agent。Agent 能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。从 Terminal Bench、NL2Repo 到 Cybergym、SWE-bench,一系列 Agent 基准测试正在重新定义好模型的标准。

从全球范围看,Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也在快速追赶。DeepSeek 此次大幅提升 Flash 的 Agent 能力,战略意图十分清晰:利用高性价比的轻量模型切入 Agent 应用的庞大市场。毕竟,Agent 场景对推理速度和成本极为敏感,一个需要反复调用工具、多轮推理的任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。若 Flash 能在 Agent 能力上达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。

官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)得分 59.6。这从侧面印证了 DeepSeek 的定位——把 Flash 打造成开发者和 Agent 应用的首选底座。

一场生态暗战也在悄然打响。正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。Responses API 是 OpenAI 力推的新一代 API 格式,相比传统的 Chat Completions,它更适合 Agent 场景——支持更灵活的工具调用、更复杂的多轮交互以及更精细的输出控制。DeepSeek 原生支持这一格式,意味着开发者可以更低成本地将基于 OpenAI 生态开发的 Agent 应用迁移到 DeepSeek 上。这将是二者在生态层面的一次正面交锋。对 Codex 的适配,则瞄准了代码生成与软件开发这一垂直场景。DeepSeek 针对性适配 Codex,等于直接在 OpenAI 的传统优势领域发起挑战。这些动作放在一起看,DeepSeek 的野心不止于做一个“便宜的替代品”,而是要在 Agent 时代建立自己的生态位。

03 500 亿融资之后:高估值下的时间窗口

此次更新,距离 DeepSeek 完成首轮外部融资不到两个月。一个多月前,DeepSeek 完成了成立近三年来的首轮外部融资,总额超 500 亿元人民币,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元(约合人民币 3500 亿元)。投资方阵容包括腾讯、宁德时代、京东等产业巨头,以及多家国资产业基金。7 月中旬,DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元(折合人民币约 4800 亿元),较首轮融资后的 520 亿美元估值上涨约 37%。

从 520 亿到 710 亿,间隔不足六周。高估值背后是市场对 DeepSeek 技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。据多家媒体报道,DeepSeek 创始人梁文锋本人在首轮融资中出资约 200 亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从“不融资不上市”转向积极拥抱资本,本身就是一个强烈的信号——DeepSeek 正在加速冲向商业化和 IPO。

Flash 正式版的上线,或许可以看作 DeepSeek 在资本加持下的一次技术兑现。但真正的考验还在后面:Pro 正式版能否如期而至?Agent 能力的提升能否转化为实打实的收入?在 OpenAI、Anthropic 等巨头的夹击下,DeepSeek 的高性价比路线将如何发挥优势?Agent 战争的大幕才刚刚拉开。DeepSeek 用一个轻量模型的大幅进化,给行业出了一道新题——当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。

最新快讯

2026年07月31日

17:21
世界纷纷扰扰,AI日新月异,苹果的“老本”依然厚厚的、香香的。北京时间7月31日凌晨,苹果发布截至6月27日的2026财年第三季度财报。公司营收1094.17亿美元,同比增长16%;每股收益2.02美元,同比增长29%,均超过华尔街预期。iPhone收入增长22%,Mac增长29%。大中华区也延续了此前的反弹,收入同比增长22%至188.1...
17:21
作者 | 谢芸子 黄绎达 编辑 | 张帆 开云的转型初见成效。 7月28日,法国开云集团Kering发布2026年上半年财报,实现营收72.2亿欧元,可比口径下同比增长1%。 更关键的信号藏在第二季度——单季营收36.52亿欧元,同比增长2%。在中东局势仍不明朗、全球消费进入下行周期的情况下,开云实现三年来的...
17:21
7月30日,中国互联网的AI牌桌上,两张底牌同时翻开,背后藏着同一个焦虑——AI烧了这么多钱,到底怎么收回来? 上午,字节跳动一封内部邮件,把做了十年的飞书"拆"了:产品团队并入豆包,销售和服务团队并入火山引擎。飞书CEO谢欣向豆包负责人赵祺汇报,独立BU时代正式终结。 同一天,腾讯WorkBuddy发布V5.3.5重大版本更新,...
17:21
引子 北京时间2026年7月30日晚间,美元兑日元汇率剧烈波动。USDJPY从163.741一度下挫至157.938,振幅高达3.67%,随后稳定在160.610附近。面对这一剧烈波动,投资者普遍猜测日本财务省进行了干预。毕竟,日元已创下40年新低,且日本并非首次出手干预。尽管官方尚未明确表态,市场估算本次干预规模约为5万亿日元(约311亿美元)。 虽然通俗...
17:21
昨日收报25.36港元的南方两倍做多海力士(7709.HK)在今早9时20分开盘报29.16港元,涨幅达14.99%。9时30分开盘瞬间,该ETF价格一度飙升306.15%,冲至103港元。交易软件显示,以103港元成交了100股(1手),但股价随即迅速回落至正常水平。这笔以103港元成交的100股是开盘后的第三笔交易。 针对这一异常波动,南方东英资产管理公...
17:21
在广州新济医药递表港交所的同一天,普祺医药也递交了招股书。据鼓狮财经获悉,北京普祺医药科技股份有限公司(简称:普祺医药)于7月24日向港交所递交申请,计划依据18A章规则上市,由中信证券及民银资本担任保荐人。这是该公司继2026年1月首次递表失效后的第二次尝试。此前,普祺医药也曾寻求A股上市,于2025年6月25日向北交所提交申请,并于2025年10月底撤回...
17:21
7月31日,财政部发布2026年1-6月全国国有及国有控股企业经济运行情况。1-6月,全国国有及国有控股企业(以下称国有企业)营业总收入同比下降2.0%,利润总额同比增长2.4%。一、营业总收入。1-6月,国有企业营业总收入402427.0亿元,同比下降2.0%。 二、利润总额。1-6月,国有企业利润总额22475.8亿元,同比增长2.4%。&nb...
17:21
上证指数收涨0.72%,报3832.26点;深证成指涨2.21%,报13578.93点;创业板指表现强劲,大涨3.06%,报3343.96点。两市成交额突破2.5万亿元,较前一交易日大幅放量2014亿元。全市场近4700只个股上涨。盘面上,多模态AI概念股全面爆发,Kimi、ChatGPT及AIGC方向领涨;宇树机器人、CPO(光模块)、存储器、算力租赁及网...
17:17
鼓狮财经7月31日讯,香港特区政府统计处今日发布2026年第二季度本地生产总值(GDP)的预先估计数字。数据显示,香港二季度GDP较去年同期实际增长4.3%,虽较一季度的5.9%增速略有回落,但依然保持强劲扩张态势。特区政府发言人指出,这主要得益于对外贸易的繁荣以及内部需求的坚挺。展望下半年,香港经济预计将继续保持稳健增长。
17:16
鼓狮财经7月31日报道,韩国KOSPI指数周五收盘暴涨18%,不仅大幅扭转了此前三天的下跌颓势,更刷新了单日最大涨幅的历史纪录。根据LSEG的数据显示,历史上KOSPI指数十大单日涨幅中,有五次发生在今年三月以来;而在过去十年中,四大单日跌幅中有三次出现在最近五周内。 KB金融集团全球战略师彼得·S·金指出,股市的“游戏化”特征引发了剧烈震荡,这种波动主要受...
16:38
喜讯传来,OpenAI 刚刚宣布对 GPT-5.6 系列模型进行大幅调价。其中,GPT-5.6 Luna 的价格下调了 80%,输入价格降至每百万 Token 0.20 美元,输出价格降至每百万 Token 1.20 美元。GPT-5.6 Terra 的价格下调 20%,输入价格降至每百万 Token 2 美元,输出价格降至每百万 Token 12 美元。此...