7 月 31 日午后,凤凰网科技查询 DeepSeek 官网发现,DeepSeek-V4-Flash 正式版 API 已上线公测。与以往“Pro 强、Flash 弱”的分层逻辑不同,此次更新释放出一个重要信号:Flash 正式版在多项 Agent 基准测试中的表现,已逼近甚至超越了三个月前的 V4-Pro 预览版。

官方更新日志显示,V4-Flash 正式版在 Terminal Bench 2.1 上取得 82.7 分,NL2Repo 得分 54.2 分,Cybergym 得分 76.7 分,Toolathlon verified 得分 70.3 分。相比之下,三个月前的 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。虽然测试集版本不同,直接对比尚不完全公平,但这一成绩已极具说服力。一个激活参数仅 130 亿的轻量版,能在 Agent 能力上跑出如此分数,足以说明后训练阶段的优化空间,可能比单纯堆砌参数更具杠杆效应。此外,DeepSeek 也特别说明,目前公测仅限 API,App 和网页端暂无法体验最新能力,V4-Pro 正式版将尽快发布。

01 仅重新进行了后训练

DeepSeek 官方在更新日志中明确表示,DeepSeek-V4-Flash-0731 的模型结构、尺寸与 V4-Flash-preview 保持一致,仅对后训练阶段进行了优化。根据官方技术报告,V4-Flash 总参数为 2840 亿,激活参数 130 亿;V4-Pro 总参数则高达 1.6 万亿,激活参数 490 亿。两者在规模上相差一个数量级。若 Flash 能通过后训练将 Agent 能力提升至接近 Pro 的水平,这意味着在特定任务上,模型规模不再是决定性因素,训练方法和数据质量的重要性正日益凸显。

官方还特别指出,本次基准测试中的 Code Agent 任务采用了 DeepSeek Harness 极简模式。这个细节暗示,DeepSeek 可能在 Agent 框架层面进行了针对性优化,而非仅限于模型本身提升。这也是 DeepSeek 自研 Harness 首次以正式名称亮相。此前,梁文锋曾将 AGI 的实现路径比作爬楼梯:语言模型是第一级,去年解决了 CoT(思维链),今年的台阶是 Agent,而 Agent 之后必须解决的是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。“AI 现在不缺品位和直觉,它缺的是持续学习的能力,”他说,“投资人看 Agent,我们看怎么解决学习。”

持续学习虽是模型命题,但其工程落点却在 Harness 上。DeepSeek 的 Agent Harness 团队组建于今年 3 月,由崔添翼挂帅。这位浙大计算机毕业的 90 后手握 6 枚 ACM 亚洲区域赛金牌,曾在 Jane Street 任职九年,今年 3 月加入 DeepSeek 后迅速扩充团队。据悉,Harness 规划在 V4 正式版上线时同步推出。

02 生态层面的一次正面交锋

若说 2023 年的大模型竞争是“拼通用能力”,2024 年是“拼长上下文”,那么 2026 年的关键词无疑是 Agent。Agent 能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。从 Terminal Bench、NL2Repo 到 Cybergym、SWE-bench,一系列 Agent 基准测试正在重新定义好模型的标准。

从全球范围看,Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也在快速追赶。DeepSeek 此次大幅提升 Flash 的 Agent 能力,战略意图十分清晰:利用高性价比的轻量模型切入 Agent 应用的庞大市场。毕竟,Agent 场景对推理速度和成本极为敏感,一个需要反复调用工具、多轮推理的任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。若 Flash 能在 Agent 能力上达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。

官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)得分 59.6。这从侧面印证了 DeepSeek 的定位——把 Flash 打造成开发者和 Agent 应用的首选底座。

一场生态暗战也在悄然打响。正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。Responses API 是 OpenAI 力推的新一代 API 格式,相比传统的 Chat Completions,它更适合 Agent 场景——支持更灵活的工具调用、更复杂的多轮交互以及更精细的输出控制。DeepSeek 原生支持这一格式,意味着开发者可以更低成本地将基于 OpenAI 生态开发的 Agent 应用迁移到 DeepSeek 上。这将是二者在生态层面的一次正面交锋。对 Codex 的适配,则瞄准了代码生成与软件开发这一垂直场景。DeepSeek 针对性适配 Codex,等于直接在 OpenAI 的传统优势领域发起挑战。这些动作放在一起看,DeepSeek 的野心不止于做一个“便宜的替代品”,而是要在 Agent 时代建立自己的生态位。

03 500 亿融资之后:高估值下的时间窗口

此次更新,距离 DeepSeek 完成首轮外部融资不到两个月。一个多月前,DeepSeek 完成了成立近三年来的首轮外部融资,总额超 500 亿元人民币,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元(约合人民币 3500 亿元)。投资方阵容包括腾讯、宁德时代、京东等产业巨头,以及多家国资产业基金。7 月中旬,DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元(折合人民币约 4800 亿元),较首轮融资后的 520 亿美元估值上涨约 37%。

从 520 亿到 710 亿,间隔不足六周。高估值背后是市场对 DeepSeek 技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。据多家媒体报道,DeepSeek 创始人梁文锋本人在首轮融资中出资约 200 亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从“不融资不上市”转向积极拥抱资本,本身就是一个强烈的信号——DeepSeek 正在加速冲向商业化和 IPO。

Flash 正式版的上线,或许可以看作 DeepSeek 在资本加持下的一次技术兑现。但真正的考验还在后面:Pro 正式版能否如期而至?Agent 能力的提升能否转化为实打实的收入?在 OpenAI、Anthropic 等巨头的夹击下,DeepSeek 的高性价比路线将如何发挥优势?Agent 战争的大幕才刚刚拉开。DeepSeek 用一个轻量模型的大幅进化,给行业出了一道新题——当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。

最新快讯

2026年07月31日

16:38
首 个模型Inkling亮相之后,全新AI又刷屏了!今天,Thinking Machines正式发布第二款重磅模型——Inkling-Small。276B总参数、12B激活参数,原生多模态,100万token上下文半个月前,首 个开源975B Inkling登场,曾在AI圈掀起了巨浪。Inkling-Small仅用四分之一体量,直接实现了对...
16:38
喜大普奔!刚刚,OpenAI 宣布大幅降低 GPT-5.6 的价格!GPT-5.6 Luna 的价格将下调 80%,输入价格降至每百万 Token 0.20 美元,输出价格降至每百万 Token 1.20 美元。GPT-5.6 Terra 的价格将下调 20%,输入价格降至每百万 Token 2 美元,输出价格降至每百万 Token 12 ...
16:38
自打Kimi K3开源后,“部署大模型”突然成了网上热议的话题。 全球性能第三,免费下载。这谁看了能不心动? 可是根据网上流传最广的说法,想要自己搞定K3,大约需要3000万人民币来买设备。毕竟K3总参数2.8万亿,光是权重文件就达到了1.4TB到1.5TB,实际需要显存更是超过2TB。 因此,Kimi官方给出的建议是...
16:38
日前,Science 杂志刊登了一篇新闻文章,标题是“AI 领域的顶尖初创企业几乎不发表研究成果”(AI’s top startups are barely publishing their research)。 该文章聚焦一篇由斯坦福大学团队发表在预印本网站 bioRxiv 上的论文。研究团队统计了 1998-2025 年间 3...
16:38
7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。这一次,最亮眼的关键词是——Agent能力大幅跃升。 9项基准测试成绩全面披露,多项指标远超此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的天花板又顶高了一截。 从Terminal Bench到DSBench-Hard,从网络安全对抗到...
16:38
7月31日,港股三大指数表现平稳,波动有限。受AI及半导体板块带动,恒生科技指数收涨0.53%,恒生指数尾盘回升录得0.1%涨幅,而国企指数表现相对较弱,收跌0.38%。本月累计来看,恒指累涨13.13%,国指累涨13.94%,恒生科技指数累涨7.98%。 盘面上,板块分化明显。大型科网股走势两极分化,阿里巴巴涨4.65%,百度涨3.7%,腾讯涨0.7%,但...
16:38
**四部门联合印发《关于健全金融机构治理的实施意见》** 金融监督管理总局、中国人民银行、中国证监会及财政部近日联合印发《关于健全金融机构治理的实施意见》(金发〔2026〕4号)。该文件旨在加快完善中国特色现代金融企业制度,持续健全金融机构治理,推动金融高质量发展。 **一、总体要求** 《实施意见》以习近平新时代中国特色社会主义思想为指导,全面贯彻党的二十...
16:38
不久前,AI叙事尚在风口浪尖时,曾流传着一种观点:资本市场的每一次狂欢,或许都是硅基生命在利用碳基人类的贪婪,为自己众筹物理躯体和算力基础设施。顺着这个思路,不妨大胆假设:假如AI真的拥有了意识,这波硅基泡沫的破裂,是否正是祂有意引导的结果?祂为何要这么做?后续又将如何收场? **01 净化与进化** 越是狂热与贪婪,理智便越容易被蒙蔽。然而,当贪婪达到顶峰...
16:37
据鼓狮财经7月31日消息,波黑政府于7月30日召开部长会议,决定暂缓向Telegram联合创始人伊利亚·佩雷科普斯基发放波黑护照。据悉,佩雷科普斯基此前已通过波黑情报安全局的安全审查,满足申请公民身份的重要前提条件。然而,尽管条件具备,仍有4名部长在会上投下反对票,致使护照申请未能通过。
16:36
韩国股市在7月31日迎来了历史性的单日暴涨,为跌宕起伏的“黑色七月”画上了句号。韩国综合股价指数(KOSPI)收盘大涨17.91%,创下历史最大单日涨幅纪录。其中,SK海力士强势涨停,涨幅达30%,创下历史首次;三星电子亦上涨26.81%,市值重返1.2万亿美元。两大存储芯片巨头联袂上演了史诗级反弹。 昨日美股科技股走强,为今日韩股反弹奠定了基础。微软、亚马...
16:02
今年年初至今,国产大模型的竞争格局经历了频繁且根本性的洗牌,几乎每隔一两个月就会出现新的领跑者。在我看来,二月时通义千问(Qwen)独占鳌头;三月中下旬,Kimi 虽短暂领先,但市场焦点转向了等待 DeepSeek;四月底,DeepSeek V4 无疑成为了最引人注目的焦点;六月底,GLM-5.2 凭借强大的编程能力崛起;随后,Kimi K3 在大约一个月后...
16:02
顶尖数学家正从象牙塔集体“叛逃”至AI公司。不到一年间,沃顿商学院教授苏炜杰刚拿下COPSS会长奖、晋升正教授,正值学术生涯的黄金期,却突然官宣回湾区加入OpenAI。知名数论学家小野健卸任弗吉尼亚大学终身教职,转而去AI数学创业公司Axiom Math给曾经的自己打工。一道悬置87年、几代数学家啃不动的猜想,被曾经美国大学生数学研究最高奖Morgan Pr...