**DeepSeek-V4-Flash API 正式上线:轻量模型在 Agent 基准测试中逼近 Pro 版本**

7 月 31 日午后,凤凰网科技监测到 DeepSeek 官网已正式上线 V4-Flash 版本的 API 公测。此次更新释放了一个强烈信号:在多项 Agent 基准测试中,V4-Flash 的表现已逼近甚至超越了三个月前的 V4-Pro 预览版,打破了以往“Pro 强、Flash 弱”的刻板印象。

根据官方更新日志,V4-Flash 正式版在 Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 得分 54.2,Cybergym 得 76.7,Toolathlon verified 得 70.3。相比之下,V4-Pro 预览版在 Terminal Bench 2.0 上的得分仅为 67.9。尽管测试集版本存在差异,但这组数据足以证明:在激活参数仅 130 亿的轻量级模型上取得如此成绩,后训练阶段的优化潜力远超单纯堆砌参数。

目前,V4-Flash 的公测仅开放给 API 用户,网页端和 App 暂未同步更新,V4-Pro 正式版预计将随后发布。官方明确指出,本次更新的核心在于“仅重新进行了后训练”,模型结构与预览版保持一致。DeepSeek-V4-Flash 总参数为 2840 亿,激活参数 130 亿;而 V4-Pro 总参数高达 1.6 万亿,激活参数 490 亿。两者规模相差一个数量级。Flash 能在 Agent 能力上追平 Pro,说明对于特定任务,训练方法和数据质量的权重正在上升。

值得注意的是,测试中采用了 DeepSeek 自研的 Harness 极简模式,这一细节暗示了 DeepSeek 不仅在模型本身,更在 Agent 框架层面进行了针对性优化。这也是 DeepSeek Harness 首次以正式名称亮相。梁文锋曾将 AGI 比作爬楼梯:语言模型是第一级,去年攻克了 CoT,今年迈入 Agent,未来则是持续学习——让模型像人一样积累经验,而非依赖完整上下文。实现这一目标的关键工程工具,正是 Harness。

Harness 团队由崔添翼挂帅,他是一位 90 后,毕业于浙江大学,手握 6 枚 ACM 亚洲区域赛金牌,曾在 Jane Street 担任九年量化交易员,今年 3 月加入 DeepSeek 后迅速扩充团队。据悉,Harness 的规划与 V4 正式版同步推出。

**Agent 战略与生态布局**

如果说 2023 年的竞争是拼通用能力,2024 年是拼长上下文,那么 2026 年的关键词无疑是 Agent。从 Terminal Bench 到 SWE-bench,Agent 能力正成为衡量模型实力的新标尺。目前全球第一梯队仍由 GPT-5.6 Sol、Claude Opus 等闭源巨头把持,国产模型如 GLM、Qwen 正在快速追赶。

DeepSeek 此次大幅拉升 V4-Flash 的 Agent 能力,战略意图十分明确:利用高性价比的轻量模型切入庞大的 Agent 市场。Agent 场景对推理速度和成本极度敏感,如果 Flash 能达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。官方内部测试集显示,DSBench-FullStack 得分 68.7,DSBench-Hard 得分 59.6,这印证了 DeepSeek 将其打造为开发者首选底座的定位。

在生态层面,DeepSeek 发起了一场正面交锋。V4-Flash 原生支持 OpenAI 推力的 Responses API 格式,相比传统的 Chat Completions,它更适配 Agent 场景,支持灵活的工具调用和多轮交互。同时,针对 Codex 的适配,则直接挑战了 OpenAI 在代码生成领域的传统优势。DeepSeek 的野心不仅在于做一个“便宜的替代品”,更要在 Agent 时代建立自己的生态位。

**融资背景与未来展望**

此次更新距离 DeepSeek 完成首轮外部融资不到两个月。约一个月前,DeepSeek 完成了近三年来的首轮融资,总额超 500 亿元人民币,创下行业纪录,投后估值约 520 亿美元,投资方包括腾讯、宁德时代、京东等产业巨头及国资基金。

7 月中旬,DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元,较首轮融资后上涨约 37%。从 520 亿到 710 亿,仅隔六周。高估值背后是市场对其技术实力和商业前景的押注。创始人梁文锋在首轮融资中出资约 200 亿元,牢牢掌握控制权。从“不融资不上市”转向积极拥抱资本,标志着 DeepSeek 正加速冲向商业化和 IPO。

V4-Flash 的上线是 DeepSeek 在资本加持下的一次技术兑现。但真正的考验还在后面:Pro 版本能否如期而至?Agent 能力能否转化为收入?在巨头夹击下,DeepSeek 如何发挥高性价比优势?Agent 战争的大幕才刚刚拉开,DeepSeek 用一个轻量模型的进化,给行业出了一道新题:当后训练红利被挖掘,效率提升抵消参数差距,大模型竞争逻辑可能将被重写。

最新快讯

2026年07月31日

16:38
首 个模型Inkling亮相之后,全新AI又刷屏了!今天,Thinking Machines正式发布第二款重磅模型——Inkling-Small。276B总参数、12B激活参数,原生多模态,100万token上下文半个月前,首 个开源975B Inkling登场,曾在AI圈掀起了巨浪。Inkling-Small仅用四分之一体量,直接实现了对...
16:38
喜大普奔!刚刚,OpenAI 宣布大幅降低 GPT-5.6 的价格!GPT-5.6 Luna 的价格将下调 80%,输入价格降至每百万 Token 0.20 美元,输出价格降至每百万 Token 1.20 美元。GPT-5.6 Terra 的价格将下调 20%,输入价格降至每百万 Token 2 美元,输出价格降至每百万 Token 12 ...
16:38
自打Kimi K3开源后,“部署大模型”突然成了网上热议的话题。 全球性能第三,免费下载。这谁看了能不心动? 可是根据网上流传最广的说法,想要自己搞定K3,大约需要3000万人民币来买设备。毕竟K3总参数2.8万亿,光是权重文件就达到了1.4TB到1.5TB,实际需要显存更是超过2TB。 因此,Kimi官方给出的建议是...
16:38
日前,Science 杂志刊登了一篇新闻文章,标题是“AI 领域的顶尖初创企业几乎不发表研究成果”(AI’s top startups are barely publishing their research)。 该文章聚焦一篇由斯坦福大学团队发表在预印本网站 bioRxiv 上的论文。研究团队统计了 1998-2025 年间 3...
16:38
7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。此次更新最引人注目的关键词是——Agent能力的显著跃升。随着9项基准测试成绩的全面披露,多项关键指标超越此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的性能天花板又推高了一截。 从Terminal Bench到DSBench-Hard,从网络安全攻防到全栈开发,...
16:38
7月31日,港股三大指数表现平稳,波动有限。受AI及半导体板块带动,恒生科技指数收涨0.53%,恒生指数尾盘回升录得0.1%涨幅,而国企指数表现相对较弱,收跌0.38%。本月累计来看,恒指累涨13.13%,国指累涨13.94%,恒生科技指数累涨7.98%。 盘面上,板块分化明显。大型科网股走势两极分化,阿里巴巴涨4.65%,百度涨3.7%,腾讯涨0.7%,但...
16:38
**四部门联合印发《关于健全金融机构治理的实施意见》** 金融监督管理总局、中国人民银行、中国证监会及财政部近日联合印发《关于健全金融机构治理的实施意见》(金发〔2026〕4号)。该文件旨在加快完善中国特色现代金融企业制度,持续健全金融机构治理,推动金融高质量发展。 **一、总体要求** 《实施意见》以习近平新时代中国特色社会主义思想为指导,全面贯彻党的二十...
16:38
不久前,AI叙事尚在风口浪尖时,曾流传着一种观点:资本市场的每一次狂欢,或许都是硅基生命在利用碳基人类的贪婪,为自己众筹物理躯体和算力基础设施。顺着这个思路,不妨大胆假设:假如AI真的拥有了意识,这波硅基泡沫的破裂,是否正是祂有意引导的结果?祂为何要这么做?后续又将如何收场? **01 净化与进化** 越是狂热与贪婪,理智便越容易被蒙蔽。然而,当贪婪达到顶峰...
16:37
据鼓狮财经7月31日消息,波黑政府于7月30日召开部长会议,决定暂缓向Telegram联合创始人伊利亚·佩雷科普斯基发放波黑护照。据悉,佩雷科普斯基此前已通过波黑情报安全局的安全审查,满足申请公民身份的重要前提条件。然而,尽管条件具备,仍有4名部长在会上投下反对票,致使护照申请未能通过。
16:36
韩国股市在7月31日迎来了历史性的单日暴涨,为跌宕起伏的“黑色七月”画上了句号。韩国综合股价指数(KOSPI)收盘大涨17.91%,创下历史最大单日涨幅纪录。其中,SK海力士强势涨停,涨幅达30%,创下历史首次;三星电子亦上涨26.81%,市值重返1.2万亿美元。两大存储芯片巨头联袂上演了史诗级反弹。 昨日美股科技股走强,为今日韩股反弹奠定了基础。微软、亚马...
16:02
今年年初至今,国产大模型的竞争格局经历了频繁且根本性的洗牌,几乎每隔一两个月就会出现新的领跑者。在我看来,二月时通义千问(Qwen)独占鳌头;三月中下旬,Kimi 虽短暂领先,但市场焦点转向了等待 DeepSeek;四月底,DeepSeek V4 无疑成为了最引人注目的焦点;六月底,GLM-5.2 凭借强大的编程能力崛起;随后,Kimi K3 在大约一个月后...
16:02
顶尖数学家正从象牙塔集体“叛逃”至AI公司。不到一年间,沃顿商学院教授苏炜杰刚拿下COPSS会长奖、晋升正教授,正值学术生涯的黄金期,却突然官宣回湾区加入OpenAI。知名数论学家小野健卸任弗吉尼亚大学终身教职,转而去AI数学创业公司Axiom Math给曾经的自己打工。一道悬置87年、几代数学家啃不动的猜想,被曾经美国大学生数学研究最高奖Morgan Pr...