7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。此次更新最引人注目的关键词是——Agent能力的显著跃升。随着9项基准测试成绩的全面披露,多项关键指标超越此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的性能天花板又推高了一截。

从Terminal Bench到DSBench-Hard,从网络安全攻防到全栈开发,DeepSeek-V4-Flash正式版展现出令人瞩目的“全能Agent”潜质。这标志着AI不再局限于简单的代码生成,而是开始真正像工程师一样工作——能够打开终端、分析代码仓库、调用工具并完成端到端的复杂任务。

**9项基准测试成绩单:数据说话**

DeepSeek此次并未保留,而是直接公开了9项基准测试的完整成绩单。测试覆盖面极广,从终端操作到代码仓库分析,从网络安全到自动化测试。

其中,Terminal Bench 2.1以82.7的高分领跑,这表明模型在终端环境下的任务执行能力已相当成熟——不仅能理解复杂命令行,还能编写脚本、调试错误,表现近乎“AI运维工程师”水平。Cybergym拿下76.7分,展示了出色的网络安全对抗能力。DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,证明模型不仅能编写单个函数,更能胜任从前端到后端的完整开发链路。

**测试说明:透明且严谨**

DeepSeek同时披露了详细的测试条件,透明度值得肯定:

对于公开基准测试集中的Code Agent任务,正式版DeepSeek-V4-Flash采用即将发布的DeepSeek Harness极简模式作为框架,测试参数设定为max档位、top_p=0.95、temperature=1.0。DSBench-FullStack和DSBench-Hard均为DeepSeek内部使用的全栈开发及Coding Agent难题测试集。

值得一提的是,作为即将独立发布的测试框架,DeepSeek Harness极简模式此次随成绩一同亮相,暗示了DeepSeek在构建标准化Agent评测生态方面的布局——不仅致力于训练更强的模型,更要提供可靠的评测工具。

**原生支持Responses API,适配Codex**

除基准成绩的飞跃外,正式版V4-Flash在工程适配上也有重要更新——原生支持Responses API格式,并针对Codex进行了深度适配。这意味着开发者可以更自然地将V4-Flash接入现有的Codex工作流,有效降低迁移成本。具体配置方法可参考DeepSeek官方文档。

**模型结构未变,后训练是关键**

值得注意的是,DeepSeek-V4-Flash-0731的模型结构和尺寸与Preview版保持完全一致,仅重新进行了后训练。换句话说,底座模型未变,变的是“后天教育”。这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间依然巨大。同样的模型架构,经过更精细的后训练调优,就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。

**此次升级范围:仅限V4-Flash API**

升级范围说明如下:

已升级:DeepSeek-V4-Flash API接口

未升级:DeepSeek-V4-Pro API

未升级:APP端 / WEB端模型

即将发布:DeepSeek-V4-Pro正式版(将尽快发布)

需要注意的是,本次升级仅涉及DeepSeek-V4-Flash的API接口。如果你是V4-Pro用户,或通过APP/Web端使用DeepSeek,此次更新暂不影响你。而关于大家关心的V4-Pro正式版,DeepSeek表示“将尽快发布”。考虑到Flash版已展现出如此强势的Agent能力,V4-Pro正式版的表现无疑更加令人期待。

**行业观察:Agent时代正式开启?**

从Terminal Bench到Cybergym,从DeepSWE到Toolathlon,这9项基准测试的名字本身就揭示了一个趋势:AI的能力评测,正在从“写一段代码”进化到“完成一个工程任务”。DeepSeek-V4-Flash正式版在多项Agent基准上远超V4-Pro-Preview,释放了一个明确信号——后训练时代的竞争焦点,已经从模型规模转向了Agent能力的深度优化。当AI能够熟练操作终端、分析代码仓库、进行网络安全对抗、完成全栈开发任务时,我们或许正在见证一个新时代的开启:AI不再只是代码助手,而是成为了真正的AI工程师。而DeepSeek,正在这条路上跑在最前面。

最新快讯

2026年07月31日

17:21
世界纷纷扰扰,AI日新月异,苹果的“老本”依然厚厚的、香香的。北京时间7月31日凌晨,苹果发布截至6月27日的2026财年第三季度财报。公司营收1094.17亿美元,同比增长16%;每股收益2.02美元,同比增长29%,均超过华尔街预期。iPhone收入增长22%,Mac增长29%。大中华区也延续了此前的反弹,收入同比增长22%至188.1...
17:21
作者 | 谢芸子 黄绎达 编辑 | 张帆 开云的转型初见成效。 7月28日,法国开云集团Kering发布2026年上半年财报,实现营收72.2亿欧元,可比口径下同比增长1%。 更关键的信号藏在第二季度——单季营收36.52亿欧元,同比增长2%。在中东局势仍不明朗、全球消费进入下行周期的情况下,开云实现三年来的...
17:21
7月30日,中国互联网的AI牌桌上,两张底牌同时翻开,背后藏着同一个焦虑——AI烧了这么多钱,到底怎么收回来? 上午,字节跳动一封内部邮件,把做了十年的飞书"拆"了:产品团队并入豆包,销售和服务团队并入火山引擎。飞书CEO谢欣向豆包负责人赵祺汇报,独立BU时代正式终结。 同一天,腾讯WorkBuddy发布V5.3.5重大版本更新,...
17:21
引子北京时间2026年7月30日晚间,美元兑日元的汇率剧烈波动,如上图所示,USDJPY从163.741一度下挫至157.938,振幅高达3.67%。目前,USDJPY稳定在160.610附近。对于这一现象,投资者们已经见怪不怪了,不少人的第一反应是,日本财务省对日元汇率进行了干预。这是因为,日元实在是太弱了,刚创下了40年以来的低位,并且日本财务省也不是第...
17:21
昨日收报25.36港元的南方两倍做多海力士(7709.HK)在今早9时20分时的开盘价为29.16港元,高开14.99%,随后股价在9时30分开盘瞬间一度飙升306.15%,报103港元,交易软件显示以103港元成交了100股(1手),股价瞬间又快速恢复至正常水平。这笔以103港元成交100股(1手)的交易是两倍做多海力士开盘后的第三笔成交。针对此异常波动,...
17:21
在广州新济医药递表港交所的同一天,普祺医药也递交了招股书。据鼓狮财经获悉,北京普祺医药科技股份有限公司(简称:普祺医药)于7月24日向港交所递交申请,计划依据18A章规则上市,由中信证券及民银资本担任保荐人。这是该公司继2026年1月首次递表失效后的第二次尝试。此前,普祺医药也曾寻求A股上市,于2025年6月25日向北交所提交申请,并于2025年10月底撤回...
17:21
7月31日,财政部发布2026年1-6月全国国有及国有控股企业经济运行情况。1-6月,全国国有及国有控股企业(以下称国有企业)营业总收入同比下降2.0%,利润总额同比增长2.4%。一、营业总收入。1-6月,国有企业营业总收入402427.0亿元,同比下降2.0%。 二、利润总额。1-6月,国有企业利润总额22475.8亿元,同比增长2.4%。&nb...
17:21
上证指数收涨0.72%,报3832.26点;深证成指涨2.21%,报13578.93点;创业板指表现强劲,大涨3.06%,报3343.96点。两市成交额突破2.5万亿元,较前一交易日大幅放量2014亿元。全市场近4700只个股上涨。盘面上,多模态AI概念股全面爆发,Kimi、ChatGPT及AIGC方向领涨;宇树机器人、CPO(光模块)、存储器、算力租赁及网...
17:17
鼓狮财经7月31日讯,香港特区政府统计处今日发布2026年第二季度本地生产总值(GDP)的预先估计数字。数据显示,香港二季度GDP较去年同期实际增长4.3%,虽较一季度的5.9%增速略有回落,但依然保持强劲扩张态势。特区政府发言人指出,这主要得益于对外贸易的繁荣以及内部需求的坚挺。展望下半年,香港经济预计将继续保持稳健增长。
17:16
鼓狮财经7月31日报道,韩国KOSPI指数周五收盘暴涨18%,不仅大幅扭转了此前三天的下跌颓势,更刷新了单日最大涨幅的历史纪录。根据LSEG的数据显示,历史上KOSPI指数十大单日涨幅中,有五次发生在今年三月以来;而在过去十年中,四大单日跌幅中有三次出现在最近五周内。 KB金融集团全球战略师彼得·S·金指出,股市的“游戏化”特征引发了剧烈震荡,这种波动主要受...
16:38
喜讯传来,OpenAI 刚刚宣布对 GPT-5.6 系列模型进行大幅调价。其中,GPT-5.6 Luna 的价格下调了 80%,输入价格降至每百万 Token 0.20 美元,输出价格降至每百万 Token 1.20 美元。GPT-5.6 Terra 的价格下调 20%,输入价格降至每百万 Token 2 美元,输出价格降至每百万 Token 12 美元。此...