7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。此次更新最引人注目的关键词是——Agent能力的显著跃升。随着9项基准测试成绩的全面披露,多项关键指标超越此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的性能天花板又推高了一截。
从Terminal Bench到DSBench-Hard,从网络安全攻防到全栈开发,DeepSeek-V4-Flash正式版展现出令人瞩目的“全能Agent”潜质。这标志着AI不再局限于简单的代码生成,而是开始真正像工程师一样工作——能够打开终端、分析代码仓库、调用工具并完成端到端的复杂任务。
**9项基准测试成绩单:数据说话**
DeepSeek此次并未保留,而是直接公开了9项基准测试的完整成绩单。测试覆盖面极广,从终端操作到代码仓库分析,从网络安全到自动化测试。
其中,Terminal Bench 2.1以82.7的高分领跑,这表明模型在终端环境下的任务执行能力已相当成熟——不仅能理解复杂命令行,还能编写脚本、调试错误,表现近乎“AI运维工程师”水平。Cybergym拿下76.7分,展示了出色的网络安全对抗能力。DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,证明模型不仅能编写单个函数,更能胜任从前端到后端的完整开发链路。
**测试说明:透明且严谨**
DeepSeek同时披露了详细的测试条件,透明度值得肯定:
对于公开基准测试集中的Code Agent任务,正式版DeepSeek-V4-Flash采用即将发布的DeepSeek Harness极简模式作为框架,测试参数设定为max档位、top_p=0.95、temperature=1.0。DSBench-FullStack和DSBench-Hard均为DeepSeek内部使用的全栈开发及Coding Agent难题测试集。
值得一提的是,作为即将独立发布的测试框架,DeepSeek Harness极简模式此次随成绩一同亮相,暗示了DeepSeek在构建标准化Agent评测生态方面的布局——不仅致力于训练更强的模型,更要提供可靠的评测工具。
**原生支持Responses API,适配Codex**
除基准成绩的飞跃外,正式版V4-Flash在工程适配上也有重要更新——原生支持Responses API格式,并针对Codex进行了深度适配。这意味着开发者可以更自然地将V4-Flash接入现有的Codex工作流,有效降低迁移成本。具体配置方法可参考DeepSeek官方文档。
**模型结构未变,后训练是关键**
值得注意的是,DeepSeek-V4-Flash-0731的模型结构和尺寸与Preview版保持完全一致,仅重新进行了后训练。换句话说,底座模型未变,变的是“后天教育”。这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间依然巨大。同样的模型架构,经过更精细的后训练调优,就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。
**此次升级范围:仅限V4-Flash API**
升级范围说明如下:
已升级:DeepSeek-V4-Flash API接口
未升级:DeepSeek-V4-Pro API
未升级:APP端 / WEB端模型
即将发布:DeepSeek-V4-Pro正式版(将尽快发布)
需要注意的是,本次升级仅涉及DeepSeek-V4-Flash的API接口。如果你是V4-Pro用户,或通过APP/Web端使用DeepSeek,此次更新暂不影响你。而关于大家关心的V4-Pro正式版,DeepSeek表示“将尽快发布”。考虑到Flash版已展现出如此强势的Agent能力,V4-Pro正式版的表现无疑更加令人期待。
**行业观察:Agent时代正式开启?**
从Terminal Bench到Cybergym,从DeepSWE到Toolathlon,这9项基准测试的名字本身就揭示了一个趋势:AI的能力评测,正在从“写一段代码”进化到“完成一个工程任务”。DeepSeek-V4-Flash正式版在多项Agent基准上远超V4-Pro-Preview,释放了一个明确信号——后训练时代的竞争焦点,已经从模型规模转向了Agent能力的深度优化。当AI能够熟练操作终端、分析代码仓库、进行网络安全对抗、完成全栈开发任务时,我们或许正在见证一个新时代的开启:AI不再只是代码助手,而是成为了真正的AI工程师。而DeepSeek,正在这条路上跑在最前面。
