7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测。此次更新最引人注目的关键词是——Agent能力的显著跃升。随着9项基准测试成绩的全面披露,多项关键指标超越此前发布的V4-Pro-Preview预览版,直接将“代码智能体”的性能天花板又推高了一截。

从Terminal Bench到DSBench-Hard,从网络安全攻防到全栈开发,DeepSeek-V4-Flash正式版展现出令人瞩目的“全能Agent”潜质。这标志着AI不再局限于简单的代码生成,而是开始真正像工程师一样工作——能够打开终端、分析代码仓库、调用工具并完成端到端的复杂任务。

**9项基准测试成绩单:数据说话**

DeepSeek此次并未保留,而是直接公开了9项基准测试的完整成绩单。测试覆盖面极广,从终端操作到代码仓库分析,从网络安全到自动化测试。

其中,Terminal Bench 2.1以82.7的高分领跑,这表明模型在终端环境下的任务执行能力已相当成熟——不仅能理解复杂命令行,还能编写脚本、调试错误,表现近乎“AI运维工程师”水平。Cybergym拿下76.7分,展示了出色的网络安全对抗能力。DSBench-FullStack(全栈开发测试)和DSBench-Hard(Coding Agent难题测试)分别取得68.7和59.6分,证明模型不仅能编写单个函数,更能胜任从前端到后端的完整开发链路。

**测试说明:透明且严谨**

DeepSeek同时披露了详细的测试条件,透明度值得肯定:

对于公开基准测试集中的Code Agent任务,正式版DeepSeek-V4-Flash采用即将发布的DeepSeek Harness极简模式作为框架,测试参数设定为max档位、top_p=0.95、temperature=1.0。DSBench-FullStack和DSBench-Hard均为DeepSeek内部使用的全栈开发及Coding Agent难题测试集。

值得一提的是,作为即将独立发布的测试框架,DeepSeek Harness极简模式此次随成绩一同亮相,暗示了DeepSeek在构建标准化Agent评测生态方面的布局——不仅致力于训练更强的模型,更要提供可靠的评测工具。

**原生支持Responses API,适配Codex**

除基准成绩的飞跃外,正式版V4-Flash在工程适配上也有重要更新——原生支持Responses API格式,并针对Codex进行了深度适配。这意味着开发者可以更自然地将V4-Flash接入现有的Codex工作流,有效降低迁移成本。具体配置方法可参考DeepSeek官方文档。

**模型结构未变,后训练是关键**

值得注意的是,DeepSeek-V4-Flash-0731的模型结构和尺寸与Preview版保持完全一致,仅重新进行了后训练。换句话说,底座模型未变,变的是“后天教育”。这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间依然巨大。同样的模型架构,经过更精细的后训练调优,就能在基准测试中产生质的飞跃——这对整个行业的启示是深远的。

**此次升级范围:仅限V4-Flash API**

升级范围说明如下:

已升级:DeepSeek-V4-Flash API接口

未升级:DeepSeek-V4-Pro API

未升级:APP端 / WEB端模型

即将发布:DeepSeek-V4-Pro正式版(将尽快发布)

需要注意的是,本次升级仅涉及DeepSeek-V4-Flash的API接口。如果你是V4-Pro用户,或通过APP/Web端使用DeepSeek,此次更新暂不影响你。而关于大家关心的V4-Pro正式版,DeepSeek表示“将尽快发布”。考虑到Flash版已展现出如此强势的Agent能力,V4-Pro正式版的表现无疑更加令人期待。

**行业观察:Agent时代正式开启?**

从Terminal Bench到Cybergym,从DeepSWE到Toolathlon,这9项基准测试的名字本身就揭示了一个趋势:AI的能力评测,正在从“写一段代码”进化到“完成一个工程任务”。DeepSeek-V4-Flash正式版在多项Agent基准上远超V4-Pro-Preview,释放了一个明确信号——后训练时代的竞争焦点,已经从模型规模转向了Agent能力的深度优化。当AI能够熟练操作终端、分析代码仓库、进行网络安全对抗、完成全栈开发任务时,我们或许正在见证一个新时代的开启:AI不再只是代码助手,而是成为了真正的AI工程师。而DeepSeek,正在这条路上跑在最前面。

最新快讯

2026年07月31日

17:56
今年年初以来,国产大模型的竞争格局可谓日新月异,每隔一两个月就会发生根本性的洗牌。在我看来,竞争态势经历了多次更迭:1至2月,通义千问(Qwen)领先;3月中下旬,Kimi曾短暂占据优势,但当时市场普遍在等待DeepSeek;4月下旬,DeepSeek V4无疑成为了焦点;6月下旬,GLM-5.2凭借强大的编程能力上位,随后在一个月左右的时间里,Kimi K...
17:56
7月31日,AI行业在同一天迎来了两记重拳。一边是OpenAI突然宣布大降价,最便宜的一款模型输入价格直接从1美元砍到0.2美元,砍掉了80%——这个价格甚至比国内以“性价比”出名的DeepSeek还要低。另一边,DeepSeek也没闲着,当天就上线了新版本,声称在写代码、修Bug这类复杂任务上的能力大幅提升。 两家公司明明走的是不同路线:OpenAI想用低...
17:56
中医连锁在规模化进程中,长期面临一个看似矛盾的结构性难题:中医讲究辨证论治和因人施方,个性化程度极高,这与连锁经营所要求的标准化、可复制性天然存在张力。誉研堂找到的突破口在于慢病患者的全生命周期健康管理。2026年7月,这家扎根北方、以慢性病防调治养为核心的企业向港交所递交了更新版招股书,成为临方制剂膏剂细分赛道的行业第一。它究竟凭什么能在这一高门槛领域脱颖...
17:56
国务院于7月31日公布了《关于出境入境管理的规定》,该法规将于2026年9月15日起正式施行。全文共19条,旨在通过规范出境入境管理,保障相关人员的合法权益,并维护国家主权、安全及发展利益。规定内容主要从以下四个方面进行了完善: 一是健全出境安全风险防范机制。明确国务院外交、文化和旅游主管部门应建立信息发布机制,及时向公众通报国外安全提醒及旅游目的地风险等级...
17:48
鼓狮财经7月31日电,受科技股上涨和新一轮亮眼业绩提振,欧洲股市延续7月以来的涨势,基准股指再创历史新高。截至伦敦时间上午10时09分,斯托克欧洲600指数上涨0.7%,突破7月6日创下的前高位,刷新历史纪录。科技股表现尤为强劲,此前亚马逊股价在美国市场上涨,其云计算业务收入连续第五个季度加速增长。英国富时100指数一度上涨0.8%,创下盘中历史新高;德国D...
17:42
鼓狮财经7月31日讯,一场全球性的AI概念股反弹浪潮自美国开启,并迅速蔓延至亚洲与欧洲市场。本周五,欧洲股市盘中创下历史新高,这主要得益于全球投资者对科技股兴趣的回暖。尽管本周央行决议密集,且中东局势依然紧张,但企业财报表现强劲,为市场提供了有力支撑。 截至发稿,欧洲斯托克600指数上涨0.83%,报655.36点,成功突破7月3日创下的前高,有望实现连续第...
17:21
世道纷扰,AI技术日新月异,但苹果的“家底”依旧殷实。北京时间7月31日凌晨,苹果发布了截至6月27日的2026财年第三季度财报。公司营收达1094.17亿美元,同比增长16%;每股收益2.02美元,同比增长29%,均超出了华尔街的预期。其中,iPhone收入增长22%,Mac增长29%。 大中华区延续了此前的强劲反弹,收入同比增长22%至188.16亿美元...
17:21
作者 | 谢芸子 黄绎达 编辑 | 张帆 开云的转型初见成效。 7月28日,法国开云集团Kering发布2026年上半年财报,实现营收72.2亿欧元,可比口径下同比增长1%。 更关键的信号藏在第二季度——单季营收36.52亿欧元,同比增长2%。在中东局势仍不明朗、全球消费进入下行周期的情况下,开云实现三年来的...
17:21
7月30日,中国互联网的AI牌桌上,两张底牌同时翻开,背后藏着同一个焦虑——AI烧了这么多钱,到底怎么收回来?上午,字节跳动一封内部邮件,把做了十年的飞书“拆”了:产品团队并入豆包,销售和服务团队并入火山引擎。飞书CEO谢欣向豆包负责人赵祺汇报,独立BU时代正式终结。同一天,腾讯WorkBuddy发布V5.3.5重大版本更新,联合腾讯文档推出“人机双写”协同...
17:21
引子 北京时间2026年7月30日晚间,美元兑日元汇率剧烈波动。USDJPY从163.741一度下挫至157.938,振幅高达3.67%,随后稳定在160.610附近。面对这一剧烈波动,投资者普遍猜测日本财务省进行了干预。毕竟,日元已创下40年新低,且日本并非首次出手干预。尽管官方尚未明确表态,市场估算本次干预规模约为5万亿日元(约311亿美元)。 虽然通俗...