谁也没料到,DeepSeek 又在 7 月底搞出了大动作,正式推出了 DeepSeek V4 Flash 模型。

起初,我对这次更新并没有太多关注。毕竟,这只是一个名为 Flash 的模型更新,主力产品 Pro 系列却毫无动静。此前,只有谷歌曾出现过只更新 Flash 而不更新 Pro 的情况,而谷歌现在已沦为笑柄。你总不能指望一个 Flash 模型比 Pro 还强吧?

然而,现实给了我一记耳光。这个 Flash 模型的性能竟然超过了自家的 Pro 版本!价格仅为 2 元/百万 token,偶尔还有缓存命中折扣。周末我消耗了 1 亿 token,仅花费了 5 元。

根据我整理的 V4 Flash 跑分数据,其能力极其惊人。它不仅超越了自家大哥 Pro,虽然仍略逊于 Claude Opus5、GPT-5.6 Sol 和 Kimi K3 等顶尖模型,但已是全球顶级水平。

网友制作了一张将各模型性能与价格并列的对比图。点越靠上性能越好,越靠左价格越便宜。大多数模型处境尴尬:性能不如 DeepSeek,价格却更贵。那些性能更强的模型,价格也高得离谱。由于图表使用了对数坐标轴,我利用 PS 将其转换为线性坐标轴以看清真实比例。结果显示,Claude Fable 5 和 GPT-5.6 Sol 的性能仅比 V4 Flash 高出约 20%,但价格却高出约 200%。DeepSeek 再次重新定义了性能与价格的“斩杀线”。

那么,DeepSeek 是如何取得如此巨大进步的?尽管架构和参数保持不变,但原因主要有两点。

首先是后训练。官方指出,预览版和正式版之间的差距主要就在这里。大模型训练分为两个阶段:预训练和后训练。预训练就像培养一个高中生,吸收各种学科知识以建立基础。后训练则是培养解决实际问题的能力,通过刷题和强化学习来磨练技能。DeepSeek R1 论文提到,经过 GRPO 强化学习后,V3 的数学能力从 15.6% 飙升至 71%。同样,InstructGPT 通过后训练将一个小参数模型提升到击败大得多的 GPT-3。

此外,仔细阅读发布说明,会发现 DeepSeek 使用了一个名为 DeepSeek Harness 的未发布工具。Harness 是一种 Agent 工具(类似于 Claude Code 或 Codex)。在 Agent 时代,模型的能力不仅取决于模型本身,还取决于它周围有什么工具。一个裸模型就像一个坐在考场里的学生,只能靠自己的脑子解决问题。Harness 为模型配备了搜索引擎、代码运行环境、上下文管理,甚至错误重试功能。多伦多大学的一项研究表明,同一个模型在使用不同的工具时,成功率可以相差数倍。

我认为,DeepSeek 提交的答案正是“Agent”时代的阶梯。通过高质量的后训练和 Harness 工具,它将原本用于轻量级应用的 Flash 模型提升到了旗舰水平。看到这个“超级强化”版的 Flash 模型,我不禁开始期待 V4 Pro。如果一个小弟都能凭借这些技术击败 GPT-5.6 和 Claude Fable 5,那么 V4 Pro 将会强到什么程度呢?

最新快讯

2026年08月04日

08:53
据鼓狮财经8月4日转引《日本经济新闻》8月1日的消息,日本政府已决定重启新一轮核电建设。根据规划,日本将在未来25年内新增9座核反应堆,从而使全国核反应堆总数达到11至14座。 日本首相高市早苗对此表示,为应对人工智能等新兴产业带来的电力需求增长,日本将最大限度利用核能,以保障国家能源安全并实现脱碳目标。 不过,日本经济产业省的相关文件却指出了产业基础面临的...
08:53
一方面,AI演员已打造出具有代表性的IP;另一方面,艺人与AI的合作方式愈发多元化,观众也从最初的不看好逐渐接受艺人通过AI参与内容创作的模式。这预示着,无论是AI独立发展还是与艺人合作,都将在文娱行业开拓更多业态。近期热播综艺《姐姐当家2》中,杜华关于“AI替代的不是顶级艺人,而是没有形成IP的素人”的观点引发热议,侧面印证了这一趋势。 AI演员正成为独立...
08:21
本周末,OpenAI 的新一代模型 Astra 在数学界投下了一颗深水炸弹。OpenAI 公布了一份令人咋舌的成绩单:在群论、算术电路复杂性、格密码学等高难度领域,该模型一举取得了十项新的研究成果。其中不少问题已经沉寂了数十年,甚至从未取得过核心突破。 这些成果涵盖高维几何、编码理论、群论、算术电路复杂性、量子复杂性、格密码学以及极值组合等多个领域。具体而言...
08:21
8月3日,阿里巴巴正式发布了Qwen 3.8-Max版本,官方数据显示该版本总参数达2.4T,激活参数为95B。同日收盘,阿里巴巴港股股价上涨6.75%。在此之前,7月31日DeepSeek发布了V4 Flash正式版,Artificial Analysis分析认为,这一版本是目前单任务成本最低的模型,价格比Anthropic的Fable 5便宜约105倍。...
08:21
三大互联网巨头集体发力,抢占AI办公市场。据智东西8月3日报道,在短短两周内,字节跳动、阿里巴巴、腾讯接连在AI办公领域投下重磅炸弹。7月30日,字节跳动CEO梁汝波发布内部邮件,宣布将飞书产品团队并入豆包,销售线划归火山引擎,原有的产品与商业化体系被拆分。同一天,腾讯WorkBuddy上线“人机双写”协同编辑能力。8月3日,阿里巴巴千问办公正式开启公测,整...
08:21
**MiniMax开源H3模型,全模态视频生成能力再上新台阶** 智东西8月3日报道,MiniMax正式开源其新一代通用视频模型MiniMax H3。该模型作为一款全模态生成系统,能够统一处理文本、图像、视频和音频等输入,并输出最长15秒、最高2K分辨率且带有原生立体声音频的视频。 此前7月31日发布的MiniMax H3,目前在Artificial Ana...
08:20
近期有媒体报道指出,浙江人形机器人创新中心正聚焦于世界模型与具身智能的前沿探索,致力于研发真正落地、服务于多场景的人形机器人产品。目前,该公司的产品已在服装制造、物流搬运、汽车装配、商超零售等多个细分行业实现了应用落地。 随着特斯拉Optimus V3量产节点日益临近,以及国内人形机器人与具身智能实景实训专项行动的正式启动,人形机器人产业正加速从实验室概念向...
08:20
复盘全球10个需求脉冲型超级周期,发现9轮形成了“第一顶-回撤-第二顶”的双顶形态,仅有2018年MLCC未形成清晰第二轮。从历史数据看,一轮顶至一轮底的平均回撤为22.1%,历时5.1个月;一轮底至二顶的平均上涨幅度为44.8%。截至当前,本轮AI存储龙头平均回撤约40%,深度已进入历史可比区间,但调整时间仅23个交易日,尚未充分出清。目前处于有赔率但缺乏...
08:20
**特朗普称美伊正进行谈判,伊朗予以否认** 美国总统特朗普周一表示,美国与伊朗正在进行谈判,并警告称这是德黑兰签署有利协议并结束冲突的“最后机会”。特朗普提出谈判分两步走:首先开放霍尔木兹海峡,其次实现无核化。他强调美方立场坚定,坚决反对伊朗拥有核武器。此外,他还透露了关于海峡开放的谈判进展,称其可能最迟明天重开。然而,伊朗方面对此予以否认,称双方并未举行...
07:49
据鼓狮财经8月4日报道,美国方面透露,日本央行近期为支撑日元汇率,在7月30日至31日期间进行了大规模的外汇干预。根据市场数据推算,日本央行在两日内累计动用了约870亿美元(约合11万亿日元)资金,其中7月30日投入530亿美元,7月31日投入340亿美元。 今年以来,日元汇率持续承压走弱。7月30日,日元对美元汇率一度跌破164比1,创下自1986年以来的...
07:49
一张仅包含简单线条、栏目框架和流程箭头的手绘草图,能否直接转化为一张符合商业出版标准的深海潜水装备流程高精海报?在下面的案例中,该模型不仅精准识别了氧气瓶、面镜、潜水电脑表等装备,更完整保留了“装备总览、功能详解、下潜前检查、安全下潜流程、下潜后检查”这五部分结构。它成功为不同栏目补充了图片、图标和说明文字,将原本粗略的构想转化为了深蓝科技风格的完整设计图。...