谁也没料到,DeepSeek 又在 7 月底搞出了大动作,正式推出了 DeepSeek V4 Flash 模型。
起初,我对这次更新并没有太多关注。毕竟,这只是一个名为 Flash 的模型更新,主力产品 Pro 系列却毫无动静。此前,只有谷歌曾出现过只更新 Flash 而不更新 Pro 的情况,而谷歌现在已沦为笑柄。你总不能指望一个 Flash 模型比 Pro 还强吧?
然而,现实给了我一记耳光。这个 Flash 模型的性能竟然超过了自家的 Pro 版本!价格仅为 2 元/百万 token,偶尔还有缓存命中折扣。周末我消耗了 1 亿 token,仅花费了 5 元。
根据我整理的 V4 Flash 跑分数据,其能力极其惊人。它不仅超越了自家大哥 Pro,虽然仍略逊于 Claude Opus5、GPT-5.6 Sol 和 Kimi K3 等顶尖模型,但已是全球顶级水平。
网友制作了一张将各模型性能与价格并列的对比图。点越靠上性能越好,越靠左价格越便宜。大多数模型处境尴尬:性能不如 DeepSeek,价格却更贵。那些性能更强的模型,价格也高得离谱。由于图表使用了对数坐标轴,我利用 PS 将其转换为线性坐标轴以看清真实比例。结果显示,Claude Fable 5 和 GPT-5.6 Sol 的性能仅比 V4 Flash 高出约 20%,但价格却高出约 200%。DeepSeek 再次重新定义了性能与价格的“斩杀线”。
那么,DeepSeek 是如何取得如此巨大进步的?尽管架构和参数保持不变,但原因主要有两点。
首先是后训练。官方指出,预览版和正式版之间的差距主要就在这里。大模型训练分为两个阶段:预训练和后训练。预训练就像培养一个高中生,吸收各种学科知识以建立基础。后训练则是培养解决实际问题的能力,通过刷题和强化学习来磨练技能。DeepSeek R1 论文提到,经过 GRPO 强化学习后,V3 的数学能力从 15.6% 飙升至 71%。同样,InstructGPT 通过后训练将一个小参数模型提升到击败大得多的 GPT-3。
此外,仔细阅读发布说明,会发现 DeepSeek 使用了一个名为 DeepSeek Harness 的未发布工具。Harness 是一种 Agent 工具(类似于 Claude Code 或 Codex)。在 Agent 时代,模型的能力不仅取决于模型本身,还取决于它周围有什么工具。一个裸模型就像一个坐在考场里的学生,只能靠自己的脑子解决问题。Harness 为模型配备了搜索引擎、代码运行环境、上下文管理,甚至错误重试功能。多伦多大学的一项研究表明,同一个模型在使用不同的工具时,成功率可以相差数倍。
我认为,DeepSeek 提交的答案正是“Agent”时代的阶梯。通过高质量的后训练和 Harness 工具,它将原本用于轻量级应用的 Flash 模型提升到了旗舰水平。看到这个“超级强化”版的 Flash 模型,我不禁开始期待 V4 Pro。如果一个小弟都能凭借这些技术击败 GPT-5.6 和 Claude Fable 5,那么 V4 Pro 将会强到什么程度呢?
