经过漫长等待,DeepSeek V4 Pro正式版和备受期待的DeepSeek Harness(DSH)终于正式问世。DSH曾在8月1日开启内测招募,当时采取严格的筛选制,优先吸纳具备大型项目开发和AI Agent二次开发经验的工程师,申请者需提交代码托管账号和过往项目作品,入选者还需签署保密协议。如今,我们终于见到了DSH的真容。经过一晚上的实测,结论是性能优异、响应迅速,且最为关键的是非常节省token。只能说,还得是DeepSeek,依旧是熟悉的味道。
再看V4 Pro正式版,虽然8月13日曾因DeepSeek修改API文件表述及官网发布公告,引发全网热议称V4 Pro已发布,但这实为一场乌龙。当时所谓的“正式版”不仅性能堪忧,价格也未变。8月13日下午,官方撤下了相关公告。当晚发布的才是真正的V4 Pro正式版,其Agent能力大幅提升。DeepSWE从预览版的12.8分飙升至62.7分,涨幅接近五倍;DSBench-Hard从31.1分跃升至67.2分;DSBench-FullStack从41.8分提升至71.1分。特别是在Agent领域影响力最大的基准Terminal Bench 2.1上,DeepSeek V4 Pro正式版的性能已可与当下最强的Claude Fable 5相媲美。
话虽如此,此前DeepSeek虽公告称价格上调,但涨幅之大出乎意料。输出方面,高峰时段价格为原价的4.5倍,即27元/百万token;空闲时段为2.25倍,即13.5元/百万token。以单日20万输出token的代码审查场景为例,调价前单日成本约1.2元,高峰时段将升至5.4元,空闲时段升至2.7元。缓存未命中输入方面,高峰时段为原价的3倍,即9元/百万token;空闲时段为1.5倍,即4.5元/百万token。缓存命中输入方面,高峰涨幅最高,达原价的12倍,即0.3元/百万token;空闲时段为原价的6倍,即0.15元/百万token。
尽管价格有所调整,但不妨先来了解这个产品。第一部分:它不是下一个Codex,而是第一个Harness。正如梁文锋所言“我们不在乎C端”,DSH的安装门槛非常高,不仅需要node.js环境,用户还需自行在GitHub上通过npm命令安装。与Codex、Workbuddy这类可直接双击安装的Harness不同,DSH既非桌面GUI,也非TUI或CLI,而是走了一条几乎无人涉足的道路——BS架构的Web UI。打开网页即使用,网页内包含一个Agent工作区域。
要理解DSH为何如此“反用户”,需先理解支撑它的论文《A Programming Paradigm for Spatiotemporal Composability》,该论文由北京大学与DeepSeek联合署名。DSH的核心思路是“一切皆插件”,任务需要什么功能,就调用什么插件,用完即卸载。打个比方,Claude Code是一辆车,可以加装装甲或武器,但本质仍是车;Codex也是车,只能改内饰车漆。DSH则像是一个底盘,可以加轮子变成车,也可以加装螺旋桨变成直升机。
为满足这一设计理念,论文提出了两个维度。第一个维度是时间可组合性,即组件移除时,对共享环境造成的所有修改必须能被完全、安全地撤销。论文引入了“效应”概念,DSH将运行办法和撤销办法记录在“可逆效应”中。传统效应如购物小票,退货需走程序;而DSH的可逆效应如同在胖东来购物,退货无需走程序,商品交给客服即可,系统自动处理。每次上下文变换自带逆变换,运行时全程追踪,组件卸载时自动回滚。
第二个维度是空间可组合性,这是一种运行时的组件组合模型。不同于传统静态依赖注入,组件依赖关系在共享运行时“空间”中动态建立、消解。例如,让DSH读一本书:视觉插件负责记录文字(充当眼睛),声音插件负责朗读(充当嘴巴)。两者在同一空间内自动关联,视觉插件将文字传递给声音插件。论文以VS Code为例,其扩展需重启才能卸载,导致缓存、连接作废,重建耗时,且需维持冗余副本。DSH采用Cordis系统,实现了热模块替换,插件原地替换,缓存和连接保留,修改失败可事务性回滚。
DSH真正惊艳之处,在于将理论应用于实践。它定义了四套执行模式:普通任务直接执行;长程任务进入Goal模式,跨多个自主轮次持续执行;少量任务可交给子Agent后台运行;大规模并行任务进入Workflow,用JavaScript编排。小事直接上手,大事制定“总目标”持续迭代,直至完成。此外,DSH还有专门的Ralph Loop,每轮创建“失忆”的新Agent,仅通过共享Workspace保留长期记忆,避免干扰。
DSH也是为AI自进化设计的。插件化实现架构解耦,模块可独立演化。AI注意力有限,大规模并发下解耦能最大限度发挥优势,避免崩溃。传统软件模块间相互依赖,改一处可能坏十处;插件化则每个功能独立,通过标准接口连接,互不干扰。传统模式下模块需排队等待,解耦后可并行推进,效率拉满。
第二部分:实际效果。我给DSH和V4 Pro正式版准备了三道题,并让Claude Fable 5和Claude Code作为对手。第一题是经典的鹈鹕测试,要求生成循环动画SVG:鹈鹕骑自行车,轮子旋转、踏板转动、腿正确踩踏,平滑无限循环,仅用SVG原生动画。Fable 5胜出,形象更合理,且地面公路会后退。DSH生成的动画中,云彩后退但草地无变化,细节不足。
第二题是俄罗斯方块小游戏,要求一个HTML文件,Canvas或DOM实现,包含七种方块、旋转、移动、加速、消行、计分、预览及重开功能,不使用任何游戏引擎。两者表现接近,但实际游玩时DSH手感更好,Fable 5略显僵硬。
第三题是曼德博集合可视化,要求HTML文件,Canvas实现,支持鼠标滚轮缩放、点击平移、渐变色彩,放大后细节清晰,不使用外部库。这是数学著名的分形图案,可无限放大。Fable 5最大只能渲染100倍,而DSH可渲染超过300倍,因此DSH胜出。
第三部分:同样的任务,便宜120倍。相同任务,相近效果,Fable 5花费9.8美金token,约合人民币近70元。使用DSH搭配V4 Pro正式版,仅花费0.59元人民币。此前Artificial Analysis测算,DeepSeek V4 Flash在相同任务下比Claude Fable 5便宜约100倍,但仅限于轻量模型。如今V4 Pro正式版及DSH的组合,已比Claude Fable 5便宜近120倍。Artificial Analysis预测V4 Pro将覆盖全球超70%模型,看来预测精准。不过,“唱个反调”的是,由于测试处于非高峰时段,token价格相对便宜,高峰时段价格优势可能小于100倍。
测试中发现DSH的缓存命中率极高,有时甚至达99%。无论高峰还是非高峰,命中缓存都比未命中缓存便宜整整30倍。除热替换和可逆效应外,还有“增量协调”机制。配置层是档案卡树,每张声明一个插件。传统做法是修改后重建整个实例;增量协调则只做最小动作,代码地址变了才重建,隔离方式变了调隔离域,配置变了交插件比对,停用卸载,取消停用再装回。插件下有子插件,则按编号“按名对账”:新增装、删掉卸、未动留,递归处理。最终状态与全量重建一致。通俗说,改东西只动该动的,效果与全推倒重来一样。
DSH在“省token”上还有后手,即PTC模式(程序化工具调用),让模型生成代码组合多轮工具调用,将五次往返压缩为一次。诚然,DeepSeek涨价了,但DSH能让“便宜”在涨价后依然成立。模型定价由DeepSeek决定,DSH能做的,是榨取每一分钱的极致价值。
