北京时间 8 月 13 日晚 8 点半,DeepSeek 正式发布了其成立以来的首个 Agent 产品——DeepSeek Harness。经过长时间的预热,这款备受期待的产品一经亮相便引发了巨大反响。截至发稿,其 GitHub 仓库在公开仅 12 小时内,Star 数已突破 5 万大关。官方将其定义为模型与 Harness 的结合,模型是大脑,Harness 是手脚。聊天机器人交付的是一段文字,而 Agent 交付的是一件完成的事。
发布当晚,我们尝试将其部署在本地,并让它完成了两项任务:一是参照 The Verge 的风格重构极客公园官网;二是利用 GitHub 接口绘制其自身的涨星曲线。两件事均顺利完成,全程消耗的 Token 不足 3 元。不过,它目前更像是一个“毛坯房”,界面对于非编程用户不够友好,开发者预览版中仍有许多毛边。试用后,我们的印象是:DeepSeek 并没有打算直接提供一个成品,而是提供了一套等待组装的零件。
01、「一切皆插件」
GitHub 仓库在正式公布前半小时悄然公开。接下来的时间里,我们目睹了惊人的增长:21:05 时仅有 7283 个 Star,21:51 就已达到 15530 个。不到两小时破万,早晨查看时已突破 5 万。此前增长最快的开源仓库 OpenClaw 耗时 84 天涨了 20 万 Star,平均每小时约 99 个。而 DeepSeek Harness 头两个小时的涨速是它的 80 倍。
目前,DeepSeek Harness 尚未提供云端服务。只需在安装了 Node.js 的电脑上运行一行命令,浏览器打开本地端口即可使用。所有会话、日志和数据均保留在本地,浏览器只是其外壳。首次启动时会弹出提示,说明这是面向开发者的尝鲜版,核心插件和基础接口未来几个月将快速迭代。
该产品最激进的设计理念是“一切皆插件”。模型、工具、界面、审批策略乃至驱动 Agent 运转的主循环,均可拆解和替换。甚至 Web UI 前端都可以自行更换。例如,我们通过 Prompt 将其改为了洋红色主题。这表明 DeepSeek Harness 是一个由插件组成的生态系统。官方内置了标准、极简、代码、创造四种预设模式,V4-Flash 上个月在 Terminal Bench 刷榜时使用的正是“极简模式”。
开放的结果超乎想象。内测阶段,开发者们已制作了约 300 个插件,有人换上了 Windows XP 的复古皮肤,有人做了表情包插件。这种广泛的玩法证明了框架中没有任何东西是焊死的。
然而,Star 涨得有多快,质疑声就有多快。发布次日,社区评价出现分化,主要集中在用户体验不够友好以及插件生态的争议上。这些批评并非针对模型本身,而是针对 Harness 这个“壳”。
我们当晚的两个测试正好印证了这一点。第一个测试是重构极客公园官网,要求参照 The Verge 风格。虽然生成的网站格式和交互存在细微瑕疵,但通过安装额外的 Agent 能力插件,网站在迭代后变得更加现代。例如,官方插件库中的 DSH-OpenPencil 插件,让对话界面直接变身设计交付工具。
第二个测试是验证图片生成和数据提取能力。我们要求其利用 GitHub 公开 API 查询 deepseek-ai/deepseek-harness 的 Star 数据,结合人工记录的时间点,绘制增长曲线图。DeepSeek Harness 的“轨迹”页面记录了模型所见的一切:系统提示词、思维链、工具调用及返回结果,这使得我们可以验证它是真的抓取了页面,还是凭记忆“脑补”。这种“全程留痕”是它与聊天机器人的根本区别,也是它在 Hacker News 上获得好评的原因。
在成本方面,Harness 本身免费开源,模型调用照常收费。测试使用的 V4-Flash 价格低廉,整篇文章的 Demo 测试 Token 消耗未超过 3 元。会话底部实时统计了步数、耗时、Token 消耗及缓存命中率。
争议点在于效率。有第三方对比称,接入其他开源 harness 消耗的 Token 仅为 DeepSeek Harness 的三成。但我们的体感是,V4-Flash 速度快且准确率并未降低,这或许说明 Harness 仍处于开发者预览阶段。
02、Agent 界的 Android
模型公司亲自下场做“壳”,DeepSeek 并非首家。Anthropic 有 Claude Code,OpenAI 有 Codex,如今名单上补齐了最后一个大玩家。
Harness 可能是大模型打通生产场景最重要的路径之一。Composio 做过对照测试:同一款 V4-Flash 接入不同 harness,完成三十项任务,最好的完成 20 项,最差的仅 14 项。模型能力相同,结果却差出三成。模型划定上限,Harness 决定能力兑现的程度。
对 DeepSeek 来说,这层壳还有三重账:成本上,上下文组织、缓存命中决定了任务烧多少 Token;数据上,完整的失败记录是改进模型的最佳养料;生态上,提供 API 额度是为了将插件开发者留在自己的生态圈内。
站在更高维度看,过去两年模型公司卖的是 Token,像卖水。但从 Claude Code 开始,它们发现真正值钱的是“把事做完”。DeepSeek 是最新入场者,也是第一个把整个壳都开源的。它赌的是另一条路:别人把 Agent 做成成品卖,它把零件摊开,赌开发者会用这些零件拼出它都没想到的东西。
回头看,“像框架、不像成品”是今天关于 DeepSeek Harness 最大的争议,放在另一个坐标系里,这其实是一句恭维——安卓刚问世时,也是一副毛坯的样子,粗糙、开放、只吸引动手的人。后来的事,大家都知道了。DeepSeek 赌的,是 Agent 这个行当也需要一个 Android。
