一夜之间,梁文锋与马斯克正面交锋。8月12日深夜,DeepSeek V4-Pro悄然上线API文档,随后官网横幅消失,直到8月13日晚19点19分才正式官宣。从4月24日预览版亮相到正式落地,历时111天。几乎同一时刻,马斯克的xAI推出了Grok 4.6。两款SOTA模型同台竞技,DeepSeek V4-Pro在AI安全和工作流自动化等特定领域更具优势;而Grok 4.6则在综合智能指数和软件工程测试中表现更佳,且成本效率突出。
**基础模型:马斯克更便宜,更好**
Anthropic推出的Claude Fable 5是当前AI行业公认的长链路任务处理和代码重构天花板。在DeepSeek V4-Pro与Grok 4.6同步亮相的当晚,两款模型直接向Fable 5发起冲击。跑分层面,官方公布的基准测试直接对标业界公认的两座山头,DeepSeek V4-Pro在多项指标上与Fable 5整体旗鼓相当。Grok 4.6则重点针对长程智能体、复杂编程和知识工作,在真实世界专业任务评测中拿到1753 Elo,高于Claude Fable 5 Max的1741分,Artificial Analysis Intelligence Index达到61。
用户体验方面,DeepSeek在速度上依然保持惯有的优势,仅用16分钟完成任务,用时为Grok的一半,视觉效果也超出预期。但也有用户实测发现,DeepSeek V4-Pro耗时更长、消耗更多代币,且在视觉任务上表现不佳,水面波纹处理缺失,帆船轨迹不自然。Artificial Analysis测评结果显示V4-Pro为53分,仅比Flash版本提高1分,引发不满。
性能之外,二者核心的区别体现在定价层面。DeepSeek V4-Pro当前定价为输入0.43美元/百万Tokens,输出0.87美元/百万Tokens,缓存命中输入只有0.0036美元。以Fable 5的价格作为对比,DeepSeek V4-Pro普通输入比Fable 5便宜23倍,输出便宜57倍。Grok 4.6输入2美元/百万Tokens,比Fable 5便宜5倍;输出6美元/百万Tokens,比Fable 5便宜8倍多。直接对比,Grok 4.6的单价约为DeepSeek V4-Pro的4.7倍(输入侧)和7倍(输出侧)。
不过,8月17日起DeepSeek将对API价格进行更新调整,采用峰谷定价。调整后,以高峰时段对比,DeepSeek-V4 Pro缓存命中输入涨至12倍,未命中输入涨至3倍,输出涨至4.5倍。涨价后,对比Grok 4.6,DeepSeek V4-Pro在高峰期的性价比优势已不明显。即便在涨价前,开发平台Composio的测评也显示,Grok在通过率、速度和成本方面均优于DeepSeek。
**智能体之争:完全不同的路线**
在正式发布DeepSeek V4-Pro的同时,DeepSeek面向全球开发者开放了DeepSeek Harness开发者预览版。公告明确表示,V4-Pro特意增强了Agent能力,而Harness正是承载这一能力的核心产品。Harness是DeepSeek于今年5月组建的代码智能体团队,旨在开发对标Claude Code的桌面端智能体编程产品。它内置多种子智能体和工作流能力,能够自主完成需求理解、代码生成、调试修复等多步骤任务。用户可以根据任务复杂度,为模型选择不同的“Agent预设”,如同给专家配备不同工具。
几乎同一时间,马斯克旗下的xAI推出了人工智能软件“Grok Bot”。这是一支全天候在线的智能助手团队,可以接受并完成用户分配的实际工作任务。SpaceXAI表示,Grok Bot最初是内部原型,已在公司内部普及,用于处理销售外呼、市场营销、办公室运营、漏洞修复等。目前处于测试阶段,面向SuperGrok Heavy、Cursor Ultra和Cursor Teams订阅用户开放。
DeepSeek Harness和Grok Bot走了两条完全不同的路线。Harness面向开发者,核心场景是编程;Grok Bot面向普通人,主打云端全能助手。实测发现,用DeepSeek Harness重构网页成本仅3元,但长程任务响应偏慢,需多轮交互,更擅长长文本、多步骤任务的资源优化。而Grok Bot响应速度快,但Token成本高于Harness。对比DeepSeek Harness,马斯克的布局远不止Grok Bot一张。今年6月,马斯克以600亿美元收购了AI编程初创公司Cursor。相比之下,DeepSeek的节奏显得更克制,集中力量自研,以工程效率追赶。双方都瞄准了智能体,谁能率先把模型能力嵌进真实工作场景,谁就握住了下一代应用的入口。
**算力之争:工程能力VS现金储备**
算力是决定谁能跑得更远的底层燃料,也是这场对决的核心比拼。几乎所有模型公司都遇到了算力不足的情况。月之暗面旗下的Kimi K3因为卓越的性能刷新榜单,但因用户请求远超预估,算力逼近集群承载极限,上线48小时便暂停订阅。DeepSeek今年频繁因服务中断登上热搜,背后就是激增的用户规模和算力扩容的严重错位。
梁文锋曾表示,DeepSeek拥有约两万张H100等效算力,落后美国12到18个月,国产算力卡可用数量仅一万六千张,难以支撑超大参数模型的完整训练迭代。算力的限制也让DeepSeek在技术路线选择上更为现实,梁文锋选择极致的工程优化,DeepSeek V3训练成本不到560万美元。但这并不能完全解决用户需求。DeepSeek已完成A轮510亿融资,新一轮融资也在推进,梁文锋直言融资要“尽快换成GPU”,如果市场允许,2026年采购200亿元算力也可以接受。
相比之下,世界首富马斯克在算力储备上要富裕得多。Grok 4.5由数万块NVIDIA GB300 GPU训练而成,其背后的Colossus超算集群总算力规模2024年约20万张H100 GPU,是DeepSeek H100等效算力(约2万张)的10倍。Colossus首批10万块GPU超算集群从启动到上线仅用122天,展现了马斯克在算力建设上的“钞能力”和执行力。在Grok 4.6发布前两周,马斯克在“X”平台上关注了DeepSeek的官方账号,连他旗下的Grok都承认这相当于把DeepSeek列入了“必须紧盯的对手名单”。
这场贴身肉搏之战还在继续。Grok 4.6只是前菜,马斯克明确表示Grok 4.7将在数周后推出,参数规模预计达到2.1万亿,目标“超越所有目前的模型”。而梁文锋也一直在追逐AGI(通用人工智能)的路上。从模型,到智能体,再到算力,马斯克和梁文锋的对决,还未分出胜负。
