刚刚,马斯克旗下的xAI正式发布了全新主力模型Grok 4.7。其核心卖点主打“同样的价格和速度,提供超强性能”。马斯克第一时间宣称,Grok 4.7让xAI在智能体编程领域跃居第三,仅次于Anthropic和OpenAI。凭借速度快、价格低,Grok 4.7成为了个人进行生产力工作的首选。官方将其定位为“史上最强Grok”,专为编程和知识工作而生。在编程和知识基准测试中,Grok 4.7的成绩几乎超越了GPT-5.6 Sol Max,直逼Fable 5.1 Max。其定价为输入每百万Token 2美元,输出6美元,与4.6版本持平。但底层模型经历了彻底大换血,基座模型更大,强化学习训练时间更长,任务难度向“需要数小时才能完成的工作”倾斜。当Grok 4.7与4.6一起测试开放世界城市游戏时,差距肉眼可见。值得一提的是,下一代2.5T参数的新模型Grok 4.8也已训练完成,马斯克的拿手好戏才刚刚开始。
01 Grok 4.7登场,编程能力追进第一梯队
Grok 4.7的进步在编程测试中尤为明显。AA榜单的数据揭示了这一点。在综合智能指数上,Grok 4.7获得46分,相比4.6仅小幅上涨2分。而第一梯队的Fable 5.1和GPT-6 Astra均达到53分。按单模型排名,它位列第16;按实验室排名,刚好挤进第四。
真正让马斯克引以为傲的编程榜单包含两张:
第一,在GrokBuild框架加持下,Grok 4.7飙升至56分,仅次于Fable 5.1、GPT-6 Astra和Opus 5。马斯克所谓的“全球第三”,是将Anthropic的两个模型合并计算的结果。
第二,在统一基准Terminal-Bench4.0上,Grok 4.7的通过率骤降至26%至27%。相比之下,GPT-6 Astra为60%,Fable 5.1为55%。此外,在ValsAI评测中,Grok 4.7不升反降,从第14名跌至第24名,比上一代4.6还要落后5名。
马斯克为何拼命为Build框架站台?答案藏在官方公告的附注中——Grok 4.7在预训练阶段深度对齐了GrokBot框架的交互模式。这意味着它极度依赖自家工具的调用逻辑和任务拆解套路,一旦脱离自家环境,战斗力会大打折扣。
02 知识能力表现出色
本次升级的另一重点在于更贴近用户的办公场景。在长流程知识工作测试AA-Briefcase中,Grok 4.7获得1657 Elo,比4.6档位提升了111分。在GDPval-AA测试中,它获得1695 Elo,比上一代高出90分。这些任务考验的是AI能否帮助专业人士完成工作并交付高质量成果,例如整理材料、制作文档、完成分析与演示文稿,Grok 4.7相比上一代有显著提升。此外,在电气工程测试EEBench上,Grok 4.7拿下64.0%,在四款模型中排名第一。
03 全网首测:惊喜与翻车并存
Grok 4.7上线后,不少开发者迫不及待地进行了实测。最出圈的一个演示来自开发者Tak,他没有给出具体要求,只说“10分钟内能做啥就做啥”。结果Grok自己跑去Blender里制作了一个黄铜浑天仪,行星还能转动,引得25万人围观。Tak评价道:“讲真,一点也不差。”
经典的“鹈鹕骑自行车”测试也再次上演。有人开启xhigh加fast模式,烧了18分钟,花费3.16美元,生成的白鹈鹕在海边骑车、翅膀搭在车把上的画面效果很好。但另一个人跑出来的棕色鸟则瘫在自行车上,效果不佳。
产品博主Paweł Huryn用两个真实代码库、埋了105个bug测试了三轮。结果是GPT-6 Astra能修好45个,Grok 4.7搞定了28.7个,戏剧性的是,上一代4.6也是28.7个。
还有人进行了硬碰硬的对照试验:将同一芯片项目同时甩给Grok Build和Cursor里的Grok 4.7,两小时测试下来,最直观的感受是“又快又省”。此外还发现一个彩蛋:Cursor居然悄悄将Grok 4.7的上下文扩展到了500K,而4.6只有256K。做编程Agent的Factory第一时间接入了自家的Droid,评价比较克制:工程、调试、数据、基础设施的活都能干,找命令比4.6快,medium档够用,high档在老代码上有加成。
04 定价便宜,但总账未必划算
这次Grok 4.7官宣的另一个亮点是价格仅为同类产品的一半。不得不说,其单价确实诱人:输入2美元、输出6美元。对比Astra和Fable动辄10美元输入、50美元输出的价格,Grok单价便宜了5到8倍。官方晒出的Cursor Bench 4.0性价比曲线上,Grok 4.7高档拿下46.3%,解一道题成本6.01美元;Fable 5.1中档46.8%,一道题7.05美元。看上去像是一场势均力敌的较量。
但只要仔细看图表底部的细节,这笔账就全变了。Fable 5.1低档跑出45.1%,单题成本只要5.44美元,比Grok的最高档还要便宜;上一代GPT-5.6 Sol高档拿下35.7%,单题只需2.85美元。
玄机在于Grok惊人的“话痨体质”。其输出8.1万token,几乎是GPT-6 Astra的三倍。单价便宜5倍,但废话多了3倍,实际账单优势被生生腰斩。Hacker News上有开发者算清总账后吐槽:Grok 4.7的缓存读取单价甚至反超了Sol。Cursor社区更是直接表示:“这根本不是什么划时代的性价比怪物,花掉的token几乎是4.6的两倍,4.5时代那种极致廉价感彻底没了。”
不过在纯速度上,它确实快得凶残,AA实测每秒狂飙188个token,fast模式更是原地翻倍。
05 模型加框架,才是下一个战场
如今再看Grok 4.7的战术意图,已经彻底明牌。它不打算碰AGI的绝对王座,而是退守前沿第二梯队,卡住最便宜、最快的高地,专打性价比。但这场发布暴露出的真正行业趋势——单体模型的时代,正在过去。Grok 4.7的高分,有一大半是靠着Grok Build的量身定制硬顶上去的;一旦脱离自家的脚手架,分数立马露馅。Anthropic用Claude Code锁死长程任务,OpenAI用Codex把持生态,xAI也终于走上了用私有框架捆绑开发者的路子。未来的第三方评测榜单将彻底失去纯粹性,以后再看到所谓的跑分排名,第一句话必须先问:你到底是用什么框架测的?
