据Business Insider报道,谷歌正在秘密测试Gemini 4的新版本,代号“Carbon”。该版本很可能是继本月初发布的Argon之后的迭代升级。Argon虽然主打长文本处理,能应对更复杂的任务,但在复杂编程场景下存在明显短板,而Carbon的研发重心正是补齐这一能力。
内部员工透露,Carbon的编码体验已能媲美Anthropic上月发布的Claude Opus 5.5。目前,Carbon已上线谷歌内部编码平台Jetson供员工测试。从反馈来看,Carbon的表现获得了不少肯定,有员工评价其体验“感觉就像Opus 5.5”,也有人称赞“Carbon真不错!”,尽管仍需更多测试验证。
10月1日,谷歌DeepMind正式推出了Gemini 4 Argon,这是谷歌迄今最强的AI模型。官方资料显示,Argon在软件工程、法律金融及网络安全等任务中能力突出,支持最高100万词元输出,相比前代6.4万词元的上限大幅提升。然而,尽管Argon在基准测试中成绩亮眼,但内部员工在实际使用中发现,其落地效果不及跑分,尤其在编程场景上短板明显。因此,Carbon极有可能是谷歌为了弥补这一不足而推出的版本。
值得注意的是,谷歌内部研发代号并不等同于最终对外发布的名称。内部文件显示,谷歌同步测试了多款Gemini 4模型,代号分别为Argon、Barium和Carbon。其中,代号Barium-B的模型最终对外定名为Argon。目前外界尚无法确定Carbon究竟是Argon的迭代版,还是Gemini 4系列中独立的全新型号。
在测试新版Carbon的同时,谷歌正面临巨大的市场竞争压力。自今年2月推出Gemini 3.1 Pro小幅更新后,谷歌已近十个月未推出全新旗舰模型。原定6月亮相的Gemini 3.5 Pro因未达内部标准,上线时间一再延后。在7月的财报电话会议上,Alphabet首席执行官皮查伊坦言,AI编程与智能体编程是谷歌仍需提升的领域。
当前,AI编码与自主智能体正是行业竞争最激烈的赛道。OpenAI和Anthropic等竞争对手持续加快迭代节奏。9月初,OpenAI发布了GPT-6 Astra,宣称其在软件工程能力上显著增强;9月22日,Anthropic推出Claude Opus 5.5,凭借出色的代码库阅读、跨文件重构及Bug排查能力,赢得了开发者圈的好评。这也是谷歌测试Carbon时直接对标Claude Opus 5.5的主要原因。随着Gemini 4系列的持续迭代,谷歌正试图缩小与行业领跑者的性能差距,巩固其在前沿AI赛道的优势,但能否如愿,仍有待观察。
