报告!整个北美科技圈现在已经乱成一锅粥了。23号凌晨,Anthropic率先发布Claude Opus 5.5,强势登顶AA智力榜。仅仅两小时后,OpenAI也紧随其后推出了GPT-6 Sol和GPT-6 Luna,展开了激烈的反击。
世超迅速上手测试后确认,Claude Opus 5.5确实实力强劲,但GPT-6 Sol的表现则令人失望,好在GPT-6 Luna凭借极高的性价比稳住了局势。先看跑分,按照Astra对标Fable和Mythos的设定,Sol理应与Opus 5.5旗鼓相当。然而在AA榜单上,Claude Opus 5.5几乎一骑绝尘,比自家Fable 5.1还高出5分。反观GPT-6 Sol和Luna,分数基本与上一代持平,位置几乎没有变动,看来Astra更像是常规的能力下放。不怕不识货,就怕货比货,即使榜单有水分,这巨大的差距依然肉眼可见。
网友的实测也印证了这一点。虽然三款模型几乎同时发布,但网上展示的案例大多集中在Claude Opus 5.5上,偶尔才见GPT-6 Astra或Sol的影子,Luna则几乎销声匿迹。其中最令人惊艳的是一段动画短片,建模精细,动效自然,转场节奏丝滑,纹理质感逼真,很难相信这是纯代码生成的。此外,还有被Three.js官方转载的交互式3D镜头拆解,光线穿过树林、镜片直至成像板的过程,调整焦距和光圈时的物理解析力表现力拉满。对比GPT那边,赛车游戏的测试中,Opus 5.5在模型细节和场景渲染上质感更胜一筹,甚至有漂移和道具特写,而Sol则显得捉襟见肘,UI设计甚至透着明显的AI生成的廉价感。
这不禁让人怀疑,前些天传得沸沸扬扬的“世纪大和解”和放缓AI发展,难道是A公司放出的缓兵之计?不过未必,毕竟大家测试时往往不惜重金,但在实际工作中,性价比才是王道。AA榜单上的价格数据也揭示了另一番景象:GPT-6 Luna以0.07美元的价格强势触底,Sol为1美元,而尊贵的Claude Opus 5.5则高达5.98美元。这种差距光看单价不够,Token消耗更是惊人,Opus 5.5做任务非常“吃”token,大约是Sol的3倍,Luna的2倍。这符合当前趋势,次旗舰虽跑分接近,但实际工作时容易陷入深度思考,消耗更多资源。
我们也进行了一句话任务测试,体感上Sol稍显拉胯,Luna表现尚可,而Opus 5.5则带来了惊喜。例如,让三款模型回顾爱因斯坦一生,且禁止使用第三方工具纯代码生成。GPT-6 Luna的效果像PPT,左侧文字右侧图片,场景切换是经典渐变,虽然画面和配色讨喜,但确实谈不上动画。好在它只消耗了2%的额度。GPT-6 Sol的直出效果则更令人失望,消耗了比Luna多几倍的额度,风格与Luna如出一辙:米黄色背景加晃动组件,分镜配色动效都差不多,像同一锅蒸出来的。但查看思维链发现Sol很在意工程完成度,会主动适配手机端。相比之下,Claude Opus 5.5则完全不同。画面围绕主线设计,去掉了突兀的分区,精准还原了“剪纸拼贴”风格,组件边缘有毛刺和阴影,立体感强。动效丰富,小提琴、水流、船、时空弯曲的引力井动画都精准到位,解析力极强。全程仅消耗30%的额度,没有出现“雷霆大思考”。
接下来测试网页小游戏开发,要求融合Minecraft和漫威蜘蛛侠玩法。GPT-6 Luna耗时12分半,消耗2%额度就完成了,不愧是价格极低的模型,就是质量一言难尽。虽然蜘蛛侠造型尚可,但城市材质缺乏Minecraft感,更像是工业白模。两种玩法冲突导致光标锁定,只能再花3%额度修Bug,修完后仍可见透明蛛丝、纯色方块和凿不动的地底,金门大桥建模简陋。只能说快是快,但太草率。GPT-6 Sol则和Luna一个模子刻出来的,左右映射反转,但修Bug效率比Luna高,能快速理解需求。不过交付质量依然崩坏。相比之下,Claude Opus 5.5的表现鹤立鸡群。开始菜单旁展示实时运行画面,环绕运镜逼格拉满。方块材质保持Minecraft风格,建筑完成度高,复刻了旧金山景点,街道有车跑,云雾缭绕,氛围感十足。整个作品一次性生成,消耗约一个5小时额度,无需调试,丝滑流畅。
测试表明,Claude Opus 5.5虽与GPT-6 Sol同代,但在意图理解和执行效率上明显高一档,且Token开销未达预期,比自家Fable和隔壁GPT-6 Astra更让人放心。GPT-6 Luna适合做执行模型,性价比极高。而GPT-6 Sol略显乏力,前端能力难以匹敌Opus 5.5。不过,现在模型众多,大包大揽已无必要。实际场景中,人们更倾向于组合使用:让聪明且昂贵的模型做规划,让便宜且管饱的模型做执行,追求性价比。厂商显然也看透了这一点,像手机厂商一样推出不同价位段的产品,并开始搞促销。看着Tibo老哥猛发重置卡,Anthropic也紧随其后,发布模型时就送重置卡。毕竟大家都是订阅消费,重置卡比单纯降价更实惠。此外,Anthropic在发布Opus 5.5时引用了“蚂蚁种西瓜”的视频,寓意进化循环,这很难不让人联想到RSI自我进化的概念,莫非这一代Claude正在种出下一代?不过这是否为彩蛋已不重要,模型进化的脚步未放缓,OpenAI和Anthropic这对老冤家仍在激烈竞争。只是打到这儿,突然想起还有位老朋友Gemini,身为“远古御三家”之一,隔壁都打成这样了,你就不打算支棱一下吗?
