最近感觉真让人头大,前几天大家还在喊着要放慢模型发布速度,结果这新模型就像不要钱一样往外扔。昨天Grok 4.7和MiMo v2.6的对抗,看来是为了给今天这两位“大哥”做铺垫。今天凌晨,OpenAI的GPT-6 Sol和Luna,以及Anthropic的Claude Opus 5.5正式发布。不禁想问,大家口中的“放慢”到底体现在哪里?感觉像是吃了一嘴的“渣男”。这种剧情我莫名眼熟,翻看历史文章,发现这简直就是历史重演——只不过对手从GPT-5.3 Codex和Claude Opus 4.6,变成了GPT-6 Sol和Claude Opus 5.5。两家公司,还是那两家,还是那个不服就干的死对头。

先聊聊Claude。坦率地说,尽管我非常讨厌Anthropic,甚至觉得这家公司不可理喻,也经常封我的号,但客观评价,Claude依然是我心中最好、最全面的模型。我至今记得Claude Fable 5带来的震撼。这次的Claude Opus 5.5是Anthropic全新5.5系列的首个模型,印象中很少一次性跨这么多版本号。我临时体验了一下(别问怎么封号还能用,直接买的次抛号,两小时就封的那种),感觉回到了Opus 4.6时代,非常有“活人感”。虽然定位是性价比款,但确实有种“白月光”的感觉。基本参数上,相比上一代Opus 5,整体成本降低40%,速度提升30%。在非大型任务上已达到Fable 5.1水平,大型高难任务仍需Fable级模型。Coding方面基本是SOTA,Terminal-Bench 4.0刷新至66.4%。但在Terminal-Bench-Science(科研)和AutomationBench(跨软件工作)上,仍落后于GPT-6 Astra。不过Computer Use能力绝对是SOTA。

这显示出两家公司在卷差异化方向:Anthropic偏向Coding和审美,相信Coding是AGI基石;OpenAI则专注全面Agent能力。但仅靠基准测试无法评估模型质量,规划与架构能力(Fable的优势)依赖于大参数和智能涌现。Opus 5.5更像是Fable 5.1的官方蒸馏版,在某些垂直场景更强、更小、更快,但容易因Token消耗过大导致成本飙升。一旦陷入困境,容易原地爆炸。X上大佬们的测试显示,Opus 5.5在审美和细节上甚至比GPT-6 Astra更精细,但代价是更慢更贵。5.5还强化了沟通,去除了绕弯和术语,更直接。

总结来说,Opus 5.5非常棒,Anthropic把旗舰活儿下放到主力价位,估计是被OpenAI逼的。建议:日常Feature、Debug、Code Review用Opus 5.5;重要结果、长时间无人监督或Opus 5.5失败时切Fable 5.1。Fable是专家顾问,Opus 5.5是主力员工。

终于到了我也能正常使用的环节——GPT-6 Sol和Luna。毕竟Claude再好,我也只能用次抛号,不是长久之计。前几天写GPT-6 Pro+MCP时预测过,Sol上线后,执行任务我会无脑切Sol,只有高难任务才切Astra。现在Sol已在Codex上线。针对Astra太贵的问题,Sol和Luna就是奔着降成本来的。Astra依然是最强模型,但Sol和Luna把Astra的能力下放到更快更便宜的模型上,策略与Claude如出一辙。定价上,Sol和Luna比GPT-5.6便宜50%。Luna单看输入输出甚至比DeepSeek还便宜,但缓存价格仍是DeepSeek的3倍。Luna最适合大规模自动化(如AIHOT背后的信息处理任务),缓存命中率低,优势明显。

知识截止日期不同,Luna最新到5月18号。Sol能力比预期稍弱,但降本幅度超预期。在AA基准上略优于GPT-5.6 Sol,但被Opus 5.5碾压。在AutomationBench(跨47种工具执行真实业务)上,Sol xhigh得分33.2%,成本0.27美元,比Astra低3.9倍,比Fable系列低8.9倍。GPT的优势在于Token效率极高,事实错误率极低,甚至能当事实核查器。推理等级很重要,低中档易出错,建议高甚至最高档。实测审美和细节下降,Blender建摩托车案例中,Astra完成度好,Sol门直接出bug,但成本降了70%,可接受。写稿时Sol/Luna已推送至Work和Codex,但ChatGPT聊天界面仍未开放,仅提供GPT-5.6 Sol,令人费解。

最后聊聊怎么选。模型太多太杂,确实累。

1. **能订阅Claude且不被封号:** 尽管我讨厌Anthropic,但用户体验上,Fable 5.1做规划,Opus 5.5做执行,是目前的最佳组合。
2. **被封号但能订阅海外模型:** 无脑选ChatGPT。GPT在创作、认知洞察、Coding上仍略强于Claude,且体验最好、额度无限、Codex好用。Astra/邪修Pro做规划,Astra高/ Sol xhigh做执行,Luna做批量自动化。
3. **只能订阅国产模型:** Qwen、Kimi、GLM、MiMo、DeepSeek没有断层级差距,习惯哪家用哪家。K3和Qwen 3.8 Max适合规划,GLM-5.3、Mimo v2.6 Pro、DeepSeek V4.1 Flash适合执行。切记只订阅1个月,不要买年卡。

以前是OpenAI/Anthropic做高端,国产做中端。现在供应链成熟,像苹果一样全域通吃。对用户是好事,AI性能成本每季度下降47%。未来半年,AI可能像水电一样廉价,真正的繁荣时代就要来了。

最新快讯

2026年09月23日

14:09
截至2026年9月22日收盘,红利低波50ETF南方(515450)换手0.70%,成交1.41亿元,跟踪标的指数标普中国A股大盘红利低波50指数涨0.04%。9月22日标普中国A股大盘红利低波50指数微涨0.04%,走势平稳。当日市场风格明显偏向科技成长,AI、半导体等高弹性方向吸金领涨,红利防御板块资金关注度阶段性回落,指数窄幅波动、收出平盘附近的小阳线...
14:09
截至2026年9月22日收盘,计算机ETF南方(159586)交投活跃,换手率达5.58%,成交额为0.15亿元。该基金跟踪的中证全指计算机指数(H30182.CSI)单日上涨1.66%,延续了近期板块的强势走势。 板块走强主要受多重利好催化。首先是当日开幕的2026云栖大会,大会以“智以致用”为主题,核心聚焦Agentic AI,集中展示了千问办公、Qod...
14:09
据鼓狮财经9月23日报道,能源数据机构Kpler警告称,若美国实施柴油出口禁令,全球柴油供应将陷入紧缺,并立刻推高欧洲、拉美及美国西海岸的柴油价格。 Kpler馏分油高级研究分析师戴维·托尼安在9月22日的报告中指出,美国庞大的出口量目前尚无替代来源。他表示,实施禁令的可能性“不大”,因为这会导致美国炼油行业蒙受数百万美元的收入损失,并造成效率损耗。Kple...
14:09
据鼓狮财经9月23日报道,美联储上周实施加息后,金融市场表面看似平静,但安联首席经济顾问、前PIMCO投资官穆罕默德·埃尔-埃利安却发出预警,指出市场动态正迫使全球主要央行不得不跟进加息。 事实上,美联储上周加息后,市场定价迅速转向鹰派,目前甚至计入了明年年中前再加息三次的可能性。尽管英国央行是9月份唯一未加息的主要央行,但其利率预期同样呈现出紧缩趋势。 在...
13:45
大模型训练的核心在于算力,而Agent训练的核心在于环境构建。如何构建环境?DeepSeek署名的最新论文公开了技术细节。这套名为DSec(DeepSeek Elastic Compute)的系统,致力于为Agent训练批量制造沙盒。其性能指标惊人:每秒可生成5000个以上沙盒,日产量达300万个,峰值同时运行38万个。支撑这一规模的集群极其庞大,包含160...
13:45
DeepSeek也加入了这场参数竞赛。据《The Information》报道,DeepSeek目前正在训练一个约2万亿参数的新模型;公司创始人梁文锋近期在投资者会议上表示,下一步计划将模型规模推至8万亿。一年前,8万亿还是难以想象的数字,但现在,Kimi K3已达到2.8万亿参数;字节跳动正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开宣布,下一...
13:45
大模型江湖风起云涌,格局正在重塑。9月21日,小米MiMo团队正式发布并全面开源新一代MiMo V2.6系列,一口气端出三款模型——Pro、Flash和Ultraspeed,彻底改写了全球开源模型的版图。 MiMo V2.6 Pro在Artificial Analysis智能指数中斩获46分,超越了Kimi K3和Qwen3.8 Max,一举夺得全球开源模型...
13:45
9 月 16 日,谷歌 DeepMind 核心研究员 Bonnie Li 宣布离职,转投 OpenAI。她在社交媒体上提及了 Ilya Sutskever 曾提出的“Feel the AGI”口号,并坦言自己“第一次感受到了 AGI,之后彻夜难眠”。对于这家曾以 12:1 的人才净流入比傲视硅谷的顶级实验室而言,Bonnie Li 的离开不过是冰山一角。如今...
13:38
截至2026年9月22日收盘,科创人工智能ETF南方(589230)交投活跃,录得0.18亿元成交额,换手率8.15%。其紧密跟踪的上证科创板人工智能指数(950180.CSI)当日收涨2.98%,领跑全市场主要指数。 此次领涨主要得益于AI产业多重利好共振。海外CSP巨头推出的个人AI助手Muse登顶美国iOS免费应用榜首,引爆了AI应用流量,并再度点燃市...
13:38
9月22日收盘,恒生科技指数报4438.21点,涨幅0.34%;港股通互联网指数报699.12点,涨幅0.77%;香港科技指数报1513.64点,涨幅0.50%。 昨日市场的主线逻辑聚焦于海外端侧AI的映射。Meta公司旗下的AI智能体Muse上线一周即登顶美国App Store免费应用榜,推动其股价隔夜大涨超10%。此外,北京时间9月24日Meta Con...
13:38
**资金、产业与政策共振,港股创新药配置价值凸显** 9月22日,港股创新药板块呈现冲高回落的走势,部分获利资金选择离场。当日,国证港股通创新药指数收报1891.17点,跌幅为0.80%。作为紧密跟踪该指数的代表产品,港股通创新药ETF(159297)交投活跃,成交额达3.22亿元,换手率为12.74%。 **资金面持续回暖** 今年以来,南向资金对医药生物...
13:38
截至上午10时17分,恒生港股通创新药指数与中证创新药产业指数双双上涨1.1%,市场表现强劲。今年以来,中国创新药“出海”步伐显著加快。数据显示,2024年1月至8月,中国创新药对外授权交易总额已突破1200亿美元,同比增长36%,首付款规模超过百亿美元,多笔大额交易接连落地。 当前,创新药行业正经历深刻变革,从过去单纯追求管线的“数量竞争”转向注重临床价值...