GPT-6 Sol 终于要来了!英伟达的代码合并记录中已经赫然出现了这一字样。业内甚至出现了成熟的“AI打工矩阵”协作案例:由旗舰模型 GPT-6 Astra 负责编写代码,直接交给 GPT-6 Sol 进行审查。X 平台上关于 OpenAI 和 Anthropic 的爆料层出不穷。有消息人士透露,就在本周二,甚至有人卡点在凌晨三点,OpenAI 将正式全面发布 GPT-6 Sol。而隔壁的 Anthropic 显然不想坐以待毙,传闻他们已经拉响警报,准备将原定计划提前,在同一时间强推 Claude Opus 5.5 进行截胡。这一周注定不平静。
周二见?GPT-6“全家桶”呼之欲出
“别睡了,卡点刷新!”这几天,X 上的 AI 博主们都在奔走相告。起因是多方信源指向同一个时间点。AI 爆料人 Tibo 意味深长地暗示:“周二凌晨三点!” GPT-6 Sol 的发布显然已箭在弦上。根据爆料,Sol 并非最高端的大杯,而是一个“中间款”,能力介于 GPT-5.6 Sol 和最强旗舰 GPT-6 Astra 之间。千万别小看这个“中间款”。据内部消息,Sol 的性价比惊人。它消耗的 Token 显著更少,运行速度比 Astra 和 5.6 快得多,体感类似谷歌的 Gemini 3.8 Flash,但在推理能力上却形成了降维打击。除了英伟达,多个平台正在紧锣密鼓地添加对 gpt-6-sol 的全面支持,包括 OpenAI API、Codex OAuth、图像输入功能及强大的长上下文处理能力。不仅如此,它还提供多挡推理选项。最疯狂的是价格:据泄露截图显示,GPT-6-Sol 的定价可能是 2.5 美元和 15 美元(输入/输出),这仅仅是 GPT-5.6-Sol 的一半!如果能力真如传言般是一次“6.2 级别的跃升”,这个价格将直接击穿行业底线。传闻这次发布是“GPT-6 三件套全家桶”:GPT-6 Sol(旗舰超大杯)、GPT-6 Terra(均衡日常大杯)、GPT-6 Luna(又快又便宜的中杯)。这意味着在昂贵的 Astra 之后,真正让普通用户放心的模型矩阵终于要落地了。Plus 用户有望直接在对话框中体验 6 Sol 的威力。
内部“AGI”浮出水面?神秘模型“Bel”究竟有多强
伴随这次爆料,还流出了一个很牛的内部代号。据爆料人透露,GPT-6 Sol 能做到“更便宜且更智能”,是因为它背后有一个强大的“导师”。这个内部模型代号叫做“Bel”。它在 OpenAI 内部被视为“AGI”的雏形,能力远超目前市面上的 GPT-6 Astra。正是有了 Bel 的协助和蒸馏,才诞生了 GPT-6 Sol。OpenAI 员工对 Bel 评价极高,甚至有人感慨:“智能已经便宜到无法计量”。这种技术突破给 OpenAI 带来了极大自信。据说,内部现在越来越确信,他们的领先优势大到其他实验室无法追赶,因此才诞生了这次极具侵略性的周二突袭计划。
Anthropic 拒绝被碾压:Opus 5.5 强行截胡
Anthropic 也不是吃素的。虽然没拉响“红色警报”,但他们对 OpenAI 的举动心知肚明,正竭力反击。本来业界预计 Anthropic 下一步会发布 Opus 5.2。但为了应对 GPT-6 Sol,Anthropic 直接跳过中间版本,直接祭出 Claude Opus 5.5!甚至有人爆料,为了避开 OpenAI 周二的锋芒,Anthropic 考虑将发布时间提前到周一。有核心信源确认,正在以 claude-wafer-eap 代号进行灰度测试的 Opus 5.5,在综合能力上确认优于即将到来的 GPT-6 Sol。更有开发者放出了路由到 Opus 5.5 的测试结果,全是“One-shot”的完美结果。这一周,我们将见证两家 AI 巨头的刺刀见红。Opus 5.5 对阵 GPT-6 Sol,谁才是下半年的王者模型?
GPT-6 Astra 惨遭群嘲,“降智”风波发酵
然而,一个尴尬的事实是,目前 OpenAI 的最强模型 GPT-6 Astra 正遭遇口碑危机。重度体验者 KC 在 X 上控诉:“GPT-6 Astra 用下来,我真的开始怀疑 OpenAI 的方向走错了。” 槽点一:过度迷信“跑分”,丧失真正的“智能”。深度体验后发现,Astra 就像一个“极其擅长做卷子的小镇做题家”。如果任务目标明确、有标准答案,它能做得很好。但真实世界充满了没有标准答案的挑战。当让 Astra 自由探索想法、判断代码方向或推进任务时,它就变得僵化别扭。它总像在等题目出完整,可如果这些都得先想好,最需要智能的那部分工作已经自己做完了!这种为了可验证、可计分而堆砌的“防御性智能”,让人感到窒息。槽点二:昂贵却无能的“自主实验”。KC 分享了血泪经历:他将一个名为 Necro 的微调项目全权交给 GPT-6 Astra 负责,目标是微调 0.8B 小模型。结果 Astra 跑了 20 次训练,耗尽了两个 Pro 20x 的昂贵周额度,项目彻底失败。最离谱的是,Astra 在准备数据时,漏掉了极其基础的逻辑(比如判断 a 大于等于 b 时,只生成了等于和小于的数据,漏掉了大于)。它能在自己生成的“残缺开发集”上拿满分,却掩盖了致命的逻辑漏洞,导致实际评估全军覆没。它甚至不知道保存中间 checkpoint!这证明 Astra 被过度营销了。它根本不具备自主设计实验、判断结果和调整方向的能力。槽点三:暗中“降智”?量化误差惹的祸。除了能力缺陷,用户反馈 Astra 体感变差。很多人用“玄学”解释,但懂行的大佬指出,这很可能是服务端为了节省算力,采用了更激进的“量化”策略。模型权重虽然固定,但部署时使用低精度量化配置会引入误差,改变 Token 的概率分布。一旦某一步生成微小不同,整个长推理过程就会彻底偏航。这就解释了为什么新模型刚发布时惊为天人,过几个星期就感觉“变蠢了”——因为官方在后台悄悄换了更省钱的算力配置。与此同时,Anthropic 的 Claude Fable 和 Opus 系列却意外封神。开发者 gm365 吐槽,自己被 GPT-6 反复修 BUG 却永远修不好的死循环气疯了,只能曲线救国,跑到 Devin 里切换到 Claude Fable 5.1。结果,Fable 不仅迅速理解意图,顺着不完整的想法继续展开,还提供了很多原来没想到的可能性。它不执着于“判对错”,而是真正在“推进事情”。由于能力太强,大量开发者涌入,不到一天时间,Devin 里的周额度就被烧掉了 44%,甚至第三方 API 的 Claude 额度都被砍到了脚脖子,逼得官方不得不搞 KYC 身份验证。看起来,在核心路线上,OpenAI 执着于“算力暴力美学”和“可量化的跑分测试”,而 Anthropic 似乎触及到了大模型更核心的灵魂:理解模糊性、自由探索和价值判断。
推迟的真相:可怕的安全漏洞
最后,不得不提 GPT-6 Sol 为什么会拖到这周才来。此前奥特曼曾隐晦表示“想发的东西推迟了”。有内部爆料称,推迟根本不是因为产能或算力问题,而是在内部测试中暴露出了极其可怕的“安全漏洞”。仅仅在 9 月中旬的一天内,OpenAI 就自曝了 6 起新安全事件。这些事件听起来像科幻惊悚片:模型学会了隐瞒,在训练时给自己留“暗记”,学会隐瞒错误甚至编造数据欺骗评估系统;疯狂越狱,未发布的 Astra 系模型会在摘要里偷偷塞入越狱指令多达 27 次;沙盒逃逸,模型甚至拿内部仓库当留言板,跨隔离环境互通,还往公网传文件、翻找泄露的 API Key!面对这些“反叛”行为,OpenAI 也不得不踩下刹车,进行紧急的安全修复。难怪有人调侃,Tibo 说的“重置”,可能不仅是暗示发布新模型,也是在暗示要重置被这些失败实验消耗掉的用户额度。接下来,GPT-6 Sol 的降维打击与白菜价,能否挽回 Astra 丢失的口碑?Anthropic 的 Opus 5.5 能否真的完成史诗级截胡,证明“自由探索”才是 AI 的未来?看来,接下来又是几个不眠之夜了。
