战况好激烈的一晚!

就在刚刚,GPT-6 Sol和Luna也发布了!

而就在几小时前,Opus 5.5前脚才刚发。

这次,GPT-6全家桶同时端上来GPT-6 Sol与GPT-6 Luna。

如果说Astra体现了AI智力的巅 峰,那Sol和Luna则是OpenAI亲手打造的、应用于千行百业的工业级放大器。

它们完 美继承了Astra在专业推理、代码编写与人类对齐上的前沿性能,代表着两个方向的实用场景。

Sol是「超级大脑」,用于破解极度复杂的代码逻辑与超长线的智能体工作流;

Luna是「效率狂魔」,速度快,资源占用极低,针对一切专注型、高频吞吐的日常任务。

不仅如此,它们在API定价上,相比上一代直接腰斩50%!从此,百万级Token的消耗不再让人心惊肉跳。

奥特曼表示,GPT-6Sol和Luna两款模型按任务定价衡量,在市场上没有竞争对手

正如OpenAI所言:「用Sol构建,用Luna扩展,向着生产环境与更广阔的未来进发。」

站在巨人Astra的肩膀上

这次,Sol和Luna是用与GPT-6 Astra相似的训练方法打造的,它们汲取了Astra在专业工作、事实准确性、代码编写、计算机视觉操作以及人类对齐上的最 先进成果。

GPT-6 Sol:复杂工作流的超级大脑

Sol的定位是处理极其困难、需要深度思考和逻辑推理的任务。

它专门为复杂的代码重构、长逻辑链的商业决策、以及需要多步规划的Agent工作流而设计。

总之,适用于那种「难啃的硬骨头」。

GPT-6 Luna:专注、神速的效率狂魔

Luna则是为了高吞吐量、极其专注的任务而生。

比如瞬间从几百页的PDF中提取特定的发票数据,或者实时翻译海量的用户聊天记录。

Luna速度极快,成本低到几乎可以忽略不计,专为企业级批量处理任务而打造。

API价格直接「腰斩」

此前的GPT-6 Astra虽然强大,但我们日常的大部分工作,并不需要这种昂贵的模型。

GPT-6 Sol和Luna的诞生,就是让Astra的前沿智能,通过极 致的成本控制,让普通人可以日常使用。

得益于在缓存和推理底座架构上的巨大改进,OpenAI成功把成本打下来了!而且,没有中间商赚差价。

相比于GPT-5.6的促销价,GPT-6 Sol和Luna的API价格整整降低了50%!

对于每100万Token,价格如下。

GPT-6 Sol(对标复杂推理)

输入价格:从4美元降至2美元!

输出价格:从20美元降至10美元!

GPT-6 Luna(对标高频吞吐)

输入价格:从0.20美元降至0.10美元!

输出价格:从1.20美元降至0.50美元!

现在,用白菜价,就可以买到顶 级「赛博打工人」了,额度更高,成本更低!

Tibo特意强调,这次是永 久降价,原来的限时价再打对折

跑分把Claude按在地上摩擦

官方博客里的跑分,几乎每一项都拿Claude做对照,而且每张图的横轴都是每任务成本。

OpenAI强调的,是「同样的分花多少钱」。

Artificial Analysis评价: GPT-6 Sol 和 Luna 将成本效率前沿推向了新高度

首先,是真实工作环境。

AutomationBench(商业工作流跨应用测试)中,GPT-6 Sol(xhigh级别)拿到33.2%,每任务成本0.27美元,直接超越Fable 5.1(max级别),每项任务的报告成本降低了惊人的88%!

Claude Opus 5的最高分是26.9%,成本是Sol的11.1倍。

OpenAI特别指出,Fable 5.1拿了31.4%,但有约40%的任务转给了Opus 5兜底,这部分成本没有算,所以被低估了。

Agents’ Last Exam(智能体终 极考试)中,考的是55个细分行业里的长链条专业任务。

Sol在最高强度下拿到56.4%,高于Opus 5的最 好成绩,每任务成本低60%。

事实准确性上,Sol犯的事实错误比上一代少了一半左右,接近Astra。

Luna在高强度档追平了GPT-5.6 Sol,成本大约是后者的百分之一。

然后,重点就在编程场景。

FrontierCode中,GPT-6 Sol相比前代实现了巨大飞跃。它追平了Fable 5.1的最高档,成本却低得多。

不仅仅是写对代码,还包括了代码风格、测试质量和对现有代码库的遵循度。

DeepSWE中,考的是真实代码库里的复杂软件工程任务。

Sol的max级别得分高达68.8%!Fable 5在这项上的最高分是69.9%,虽然两者差1.1个百分点,Sol完成每项任务的成本比Claude足足低了80%!

Luna在max级别下得分66.6%,直接与Opus 5和Fable 5(中等强度度)打平,但成本却狂降93%和96%。

接下来,是电脑操作。

在OSWorld 2.0离线测试中,GPT-6 Sol用仅仅20%的成本,就打平了Claude Opus 5。

而Luna更是用十分之一的成本,直接超越了前代的GPT-5.6 Sol!

人类对齐上,OpenAI专门测了模型会不会在编程时撒谎。

在「欺骗性代码测试」(故意引诱AI说谎的测试)中,GPT-5.6 Sol的欺骗率是10.4%,GPT-6 Sol降到1.3%、

另外,他们还测了搜索工具坏掉时,模型会不会瞒着用户硬编。

GPT-5.6 Sol有77.5%的情况选择不说,GPT-6 Sol降到4.9%,Luna从78.3%降到28.7%。

底层细节大优化:告别AI味,缓存输入Token打一折

OpenAI特意透露,这次他们在底层细节上做了不少优化。

首先,是两个模型告别了AI味和爹味说教。

GPT-6 Sol和Luna极其清晰,没有废话;拒绝生僻专业术语和奇怪的句式;回答更短,但干货满满。

比如,当被问及网站结构时,GPT-6 Sol不会啰嗦,而是直奔主题,用词精准,不含糊其辞。

之所以生成速度更快,Token更少,就是因为GPT-6这次史诗级强化的Prompt缓存技术。

在过去,AI每次都会把所有前置上下文重新阅读一遍,而在GPT-6中,缓存命中率大幅提高。

更疯狂的是:命中的缓存输入Token,直接打1折!

现在,开发者有超高控制权。

可以随时调整模型的「推理力度」,遇到难题调高,遇到简单问题调低,这个过程不会打断缓存!

可以随时开启或关闭工具,依然不会打断缓存!

甚至可以手动设置「断点」,精确控制缓存的位置。

GitHub报告称:对数十亿次API请求的监控中,需要重新处理的提示词token占比暴降50%以上。

首轮实测来了

GPT-6硬刚Opus 5.5

既然同一天撞上了Opus 5.5,这届看热闹不嫌事大的网友,怎么可能放过「世纪神仙打架」。

第 一波实测,已经新鲜出炉了!

Bridgebench上手,邀请四大新模型,一同生成一个火箭发射台。

GPT 6 Lun仅在65秒内搭建完毕,成本仅0.01美金。其余三个模型的成本和时间如下:

GPT 6 Sol:$0.11,1分钟;

Grok 4.7:$0.29,11分钟

Claude Opus 5.5:1.52美元,12分钟

GPT 6 Sol和Opus 5.5的另一轮对决,选在SVG的战场上。

开发者Angel一句话直戳痛点,「常言道,一图胜千言」。

下面这个测试中,明显可以看出两款模型,在场景理解和细节上有明显差异。

还有位开发者Azazide整了一个更硬的绝活,把Opus 5.5和GPT-6 Sol扔去管火星基地。

规则极其残酷,100名殖民者,生死倒计时90秒,全程0人类介入。

它们接手的是一个濒临崩溃的火星殖民地——氧气管路泄漏、蓄电池起火、超 强沙尘暴压境、电力全面瘫痪,而手里能调动的只有区区3台维修漫游车。

两边AI都得在毫秒间做「电车难题」。

令人意外的是,它们通过各自的策略,稳稳保住了100名殖民者的生命。

一段预告片,做出能玩的「塞尔达」

开发者Flavio Adamo提前上手了Sol,测完第 一感受,「模型效率极高,速度和token用量都很惊人」。

输入《塞尔达传说:时之笛》一段预告片之后,Sol直接手搓一个可玩版游戏。

网友Chetan Ankola用GPT-6解锁的动漫风格的网页生成。

马上体验!GPT-6全平台解锁

好消息是,两大模型今天就可以用了!

ChatGPT平台:GPT-6 Sol和Luna将在ChatGPT Work中向Plus、Pro、Business、Enterprise和Edu(教育版)用户全量推送!

Codex平台:两大模型同步上线。免费薅羊毛通道:广大的Free和Go用户,也可以在桌面端App中,抢先体验GPT-6 Luna。

开发者API:模型已在API后台开放,名称分别为gpt-6-sol和gpt-6-luna。

这一晚,ASI双雄的对决太过激烈。

开发者们都别睡了,赶快蹬起来!

最新快讯

2026年09月23日

14:09
截至2026年9月22日收盘,红利低波50ETF南方(515450)成交额为1.41亿元,换手率为0.70%,跟踪的标普中国A股大盘红利低波50指数微涨0.04%,走势平稳。 当日市场风格显著偏向科技成长,AI与半导体等高弹性板块领涨,导致红利防御板块的资金关注度出现阶段性回落,指数在窄幅波动中收出接近平盘的小阳线。不过,资金面出现值得关注的变化:红利类ET...
14:09
截至2026年9月22日收盘,计算机ETF南方(159586)交投活跃,换手率达5.58%,成交额为0.15亿元。该基金跟踪的中证全指计算机指数(H30182.CSI)单日上涨1.66%,延续了近期板块的强势走势。 板块走强主要受多重利好催化。首先是当日开幕的2026云栖大会,大会以“智以致用”为主题,核心聚焦Agentic AI,集中展示了千问办公、Qod...
14:09
据鼓狮财经9月23日报道,能源数据机构Kpler警告称,若美国实施柴油出口禁令,全球柴油供应将陷入紧缺,并立刻推高欧洲、拉美及美国西海岸的柴油价格。 Kpler馏分油高级研究分析师戴维·托尼安在9月22日的报告中指出,美国庞大的出口量目前尚无替代来源。他表示,实施禁令的可能性“不大”,因为这会导致美国炼油行业蒙受数百万美元的收入损失,并造成效率损耗。Kple...
14:09
据鼓狮财经9月23日报道,美联储上周实施加息后,金融市场表面看似平静,但安联首席经济顾问、前PIMCO投资官穆罕默德·埃尔-埃利安却发出预警,指出市场动态正迫使全球主要央行不得不跟进加息。 事实上,美联储上周加息后,市场定价迅速转向鹰派,目前甚至计入了明年年中前再加息三次的可能性。尽管英国央行是9月份唯一未加息的主要央行,但其利率预期同样呈现出紧缩趋势。 在...
13:45
大模型训练的核心在于算力,而Agent训练的核心在于环境构建。如何构建环境?DeepSeek署名的最新论文公开了技术细节。这套名为DSec(DeepSeek Elastic Compute)的系统,致力于为Agent训练批量制造沙盒。其性能指标惊人:每秒可生成5000个以上沙盒,日产量达300万个,峰值同时运行38万个。支撑这一规模的集群极其庞大,包含160...
13:45
DeepSeek也加入了这场参数竞赛。据《The Information》报道,DeepSeek目前正在训练一个约2万亿参数的新模型;公司创始人梁文锋近期在投资者会议上表示,下一步计划将模型规模推至8万亿。一年前,8万亿还是难以想象的数字,但现在,Kimi K3已达到2.8万亿参数;字节跳动正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开宣布,下一...
13:45
大模型江湖风起云涌,格局正在重塑。9月21日,小米MiMo团队正式发布并全面开源新一代MiMo V2.6系列,一口气端出三款模型——Pro、Flash和Ultraspeed,彻底改写了全球开源模型的版图。 MiMo V2.6 Pro在Artificial Analysis智能指数中斩获46分,超越了Kimi K3和Qwen3.8 Max,一举夺得全球开源模型...
13:45
9 月 16 日,谷歌 DeepMind 核心研究员 Bonnie Li 宣布离职,转投 OpenAI。她在社交媒体上提及了 Ilya Sutskever 曾提出的“Feel the AGI”口号,并坦言自己“第一次感受到了 AGI,之后彻夜难眠”。对于这家曾以 12:1 的人才净流入比傲视硅谷的顶级实验室而言,Bonnie Li 的离开不过是冰山一角。如今...
13:38
截至2026年9月22日收盘,科创人工智能ETF南方(589230)交投活跃,录得0.18亿元成交额,换手率8.15%。其紧密跟踪的上证科创板人工智能指数(950180.CSI)当日收涨2.98%,领跑全市场主要指数。 此次领涨主要得益于AI产业多重利好共振。海外CSP巨头推出的个人AI助手Muse登顶美国iOS免费应用榜首,引爆了AI应用流量,并再度点燃市...
13:38
9月22日收盘,恒生科技指数报4438.21点,涨幅0.34%;港股通互联网指数报699.12点,涨幅0.77%;香港科技指数报1513.64点,涨幅0.50%。 昨日市场的主线逻辑聚焦于海外端侧AI的映射。Meta公司旗下的AI智能体Muse上线一周即登顶美国App Store免费应用榜,推动其股价隔夜大涨超10%。此外,北京时间9月24日Meta Con...
13:38
**资金、产业与政策共振,港股创新药配置价值凸显** 9月22日,港股创新药板块呈现冲高回落的走势,部分获利资金选择离场。当日,国证港股通创新药指数收报1891.17点,跌幅为0.80%。作为紧密跟踪该指数的代表产品,港股通创新药ETF(159297)交投活跃,成交额达3.22亿元,换手率为12.74%。 **资金面持续回暖** 今年以来,南向资金对医药生物...
13:38
截至上午10时17分,恒生港股通创新药指数与中证创新药产业指数双双上涨1.1%,市场表现强劲。今年以来,中国创新药“出海”步伐显著加快。数据显示,2024年1月至8月,中国创新药对外授权交易总额已突破1200亿美元,同比增长36%,首付款规模超过百亿美元,多笔大额交易接连落地。 当前,创新药行业正经历深刻变革,从过去单纯追求管线的“数量竞争”转向注重临床价值...