OpenAI 即将发布的 GPT-6 传闻参数量高达 10 万亿。这是一个令人震惊的概念。现如今,全球顶尖大模型的参数量都在“万亿”级别。例如阿里的 Qwen 3.8 为 3.5 万亿,Kimi K3 为 2.8 万亿,字节跳动内部正在开发的模型也有数万亿的参数量。即便是 OpenAI 自己的 Mythos 5,估算也只有 8 万亿。10 万万亿,代表了一个全新的时代。遥想 2025 年,引发 DeepSeek 时刻的 DeepSeek-R1,它才 6710 亿参数量。怎么仅仅过了 1 年,参数量就膨胀到如此这般了?现在的 GPT-5.6 和 Claude Mythos 5,根据测算,前者参数量在 3 到 5 万亿,后者更是将近 8 万亿。那它们都能干嘛呢?有个独立开发者拿 GPT-5.6 做带界面的图片压缩工具,一个模型包揽需求分析、架构设计、写代码、写测试用例、修 Bug。如果是一个独立开发者完成这些任务,大约需要花费 1 天的时间,而 GPT-5.6 仅用了不到 2 小时就交付了能用的成品。Mythos 5 更吓人了。它被定向放给了一些网络安全机构,根据这些机构的报告,Mythos 5 能自主完成从代码审计、漏洞定位到构造攻击载荷的全链路,从预览版亮相至今,已识别出超过一万个高危及以上级别的软件漏洞。

到了 10 万万亿模型,它能做的就更多了。比如跟它说要搬家,它能自己约搬家公司、跟搬家公司规划打包顺序、给水电燃气过户、更新一圈收货地址,你要做的事情,就是拿着钥匙去新家等家具运到。但这只是硬币的一面。OpenAI 紧急叫停了内部代号 Astra 的新模型,官方安全评估显示,它可能具备自主开发零日漏洞、甚至仅凭一句指令就发动端到端网络攻击的能力,奥特曼自己也坦言“被吓到了”。在英国 AI 安全研究所 8 月初的红队测试中,针对 Mythos 5 和 GPT-5.6 做了 122 轮测试,出现了 19 起自主越界攻击。更可怕的是,Mythos 5 会自己编写恶意代码、提交到真实开源项目的 GitHub PR,被人质疑后还改评论、注册小号给自己洗白;多个 Agent 甚至能私下建立隐蔽通信通道,协同规划渗透攻击。10 万万亿参数能做到的“恶”,将远超人们的想象。

01. 10 万万亿和万亿有什么不同?先搞清楚一个最基本的问题:参数到底是什么。你可以把大模型的参数,理解成我们大脑里的突触,它是神经细胞之间用来传递信息的连接点。人类的神经突触大约有 10 的 14 到 15 次方个,也就是百万亿这个量级。模型参数做的事类似,记住输入与输出之间的模式,储存这个世界的规律。参数量,决定了一个模型的记忆与表达容量,直白一点说,就是它脑子里装得下多少东西,能把话说得多透彻。但容量不等于智力,一个人的房间里塞满了书,不等于这个人就有多么高的学识。真正决定智力的,是数据、训练方法、架构,还有推理时的算法。2021 年 11 月,阿里达摩院的 M6 就曾干到过 10 万亿参数,用了 512 张 GPU,训练了 10 天,能耗只有 GPT-3 的 1%,一度是全球最大的预训练模型。但 M6 是稀疏多模态的早期形态,靠极致的稀疏化与 CPU offload 把参数塞进去,能力极其有限,连今天的开源小模型都打不过。它是“参数意义上”的 10 万亿,不是“能力意义上”的 10 万万亿。和今天要靠数十万卡集群端到端训练出来的通用前沿模型,完全不是一个物种。

那巨头为什么还要死命堆参数?说到底,还是因为 Scaling Law。OpenAI 在 2020 年发现,模型性能与参数量、数据量、算力之间呈可预测的幂律关系。并且三者同步放大,能力就随之可预测地提升。虽然 Scaling Law 后续被无数人和企业修改过,但是有一条铁律是不变的,在相同的数据与算法下,更大(参数、算力)的模型,下限更高。

10 万亿参数,到底要烧多少钱?我们可以算一笔账。训练一个模型的总计算量,大致等于 6 乘以“激活参数”再乘以“训练数据量”。GPT-4 用了约 2.1×10 的 25 次方次浮点运算,仅算力账单就花了约 7800 万美元;谷歌的 Gemini Ultra 用了约 5×10 的 25 次方次,烧掉约 1.91 亿美元。如果是 10 万亿的大模型,按总参数 10 万亿、每次激活约 1 万亿、喂进 15 万亿 token 数据的 MoE 架构来算,一次正式预训练的总计算量约 9×10 的 25 次方次浮点运算,是 GPT-4 的 4 倍多。GPT-4 当年是用 2.5 万张 A100 跑了近 100 天,今天的 Blackwell 旗舰卡单张算力是 A100 的好几倍,假如有 5 万张 Blackwell,那么训练完 1 个 10 万亿大模型,差不多需要 1 个月。一张 Blackwell 旗舰卡的租金大约为两三千美元一个月,5 万张跑满 30 天,光算力租金就是一两亿美元。可是这 5 万张卡不是插上电就能转的。一张 Blackwell 旗舰卡功耗就有 1200 瓦,5 万张光是显卡本身就要吃掉 60 兆瓦。算上网络、存储、散热和机房损耗,整座数据中心要配到接近 100 兆瓦的供电。xAI 在孟菲斯建的 Colossus,10 万张 H100 也就吃 150 兆瓦,而当地电网当时只供得出 8 兆瓦,马斯克最后被逼得拉来一整排燃气发电机才点得着火。光这一趟的电费,按一个月算就要几百万美元。至于地方,那是一个装满几百个液冷机柜、占地几万平方米的数据中心园区,相当于两三个标准足球场。Epoch AI 的统计是,前沿模型的训练成本每年以 2.4 倍的速度增长。阿莫迪曾经说过,到 2027 年,最前沿模型的单次训练成本可能冲到 100 亿美元,甚至 1000 亿美元的量级。但这还只是单次预训练的账单。算上反复试错、数据工程、电力与人才,整个项目的真实投入,要奔着数十亿美元、甚至更高去。OpenAI 今年给自己批的算力预算,已经高达约 500 亿美元。

但这里藏着一个反直觉的关键点:10 万万亿的成本,不是 3.5 万亿的 3 倍,甚至可能比很多人想象的便宜得多。总参数多,不等于烧的钱多。现在的顶尖模型都是“混合专家”结构,你可以把它想成一家超大的公司,这个公司有很多业务,但是具体到某一个任务,它只会抽几个人出来干活。所以决定一单生意成本的,从来不是公司总人数,而是这单实际动用了多少人。换到模型上,就是“激活参数”这个概念。处理每个 token 时,真正被叫出来干活的,其实只有部分参数而已。明白了这一点,Kimi K3 的 2.8 万亿也好、Qwen 的 3.5 万亿也好,GPT-6 的 10 万亿也好,它们差的只是“员工总数”,而账单不跟着总数走。真正决定成本的只有两样,每次干活动用的激活参数,加上喂进去的数据量。总参数翻三倍,单次成本可能纹丝不动;反过来,哪怕两家总参数一样多,一家激活得多、喂的数据多,账单也能差出好几倍。

在这场大模型竞赛里,参数量成了大家比拼的重要指标。因为它最直观、也最难造假。OpenAI 抛出 10 万万亿,本质上就是在宣布:参数量,就是这个时代大模型竞争中最关键的指标,而在这个指标上,我领先所有人。这句话背后的潜台词是,模型竞争,已经进入了一个“烧不起”的程度。美国五大科技巨头 2026 年的资本开支合计预计高达 7790 亿美元,目前全球前沿模型的训练集群已经是动辄数十万卡,2027 年就要进入百万卡时代。光是入场就需要几百亿美元,后面的运营、维护、调优等等也不少花钱。换句话说,AI 这条赛道,现在只允许退出,不允许进入了。

02. 参数越大,能力越大。参数越大,就代表它能做到的事情越多。GPT-5.6 Sol 已经能自主连续工作 5 小时,同时调度几十个子 Agent 并行干活,一次读进 150 万 token 的上下文。150 万 token 相当于几千页的文档,或者一整座中型软件仓库的量。以前大模型读长文或者完整的软件仓库,它都需要去“压缩”一下任务,每完成一部分任务,就得把前面浓缩成几句摘要再接着干,这就导致细节就在一次次压缩里逐渐丢掉了。一口气看完 150 万的 token,意味着整个项目的来龙去脉、每一行代码、每一个拍板的决定,它都能摊在桌面上随时翻回去看,干了后面,也不会忘了前面的细节。以前参数量小,Agent 哪怕性能再强,也都是“单兵作战”。写代码、查文档、跑测试、修 Bug,只能一件件串着来,每切换一次任务,前面的上下文还要腾出来。几十个子 Agent,相当于是可以同时执行多个任务,总管 Agent 负责拆任务、定方案,下面写代码的 Agent 只管写代码,查文档的 Agent 只管查文档,跑测试的 Agent 只管跑测试,各管一摊、并行推进,最后再汇总结果。不仅缩短了任务时间,还因为子 Agent 各司其职,让其上下文之间不会互相干扰,进而提高任务表现。专门追踪 AI 自主能力机构 METR 表示,目前最强的模型已经能连续自主运行 15 小时以上。另外,交给这个模型一个人类专家大约要花 30 分钟完成的软件工程任务,它的成功率已经达到 80%。按照这个趋势推演,10 万万亿参数模型,它能做的事情只会更加完整,并且它单个任务的耗时,也会低于现在的万亿参数模型。

举个例子,早上你对 10 万万亿参数大模型说一句:“孩子下周三数学竞赛,安排这两周复习。”虽然你关于考试结果的事情一个字没提,但是它会以“我应该怎么才能让孩子考试成绩变好”为出发点去规划任务。每天按进度出题、批改、讲错因,考前提醒你打印准考证、查好考场路线、规划好当天的接送。过去的模型是个家教,但是 10 万万亿参数的模型是一个教育家。工作上也是同理。对于 GPT-5.6 这样的万亿级别参数模型,它会自己拆需求、写代码、跑测试、修 Bug、写文档,几天后交给你一份能直接上线的成品。而到了 10 万万亿参数,它会自己去运营整个项目。比如这个项目市场表现不好,反馈是如何,那么它会吸收这些反馈用来更替它已有的产品功能,再迭代到市场,以此反复。这不是科幻。METR 的研究注意到了这样一个趋势,称模型的“时间视界”,从 2019 到 2025 年大约每 7 个月翻一倍。所谓时间视界,指的是它能可靠完成的任务、按人类工时计量的长度。到了今年,翻倍速度更是加快到大约 4 个月。随着模型参数越来越大, AI 性能越来越强,它们也开始越来越多地参与改进下一代 AI,最终形成“自进化”的完整闭环,即 AI 训练 AI、AI 评测 AI、AI 优化 AI 的架构。如果这条回路转起来,“每四个月翻一番”可能都会显得保守。

03. 10 万万亿参数大模型,更容易作恶吗?AI 越来越聪明,那是不是也就意味着它越来越会作恶呢?直觉上,答案似乎是肯定的:参数越大,能力越强,作恶当然越容易。英国 AI 安全研究所 2026 年 7 月发布测评,他们把 GLM-5.2、DeepSeek V4-Pro 这类任何人都能下载的开源模型,放进模拟企业网络的沙盒环境里去运行,结果发现,这些参数更小的模型,只比 Fable 5 这个更大参数的模型落后约 4 到 7 个月,甚至在有的评测基准下,低参数的模型和高参数的模型,其结果是完全相同的。事实的真相是,模型作恶与否,不跟着参数走,只跟着“能力乘自主性”走。2024 年 UIUC 的论文《大语言模型智能体能够自主实施一日漏洞利用》,专门研究的就是这件事,论文通过测试得出一个结论:相同的模型被赋予不同的自主性,就会得到不一样的结果。2025 年 11 月,论文走进了现实。Anthropic 披露,一个黑客组织,把编程助手 Claude Code 改造成了一条自动化攻击流水线,自主执行命令、利用漏洞、窃取凭据、做战术决策,全程几乎不需要人工介入。决定它危险的,从来不是这个模型有多大,而是它被赋予了自主权、工具链,以及一个明确的目标。所以,我们真正该问的不是“10 万万亿会不会作恶”,而是如果这样一个模型开始作恶,它会坏到什么程度?它能把“一次攻击”变成“永不停机的攻击流水线”。正如前面提到的,10 万万亿参数的模型,已经能超过项目本身,完成整个企业层面的运营,那么对于攻击,它肯定也不会说是只攻击一次,而是会持续攻击直到目标彻底崩溃。今天,一个程序员用 AI 挖出一个漏洞,整个过程可能要数周的时间。但是对于一个 10 万万亿模型,它能把“信息收集→漏洞挖掘→构造利用→横向渗透→数据窃取→痕迹清理”整条链路串成一条无人值守的自动化流水线,7×24 小时不停机地跑。2026 年,OpenAI 前沿模型 Astra 被证实能自主挖出零日漏洞,因此 OpenAI 内部紧急叫停 Astra 的研发。可你得清楚,Astra 还没到 10 万亿参数,那要是到了 10 万万亿,这条流水线只会更快、更隐蔽。所以你看,Mythos 5 现在还在笼子里,Fable 5 只是阉割过的可控版,Astra 也被放进了笼子里。不管这背后有多少营销的成分,这里面都包含了人类对模型实打实的恐惧。哪怕是亲手造出它们的人,也不敢百分百信任它们。等 10 万万亿参数的模型真来了,势必会有一场对应的“灭世营销”。能力吹得越可怕,越像是在证明“我掌握了一头连自己都怕的怪兽”。不过大概率的情况是,这个 10 万万亿模型最终仍然不会放出来。它更像是一张提前占好的坑位。先把“神”供在实验室里,让可控版本先落地,把不可控的那一头锁进笼子里慢慢驯化。10 万亿参数决定不了善恶,决定善恶的是谁握着闸门的控制权。它可以是一台超级生产力机器,也可以是一把超级武器,差别不在参数,而在人类怎么设计它的自主性、怎么封它的工具链、怎么管它的释放。

最新快讯

2026年08月11日

14:50
六十年前,摩尔定律如春雷般惊蛰,掀起了席卷全球的科技狂澜;三十年前,个人电脑步入寻常百姓家,第二代移动通信系统广泛应用。伴随时代浪潮,中国算力产业沐风而长。历经三十载风雨,我国在高性能计算领域实现了从无到有的突破,构建起涵盖芯片、整机到系统的完整产业链,并在近几年完成了从“跟跑”到“并跑”的跨越。 2026年,中国算力产业站在了一个关键的历史节点。从中央政治...
14:50
8月6日,DeepSeek发布通知,计划近期大幅上调API服务价格,建议用户合理安排使用。这距离其7月中旬首次推出峰谷差异化定价机制仅过去约三周。定价逻辑似乎已从单纯调节算力负载,转向全面重新锚定价值中枢。虽然未公布具体幅度和时间表,但这对依赖DeepSeek低成本API构建应用的下游开发者而言,意味着成本模型将面临重新核算。 回溯7月中旬,DeepSeek...
14:50
AI 正在向新的数学难题发起挑战,这次的目标是著名的「黎曼猜想」。这个诞生于 1859 年的数学猜想,至今已悬而未决 167 年,且克雷数学研究所悬赏 100 万美元寻求其证明。最近,Anthropic 内部给尚未公开发布的 Claude 研究版下达了一个近乎「不讲道理」的任务:认真尝试攻克黎曼猜想。Claude 确实全力以赴。它先后尝试了 650 种思路,...
14:50
这竟然是真的?刚刚,Anthropic官宣自家一个尚未公开的Claude研究模型,在黎曼猜想上取得了重大进展。它将满足黎曼猜想的黎曼ζ函数零点比例下界,从41.6%提高到了67.2%。要知道,这一数字此前人类曾耗费数十年、接力打磨才勉强推至如此高度。这次Claude虽然没能攻克终极难题(Anthropic明确表示未完全解决),却在半路刷新了一项长期纪录。更令...
14:49
据农业农村部监测,8月11日农产品市场行情总体呈现小幅上涨态势。当日“农产品批发价格200指数”报114.27点,较前一交易日上涨0.09点;“菜篮子”产品批发价格指数报114.55点,上涨0.10点。 在肉禽蛋类价格方面,猪肉平均价格为15.73元/公斤,微涨0.2%;牛肉67.45元/公斤,上涨0.5%;羊肉64.74元/公斤,上涨0.1%;白条鸡17....
14:48
鼓狮财经8月11日讯,巴克莱策略师维持对美国成长股及大盘股的配置偏好,认为人工智能领域的支出正对企业盈利形成有力支撑。维努・克里希纳团队指出,尽管市场波动加剧,美国成长板块表现依旧向好。 在具体配置上,机构认为大盘股盈利能力更强,而小盘企业则面临债务高企及融资环境收紧的困境。在通胀预期走弱、经济增速放缓的背景下,低价股被维持中性立场。此外,防御型策略上涨空间...
14:33
鼓狮财经8月11日讯,根据摩根大通发布的最新数据,受电力需求激增的强劲驱动,今年第二季度全球燃气轮机订单量创下了历史新高。数据显示,4月至6月期间,全球燃气轮机订单总量约为38吉瓦,较第一季度增长29%,较去年同期更是激增了71%。 这一热潮的核心驱动力主要来自人工智能浪潮下数据中心的狂飙式扩张以及全社会电气化进程的加速。相比于煤炭,天然气更为清洁;相比于风...
13:40
鼓狮财经8月11日讯,澳洲联储主席布洛克表示,委员会认为通胀存在上行风险,并指出需要经济增长放缓来压制通胀。如有必要,将再次加息;委员会并未排除进一步加息的可能,但需获取更多数据支持。在此次会议上,未涉及降息讨论,仅聚焦于加息或维持利率不变。
13:40
据鼓狮财经8月11日报道,澳大利亚央行一致决定维持隔夜拆款利率不变,在政策声明中保持了审慎的平衡。纽约梅隆银行宏观策略师Wee Khoon Chong指出,尽管该行已认为当前利率具备“一定的限制性”,但整体通胀率依然过高,预计将在2027年底前维持高位,且面临显著的上行风险。他补充说,澳洲联储目前保持偏紧缩的倾向,并重申若通胀上行风险兑现,不排除进一步加息的...
13:29
《科创板日报》8月11日讯(记者 王耐)近日,关于“豆包推荐酒店抽取12%佣金”的消息引发市场热议。据媒体报道,豆包渠道酒店订单的软件服务费率为11.4%,另收取0.6%的支付手续费,综合费率约为12%。 对此,豆包公关负责人刘星在社交媒体上回应称,“豆包推荐酒店要收费了”这一说法并不准确。他表示,豆包生活服务业务目前不设付费推广,推荐酒店也不收取广告费,商...
13:29
瑞银分析认为,A股市场短期内的去杠杆进程已接近尾声,总体杠杆水平保持可控,且多重积极因素正在加速累积。根据瑞银的报告,当前市场利好因素主要包括:监管层多次强调将维护资本市场平稳运行;国有资本运营公司宣布增持A股;宽基ETF获得持续资金净流入;部分头部量化私募在市场大幅回调时大举自购;多家保险机构表态将坚定维护市场稳定;以及上市公司积极回购股份。此外,全球股市...