一个中小企业的技术负责人最近遇到了一个头疼的问题。他们采购了一批国产GPU卡,打算在自有环境里部署一个开源大模型,用于内部知识库问答。硬件到货之后,团队花了整整两周时间,模型还是跑不起来。问题不在于卡本身——单看标称算力,这批国产卡能达到国际主流产品的七到八成,但模型在上面运行的输出速度,却只有理论值的一成左右。这个场景正在无数中国企业中重复上演。而它所暴露的问题,恰恰指向了当下AI产业最核心的一个转变。

**1 Token成本是AI产业新的“游戏规则”**

国家数据局公布的数据显示,中国日均AI词元调用量已从2024年初的约1000亿飙升至2026年3月的超过140万亿,而另一面,中国信通院等机构的调研显示,国内智算中心GPU平均利用率不足30%。一边是Token需求呈指数级暴涨,一边是昂贵的加速卡在机房里“空转”。Token正在成为AI世界的“硬通货”。然而硬币的另一面是:越来越多企业发现,让这套系统真正跑起来,远没有买卡时想象得那么轻松。现实给所有应用算力的企业,以及算力服务商提出了一个难题:算力买回来了,为什么用不起来?这道题的答案,正在塑造中国AI基础设施的下一个五年。

故事要从两年前说起。彼时国内AI行业弥漫着一种朴素的信仰:手里有卡,心里不慌。地方政府大力建设数据中心,企业纷纷采购显卡,大家相信握住算力就握住了未来。GPUStack CEO秦小康在与我们的交流中回忆,那个阶段GPU卡资源极度紧缺,“拿到卡才有想象空间”是普遍心态。但真正把系统搭起来之后,很多人才发现自己买回来的只是一堆昂贵的“铁”。模型部署的复杂度,远超想象。具体到场景中,最典型的故障有两类,这两类几乎覆盖了企业踩坑的大半。

其一,模型根本跑不起来。很多大模型并不是在这款国产显卡上训练的,强行迁移过来,第一步就报错;其二,模型跑通了,性能却惨不忍睹。秦小康给出了一个惊人的对比:国产GPU芯片标称性能可以达到英伟达的70%到80%,但实际跑模型时,Token输出能力可能只有理论值的10%。问题不在芯片本身,而在上下层软件没有匹配好,需要大量调优。这两类问题,按他自己的话说,覆盖了八成以上的故障场景。

一个常被忽略的细节是:模型本质上是一堆参数文件,它本身是无状态的,不能像程序一样拿到就运行。想让模型工作,必须配套运行环境,推理后端就是环境中最核心的组件,且不止一种,英伟达有自研的,华为昇腾有自研的,开源社区还有vLLM、SGLang这样的通用方案。模型、后端、硬件三者组合,才是企业真正面对的“黑盒”。秦小康给出了一个直观的对比:市面上主流显卡型号有几十种,Hugging Face上的公开模型超过3600个,中间还要对接十几种推理后端,每种后端又各有十余种优化方案。几十种硬件对上数千个模型,再乘以多套软件栈,“这是一个多维度组合匹配的问题,复杂度近乎呈阶乘级膨胀。”秦小康如是说。换句话说,买卡是一道加法题,把卡用好却是一道乘法题。

这样的行业现状也体现在了行业调研数据上。IDC的调研显示,近半数企业的智算资源利用率处于51%到70%区间,还有6.7%的企业仅为31%到50%;不少自建智算项目存在“重硬轻软”的问题,服务器和GPU上架了,却缺乏统一算力调度平台、资源池化管理和动态分配机制。

与此同时,中科曙光高速网络互联产品部总工程师万伟也给出了一个判断:决定Token生成效率的,不只是加速卡的算力,更是算力、网络和存储三者之间的数据流转效率。他用一个简单的逻辑来解释:模型规模越来越大,单块GPU已经装不下完整模型,必须通过分布式架构把模型拆到多个节点上。一旦数据要在节点之间来回跑,通信就变成了“并行计算逻辑的一部分”,任何一处时延增加,整个集群的效率都会被拖下水。而随着推理需求爆发,这个缺口还在放大:IDC预测,到2027年中国智能算力规模中推理占比将提高到72.6%;TrendForce的数据同样显示,北美五大云服务商2026年的推理算力增速(预计122%)将超过训练算力增速(56%)的两倍以上。训练是阶段性的、可以提前排期的,推理却是全天候、贴着用户跑的——这意味着未来绝大多数GPU资源都要用来干“推理”这件精细活,而恰恰是这件精细活,最考验软件功夫。

**2 Token工厂是算力的“自来水系统”**

痛点的背后,藏着一次定位的转变。秦小康表示,GPUStack过去强调的是GPU管理,如今把“Token工厂”作为核心概念,“过去大家追求的是获取硬件资源,现在用户需要的是把资源之上的模型真正跑好。”秦小康指出。如今,用户与服务商之间不再只是“你需要卡,我就给你卡”的粗放调度,而是要提供从硬件管理到模型一键部署的一体化方案,最终对外稳定输出Token。行业内常说算力要像水电一样随取随用,如果顺着这个比喻往下延伸:有人修建水塔、铺设水管,对应底层的GPU硬件和驱动基础设施;而在秦小康看来,Token工厂的角色更像是自来水公司,负责完成Token的生产与供给,屏蔽底层资源的所有波动,让终端用户拧开“水龙头”就能用。至于Token之上跑的智能体、对话应用、代码助手,那是Token的消费者,属于另一层生态的生意。

秦小康对于Token工厂的边界划分得相当清晰——生产Token,不碰消费Token。顺着一条Token的生产流程看,它要经过训练、推理、存储三个环节,每一环都有暗礁。首当其冲的就是模型与硬件之间的“驱动”鸿沟。GPUStack联合创始人、CTO梁胜比喻道:GPU相当于显卡,模型相当于游戏,推理后端就是显卡驱动,而管理这一切的平台,相当于操作系统。梁胜表示,现在整个行业还处于上世纪90年代Windows的状态——驱动要不停调试、优化,各种不兼容层出不穷。一个新模型发布,想跑在华为昇腾卡上,推理后端必须同时适配上层模型和下层硬件;如果推理后端不做适配,模型和硬件就无法协同工作。这也解释了为什么英伟达的TensorRT-LLM、华为的MindIE等厂商自研工具,如今都把重心转向vLLM、SGLang等开源生态,因为单靠一家厂商,已经很难覆盖层出不穷的模型组合。

其次是算力之间的通信。训练阶段GPU集群要通过All-Reduce、All-to-All等集合通信方式同步梯度,异常时延会直接拉低模型计算利用率;推理阶段,流行的PD分离架构要把KV Cache从Prefill节点搬运到Decode节点,上下文越长,KV Cache体积越大,行业数据显示,长上下文场景下KV Cache可达几十GB。这些数据要在GPU、网络和远端存储之间反复流转,据其测算,万卡级分布式训练中,网络通信耗时已占整体任务时间的30%到50%。万伟的判断是:模型越来越大,单卡甚至八卡都装不下完整模型,分布式是唯一出路,而分布式的代价,就是数据必须在节点之间高频流动。通信优化的难点还在于频繁地传输小数据。当前主流大模型普遍采用MoE架构,专家之间要频繁传递大量并发的小数据包,这类通信恰恰是CPU最不擅长的:处理小包指令的时间,往往远超数据传输本身。针对此,中科曙光前不久发布了IBGDA技术,通过该技术能让GPU内核直接驱动网卡发起通信,把“发号施令”的权力从CPU移交到GPU,相当于在高速公路入口取消了一个堵点。

第三个“卡”点就是当前行业热议的存储。目前行业比较可行的“以存代算”方式,通过将生成号的KV Cache保存下来供后续复用,用存储换算力。但传统路径下,GPU访问远端存储,数据要先从显存搬到CPU内存,再经网络送到存储,多一次拷贝就多一层延迟。训练数据的加载、Checkpoint的写入、KV Cache的卸载,每一笔都是存储访问,而分布式存储集群本身就是网络流量的制造者。曙光把存储通道拆成了三件事:NFS over RDMA处理训练数据和Checkpoint这类文件访问,NVMe over RDMA处理KV Cache这类块数据缓存,XDS则让加速卡绕过CPU直接访问远端存储。据万伟介绍,存储访问延迟可因此降低80%以上。

三个“卡”点结合在一起,Token工厂要做算力的“自来水系统”的难点就跃然纸上——Token工厂难建,难的不是某一个单点,而是算力、网络、存储三者之间的数据流转效率。秦小康将这套逻辑概括为“硬件之上还有一套软件栈”,曙光则表示,数据流转效率是影响Token生成效率的关键因素。

**3 多路径尝试解决Token效率难题**

面对同一道难题,GPUStack与中科曙光在产业中定位、解题思路不同,但最终的目的殊途同归。GPUStack的选择是要做Token的操作系统。秦小康介绍,GPUStack把推理后端做成可插拔的插件,类似早年PC的即插即用。新模型带着特殊推理后端,可以直接导入平台运行,上层业务代码几乎无需改动。在GPUStack的体系里,底层是管理GPU硬件、负责多租户与计费的“操作系统”,之上才是面向用户的Token工厂,以及对外提供Token服务的应用。这种“开箱即用”的能力背后,是GPUStack多年来坚持开源策略的底气,据秦小康介绍,目前GPUStack已有11万部署实例,用户从8万增长到11万只靠社区传播,年底目标15万;国内一家头部芯片企业甚至把小规模集群业务全部迁移上来,90%的业务跑在这个开源平台上。

如果说Linux是开源操作系统的事实标准,梁胜则希望GPUStack成为算力中心的“操作系统”。中科曙光的思路则是把“路”修好。scaleFabric网络从设计之初就是为了面向AI集群,这次与万伟的沟通,他重点介绍了两件事。一是通信加速。在GPUDirect RDMA基础上,规模化落地IBGDA技术,让GPU内核直接驱动网卡,把通信任务的下发也交给GPU。二是存储加速。通过NFS over RDMA、NVMe over RDMA、XDS三项技术组合,把“以存代算”的短板补上。

GPUStack解决的是“软件栈”的标准化问题,曙光解决的是“数据通道”的物理问题,而它们的共同指向,是中国算力产业的一个现实困境:国产加速卡与国外顶级产品在制程和封装上仍有差距,单卡性能存在客观差异,出路只能靠系统级创新,比如用集群规模和多卡通信效率,去弥补单卡的不足。而这个判断也被产业验证:DeepSeek曾公开说明,其模型训练同时跑在英伟达和华为硬件上,这是顶级模型首次公开的跨硬件训练;上千卡规模的国产GPU集群已落地,万卡集群开始建设。硬件供给充足之后,配套的软件与管理体系将成为决定算力“好不好用”的关键。

最新快讯

2026年09月20日

19:28
据鼓狮财经9月20日报道,长城华能燃煤发电封闭式基础设施证券投资基金(简称“长城华能燃煤发电REIT”)正式获得批复。作为长城基金旗下首只公募REIT产品,该基金首轮纳入的资产估值约为30.16亿元。 该基金的底层资产为华能青岛项目,业务覆盖发电、供暖及供汽三大板块。公开资料显示,该项目近年来营业收入持续增长,净利润与EBITDA指标亦呈现逐年上升态势。基于...
19:28
据鼓狮财经9月20日报道,必和必拓首席执行官康柏德透露了未来的业务投资规划。在铁矿领域,公司计划在未来五年内投入逾100亿美元,重点用于保障产能维持、开发高品质矿源及升级港口铁路等基础设施,致力于确保西澳铁矿在2028财年达到年产3.05亿吨的产能目标。同时,必和必拓还将致力于未来十年的铜产能扩张,以顺应全球电气化、能源转型及数字基础设施建设的需求。
19:05
在产业超级周期的尾声,机构重仓股见顶后往往会出现一轮由非机构重仓股引领的新高行情。当前,AI叙事、盈利周期阶段及全球货币环境对机构票形成了一定制约:一是AI算力投入虽未放缓,但市场对前沿模型厂商业化空间的预期正在调整;二是全A非金融盈利在2026年第三季度环比有望继续上行,但同比增速顶点或已出现在2024年第四季度;三是美联储展现出控通胀的强硬姿态,年内将维...
19:05
9月17日,波罗的海交易所TD3C航线(中东湾至中国,27万吨级VLCC)的日均收入(TCE)报121.25万美元,环比激增40.64%。一个月前,这一数字还在70万美元左右。若追溯至2月13日美伊冲突爆发前夕,TD3C的TCE仅为11.74万美元。短短半年多时间,涨幅已接近10倍。同期,TD15(西非至远东)和TD22(美湾至远东)的TCE也分别录得52....
19:05
明天A股又有新股申购,还是光通信领域的“小巨人”公司,记得打新。鼓狮财经获悉,9月21日,北交所新股宇特光电(920157)申购,发行总数1766.67万股,发行价格13.75元/股,发行市盈率14.99倍,顶格申购所需资金约为850.16万元。鉴于近年来A股打新赚钱效应较好,而且宇特光电处于热门的光通信领域,建议积极参与申购。宇特光电是专业从事光连接产品研...
18:34
9月20日,在百度智能云超级智能体大会深圳站上,百度集团执行副总裁、百度智能云事业群总裁沈抖发表演讲。他指出,智能体的价值不仅在于降本增效,更在于助力企业创造过去难以实现的新产品、新服务及新增长空间,推动企业经营系统从“信息数字化”和“流程软件化”迈向“任务自主化”的3.0阶段。 沈抖强调,降本增效虽是智能体最直接的价值,但真正的生产力在于创造过去无法实现的...
18:03
从字面上看,alibaba.ai是一个指向性非常明确的域名,但它此前并不属于阿里巴巴。2026年7月,一名投资者在Spaceship交易平台上买下了该域名,成交价为3,333美元,随后又以33,333美元挂牌出售。但在一个月后,捷克仲裁法院认定该持有人明知阿里巴巴品牌存在,购入后仅用于加价转售,未进行任何真实使用,构成“机会主义式的恶意”,最终强制将该域名转...
18:02
本周五,美股大盘走势分化,纳指微涨0.39%,道指微跌0.18%,标普500上涨0.17%。然而,费城半导体指数在最后时刻出现惊人拉升,收盘大涨2.78%。闪迪股价飙升近11%,美光、迈威尔、应用光电和Lumentum等芯片巨头也在尾盘集体暴涨。这波行情的背后,源于近1亿美元涌入相关股票的看涨期权,引发了典型的“逼空”效应。据ZeroHedge数据统计,约9...
18:02
近期,2026深圳AI人工智能行业生态交流会在深圳星河吉酒店圆满落幕。这场盛会汇聚了300家AI产业链企业,以及22家银行、20家券商、45家创投机构,更有约300位企业高管、20位银行行长及80位企业领袖齐聚一堂。本次活动由星盛商业旗下的星河产业与星河资本联合主办。作为星河控股旗下的产业与资本双引擎,星河产业与星河资本在园区运营与科创投资领域深耕多年,为大...
18:02
在翱捷科技积极寻求A+H双重上市的背景下,同行业公司宸芯科技也更新了其IPO动态。鼓狮财经获悉,宸芯科技近期已回复交易所的首次问询,针对技术产品、市场空间及持续经营能力等核心问题进行了阐述。该公司创业板IPO招股书于6月30日获受理,保荐人为中信建投证券。 宸芯科技成立于2019年12月,2022年11月改制为股份有限公司,总部位于山东青岛。2024年12月...
17:55
9月20日,德国首都柏林及东部梅克伦堡-前波美拉尼亚州举行了议会选举。据媒体报道,梅克伦堡-前波美拉尼亚州的选情十分胶着,极右翼政党德国选择党与社会民主党支持率接近,分别约为36%和37%,双方竞争将十分激烈。相比之下,总理默茨领导的基民盟在该州的支持率仅为6%左右。 回顾本月6日萨克森-安哈尔特州的选举,德国选择党以43.8%的得票率大幅领先,成为该州第一...
17:30
9月20日,在2026世界制造业大会上,长鑫科技正式对外发布了其第五代DRAM技术平台(G5),并同步展示了基于该平台打造的大容量LPDDR5X内存新品。与此同时,长鑫科技在8月底宣布量产的LPDDR6产品也首次在大会上亮相,引起了业界的广泛关注。 长鑫科技副总裁骆晓东在开幕式上介绍,G5平台已实现量产,并全面进入国产主流旗舰手机市场。该平台采用了创新的四重...