8月31日,《科创板日报》援引腾讯混元消息,为保障用户体验,该团队已针对Hy4 preview推理集群实施紧急扩容,并承诺将持续动态调配资源。
关于紧急扩容的原因,腾讯混元表示,自2024年8月28日Hy4 preview在WorkBuddy平台首发接入以来,凭借其Agent能力的显著增强,迅速赢得了广大用户和开发者的积极反馈。然而,上线首日便出现了任务队列拥堵的情况。
针对排队现象,腾讯混元推出了过渡方案:一是允许用户切换至Hy3等其他模型继续使用,且Hy3在WorkBuddy的限时免费政策将延长至9月30日23:59;二是建议非紧急需求用户错峰至晚间时段使用。
同时,腾讯混元也提醒,受限于高端算力总量及高峰并发集中,个别时段排队情况仍可能发生。此外,由于Hy4 preview仅属于大语言模型,暂不具备多模态生成能力,当用户发起生图或视频生成任务时,系统将自动切换至其他多模态模型执行。
华创证券分析认为,Hy4 preview模型在模型规模(770B参数)、上下文长度(1M)及数据规模上均较Hy3有显著提升。在与GLM-5.3、Kimi K3等头部开源模型的对比中,Hy4在多项基准测试中表现接近,且在WorkBuddy的盲测中略占优势。其API定价极具性价比,输入(缓存命中)、输入及输出每百万tokens价格分别为0.3、6及18元,且在WorkBuddy平台享受两周免费体验。
**大模型持续火热,国产算力放量在望**
AI模型访问量的激增正持续倒逼算力扩容,类似的情况近年来屡见不鲜。
例如,7月17日月之暗面发布的Kimi K3,其次日年化收入便创下历史最大单日增幅。上线48小时后,Kimi K3的用户请求量大幅超出预估,一度逼近推理集群极限,公司被迫暂停C端新用户订阅并全力推进扩容。同样,本月DeepSeek V4 Flash上线公测后,海外开源AI Coding Agent平台OpenCode也发文指出其因访问量过大导致容量不足,技术团队随即启动紧急扩容方案。
根据OpenRouter最新数据测算,上周(8月24日至8月30日)全球AI大模型总调用量达到113万亿Token,环比增长21.11%,较年初增长1928.73%。其中,国产大模型周调用量达55.16万亿Token,环比增长36.26%;同期美国AI大模型周调用量为17.07万亿Token。数据显示,国产大模型周调用量已连续十八周超过美国,稳居全球首位。
在国产大模型百花齐放之际,华创证券建议关注国内外模型竞争格局,以及头部厂商在高效架构、国产算力适配、办公Agent入口和开发者生态的商业化进展。该机构指出,在国产模型开源为主、性能提升加速、格局相对分散的趋势下,互联网平台有望依托其企业数据与入口优势,在编程、办公等高价值场景中提升渗透率,从而推动MaaS与云收入的增长。
广发证券分析认为,Token调用量快速增长,且需求正由简单问答向Coding、Agent、多模态生成和复杂知识工作迁移,这将带动模型API、云算力及AI应用需求的持续扩张。单位Token价格的下降进一步降低了应用门槛,推动了调用量和使用场景的增长。该机构预测,国产大模型Token的快速放量有望带动国产AI芯片和服务器产品的需求提升。此外,在国内算力供需失衡的背景下,高端GPU采购成本上升,算力租赁成为获取高端算力资源的重要补充,且具备稳定现金流、高硬件残值等优势,看好后续基于Token分成的商业模式。
开源证券研报指出,大模型C端应用规模化扩张、B端私有化部署加速及边缘推理场景渗透,将驱动推理算力需求呈指数级增长。同时,推理成本的持续下探进一步释放了中小客户的需求。预计国产算力推理场景增速将高于训练场景,国产大模型与芯片的协同渗透率将持续提升。供给侧方面,2024年上半年国产芯片龙头通过大幅提升存货与预付款规模,锁定上游原材料及委托加工产能,寒武纪、海光信息等核心厂商存货较2025年末实现显著增长。在推理算力赛道供需共振的背景下,AI算力产业链上下游均有望迎来业绩释放机遇。
