随着国产算力加速迈向规模商用,如何跨越从“适配验证”到“真实生产”的关键鸿沟,已成为行业亟待破解的难题。近期,商汤大装置携手智象未来,以视频生成业务为突破口,成功打通了从国产算力适配到规模化落地的全链路。对于以图像和视频生成模型为核心的AI企业来说,国产化绝非简单的GPU替换。尤其是视频生成模型,因其参数规模庞大、推理链路复杂、计算密集度高,从底层算力、推理框架到模型性能、生成效果乃至工具链,每一个环节都可能是国产化落地的“卡点”。
智象未来是全球领先的多模态生成式人工智能创新企业,拥有自研HiDream系列大模型,致力于打造下一代原生全模态世界模型。目前,其产品已覆盖全球100多个国家和地区,服务超过5000万名专业用户及4万余家企业客户。作为其重要的AI基础设施合作伙伴,商汤大装置持续提供稳定高效的算力支持。此次合作进一步延伸至国产算力适配验证,双方围绕底层算力替代、模型推理、性能优化及生成效果等关键环节,通过全栈技术适配与FDE专家服务,帮助智象未来在国产算力环境下平稳运行,为多模态大模型的国产化部署形成了可复用的样板。
多卡并行优化,实现93%加速比
对于视觉生成应用而言,性能不足不仅会增加用户成本,还会影响体验。因此,双方设定了在国产算力环境下高效生成高清视频并优化端到端时长的目标。商汤大装置团队基于LightX2V进行了多卡并行优化,并探索多机多卡场景。首先,采用训练-推理联合优化思路,通过步数蒸馏、CFG蒸馏等方案,在保持质量的同时提升推理速度。推理过程中,引入CFG双分支并行、Ulysses序列并行、TP并行等策略,协同调度计算任务。最终,在国产芯片运行DiT模型的场景下,多卡并行视频生成加速比达到93%,充分释放了国产算力性能。
精细化调优,确保多卡生成效果一致
如果模型迁移后速度提升但细节失真,则难以进入生产环境。针对多卡推理中单卡与多卡在表情等特征上的细微差异,商汤大装置团队通过重新注入Face特征,加强了特征一致性,使多卡效果向单卡对齐。针对长视频尾帧细节模糊的问题,经排查发现是训练与推理帧数不匹配导致,团队通过补齐和优化推理帧数,有效改善了细节表现。通过这些细节调整,解决了国产模型适配国产算力走向生产环境过程中的工程挑战。
构建统一抽象体系,支持异构芯片零成本迁移
智象未来需要应对不同国产芯片间的异构适配挑战。商汤大装置构建了统一的硬件抽象体系,涵盖异构硬件初始化、统一设备抽象层、Registry调度工厂及硬件算子插件等,屏蔽底层差异。基于此,实现了“一次开发,多平台适配”,目前已支持10余种异构芯片的模型零成本迁移。同时,完成了对ComfyUI等主流AI开发工具生态的适配,无需改变原有工作流,即可在国产算力平台完成应用开发与部署,大幅降低迁移成本。
FDE专家服务模式,深入业务现场保障闭环
对于AI科创企业,国产化适配需投入大量人力。商汤大装置通过FDE(现场部署工程师)专家服务,将专业工程能力深入业务场景。专业工程团队围绕智象未来实际需求,全程参与国产化适配:从模型迁移、算子优化、多卡并行,到生成效果调优、工具链适配,再到业务效果保障。这种“算力平台+工程专家”的协同方式,帮助企业减少工程投入,将更多资源聚焦于模型创新与产品迭代。
业务落地:国产算力支撑规模化短视频创作
在商汤大装置的AI基础设施与FDE专家团队支持下,智象未来图像模型已完成国产算力适配验证,并支撑起规模化线上流量及短视频创作业务。此次合作验证了一条可复用的国产算力落地路径:以异构算力为基础,以统一抽象体系和开发工具适配为连接,以模型性能与生成效果优化为核心,结合FDE专家服务,最终实现从全栈适配、技术验证到规模生产的完整闭环。未来,双方还将围绕更多AI应用场景深化合作,共同探索国产AI基础设施与生成式AI应用融合发展的更多可能,推动国产算力从“能用”加速迈向“好用”,助力AI创新企业高效实现技术创新与业务规模化落地。
关于商汤大装置
商汤大装置是商汤科技前瞻打造的高效率、低成本、规模化的新一代AI基础设施,以大模型开发、生成、应用为核心,赋能人工智能生产新范式,通过与大模型迭代的联合调优,致力于打造“最懂大模型的AI基础设施”。
