2025 年,英伟达抛出200 亿美元现金收购数据流芯片企业Groq,这也是英伟达史上规模最 大的技术收购。这笔重磅交易,释放出清晰的行业信号:摩尔定律逐步逼近物理上限的当下,芯片架构创新,已经从可选项变成必答题。
几乎同一时期,AMD 收购加拿大数据流推理芯片公司Taalas,英特尔、三星也在加速布局数据流技术路线。全球科技巨头在用真金白银验证同一个判断:数据流架构,正在走出学术论文,成为 AI 推理时代无法忽视的技术方向。
而在苏州工业园区,睿芯集成电路科技有限公司(下称“睿芯”)的技术团队已经在这条长周期赛道深耕十余年。这支产业队伍走的是一条差异化技术路线:RISC-V指令集加数据流架构。如今正迎来一系列里程碑:今年6月,睿芯“高光D35”芯片正式实现量产,公司将之定义为全球首 款RISCV数据流物理AI芯片。
9月20日启元机器人新品发布会上,睿芯被宣布为启元机器人算力生态合作伙伴,旗下RISC-V数据流物理AI芯片正式牵手启元机器人。双方将围绕具身智能端侧算力需求展开技术合作,共同推进数据流架构AI芯片在人形机器人场景的落地应用。属于数据流芯片的产业窗口期,已经摆在眼前。
物理AI算力
引爆一条前沿赛道
想要读懂数据流架构的价值,首先要看清物理 AI 面临的结构性困境。
大模型训练可以简单粗暴堆叠 GPU,算力不够就增加卡的数量。但物理 AI 场景完全不一样:工业质检机器人需要毫秒级完成缺陷识别,无法后端挂载大型服务器;人形机器人跑端侧大模型做实时决策,本体也不可能背负一套数据中心。
这类端侧物理 AI 应用,功耗、体积、成本全部是硬性约束。比拼的不再是纸面峰值算力有多高,而是每瓦功耗可以产出多少有效推理性能。
传统GPU在这类场景下有一个“先天不足”。GPU的设计原点是为图形渲染服务的——大量数据一次性加载,然后全力计算。但推理的数据是流式的,一帧视频、一组传感器数据实时进来,你不可能等攒够了再处理。行业里一个不算秘密的数据是:在很多实际推理场景中,GPU的算力利用率不到30%。
睿芯创始人范东睿给了一个更直观的对比:他们测过英伟达的芯片,在很多复杂运算场景下,效率只有个位数百分比,而用数据流方法做的芯片,同样场景下效率可以到60%。
差异的根源在架构。控制流架构下,指令一条一条排队执行,大量能量消耗在“等”和“搬”上。数据流不一样,数据就绪就自动触发计算,没有程序计数器,没有指令调度开销。打个比方,控制流像食堂打饭,有个阿姨在前面指挥,所有人排队一步一步走;数据流像自助餐,菜摆在那儿,需要什么拿什么。
数据流的理论构想距今已经超过六十年,但直到最近几年,才迎来真正的产业化土壤。
师从高光荣
他们打造首 款RISCV数据流物理AI芯片
睿芯创始人范东睿,在国内芯片创业者当中路径十分特殊。他押注的数据流架构,长期属于冷门、学术属性极强的长周期方向,并非 GPU、通用 NPU 这类风口赛道。
范东睿同时担任中科院特聘研究员、博士生导师。早在 2010 年,他带队研发众核处理器 SmarCo1,入选 “全球十大服务器处理器” 设计。2014 年,北京中科睿芯成立;2020 年,苏州睿芯落地,承接芯片产业化业务。
谈及数据流体系,绕不开范东睿的导师——高光荣。高光荣是中 国 第 一位 MIT 计算机博士,也是数据流体系结构的奠基者之一,上世纪 70 年代便在 MIT 开展数据流方向研究,后续在特拉华大学任教,培养出一大批该领域人才,美团王兴也是其学生之一。
这份学术师承,不只是故事叙事的点缀。意味着睿芯团队并非看到赛道热度才转身入局,在行业尚未关注数据流的时候,就已经完成深度的技术积累。公开资料显示,睿芯团队在数据流领域拥有80余项技术专利,相关研究成果获得国际计算机体系结构研讨会(ISCA)2026最 佳论文提名,是国内最早系统性推进数据流架构产业化的团队之一。
睿芯旗舰产品高光D35芯片,正是数据流架构面向边端推理场景的代表性产品。据介绍,高光D35定位为面向边缘端的高性能AI推理芯片,在能效比、显存容量、软件生态等方面进行了针对性优化。
芯片采用Chiplet先进封装技术,可根据不同应用场景灵活配置算力档位,并配套完整的全栈软件工具链,支持主流深度学习框架与大模型推理部署。
截至目前,睿芯已接连完成5轮融资,投资方包括元禾控股、中科创星、苏州园区科创基金等。据透露,公司新一轮融资正在交割中。
用架构创新换竞争空间
瞄准物理 AI 边缘侧多元场景
数据流架构的理论优势已经讲了半个世纪,为什么现在才迎来爆发?
范东睿给出的解释是摩尔定律走到头了。以前做芯片,设计复杂一点、难一点,不如直接把工艺从12纳米切到5纳米,红利就来了。但现在工艺逼近物理极限,红利吃完了,大家才被迫回到设计本身去找效率。
与此同时,AI的爆发带来了对复杂运算场景的强烈需求——数据流架构在复杂逻辑下的效率优势,恰好是AI推理最需要的。
但对中国公司来说,还有一个更现实的考量。范东睿在采访中直言:睿芯面对的是全球竞争,而中国公司有一个硬约束——你能用的工艺是被卡死的。台积电3mn、2mn用不上,国产能力目前只能做到7mn。你用不了最 好的工艺,就意味着你的芯片在峰值性能上天然吃亏。再加上新芯片的软件生态往往不成熟,如果用同样的设计方法追英伟达,是不可能追上的。
“资源有限的情况下,设计方法就一定得变。”这正是睿芯选择数据流路线的底层逻辑:不是单纯追求技术更前沿,而是在工艺约束的现实条件下,依靠架构创新,去争夺商业市场的竞争席位。
正如高光 D35 的市场定位十分清晰:不进入云端市场与英伟达正面竞争,把目标锁定物理 AI 赛道,覆盖智能安防、工业质检、具身机器人、自动驾驶、智能存储等边缘场景。
这款芯片配备了单芯片128GB大显存,支撑大参数模型在边缘侧本地部署。这个容量在边缘芯片里是少见的。范东睿在群访里反复提到“脑容量”这个概念:机器人要在本地做决策,模型参数规模不能太小,否则就像一个人虽然聪明但没读过什么书,“小聪明”解决不了复杂问题。
从订单结构来看,目前智能计算类业务占比过半,具身智能相关业务约 20%,通信业务占 15%。已经落地包括启元机器人算力生态合作,以及无人车、视频压缩等多类客户。
但技术参数亮眼不等于商业闭环跑通。范东睿拿车企举例,理想汽车年销量几十万级别,自研芯片可以靠巨大出货摊薄研发成本,单片外采成本未必占优。但大量中小体量客户,一年几万、几千台的出货规模,很难负担自研芯片的高昂投入。这一部分客户,正是睿芯瞄准的目标市场。
量产只是开始,生态才是真正大考
流片量产,仅仅是长征的起点,数据流架构与生俱来的难题,才是更大考验。
清华教授汪玉在多个场合表达过一个判断:数据流架构的优势是提升了计算效率,但代价是编译难度大幅提升。在没有指令调度的情况下,如何让编译器高效地把模型映射到硬件上,是整个行业还没有完全解决的问题。
睿芯采用两层方案应对挑战:一方面自研自动翻译工具,把主流 AI 框架模型自动适配到自家芯片,把底层复杂工作内部消化;另一方面推出 “光荣社区”,打造全球首 个RISCV 数据流开发者社区,围绕高光 D35 输出 SDK、开发文档与工具,降低开发者使用门槛。
除此之外,通用和专用芯片的钟摆效应同样值得警惕。理想汽车马赫 M100 同样采用数据流路线,但属于车企高度定制化芯片。当头部大厂具备自研专用芯片能力,第三方通用数据流芯片厂商的生存空间,会受到挤压。
“通用和专用是永恒迭代的逻辑,大概每十年就会切换一轮。” 范东睿如此看待这个命题。但对创业公司来说,迭代的周期,直接关乎企业生死。
放眼全球,数据流架构理论提出六十年,真正实现量产落地的企业屈指可数。Groq、SambaNova、理想马赫、睿芯,全部处在产业化早期阶段,这套架构即将面临大规模商业验证。
产业的大考落到每一家参与者身上,睿芯也不例外。下一代产品能否压缩研发周期、能否在更多场景证明真实性价比、编译器工具链能否降低客户使用负担 ——属于这家数据流AI芯片公司的考验才刚刚开始。
