一段原本专为英伟达 CUDA 构建的计算程序,几乎未改动内核代码,便直接在搭载 M3 Pro 芯片的苹果设备上运行。这是 X 网友 @Abhinav 昨日公布的一项进展。更令人意外的是,这并非简单的向量加减乘除演示,而是在真实的三维流体模拟任务中实现了约 10 倍的速度提升。
这一突破的背后,离不开特殊参与者 GPT-5.6 Sol 的助力。该项目基于开源科学计算平台 OpenFPM 展开,旨在解决一个被许多人认为“不可能”的任务:让原本为 CUDA/HIP GPU 设计的高性能计算程序,跨越平台壁垒,在苹果自研的 Metal GPU 架构上运行。
过去十几年,GPU 计算领域高度碎片化——英伟达有 CUDA,AMD 有 HIP,苹果有 Metal,这些生态如同不同的语言,互不兼容。一个用 CUDA 编写的程序,通常需要大量重写才能在其他平台运行。这次,开发者没有选择重新开发 Metal 版本,而是搭建了一条转换通道:程序先经过 Clang/HIP 处理,再通过 SPIR-V、Vulkan 和 MoltenVK 等中间层,最终让苹果 Metal GPU 能够理解并高效执行。更重要的是,整个过程完全没有添加任何 Metal 专用的粒子 API,应用层仍保留原有的 CUDA/HIP 风格 kernel 调用,实现了真正的硬件透明。
在此过程中,GPT-5.6 Sol 发挥了关键作用。它帮助完成了设备端内存布局构建,并在约 6 小时内发现了 MoltenVK 和 SPIR-V 中的兼容性问题,设计了相应的变通方案。
真正的考验来自一个复杂的测试用例——三维 SPH 大坝溃坝模拟。该任务涉及扫描、排序重排、单元格与相邻列表构建、ghost 粒子交换、归约操作及原子操作等多个复杂模块,任何一个环节出错都会导致性能下降或物理结果偏差。然而测试结果出乎意料:在搭载 M3 Pro 芯片的苹果设备上,使用 Metal GPU 运行仅需约 6 秒,而使用 CPU 顺序计算则需约 60 秒。这意味着,同一个程序仅更换硬件,就获得了约 10 倍的速度提升,且 GPU 利用率接近 100%,表明转换效率极高。
更重要的是,速度提升并非以牺牲准确性为代价。开发者检查发现,苹果 GPU 版本与原始计算版本的物理结果保持一致,关键参数和模拟轨迹高度吻合。这证明苹果 GPU 不仅跑通了程序,更真正完成了科学计算任务。
开发者进一步指出,粒子存储随粒子数 N 线性增长,而邻居搜索等工作量大致为 O(N·k)。目前展示的 10 倍加速是单机后端对比的结果。未来,借助苹果 Thunderbolt 支持的 RDMA 技术,还可以实现多机动态负载均衡,让模拟在多台设备上扩展。不过,目前苹果 Metal GPU 的最大限制之一是对高精度浮点计算支持不足,而许多专业科学计算领域依赖双精度运算,因此在天气预测、航空航天模拟等超级计算场景中,英伟达专业 GPU 仍占据优势。
面对这项突破,也有人提出质疑,认为在 Mac 上跑这种小仿真并无实际意义,更像是一场炫技。对此,开发者的回应颇为坦率:“最大的用处就是好玩,以及工作顺手。”他解释说,团队的大规模仿真本就运行在集群上,而在 Mac 上跑通验证了设备抽象层设计的可行性。更实际的理由是:跑大仿真前需要先用小仿真调试,本地调试靠 CPU 实在太慢;仿真结果动辄几个 GB,SSH 传输困难,远程桌面笨重,不如直接在本地跑。最妙的是,在笔记本上调试通过的代码,原封不动地放到 GPU 集群上,就能自动扩展规模。
这项探索证明了同一套 CUDA/HIP 风格的算法,可以相对透明地运行在 Apple Silicon 等不同硬件后端上。未来,软件开发者或许不再被单一 GPU 生态所束缚。这也展现了 AI(GPT-5.6 Sol)正在从“帮助写代码”走向“参与底层系统设计、优化和跨平台工程调试”的新阶段。苹果 GPU 跨过 CUDA 鸿沟,可能只是一个开始。
