尽管通过增加算力、扩大模型规模来提升性能的Scaling Law依然有效,但这套传统范式已显疲态。单纯依赖大算力狂奔不仅缺乏新意,而且大尺寸模型往往受限于硬件体积、能耗及算力瓶颈,并不适用于所有场景,尤其是在物理AI领域。
由加州理工学院教授创立的PrismML,正致力于探索一条不同于传统Scaling Law的新路径。相比继续堆砌算力和规模,该公司将重点放在提升模型的“智能密度”上。PrismML此前完成1625万美元种子轮融资,Khosla Ventures和Cerberus Ventures参投,加州理工学院也参与了融资,并共同提供算力支持。
PrismML的创始团队汇聚了信息论、信号处理、优化和机器学习领域的顶尖专家。联合创始人兼CEO Babak Hassibi是加州理工学院电气工程、计算与数学科学教授,长期研究神经网络剪枝等前沿技术,并拥有将算法、芯片与硬件系统结合的产业经验。联合创始人Sahin Lale和Omead Pooladzandi分别专注于动态系统与二阶优化,Reza Sadri则拥有丰富的数据库与机器学习基础设施背景。
增加训练算力和数据量确实能增强模型性能,但这些模型部署时必须依赖庞大的数据中心基础设施,这形成了结构性限制:受限于延迟、硬件性能和隐私风险,最强大的模型被锁在大型计算集群中,而手机、笔记本、汽车等端侧设备难以实现实时且安全的AI体验。
PrismML试图解决的就是这个问题:让强大的AI在本地实现高效、安全且快速的运行,同时让数据中心用更少资源提供更强计算能力。他们希望开创一种全新的AI范式,即模型能适应多样化硬件环境,并在单位算力和能耗下释放最大智能潜力。
具体而言,PrismML通过无损压缩AI模型,大幅降低对内存、算力和能耗的占用。不同于其他公司仅压缩部分权重,PrismML将整个语言网络(包括Embedding、Attention、MLP和输出层)改造成二值或三值权重。在二值模型中,每个权重仅表示正负两种状态,每128个权重共享一个FP16缩放系数,平均占用约1.125 bit;三值模型增加零状态,平均占用约1.71 bit。配合专为这些权重开发的专用推理内核,模型运行时无需展开为FP16,从而同时减少体积、内存带宽和推理过程中的数据移动。
PrismML提出了评判模型的新概念——智能密度,用于衡量模型单位部署体积所能提供的能力。2026年3月,他们推出了全球首批具备商业可行性的1-bit大语言模型——1-bit Bonsai 8B。该模型实现了端到端原生1-bit设计,体积比同类模型小10倍以上。相比Llama 3 8B,其体积缩小14倍,速度提升8倍,能效提高4至5倍,大小仅为1.15 GB,可轻松装入iPhone 17 Pro。
在Mac M4 Pro上,1-bit Bonsai 8B推理速度可达131 tokens/秒;使用RTX 4090显卡可达368 tokens/秒;在iPhone 17 Pro Max上约为44 tokens/秒。最新发布的Bonsai 27B基于Qwen3.6 27B打造,是同级别模型中首款可在手机上运行的模型。在RTX 5090上,其1-bit版本速度最高可达163 tokens/秒;在Mac M5 Max上,1-bit版本最高为87 tokens/秒。
Bonsai 27B的意义在于,27B尺寸的模型现在可以处理多步推理、结构化工具调用、视觉任务以及复杂的“计算机操作”智能体循环。它解锁了“混合部署”的新系统架构:将非隐私敏感型任务路由给本地模型,将云端前沿模型保留给最困难的步骤。这将使智能体系统的单任务成本大幅下降。
随着AI进入企业系统、机器人和汽车等物理世界,模型体积和能耗成为新的约束。AI模型的下一轮进化可能从追求绝对规模转向提升“智能密度”,让每个bit、每GB内存和每单位能耗承载更多能力。未来的AI将分布在云端、边缘以及两者之间的所有位置,谁能以更小的资源代价将更强的智能带入更广阔的现实世界,谁就将定义下一轮模型竞争。
