一台放在办公桌上、大小仅如机顶盒的机器,塞着上百GB统一内存,断网也能运行千亿参数的大模型。无需机房,无需机柜,插电即用,数据不出房门。这就是AI Box,一台搬上办公桌的数据中心。苹果、英伟达、AMD、微软、英特尔悉数入场。但这并非新形态,为何2026年这种“连上显示器就是电脑”的小盒子成了必争之地?
大模型主要有两种用法:云端或本地。云端意味着能力无上限,模型管理简单,但订阅费高昂。ChatGPT Pro、Claude Max每月200美元封顶,超出部分按量计费,如GPT-6 Astra每百万token高达50美元。重度用户一个月烧掉几百甚至上千美元很常见。业内人士指出,过去两年企业上AI,大多卡在“从概念到落地”的摸索期:场景试错、流程改造、提示词调试。每一分钟都在消耗token费用,但老板往往只给方向不给具体要求。“烧了很多钱,结果却不知道。”本地部署的逻辑因此成立:主流模型大多开源免费(如DeepSeek、Qwen),硬件一次性购入,无后续token账单,数据不出房门。预研、验证、试错,成本固定。AI Box因此诞生。
### 什么样的Box才能叫AI Box?
本地部署有一道硬门槛:模型必须“装得下”,内存就是入场券。运行大模型的前提是权重全部装入内存或显存。以DeepSeek-R1满血版为例,6710亿参数在FP16精度下需约1.3TB显存,FP8量化约0.7-0.8TB,即使是4-bit量化,所需空间也高达400至480GB。相比之下,一张RTX 5090仅32GB显存,高配笔记本24-32GB统一内存,只能跑70亿参数级别的小模型。这就是桌面AI设备面临的关键技术挑战:在桌面上塞入尽可能大的统一内存、提供尽可能高的带宽,并将功耗压进办公室插座承受的范围。容量决定能跑多大模型,带宽决定并发量和响应速度,功耗决定能否放在办公室而非机房。最戏剧化的是,准备最充分的那家公司并非专为AI设计。2020年,苹果将Mac迁移至自研M系列芯片,做出了一个激进决定:CPU、GPU、神经引擎共享同一块内存,即统一内存架构。初衷是降低数据搬运开销和功耗。五年后大模型时代降临,这套架构完美契合需求。今天的Mac Studio,M3 Ultra版本最高512GB统一内存,带宽819GB/s,持续功耗480W;9月发售的M5 Ultra带宽拉至1.2TB/s。苹果官方宣称可跑6000亿参数以上模型。据报道,OpenAI过去几个月采购了数万台Mac mini和Mac Studio用于强化学习和Agent开发。库克在财报电话会上承认,越来越多客户将Mac mini用作运行智能体的平台,Mac Studio集群用于本地部署前沿模型。
### 英伟达:不卖机器,卖“同款架构”
如果说苹果是“无心插柳”,英伟达则是看到需求后的“降维打击”。DGX Spark采用GB10 Grace Blackwell芯片,128GB统一内存、273GB/s带宽、FP4精度下1 PFLOPS算力,整机功耗240W,官方标称单机可推理2000亿参数模型、两台互联跑4050亿。美国售价4699美元,国行首发约3万元。纸面参数对Mac Studio无优势,但DGX Spark跑的是DGX OS,软件栈与数据中心万卡集群同源,CUDA生态和企业级支持完善,开发者桌面的代码可无缝迁移至云端。围绕DGX Spark,宏碁、华硕、戴尔、技嘉、惠普、联想、微星七家OEM同步推出整机,微星版本低至2999美元,联想ThinkStation PGX已进入中国政企目录。相比苹果,英伟达给AI Box更清晰的市场定位与销售野心。DGX Station针对小团队桌边工作站:GB300芯片、748GB一致性内存、20 PFLOPS、1600W功耗,宣称能跑万亿参数模型。微软Surface RTX Spark Dev Box:同款GB10芯片、128GB内存、1 PFLOPS,热设计功耗压至100W,预装Windows 11 Pro,标称本地可跑1200亿参数模型。其入场意义大于产品意义:Windows生态需要一个官方答案,告诉开发者本地AI不必非买Mac。
### X86阵营:展示推理时代的性价比
AMD Ryzen AI Max+ 395(代号Strix Halo)将128GB统一内存、256GB/s带宽做进55-120W功耗墙,NPU 50 TOPS、平台总算力约126 TOPS。今年三季度,换代Ryzen AI Max 400(Gorgon Halo)将统一内存上限拉至192GB,官方称可跑3000亿参数模型。X86底牌是兼容,Windows、Linux直接安装,企业运维体系全部复用。性能虽非最强,但无需换生态,是采购决策中的核心考量因素。英特尔推出Panther Lake(Core Ultra 300系),NPU算力50 TOPS,塞入每一台笔记本和迷你主机;最接近盒子形态的NUC 16 Pro,内存上限96GB,定位Copilot+迷你PC。值得注意的是,英特尔将AI Box放到了智能汽车上,让过去算力不足的汽车拥有算力加成。英特尔将AI Box目标定位到更具体的B端场景中。
### AI Box,到底谁在买?
盒子卖出去之后,到底干出了什么?高职教育场景中,学校把备课、批改、实训答疑、教案沉淀做成三组智能体,本地化运行。试点数据:教师周均备课时间从9.2小时降到5.1小时,每班批改时间从2小时压到0.4小时,实训错误率从22%降到14.3%,优秀教案复用率从不到10%提到67%。律所场景是盒子主场:卷宗不能出所,类案检索压缩到40秒以内,司法文书自动生成覆盖率80%以上,利益冲突审查准确率95%以上。选择逻辑清晰:重复性资料处理 + 数据安全敏感 + 结果可被人工复核。AI Box优势明显:传统本地服务器需机房改造、周期三到六个月;公有云API即时开通但数据有出域风险;盒子桌面即插即用、物理隔离,部署时间以小时计。
### 写在最后
AI Box潜力算的是一笔经济账。自建机房需8张RTX 4090整机,报价35万元上下,峰值功耗4800W以上,需机房、散热、工程师维护。云端AI能力无限,但token账单随使用量线性增长,摸索期花费无上限。AI Box从千元到万元,功耗100-480W,插电即用,模型免费,试错成本固定。与8卡服务器相比,功耗相差10到30倍。摆在行业面前的问题是ROI仍算不清。真正掏钱的采购方,得拿自己的流程重新折算一遍。客服等场景能折算成“少多少坐席”,但流程优化、效率提升难以良好量化。此外,如自动驾驶推进的权责问题,AI出错谁来检查负责,也没有答案。现实情况是,当前成熟场景只有两个:写代码和办公,其余大多在摸索。硬件只是门票:数据治理、微调、迭代以三到六个月为周期,模型一换,上层应用大概率要返工。还有一个思考是,盒子通常不能升级,扩容只能再买一台。在DRAM成本高企的情况下,卖盒子似乎成了消化高价存储的一种方案。对市场来说,他们更需要看到AI Box到底能做什么。AI Box不是来取代云的。需要最强模型、弹性算力、零维护的任务,云端仍是首选方案。盒子承接的是另一类需求:反复试错的预研、不愿上云的数据、十来人小团队的固定算力、算得清电费和折旧的小本生意。AI Box的出现是把硬件做小,在支付固定成本后,实现算力自由。归根结底,产品的未来是算力如何落地,如何带来真正的价值。
