办公Agent领域正式拉开了“模型聚合”的大幕。8月14日晚,千问办公宣布接入智谱GLM-5.3与DeepSeek V4 Pro,用户可直接在“前沿模型”栏位中切换。同日,百度文库网盘的通用智能体GenFlow正式启用中文名“库库AI”,并推出独立桌面端,其模型池同样涵盖了DeepSeek、智谱GLM等外部模型。腾讯WorkBuddy、字节TRAE Work等办公Agent早已内置多家第三方大模型。从阿里、百度到腾讯、字节,国内头部厂商的办公Agent正不约而同地走向模型聚合模式。
过去大模型产品比拼的是“谁家的模型更强”,而到了办公Agent阶段,竞争逻辑发生了变化:首要任务是构建一个包含多种模型的统一工作台,吸引用户将真实工作交给平台。只有当用户真正使用起来,写作、表格分析、PPT制作等真实工作流才能持续涌入Agent,平台才能积累任务拆解、工具调用、失败恢复和用户纠正等反馈,进而反哺系统打磨Harness,形成数据飞轮。然而,随之而来的新问题是:同一项任务究竟该调用哪个模型?这便是“路由”成为聚合路线必须攻克的难题。
目前,千问办公对外展示的“前沿模型”虽不多,除自家模型外主要接入GLM-5.3和DeepSeek V4 Pro,但其表示会持续扩充模型池。相比之下,腾讯WorkBuddy已形成了庞大的内置模型池,包含混元Hy3、智谱GLM、MiniMax、Kimi及DeepSeek等多个系列;字节TRAE Work同样走在多模型并行路线,可见模型涵盖字节Seed系列、智谱GLM、DeepSeek及千问等;百度新推出的独立端“库库AI”也引入了DeepSeek和智谱GLM。四家产品的共性已十分明显:办公Agent不再将能力完全绑定于单一模型。原因在于,现阶段对办公Agent而言,让用户真正用起来远比强行将每次调用留给自家模型更重要。当Agent开始搜索网页、打开文档、分析Excel、制作PPT并与用户反复修改时,会留下完整的执行过程:模型如何拆解任务、调用了哪些工具、哪步失败、用户如何纠正以及最终结果。真实工作流是Agent时代稀缺的数据资源。
百度集团副总裁王颖指出,随着公共数据被模型充分学习,人产生的新知识、新经验和新想法将愈发重要。未来需要共同建立的是通用智能体能力、记忆与存储以及个人知识这三部分能力。模型池越丰富,越能提升不同任务的完成率,降低用户尝试门槛。只有更多用户将工作交给Agent,平台才能获得持续反馈,从而优化任务拆解、Context管理、工具选择和失败恢复等Harness能力。因此,模型聚合不仅是模型能力的拼盘,更是为数据飞轮争取真实任务。但聚合并不意味着大厂间的边界消失。从目前产品可见的默认模型池来看,WorkBuddy接入了多家外部模型却未见阿里千问和字节Seed;TRAE Work内置了千问却未见腾讯混元;库库AI目前也未见混元、千问和Seed。虽然都在扩大选择,但各家仍保留着自己的生态边界。
把更多模型装进同一个Agent,只解决了“有没有得选”的问题,真正决定聚合路线能否跑通的是“怎么选”。大模型落地始终存在一组近似“不可能三角”的权衡:效果、速度和成本很难同时拉满。能力更强的模型通常意味着更高的推理价格,复杂任务为了追求高质量往往需要更长的思考时间;反之,一味追求便宜和低延迟,可能牺牲任务完成质量。路由要解决的本质,就是这道三角题:为了把工作做完,应在何时花更多钱换能力,又在何时用速度和成本换效率。
这让聚合型办公Agent的竞争出现了另一层差异。理想状态是用户只需提出任务,后台根据难度、时效和成本自动选择模型。对个人用户而言,这体现在结果好坏、等待时长和积分消耗;对企业客户,则关乎单位算力成本。办公Agent一旦大规模使用,微小的单次调用差异也会被任务量放大,路由由此成为一笔规模化的经济账。但从完整执行链条看,路由只是Harness的一环。路由决定“这一步该调用谁”,但真正决定任务能否稳定完成的,是整套Harness能否协同各环节。这也是聚合路线真正可能形成壁垒的地方。模型本身可以接入,价格也可能随竞争下降,但如何在效果、速度、成本间找到最佳平衡,需要的是足够多的真实任务和平台长期积累的调度经验。当WorkBuddy、TRAE Work、千问办公、库库AI手中的模型越来越多,真正拉开差距的,将是同一道题谁算得更精:何时该用最强模型,何时又根本没必要。
