鼓狮财经9月4日讯,针对优质训练数据长期匮乏的困境,Meta近日推出了一项颇具创新性的定价策略。以往在大多数AI工具中作为免费勾选项的数据授权,如今被Meta明码标价,转化为换取用户数据的交易。
据媒体当地时间周五报道,Meta针对其Muse Spark系列模型推出了“贡献者”计划。客户若愿意提供提示词与模型回复用于未来模型训练,可享受高达95%的模型调用折扣。Muse Spark系列最新的1.3模型于9月2日发布,Meta首席执行官扎克伯格称该模型展现了公司在编程与智能体能力上迄今为止的最大提升。
Meta为该系列设置了“标准版”与“贡献者版”两个层级。两者调用同一模型,能力并无差别,核心区别在于Meta是否可将用户的提示词与模型输出用于改进自身产品。按照Meta说明,标准版下相关数据不会被用于训练。
根据Meta官方定价文档,标准协议下每百万输入Token收费1.25美元,输出Token为4.25美元;而在“贡献者”档位下,输入Token仅需0.10美元,输出Token为0.20美元。媒体报道指出,价差最悬殊的是“缓存输入Token”——即智能体反复重传同一段上下文时被命中缓存的部分,标准版每百万Token收费0.15美元,贡献者版仅需0.002美元,相差约75倍。
数据的价值在这一定价策略中体现得淋漓尽致。此前,Meta在获取训练数据方面并不顺利,今年早些时候启动的员工电脑使用追踪计划因遭到内部广泛批评而于6月暂停。业界普遍认为,用户数据对提升智能体工具表现至关重要。开源智能体框架Pi的开发者Mario Zechner表示,编程智能体能力在2025年4月至10月间的跃升,很大程度上得益于Claude Code默认保存用户全部会话并用于强化学习训练。
然而,厂商如今想要获取这些数据,面临着两重障碍。一是数据“不存在”。随着模型应用重心从软件工程转向更广泛的行业场景,许多专业工作流程复杂且不留数字痕迹,厂商既难评估智能体表现,也无从改进。二是数据“存在也拿不到”。美国普林斯顿大学计算机科学教授Arvind Narayanan指出,有充分证据显示,大型企业并不愿让自己的数据被用于模型训练。他在社交媒体上写道,企业客户宁愿选择按Token计费的企业版方案,也不采用Claude Max或ChatGPT Pro这类订阅制消费级方案,尽管后者折算下来要便宜10至20倍甚至更多。两类方案的差别主要在于数据留存政策与企业IT治理。
换言之,这些公司是在为“数据不进训练集”支付十几倍乃至更高的溢价。Meta正是出于对这一现实的认知,选择以明确的价格补偿来换取数据。
报道称,Muse Spark定价指南将“贡献者”档位定位为“可以接受用你的数据进行训练”的场景,如搭建原型、测试集成、运行批量实验,即尚未上线生产且数据本身不敏感的工作场景。Narayanan认为,该价格框架或许能反过来促使大型企业更审慎地区分:哪些数据是真正的专有资产,哪些其实可以拿去交换成本优势。
