
财联社 9 月 4 日讯(编辑 李莹)面对优质训练数据的长期匮乏,Meta 近日出了一记‘奇招’:原本在多数 AI 工具中作为免费勾选项的数据授权,如今被它做成了一门明码标价的生意。
据媒体当地时间周五报道,针对 Muse Spark 系列模型,Meta 向愿意提供自己的提示词与模型回复用于未来模型训练的客户,开出平均约 95% 的模型调用折扣。
Muse Spark 系列最新的 Muse Spark 1.3 模型已于 9 月 2 日发布,Meta 首席执行官扎克伯格称该模型展现了公司在编程与智能体能力上迄今为止最大的一次提升。
Meta 为该系列模型设置了 " 标准 "(Standard)与 " 贡献者 "(Contributor)两个档位:两者调用的是同一模型、能力并无差别,核心区别在于 Meta 是否可将用户的提示词与模型输出用于改进自身产品。
按照 Meta 的说明,标准档位下相关数据不会被用于训练。

注:图为 Meta 针对 Muse Spark 系列模型官方定价表
据 Meta 官方定价文档,标准协议下,每百万输入 token 收费 1.25 美元,而在 " 贡献者 " 档位下仅需 0.10 美元;输出 token 的标准价为每百万 4.25 美元,贡献者档位则为 0.20 美元。
媒体报道指出,价差最悬殊的是 " 缓存输入 token" ——即智能体反复重传同一段上下文时被命中缓存、无需重算的部分:标准档每百万 token 0.15 美元,贡献者档仅 0.002 美元,相差约 75 倍。

数据的价码
报道指出,此前,Meta 在获取训练数据方面并不顺利。今年早些时候启动的一项追踪员工电脑使用情况的计划遭到内部广泛批评,已于 6 月暂停。
用户数据对提升智能体工具的表现至关重要。开源智能体框架 Pi 的开发者 Mario Zechner 表示:"2025 年 4 月到 10 月间,编程智能体能力之所以出现大幅跃升,原因在于 Claude Code 默认会保存用户全部的编程智能体会话,并将其用于强化学习训练。"
而厂商如今想要获取这些数据,面临着两重障碍。
一是数据不存在。报道称,随着模型使用的重心从软件工程转向更广泛的行业场景,许多专业工作流程复杂且不留数字痕迹,厂商既难评估智能体的表现,也无从改进。
二是存在也拿不到。美国普林斯顿大学计算机科学教授 Arvind Narayanan 指出,有充分证据显示大型企业并不愿让自己的数据被用于模型训练,最直接的证据就是价格。
Narayanan 在社交媒体上写道,企业客户宁可选择按 token 计费的企业版方案,也不采用 Claude Max、ChatGPT Pro 这类订阅制消费级方案,尽管后者折算下来要便宜 10 至 20 倍甚至更多;而两类方案的差别主要就在于数据留存政策与企业 IT 治理。
换言之,这些公司是在为 " 数据不进训练集 " 支付十几倍乃至更高的溢价。
或许正是出于对这一现实的认知,Meta 选择以明确的价格补偿来换取数据。
报道称,Muse Spark 定价指南把该 " 贡献者 " 档定位于 " 可以接受用你的数据进行训练 " 的场景——如搭原型、测集成、跑批量实验,即尚未上生产、数据本来就不敏感的工作场景。
Narayanan 认为,该价格框架或许能反过来促使大型企业更审慎地区分:哪些数据是真正的专有资产,哪些其实可以拿去交换成本优势。


登录后才可以发布评论哦
打开小程序可以发布评论哦