← 研究

AI 的经济引擎:从数据到归因

每台经济引擎都需要燃料,生成式 AI 的燃料是数据。本文追踪 AI 数据经济从旧有所有权瓦解到 AI 操作系统兴起的演进,并解释为何归因基础设施正在成为决定 AI 经济未来的核心因素。

AI 的经济引擎:从数据到归因

每台经济引擎都需要燃料。蒸汽机依靠煤炭,工业流水线依靠电力,互联网依靠广告收入。生成式 AI 依靠数据,尤其是关于真实人类知识和互动的数据。

尽管历史很短,AI 的数据经济已经迅速演进。本文追踪这一过程,从旧有所有权体系的瓦解,到服务分发平台的兴起,并解释为何归因基础设施正在成为决定 AI 经济未来的核心因素。

经济转变

传统估值围绕旧有所有权展开:Disney 拥有 Mickey Mouse 的版权,Universal 拥有发行权,AMC 掌握放映渠道。每一层都通过受控许可和分发获得收入。

生成式 AI 切断了这种可追踪性。家长现在可以提示模型,将一段家庭录像转换成类似 Mickey 的角色,甚至加入 Universal 风格的片头和 AMC 品牌背景。结果即时、个性化,而且可能更有意义,但它不会触发版权主张、许可费或电影票销售,而是绕过所有传统受益者。

AI 模型使用从网络抓取的大量书籍、艺术作品、音乐和代码进行训练,其中往往包含受版权保护的材料。一份泄露的 Meta AI 训练抓取网站清单中包含版权内容、盗版书籍和成人媒体。这种捷径使 AI 产品能够以真实创作者的风格生成文字、图像或音乐,同时绕过每一位传统受益者。

一旦这些作品被吸收到训练数据中,衍生内容便可以无限生成。来源链条与补偿链条同时崩塌。现在真正重要的不再是谁拥有昨天的内容目录,而是谁仍有能力在此时此地创造相关价值。

法律反击

作家、艺术家和出版商已经针对 AI 公司未经同意使用其作品训练模型发起重大诉讼。一批图书作者在发现 Anthropic 从影子图书馆下载约 700 万本盗版书用于训练模型后提起诉讼。面对可能超过 1 万亿美元的损害赔偿,Anthropic 于 2025 年达成和解以避免审判。

视觉艺术家也对 Stability AI 提起类似诉讼,指控其未经补偿抓取数十亿张网络图像。Hollywood 工会则在 2023 年协议中加入 AI 防护条款,保护编剧剧本和演员数字形象不被未经授权复制。

合作式应对

越来越多既有企业选择合作而非对抗。Getty Images 与 Nvidia 构建了一款只使用其授权图库训练的 AI 生成器,承诺提供完整权利保障,并向图片影响模型输出的摄影师支付版税。Shutterstock 与 OpenAI 达成协议整合 DALL·E,并成立贡献者基金,向训练内容的艺术家付款。在音乐领域,Universal 和 Warner Music 正在推进许可协议;任何使用艺术家声音或作品的 AI 生成歌曲都会触发小额版税,类似 Spotify 的按播放付费模式。

与此同时,Reddit 曾经是免费的对话数据来源,如今开始收取 API 访问费,并从 Google 的许可协议中每年获得约 6,000 万美元。

但这些安排更像是在现有数据彻底失去相关性前进行的一场“最终拍卖”:在合成数据和实时数据生成取代旧内容之前,尝试从前 AI 内容时代榨取最后的价值。

技术战线

在技术层面,基础设施提供商和初创公司正在建立数字屏障和取证工具,以约束 AI 的触角。Cloudflare 推出控制功能,让网站能够阻止 AI 爬虫或对其计量收费,尝试建立按抓取付费模式。与此同时,一批新创公司,包括近期进入 Y Combinator 的团队,正在使用 AI 扫描公开的生成内容,寻找可能侵犯专利或版权的情况。

但其有效性仍不确定。一旦使用版权或近似版权材料训练的模型投入运行,它就能以极低的可追踪性直接向消费者交付内容;而且模型还可以继续被微调、蒸馏或层叠组合。

看不见的补贴

想象一下通过 Deliveroo 点餐,却支付远低于菜单的价格。这怎么可能?因为食物原本是为昨天已经付款的另一位顾客准备的。

AI 一直以类似方式运行:交付建立在未获报酬劳动之上的内容。过去十年,数十亿用户在博客、论坛、社交媒体、Wikipedia 和粉丝网站上免费创作,从未想到这些内容会成为 AI 的原材料。例如,OpenAI 的 GPT 模型使用 Common Crawl 训练,其中包含大量用户生成内容。到 2019 年,粉丝小说网站 Archive of Our Own 已发布超过 320 亿词,是英文 Wikipedia 文本量的八倍,其中许多进入了训练数据。正如一位作者所说:“如果你用过 ChatGPT,那么恭喜,你已经使用过我的作品。”

另一个案例中,一名独立开发者抓取了 1,260 万篇粉丝小说,并将其作为 AI 数据集上传到 Hugging Face,引发作者强烈反对,他们称之为“对礼物经济的盗窃”。这一模式遍及多个领域:LAION-5B 抓取数十亿张图片,Copilot 使用开源代码,早期音乐 AI 使用未获许可的音频。

但这些内容从来不是为了成为免费投入。电影公司发布预告片是为了出售电影票,插画师发布作品集是为了获得委托,程序员开放源代码是为了赢得项目。隐含的交换是:以免费样本换取付费工作。

AI 颠倒了这一逻辑。创作者在网上发布的内容越多,消费者就越容易通过 AI 获得他们的服务,而完全不向他们付费。过去的免费营销,变成了免费的燃料。

现在只剩下一个问题:谁来为明天的餐食付款?

没有什么永远免费

AI 对数据极度饥渴,而且越来越愿意为能够喂养它的内容付费。

Scale AI、Surge AI 和 Mercor 等数据标注公司已经成为估值最高的 AI 企业之一,它们提供推动前沿模型发展的高质量标注数据。到 2024 年末,AI 生成文本的数量已超过人类撰写文章;如今,它占新增网络材料的 70% 以上,预计到 2025 年末会超过 90%。随着 AI 内容充斥网络,新模型可能开始使用合成数据训练,实际上是在学习自己的输出。

衔尾蛇效应

研究者将这种递归退化称为衔尾蛇效应,也就是蛇吞食自己的尾巴。2023 年发表于 Nature 的一篇论文展示了重复自我训练如何导致“模型崩塌”:使用合成文本训练的语言模型会逐步失去保真度、遗忘真实数据分布的尾部,并生成越来越平淡甚至毫无意义的内容。

高质量的人类生成材料,尤其来自真实互动的数据,正在成为最有价值也最稀缺的资源。

数据井正在枯竭

主要内容平台已经开始收费或限制数据访问。Reddit 封锁 API、Twitter 重构 API 定价、Stack Overflow 实施限制,都指向同一趋势:数据稀缺。包括 New York Times 在内的新闻机构已经阻止 OpenAI 爬虫并提起诉讼,试图制止未经许可的使用;它们认为 AI 模型在不向来源带回流量的情况下“与来源竞争”。

随着开放网络的数据管道逐渐关闭,OpenAI、Anthropic 等公司开始与 Associated PressFinancial Times 等机构签订付费许可协议。免费数据时代正在结束。下一代燃料将是经过验证并获得补偿的人类输入。

垂直 AI

数据变得专业化,模型也随之专业化。2025 年的重要趋势之一,是垂直 AI,即使用特定行业专有数据训练的系统。

精准胜过规模

垂直 AI 通常在专业行业中表现更好。拥有 500 亿参数的 BloombergGPT 使用金融新闻、监管文件和市场数据训练,在金融自然语言处理任务上显著优于通用模型,同时在通用基准上保持相当水平。在医疗领域,Med-PaLM 2 在美国医学考试问题上达到 85% 以上准确率,与认证医师相当。

在法律领域,基于 GPT-4 构建的 Harvey AI 被 Allen & Overy 部署,为 3,500 名律师提供从尽职调查到起草文件的协助。该律所报告了数万次使用和可衡量的生产力提升。Harvard 与 BCG 的研究同样发现,使用 GPT-4 的顾问完成任务的速度提高 25%,输出质量提高 40%。

新的所有权模式

垂直 AI 往往由数据提供者共同拥有。Thomson Reuters 以 6.5 亿美元收购 Casetext,将自身法律数据库与 Casetext 的 CoCounsel AI 合并。Getty 的 AI 建立在自己的数据集上,并向贡献者支付版税。这些安排标志着 AI 所有权开始从集中式结构转向分布式、领域专用的生态系统。

共同所有权也在重塑竞争。SaaS 公司过去销售提高生产力的工具;垂直 AI 则替代完整工作流。SaaS 销售人员说服经理采用软件,垂直 AI 销售人员则说服 CEO 替换整个部门。

对于专业人士,这意味着大规模岗位替代。对于企业主,专有数据、工程人才乃至速度等传统壁垒都在削弱,因为 AI 智能体开始端到端接管工作流。

拥有强大而高效的分发网络仍是一项优势,但只会持续到 AI 操作系统出现为止。

AI 操作系统

AI 平台正在扮演操作系统的角色,成为用户与服务之间的中介。

2025 年 10 月,OpenAI 发布完整的 ChatGPT Apps SDK,允许第三方开发者直接集成到 ChatGPT 界面中。超过 80 家首发合作伙伴,包括 Expedia、Spotify 和 Shopify,使 ChatGPT 不再只是聊天机器人,而成为统一的服务层。

这种变化重新定义了服务分发:从应用商店、搜索排名和加盟网络转移到 AI 对话。不只是 OpenAI,竞争者也在趋同:Anthropic 的 Claude 集成到 Slack;Google Bard 可以访问 Gmail、Docs、Maps 和 YouTube;Microsoft Copilot 则内置于 Windows 和 Office。

对超过 8 亿活跃用户而言,体验会十分顺畅。他们无需离开对话,就可以探索、比较并交易不同功能。但对企业而言,在 AI 界面中失去可见性,就意味着失去相关性。只有当 AI 判断您的服务相关时,用户才会发现它;而离开您的服务几乎不需要任何成本。

一个自然的问题是:垂直 AI 能否在这些集中式 AI 生态中扩大覆盖范围?

对全球高端品牌而言,答案是肯定的。AI 依赖概率,而这些品牌已经主导训练数据。当用户要求“预订一家伦敦酒店”时,模型更可能打开 Booking.com,而不是某个初创替代品。

对其他企业而言,服务分发将更难预测。然而,战场仍然广阔,尤其是大品牌无法覆盖的个性化请求。心理学 AI 可能回答“间隔年后进入大学,我怎样结交新朋友?”医疗 AI 可能回应“我感到头晕和呼吸急促,该怎么办?”很多时候,两者需要组合,共同处理诸如“间隔年后进入大学,我交不到新朋友,现在还感到头晕和呼吸急促”这样的复杂重叠需求。

实际上,专业垂直数据需要重新接入集中式 AI 平台,才能实现商业化。为了让这些交易成为可能,平台必须拥有高效、稳健的归因基础设施。

AI 归因作为基础设施

归因就像烘焙前测量原料:先称量糖和面粉,而不是烘焙后再品尝甜度。当每种原料都有已知成本时,整个产品才能被公平定价和分配。因此,归因是即将到来的 AI 服务经济的基础。

它也是瓶颈。当 AI 平台接入多个第三方服务时,必须具备归因能力,才能兑现每一笔交易。对软件而言,这很简单:使用量可以计量,并按调用收费。

但知识、想法和咨询呢?询问癌症治疗是否应该与询问普通感冒收费相同?如果一千个医疗 AI 都能回答,应该向哪一个付款,又应该支付多少?

技术基础

研究界已经尝试量化 AI 模型内部的归因。Microsoft 启动了“训练时出处”项目,估算哪些数据点,包括照片、书籍或对话,对模型输出影响最大。Carnegie Mellon、Adobe 和 UC Berkeley 的研究者也开发了追踪文生图模型中图像影响的算法,量化哪些训练图像以何种程度塑造了新输出。

但这是一条艰难的路径。Transformer 架构从未被设计为追踪这类出处,详见我们此前的文章:《Transformer 模型如何丢失归因:逐步示例》

商业进展

从商业角度看,归因仍处于早期阶段,目前主要通过预先补偿或面向数据贡献者的版税池实现。

Bria AI 等初创公司声称可以“以程序化方式追踪并补偿”数据贡献者;Adobe Firefly 和 Shutterstock AI 已经运营版税池,根据训练数据使用情况向艺术家付款。Getty 的模型同样按比例向文件参与生成的摄影师分配版税。Mercor 则连接并补偿不同领域的专业人士,为顶尖 AI 公司提供用于训练和评估模型的“专家数据”。

相比之下,按使用量归因仍远未成熟。这种模式要求补偿反映贡献者数据在真实输出中被使用的频率或重要程度。澔智是最早开发此类系统的公司之一。公司的 Mercurise 平台可以实时追踪 AI 生成价值,并确保价值回流至原始来源。

前方道路

AI 既打破壁垒,也促进平等:它让创作更加普及,却侵蚀了传统价值结构。但免费数据时代正在结束。从现在起,真实人类互动将成为最稀缺也最有价值的资源。

如果暂时放下只让少数人受益的 AGI 梦想,未来 AI 将越来越多地成为不同服务之间的交易引擎,为个人创造新的收入方式,并让他们参与生态本身。转变已经开始。在 Product Hunt 上,付费让用户使用 AI 的应用发布,已经开始优于向用户收费使用 AI 的产品。

2026 年将成为转折点:AI 平台之间的竞争将不再主要围绕能力,而会更多围绕归因基础设施,即追踪价值来源并据此补偿的能力。这将标志着 AI 从推动岗位替代转向促进岗位创造。


澔智构建 AI 的归因层,帮助企业和个人将知识与想法转化为 AI 服务生态中的活跃组成部分。欢迎联系我们参与其中。

建议引用。 如需在学术场景中引用本文,请使用:

Liao, S. (2025). The economic engine of AI. 澔智研究。

标签

  • AI 归因
  • AI 经济学
  • 垂直 AI
  • AI 数据经济
  • AI 操作系统

继续阅读

全部文章 →