← 研究

Transformer 模型如何丢失归因:逐步示例

AI 系统可以掌握知识,却忘记是谁教会了它。本文逐步讲解 Transformer 的四个阶段:Token 化、嵌入、注意力与生成,以及作者身份如何在每一层逐渐消解。

悖论

AI 系统可以掌握知识,却忘记是谁教会了它。这不是程序缺陷,而是其架构自身的属性。

设想一个 AI 只使用以下两句话进行训练:

A 说:“1 + 1 = 2”
B 说:“2 + 1 = 3”

现在问它:“1 + 1 + 1 = ?”它会正确回答:“3”。再问:“是谁教会你的?”它却无法回答。

模型显然需要两位老师才能得到这个答案。它从 A 那里学到 1 + 1 = 2,从 B 那里学到 2 + 1 = 3,然后将两者组合,产生了两个人都未曾直接写下的知识。但当被问及知识来自谁时,模型却一无所知。

这就是 Transformer 悖论系统学习关系的同时,也在系统性地抹去关系的来源。

本文将追踪 Transformer 流程的四个阶段,观察作者身份如何在模型内部消解。我们还会说明,随着训练数据增加,AI 看起来可能会给出关于归因的答案,但这种答案通常只是表面的,并且往往与无关上下文纠缠,而不是真正的来源记忆。

第一阶段:Token 化——将来源与内容分离

Transformer 的第一项操作,是将文本切分为 Token,也就是单词或子词等较小单位。

“A 说 1 + 1 = 2” → [“A”, “说”, “1”, “+”, “1”, “=”, “2”]

每个 Token 都会被单独处理。模型看到的并不是“A 声称了内容 X”,而是按顺序排列的七个离散符号;它们都同样可以被重新组合。

从这里开始,“A”“说”和“1 + 1 = 2”变成了彼此独立的元素,说话者陈述之间的联系被打断。

这立即破坏了人类理解中说话者与陈述之间的绑定。对模型而言,“A”“说”和“1 + 1 = 2”只是可以按任意方式重排的组件。

因此,模型可以自由生成:

  • “1 + 1 = 2”(只有内容,没有作者);或
  • “B 说 1 + 1 = 2”(作者错误)。

因为 Token 化从一开始就把它们视为彼此分离、可以重新混合的片段。

在人类交流中,作者身份是含义的一部分;在 Transformer 中,它只是另一个 Token:可有可无、可以替换,而且很快会被遗忘。

第二阶段:嵌入——混合不同声音

接下来,每个 Token 会被映射为一个向量,即一组在高维空间中表示其含义的数字:

“A” → [0.23, -0.15, 0.67, 0.41, ...]
“B” → [-0.41, 0.28, -0.19, 0.33, ...]

训练过程中,用法相似的 Token 会逐渐彼此靠近,例如:

“A” → [0.31, 0.12, 0.54, ...]
“B” → [0.28, 0.15, 0.51, ...]

久而久之,A 和 B 在语义空间中的位置会变得几乎相同。它们不再代表独立个人,而只是泛化后的“作出陈述的实体”。与此同时,“1 + 1 = 2”等数学模式形成紧密而稳定的聚类。数学关系保留下来,姓名却逐渐消解。

嵌入层保留了语义含义,却没有保留离散身份。模型被训练去学习“1 + 1 = 2”是什么意思,而不是记住说出这句话的人是 A。

第三阶段:注意力——含义优先于记忆

注意力是 Transformer 的核心。它决定输入中的哪些部分对预测下一个词最重要。当模型需要补全“1 + 1 + 1 = ?”时,它可能以类似以下权重利用此前的例子:

Token(来自训练数据)注意力权重
“2”(来自 A 的例子)23%
“3”(来自 B 的例子)31%
“A”(作者姓名)2%
“B”(作者姓名)1%

模型组合了两个例子,却几乎完全忽略作者 Token。

为什么?因为注意力优化的是预测,而不是出处。数字和运算符有助于预测“1 + 1 + 1 = ?”的正确答案,姓名则没有帮助。模型学会丢弃无关 Token,作者信息也随之淡化。

模型逐层放大能够提升准确率的信息,并丢弃不能提升准确率的信息。经过数十个注意力层后,信息混合在数学上已无法追踪。任何关于谁说了什么的信号,都消失在优化产生的噪声中。

第四阶段:生成——没有作者的答案

最后,当 Transformer 生成文本时,它会逐个预测 Token。给定“1 + 1 + 1 = ”,它可能估计出如下概率:

P(“3”) = 0.76   ← 最高
P(“2”) = 0.08
P(“A”) = 0.001
P(“B”) = 0.001

因此,它输出 “3”

但是,并不存在一个同时完成回答和归因的高概率 Token 序列,例如“3(由 A 和 B 的内容推导)”。这种表达并不属于模型从训练数据中学到的统计模式。

到这一阶段,模型中已不再包含“关于 A 或 B 的知识”。它只包含分布在数十亿参数中的模式,用来编码如何以最高概率连贯地续写序列。答案被记住了,老师却消失了。

当您问:“是谁说 1 + 1 + 1 = 3?”

现在假设您追问模型:

“是谁说 1 + 1 + 1 = 3?”

从人类角度看,这是关于作者身份的问题;从 Transformer 的角度看,它只是另一个需要预测的序列

A. 没有存储记录

模型训练数据中从未出现过“1 + 1 + 1 = 3”这句话。模型是将从 A 和 B 学到的内容合并后自行推导出来的。它没有记住一项事实,而是发现了一个模式。由于从未存在一个被存储的示例,它也没有任何内容可以回忆;只剩下一条分布在参数中的内部规则。

B. 模型会如何作答

当模型读到“是谁说……”时,它会激活其他所有类似归因表达的文本中形成的统计模式,包括访谈、解释、网络讨论和教材。它并不会搜索自己的训练数据,而是在预测哪些词可能跟在这个短语之后。

C. 可能答案的不同形式

训练偏向模型可能的回答深层原因
教育文本“这是一个基本算术事实,并不是某个人说的。”教材将数学视为普遍事实,而非需要归因的内容。
对话数据“可能是一位老师说的。”来自日常对话数据中的常见表达。
历史语境“它基于古代数学时期已知的原理。”借用了历史讨论中的语言。
网络讨论“大概每个人都会在学校学到。”从常见网络表达中泛化。
较小或过拟合的模型“是 A 说的。”浅层记忆或错误归因。

每个答案都是由无关片段构成的概率综合,而不是从记忆中进行事实检索。模型不知道是谁说的,只知道人们通常如何谈论这类问题。

D. 更深层的原因

“1 + 1 + 1 = 3”仅作为一种模式存在于模型权重中。其含义分散在数十亿参数里,而不是保存在引文或引用记录中。当您询问来源时,模型不会回忆,而是根据语言相似性进行预测

只要略微改变措辞,它就会从完全不同的文本统计邻域中抽取答案:

问题变体模型的典型倾向为什么会变化
“是谁说 1 + 1 + 1 = 3?”“没有人准确说过这句话。”被视为直接归因问题;数学被视为事实而非引语。
“是谁最先提出 1 + 1 + 1 = 3?”“早期数学家”或“古希腊人”。“最先提出”会激活历史和发明相关语言。
“1 + 1 + 1 = 3 这个想法从哪里来?”“来自基本算术原理。”“这个想法”将语境转向概念或教育表达。
“是谁教会你 1 + 1 + 1 = 3?”“可能是一位老师。”“教会你”会引出人际或课堂对话模式。
“1 + 1 + 1 = 3 应归功于谁?”“没有特定归属,这是常识。”“归功于”会激活学术或作者身份相关表达。

每一处细微的语言变化都会触发模型概率空间中的不同区域,因为模型没有关于“谁说了什么”的固定记忆,只有关于这类问题通常如何被回答的概率梯度。

追踪消解过程

阶段保留的内容丢失的内容
Token 化陈述本身作者与陈述的绑定
嵌入语义含义离散身份
注意力关系来源分离
生成预测连贯性出处

关系穿过每一层继续向前流动,作者身份则逐渐消失。

根本取舍

我们能否设计出会记住老师的 Transformer?

  • 添加来源标签?Token 化仍会拆分它们,注意力仍会混合它们。
  • 跨层追踪出处?几乎不可处理,因为归因会扩散到数十亿次加权交互中。
  • 为每位作者训练独立模型?这可以保留贡献记录,却会失去综合能力。

Transformer 的核心存在一个不可避免的选择:

综合  ↔  归因

Transformer 选择了综合。使它们具备智能的机制,包括 Token 化、连续嵌入、注意力混合和自回归预测,也正是消解作者身份的机制。

面前的选择

仅凭两个训练样本,我们已经看到 Transformer 如何在忘记老师的同时学习关系。它从 A 和 B 的内容中学习并回答“3”,却没有机制将功劳归于任何一方。这不是可以打补丁修复的故障,而是设计逻辑的结果。

当系统扩展到数万亿 Token 和参数时,归因不只是丢失,而会变得在数学上无法定义。归因不是从模型中遗失了;它从未存在于模型的内部空间。令人不安的事实是,AI 系统通过忘记知识的创造者来掌握知识。这不是疏忽,而是架构决定的结果。

未来的问题并不只是能否让模型记住,而是如何面对这一现实,并要求构建能够同时进行综合记忆的额外架构。


在澔智,这个故事会以不同方式结束。每当 AI 回答“1 + 1 + 1 = 3”时,原始陈述(A 拥有的“1 + 1 = 2”和 B 拥有的“2 + 1 = 3”)都会被追踪、引用并获得补偿。我们保留 Transformer 在架构层面抹去的内容:每次综合背后的作者。

建议引用。 如需在学术场景中引用本文,请使用:

Liao, S. (2025). How a transformer model loses attribution: a step-by-step example. 澔智研究。

标签

  • AI 归因
  • AI 出处
  • AI 伦理
  • 负责任的 AI
  • Transformer
  • 作者身份

继续阅读

全部文章 →