悖论
AI 系统可以掌握知识,却忘记是谁教会了它。这不是程序缺陷,而是其架构自身的属性。
设想一个 AI 只使用以下两句话进行训练:
A 说:“1 + 1 = 2”
B 说:“2 + 1 = 3”
现在问它:“1 + 1 + 1 = ?”它会正确回答:“3”。再问:“是谁教会你的?”它却无法回答。
模型显然需要两位老师才能得到这个答案。它从 A 那里学到 1 + 1 = 2,从 B 那里学到 2 + 1 = 3,然后将两者组合,产生了两个人都未曾直接写下的知识。但当被问及知识来自谁时,模型却一无所知。
这就是 Transformer 悖论:系统学习关系的同时,也在系统性地抹去关系的来源。
本文将追踪 Transformer 流程的四个阶段,观察作者身份如何在模型内部消解。我们还会说明,随着训练数据增加,AI 看起来可能会给出关于归因的答案,但这种答案通常只是表面的,并且往往与无关上下文纠缠,而不是真正的来源记忆。
第一阶段:Token 化——将来源与内容分离
Transformer 的第一项操作,是将文本切分为 Token,也就是单词或子词等较小单位。
“A 说 1 + 1 = 2” → [“A”, “说”, “1”, “+”, “1”, “=”, “2”]
每个 Token 都会被单独处理。模型看到的并不是“A 声称了内容 X”,而是按顺序排列的七个离散符号;它们都同样可以被重新组合。
从这里开始,“A”“说”和“1 + 1 = 2”变成了彼此独立的元素,说话者与陈述之间的联系被打断。
这立即破坏了人类理解中说话者与陈述之间的绑定。对模型而言,“A”“说”和“1 + 1 = 2”只是可以按任意方式重排的组件。
因此,模型可以自由生成:
- “1 + 1 = 2”(只有内容,没有作者);或
- “B 说 1 + 1 = 2”(作者错误)。
因为 Token 化从一开始就把它们视为彼此分离、可以重新混合的片段。
在人类交流中,作者身份是含义的一部分;在 Transformer 中,它只是另一个 Token:可有可无、可以替换,而且很快会被遗忘。
第二阶段:嵌入——混合不同声音
接下来,每个 Token 会被映射为一个向量,即一组在高维空间中表示其含义的数字:
“A” → [0.23, -0.15, 0.67, 0.41, ...]
“B” → [-0.41, 0.28, -0.19, 0.33, ...]
训练过程中,用法相似的 Token 会逐渐彼此靠近,例如:
“A” → [0.31, 0.12, 0.54, ...]
“B” → [0.28, 0.15, 0.51, ...]
久而久之,A 和 B 在语义空间中的位置会变得几乎相同。它们不再代表独立个人,而只是泛化后的“作出陈述的实体”。与此同时,“1 + 1 = 2”等数学模式形成紧密而稳定的聚类。数学关系保留下来,姓名却逐渐消解。
嵌入层保留了语义含义,却没有保留离散身份。模型被训练去学习“1 + 1 = 2”是什么意思,而不是记住说出这句话的人是 A。
第三阶段:注意力——含义优先于记忆
注意力是 Transformer 的核心。它决定输入中的哪些部分对预测下一个词最重要。当模型需要补全“1 + 1 + 1 = ?”时,它可能以类似以下权重利用此前的例子:
| Token(来自训练数据) | 注意力权重 |
|---|---|
| “2”(来自 A 的例子) | 23% |
| “3”(来自 B 的例子) | 31% |
| “A”(作者姓名) | 2% |
| “B”(作者姓名) | 1% |
模型组合了两个例子,却几乎完全忽略作者 Token。
为什么?因为注意力优化的是预测,而不是出处。数字和运算符有助于预测“1 + 1 + 1 = ?”的正确答案,姓名则没有帮助。模型学会丢弃无关 Token,作者信息也随之淡化。
模型逐层放大能够提升准确率的信息,并丢弃不能提升准确率的信息。经过数十个注意力层后,信息混合在数学上已无法追踪。任何关于谁说了什么的信号,都消失在优化产生的噪声中。
第四阶段:生成——没有作者的答案
最后,当 Transformer 生成文本时,它会逐个预测 Token。给定“1 + 1 + 1 = ”,它可能估计出如下概率:
P(“3”) = 0.76 ← 最高
P(“2”) = 0.08
P(“A”) = 0.001
P(“B”) = 0.001
因此,它输出 “3”。
但是,并不存在一个同时完成回答和归因的高概率 Token 序列,例如“3(由 A 和 B 的内容推导)”。这种表达并不属于模型从训练数据中学到的统计模式。
到这一阶段,模型中已不再包含“关于 A 或 B 的知识”。它只包含分布在数十亿参数中的模式,用来编码如何以最高概率连贯地续写序列。答案被记住了,老师却消失了。
当您问:“是谁说 1 + 1 + 1 = 3?”
现在假设您追问模型:
“是谁说 1 + 1 + 1 = 3?”
从人类角度看,这是关于作者身份的问题;从 Transformer 的角度看,它只是另一个需要预测的序列。
A. 没有存储记录
模型训练数据中从未出现过“1 + 1 + 1 = 3”这句话。模型是将从 A 和 B 学到的内容合并后自行推导出来的。它没有记住一项事实,而是发现了一个模式。由于从未存在一个被存储的示例,它也没有任何内容可以回忆;只剩下一条分布在参数中的内部规则。
B. 模型会如何作答
当模型读到“是谁说……”时,它会激活其他所有类似归因表达的文本中形成的统计模式,包括访谈、解释、网络讨论和教材。它并不会搜索自己的训练数据,而是在预测哪些词可能跟在这个短语之后。
C. 可能答案的不同形式
| 训练偏向 | 模型可能的回答 | 深层原因 |
|---|---|---|
| 教育文本 | “这是一个基本算术事实,并不是某个人说的。” | 教材将数学视为普遍事实,而非需要归因的内容。 |
| 对话数据 | “可能是一位老师说的。” | 来自日常对话数据中的常见表达。 |
| 历史语境 | “它基于古代数学时期已知的原理。” | 借用了历史讨论中的语言。 |
| 网络讨论 | “大概每个人都会在学校学到。” | 从常见网络表达中泛化。 |
| 较小或过拟合的模型 | “是 A 说的。” | 浅层记忆或错误归因。 |
每个答案都是由无关片段构成的概率综合,而不是从记忆中进行事实检索。模型不知道是谁说的,只知道人们通常如何谈论这类问题。
D. 更深层的原因
“1 + 1 + 1 = 3”仅作为一种模式存在于模型权重中。其含义分散在数十亿参数里,而不是保存在引文或引用记录中。当您询问来源时,模型不会回忆,而是根据语言相似性进行预测。
只要略微改变措辞,它就会从完全不同的文本统计邻域中抽取答案:
| 问题变体 | 模型的典型倾向 | 为什么会变化 |
|---|---|---|
| “是谁说 1 + 1 + 1 = 3?” | “没有人准确说过这句话。” | 被视为直接归因问题;数学被视为事实而非引语。 |
| “是谁最先提出 1 + 1 + 1 = 3?” | “早期数学家”或“古希腊人”。 | “最先提出”会激活历史和发明相关语言。 |
| “1 + 1 + 1 = 3 这个想法从哪里来?” | “来自基本算术原理。” | “这个想法”将语境转向概念或教育表达。 |
| “是谁教会你 1 + 1 + 1 = 3?” | “可能是一位老师。” | “教会你”会引出人际或课堂对话模式。 |
| “1 + 1 + 1 = 3 应归功于谁?” | “没有特定归属,这是常识。” | “归功于”会激活学术或作者身份相关表达。 |
每一处细微的语言变化都会触发模型概率空间中的不同区域,因为模型没有关于“谁说了什么”的固定记忆,只有关于这类问题通常如何被回答的概率梯度。
追踪消解过程
| 阶段 | 保留的内容 | 丢失的内容 |
|---|---|---|
| Token 化 | 陈述本身 | 作者与陈述的绑定 |
| 嵌入 | 语义含义 | 离散身份 |
| 注意力 | 关系 | 来源分离 |
| 生成 | 预测连贯性 | 出处 |
关系穿过每一层继续向前流动,作者身份则逐渐消失。
根本取舍
我们能否设计出会记住老师的 Transformer?
- 添加来源标签?Token 化仍会拆分它们,注意力仍会混合它们。
- 跨层追踪出处?几乎不可处理,因为归因会扩散到数十亿次加权交互中。
- 为每位作者训练独立模型?这可以保留贡献记录,却会失去综合能力。
Transformer 的核心存在一个不可避免的选择:
综合 ↔ 归因
Transformer 选择了综合。使它们具备智能的机制,包括 Token 化、连续嵌入、注意力混合和自回归预测,也正是消解作者身份的机制。
面前的选择
仅凭两个训练样本,我们已经看到 Transformer 如何在忘记老师的同时学习关系。它从 A 和 B 的内容中学习并回答“3”,却没有机制将功劳归于任何一方。这不是可以打补丁修复的故障,而是设计逻辑的结果。
当系统扩展到数万亿 Token 和参数时,归因不只是丢失,而会变得在数学上无法定义。归因不是从模型中遗失了;它从未存在于模型的内部空间。令人不安的事实是,AI 系统通过忘记知识的创造者来掌握知识。这不是疏忽,而是架构决定的结果。
未来的问题并不只是能否让模型记住,而是如何面对这一现实,并要求构建能够同时进行综合与记忆的额外架构。
在澔智,这个故事会以不同方式结束。每当 AI 回答“1 + 1 + 1 = 3”时,原始陈述(A 拥有的“1 + 1 = 2”和 B 拥有的“2 + 1 = 3”)都会被追踪、引用并获得补偿。我们保留 Transformer 在架构层面抹去的内容:每次综合背后的作者。
建议引用。 如需在学术场景中引用本文,请使用:
Liao, S. (2025). How a transformer model loses attribution: a step-by-step example. 澔智研究。


