第四幕 / 从赢下一盘棋,到生成一个世界
一句话里的词,开始彼此参照
Transformer改变了信息相互联系的方式,为后来的大模型提供了重要结构。
本篇目录 +
一句话很长,结尾的“它”到底指谁?理解当前位置,往往需要回头参考别处的信息。语言模型也要处理这样的联系。
不把所有信息挤在一起
早期序列模型常按顺序传递信息。句子变长,保持远处的重要线索会变得困难。机器翻译中的注意力研究,让模型在生成某个部分时,可以有选择地参考输入中的不同位置。
这个过程叫“注意力”,借用了一个熟悉的词,但实际是数学运算。它计算信息之间的关系,并按权重组合信息,不等于机器具有人的心理专注体验。[1]
2017年的八位作者
2017年,《Attention Is All You Need》提出Transformer结构,把注意力机制放在核心位置。它改变了序列信息的组织方式,也让训练中的许多计算更适合并行处理。
它不是所有相关思想的共同起点。词表示、序列建模、注意力与优化方法早有积累。这篇论文将多项想法组合成一种后来能够广泛扩展的结构。[2]
- 当前位置
- 比较相关线索
- 分配权重
- 组合信息
这里的“注意力”是一种信息计算方式,不代表人的心理体验。
结构打开了空间
Transformer后来被用于语言、视觉和多模态任务。更大的训练数据与计算资源,让研究者能够探索它在更广范围中的能力。
但一种结构的成功,并不意味着它自动具备准确知识或稳定推理。结构决定如何处理信息,学习目标与数据影响学到什么,评估则帮助我们看见实际表现。[2][3]
留给你的一个问题
读一段复杂文字时,你会来回参考哪些线索?
能并行训练,为什么回答仍逐字出现?
训练时,可以在已知的一段文本上并行计算很多位置;常见自回归模型生成时,则利用已有内容预测下一个词元,再继续生成。两者所面对的信息条件不同。
词元也不总是一个完整的词或汉字,它是模型处理文本时使用的基本片段。界面里的逐步输出,是生成方式与产品呈现共同作用的结果。
本篇来源
沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。
- 研究论文与原著 · Dzmitry Bahdanau、Kyunghyun Cho、Yoshua BengioNeural Machine Translation by Jointly Learning to Align and Translate ↗
- 研究论文与原著 · Ashish Vaswani等八位作者Attention Is All You Need ↗
- 研究论文与原著 · Rishi Bommasani等On the Opportunities and Risks of Foundation Models ↗
整理于2026年9月16日