第四幕 / 从赢下一盘棋,到生成一个世界
先广泛学习,再面对不同任务
预训练改变了开发AI的方式,一份模型能够适应越来越多的用途。
本篇目录 +
以前,做情感分析、问答和文本分类,常要为每项任务准备专门的模型。如果许多任务能从同一份基础能力出发,会怎样?
先学习通用的表示
2018年的BERT通过上下文预训练,改善了多种语言理解任务的表现。GPT系列则沿着生成式预训练路线发展。它们学习目标有所不同,但都体现了从广泛数据中学习,再适应具体任务的方向。
这样的训练,不是把资料原封不动放进一个可以逐页查阅的书柜。模型调整参数,学习数据中的规律与表示。后来能否答对某个问题,仍然需要实际检验。[1][2]
提示成为新的使用方式
2020年的GPT-3论文展示,大模型可以根据文字提示和少量示例完成多种任务。人们开始用描述和例子告诉模型要做什么,而不必每次都重新训练一个专用系统。
“基础模型”这个名称随后被用于讨论一种重要模式:模型通过广泛数据训练,并能够适应一系列下游任务。它描述的是能力与应用的组织方式,不是一份毫无限制的通用智能证明。[2][3]
回答时,也可以查资料
模型掌握的信息可能过时,也可能在细节上出错。检索增强生成,常称RAG,把外部资料的检索与生成结合,让系统在回答时参考找到的内容。
查到资料也不保证解释正确:检索可能漏掉关键证据,材料本身可能有误,模型可能引用不当。因此,资料是否相关、出处是否可信、结论是否受到支持,都值得分别检查。[4]
留给你的一个问题
你希望AI直接给答案,还是同时告诉你答案依据了哪些材料?
参数、上下文与外部记忆
参数是训练后保留在模型中的数值;上下文是本次处理时提供的内容;外部记忆或检索库则由系统另外保存和调用。它们会以不同方式影响回答。
一段聊天能被继续、一份资料能被搜索到、模型经过重新训练,是三种不同的事情。了解这种区别,有助于理解长期记忆项目究竟在解决什么问题。
本篇来源
沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。
- 研究论文与原著 · Jacob Devlin、Ming-Wei Chang、Kenton Lee、Kristina ToutanovaBERT: Pre-training of Deep Bidirectional Transformers for Language Understanding ↗
- 研究论文与原著 · Tom B. Brown等Language Models are Few-Shot Learners ↗
- 研究论文与原著 · Rishi Bommasani等On the Opportunities and Risks of Foundation Models ↗
- 研究论文与原著 · Patrick Lewis等Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks ↗
整理于2026年9月16日