第四幕 / 从赢下一盘棋,到生成一个世界
机器开始画出未曾见过的画面
从识别图像到生成图像,研究者把问题反过来问了一遍。
本篇目录 +
识别一张猫的照片,是从图像找到类别。如果把方向反过来,给机器一个描述,让它产生一张新的图像呢?
两种角色,在训练中相遇
2014年,生成对抗网络GAN提出一种训练方式:生成器产生样本,判别器尝试区分真实数据与生成结果,两者在训练中相互影响。
可以用“制作作品的人”和“评判作品的人”作比喻,理解这种相互促进。但这只是对机制的说明,并不意味着两个模型具有人的审美体验或欺骗意图。[1]
从噪声中恢复结构
扩散模型发展出另一条路线。训练时,系统学习如何从带噪声的数据中恢复结构;生成时,从噪声出发,逐步形成样本。2020年的去噪扩散概率模型论文,是这一方向的重要工作之一。
潜在扩散模型进一步在压缩后的表示空间中进行处理,降低部分计算负担。语言与图像的联系,则让文字描述能够影响生成结果。[2][3]
逼真与真实,是不同的问题
一张图像可以看起来可信,却不对应任何真实发生的事件。画面中的文字、空间关系、人物细节,也可能出现错误。生成图像因此既提供创作工具,也改变了我们判断图像证据的方式。
训练资料来自哪里、创作者的权益如何处理、生成内容怎样标明,都成为技术发展的一部分。讨论生成式AI,既要看能做什么,也要看这些能力进入生活后的关系与责任。[4]
留给你的一个问题
当一张照片般的画面出现在你面前,你会怎样判断它能不能作为事件证据?
生成图像是在拼接素材吗?
主流生成模型通常根据学到的统计结构产生图像,并不是简单检索几块素材后剪贴。但模型可能记住训练样本,生成与既有作品近似的内容;具体情况需要检查。
理解生成机制,不能代替对数据来源、使用许可和具体输出的判断。
本篇来源
沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。
- 研究论文与原著 · Ian J. Goodfellow等Generative Adversarial Nets ↗
- 研究论文与原著 · Jonathan Ho、Ajay Jain、Pieter AbbeelDenoising Diffusion Probabilistic Models ↗
- 研究论文与原著 · Robin Rombach等High-Resolution Image Synthesis with Latent Diffusion Models ↗
- 研究论文与原著 · Rishi Bommasani等On the Opportunities and Risks of Foundation Models ↗
整理于2026年9月16日