幕 / 从赢下一盘棋,到生成一个世界

机器开始画出未曾见过的画面

从识别图像到生成图像,研究者把问题反过来问了一遍。

本篇目录 +

识别一张猫的照片,是从图像找到类别。如果把方向反过来,给机器一个描述,让它产生一张新的图像呢?

两种角色,在训练中相遇

2014年,生成对抗网络GAN提出一种训练方式:生成器产生样本,判别器尝试区分真实数据与生成结果,两者在训练中相互影响。

可以用“制作作品的人”和“评判作品的人”作比喻,理解这种相互促进。但这只是对机制的说明,并不意味着两个模型具有人的审美体验或欺骗意图。[1]

从噪声中恢复结构

扩散模型发展出另一条路线。训练时,系统学习如何从带噪声的数据中恢复结构;生成时,从噪声出发,逐步形成样本。2020年的去噪扩散概率模型论文,是这一方向的重要工作之一。

潜在扩散模型进一步在压缩后的表示空间中进行处理,降低部分计算负担。语言与图像的联系,则让文字描述能够影响生成结果。[2][3]

逼真与真实,是不同的问题

一张图像可以看起来可信,却不对应任何真实发生的事件。画面中的文字、空间关系、人物细节,也可能出现错误。生成图像因此既提供创作工具,也改变了我们判断图像证据的方式。

训练资料来自哪里、创作者的权益如何处理、生成内容怎样标明,都成为技术发展的一部分。讨论生成式AI,既要看能做什么,也要看这些能力进入生活后的关系与责任。[4]

留给你的一个问题

当一张照片般的画面出现在你面前,你会怎样判断它能不能作为事件证据?

生成图像是在拼接素材吗?

主流生成模型通常根据学到的统计结构产生图像,并不是简单检索几块素材后剪贴。但模型可能记住训练样本,生成与既有作品近似的内容;具体情况需要检查。

理解生成机制,不能代替对数据来源、使用许可和具体输出的判断。

故事里的人与想法

本篇来源

沿着原始资料,继续了解故事。团队发布与回顾代表发布者提供的记录。

  1. 研究论文与原著 · Ian J. Goodfellow等Generative Adversarial Nets
  2. 研究论文与原著 · Jonathan Ho、Ajay Jain、Pieter AbbeelDenoising Diffusion Probabilistic Models
  3. 研究论文与原著 · Robin Rombach等High-Resolution Image Synthesis with Latent Diffusion Models
  4. 研究论文与原著 · Rishi Bommasani等On the Opportunities and Risks of Foundation Models

整理于2026年9月16日