输入一句话就能生成一张图,背后主流的技术是扩散模型(Diffusion Model)。它的思想出乎意料地直观:先学会把图片一步步破坏成噪声,再学会把噪声一步步还原成图片。生成时从纯噪声出发逆向还原,就”画”出了一张新图。

前向扩散:加噪

训练的第一半是破坏过程:

  • 拿一张真实图片,按固定计划逐步加入高斯噪声
  • 经过足够多步后,图片变成纯噪声,信息完全丢失

这个过程是预定义的、不需要学习的,它的作用是为模型制造”从噪声到图片”的各种中间状态样本。

反向去噪:生成

训练的第二半是学习还原:

  • 训练一个神经网络(通常是 U-Net),输入”带噪图片 + 当前步数”,预测本轮加入的噪声
  • 把预测的噪声减掉,就得到更干净一点的图
  • 损失函数衡量预测噪声与真实噪声的差距

生成时从随机纯噪声开始,重复”预测噪声→减去→更清晰”几十步,最终得到一张训练集中从未存在过的新图。模型学的不是复制图片,而是自然图像的分布规律

文本如何控制画面

纯扩散模型只能随机生成,让”文字指挥画画”靠的是条件注入:

  • 用文本编码器(如 CLIP)把提示词转成语义向量
  • 通过交叉注意力机制,在每一步去噪时让图像特征”关注”文本语义
  • 提示词说”雪中的狐狸”,去噪方向就被引导向符合该语义的图像分布

负面提示词(negative prompt)同理:告诉模型每一步要”远离”哪些语义。

Stable Diffusion:把扩散搬进潜空间

直接在像素空间做扩散计算量巨大。Stable Diffusion 的关键优化:

  • 先用 VAE 编码器把图片压缩到低维潜空间(如 64x64)
  • 在潜空间里做扩散与去噪,最后用 VAE 解码器还原成像素图

计算成本下降一个数量级,消费级显卡也能跑,这才有了 AI 绘画的全民爆发。LoRA 微调则让普通人用几十张图就能训练自己的画风模型。

能力与边界

扩散模型擅长质感、光影与创意组合,但也有边界:文字渲染、手部结构等精细约束仍易出错;生成内容受训练数据版权与偏见影响。理解”加噪-去噪”的原理后就能明白:AI 绘画不是拼贴素材,而是模型在语义引导下从噪声中”雕刻”出符合分布的图像——这既是它创造力的来源,也是它偶尔”画不对”的原因。