扩散模型简介:图像生成背后的原理(去噪的魔法)
Midjourney、Stable Diffusion 背后的扩散模型是怎么工作的?用最直观的方式讲清'从噪声到图像'的过程。
#扩散模型#Stable Diffusion#图像生成#DDPM更新于 2026-08-12
Midjourney、Stable Diffusion、DALL·E 3 背后,是扩散模型(Diffusion Model)。它取代了早期的 GAN,成为图像生成的事实标准。
理解它的钥匙是一句反直觉的话:
图像生成 = 把纯噪声一点点“擦干净”成一张图。
核心思想:加噪与去噪
扩散模型分两个过程:
正向过程(加噪,训练时): 把一张真实图片一步步加入随机噪声,直到变成完全随机的噪点。这个过程是确定、可算的——每一步往图片上叠一点噪声。
反向过程(去噪,生成时): 训练一个神经网络,学会倒着走——从纯噪点一步步“猜”出上一步更清晰的样子,逐步还原出图像。
纯噪声 →(去噪)→ 模糊轮廓 →(去噪)→ 越来越清晰 → 最终图像
三个关键角色
- 噪声调度器(Scheduler):控制每一步加多少噪声、去噪时的步长
- 去噪网络(U-Net / DiT):核心神经网络,学会估计“这一片噪声该怎么去掉”
- 文本条件(Cross-Attention):把“一只戴帽子的猫”这样的文字提示,通过注意力机制引导去噪方向——这就是文生图的关键
为什么用“文本”能控制图像
生成时,文本被编码成向量,在每一步去噪时通过 交叉注意力 注入去噪网络,告诉它“往有猫、有帽子、有这些特征的方向走”。文字成了“方向盘”。
Latent Diffusion:Stable Diffusion 的优化
直接在像素上做扩散太慢、太吃显存。Stable Diffusion 的巧妙做法:
- 先用 VAE 编码器把图像压缩到低维“潜空间”(Latent Space)
- 在潜空间里做扩散(快得多、省显存)
- 用 VAE 解码器还原成高清像素
这就是为什么 SD 能在普通显卡上跑文生图。
关键参数(用得上的)
- Steps(步数):去噪步数,越多越精细但越慢,一般 20-40
- CFG(提示词引导强度):越高越贴合文字但越“死板”,一般 5-8
- Sampler(采样器):不同去噪算法,影响速度与质量
- Seed(种子):固定随机种子可复现同一张图
一句话总结
扩散模型 = 学会“把噪声还原成图像”(去噪)的模型。配合文本引导(交叉注意力)和潜空间压缩(VAE),就成了我们天天用的文生图工具。核心是理解:生成不是“从无到有”,而是“从乱到整”。
继续学习
模型社区与资源:Hugging Face、ModelScope、Replicate、CivitAI
去哪找模型、怎么下模型?盘点主流模型社区:Hugging Face、魔搭 ModelScope、Replicate、CivitAI 的功能与直达教程。
本地部署实践:Ollama / vLLM / llama.cpp 对比与保姆级教程
在本地或小服务器跑大模型的三大工具对比,含安装、量化选型、消费级显卡(RTX 3060/4090)跑 7B/13B 的实战指南。
多模态模型简介:CLIP、GPT-4V 与视觉语言模型
多模态模型让 AI 同时理解文字和图像。从 CLIP 的对比学习,到 GPT-4V 的图文对话,讲清它们如何对齐不同模态。
提示工程心法:Few-shot、Chain-of-Thought 等实用技巧
不堆术语,讲清提示工程最实用的几个核心方法:Few-shot、CoT、角色设定、结构化输出,附可直接套用的模板。