Stable Diffusion 文档站STABLE DIFFUSION 下载

模型家族时间线

「Stable Diffusion」不是一个模型,而是一个家族。 从 2022 年到 2024 年的三代发布,走了一条「参数变大、架构换代、文字理解变强」的路线。

时间线速览

版本发布规模原生分辨率一句话定位
SD 1.4 / 1.52022 年 8 / 10 月约 8.6 亿参数512开放生态的起点
SD 2.12022 年 12 月与 1.5 相当768换文本编码器的过渡版
SDXL 1.02023 年 7 月约 35 亿参数1024画质与构图的跃升
SD 3 / 3.52024 年 6 / 10 月25 亿 ~ 81 亿参数约 100 万像素档新架构 MM-DiT,文字渲染显著变强

架构上的分水岭

SD 1.5 与 SDXL 走的是 U-Net + CLIP 路线:去噪网络是卷积形态的 U-Net, 文本理解交给 CLIP 编码器。SD 3 系列换成 MM-DiT(扩散 Transformer) 并引入 T5 大语言模型做文本编码——这正是 SD 3.5 能把提示词「听得更明白」、 在图里写出像样文字的原因。直觉原理见出图原理。

生态为什么不通用

每一代的内部结构不同,社区为某一代训练的 LoRA、ControlNet 等附件不能跨代使用: SD 1.5 的 LoRA 装不进 SDXL,反之亦然(详见LoRA 是什么)。 选模型实际是在选「哪一代的生态」——这也是社区平台按代分区的根本原因 (见Civitai 社区模型库)。

手机端用的是什么

手机客户端的生成由云端服务完成,服务端按风格与场景调度对应档位的模型, 版本随官方更新而升级,手机上无需(也无法)手动选模型。 各代的详细展开见 SD 1.5、 SDXL、SD 3.5 三页。

相关阅读:SD 1.5:轻量经典 · SDXL:画质跃升 · SD 3.5:新架构