模型家族时间线
「Stable Diffusion」不是一个模型,而是一个家族。 从 2022 年到 2024 年的三代发布,走了一条「参数变大、架构换代、文字理解变强」的路线。
时间线速览
| 版本 | 发布 | 规模 | 原生分辨率 | 一句话定位 |
|---|---|---|---|---|
| SD 1.4 / 1.5 | 2022 年 8 / 10 月 | 约 8.6 亿参数 | 512 | 开放生态的起点 |
| SD 2.1 | 2022 年 12 月 | 与 1.5 相当 | 768 | 换文本编码器的过渡版 |
| SDXL 1.0 | 2023 年 7 月 | 约 35 亿参数 | 1024 | 画质与构图的跃升 |
| SD 3 / 3.5 | 2024 年 6 / 10 月 | 25 亿 ~ 81 亿参数 | 约 100 万像素档 | 新架构 MM-DiT,文字渲染显著变强 |
架构上的分水岭
SD 1.5 与 SDXL 走的是 U-Net + CLIP 路线:去噪网络是卷积形态的 U-Net, 文本理解交给 CLIP 编码器。SD 3 系列换成 MM-DiT(扩散 Transformer) 并引入 T5 大语言模型做文本编码——这正是 SD 3.5 能把提示词「听得更明白」、 在图里写出像样文字的原因。直觉原理见出图原理。
生态为什么不通用
每一代的内部结构不同,社区为某一代训练的 LoRA、ControlNet 等附件不能跨代使用: SD 1.5 的 LoRA 装不进 SDXL,反之亦然(详见LoRA 是什么)。 选模型实际是在选「哪一代的生态」——这也是社区平台按代分区的根本原因 (见Civitai 社区模型库)。
手机端用的是什么
手机客户端的生成由云端服务完成,服务端按风格与场景调度对应档位的模型, 版本随官方更新而升级,手机上无需(也无法)手动选模型。 各代的详细展开见 SD 1.5、 SDXL、SD 3.5 三页。
相关阅读:SD 1.5:轻量经典 · SDXL:画质跃升 · SD 3.5:新架构