Stable Diffusion 文档站STABLE DIFFUSION 下载

什么是 Stable Diffusion

Stable Diffusion 是由 Stability AI 等团队于 2022 年 8 月发布的 文字生成图片模型家族:输入一段文字描述,模型从随机噪声开始逐步「去噪」, 最终得到一张完整图片。它是这一代 AI 绘画工具里最早把模型权重开放给公众的一支, 也因此长出了庞大的社区生态。

「开放权重」意味着什么

2022 年 8 月首次公开发布后,SD 1.5(同年 10 月)等版本的模型权重被放到 Hugging Face 等平台上,任何人都可以下载研究、在自己的电脑上运行、在它基础上继续训练。作为对照, 同期主流的文生图服务大多只提供网页或接口调用,用户看不到模型本身。 开放带来三件事:本地运行成为可能、微调定制成为可能、社区改编作品(checkpoint、LoRA 等) 井喷式出现。

核心能力一览

  • 文生图:描述 → 图片,这是最基础也最常用的能力。
  • 图生图:给一张参考图再加描述,让模型按参考的构图重画(见图生图与重绘幅度)。
  • 风格可控:同样内容可以要水彩、要赛博朋克、要胶片感——靠描述词与风格模板控制。
  • 可控生成:借助 LoRA、ControlNet 等社区技术,可以锁定人物长相或姿势(见LoRA 是什么)。

手机上怎么用它

模型的原始运行环境是带独立显卡的电脑,但计算可以放在云端: 安卓手机上安装一个体积约 20.3 MB 的客户端(当前版本 5.3),描述经由网络提交到服务端生成, 图片再传回手机展示。你不需要显卡、不需要配置 Python 环境, 打开应用选一个风格分区、写一句描述就能出图。具体路径见 第一次生成图片。

手机端与电脑端的关系不是替代而是分工:手机端胜在零门槛、随身可用; 电脑端参数全开放、适合深度可控创作。两端的差异在 手机版与电脑版里逐项对比。

技术原理一句话

SD 属于潜在扩散模型(Latent Diffusion):图片先被压缩到一个低维度的 「潜空间」,去噪的全部计算都发生在潜空间里,最后再解码回像素——这层压缩让它快到能在 消费级硬件上运行。完整的直觉解释见出图原理:从噪声到画。

相关阅读:第一次生成图片 · 模型家族时间线 · 手机版与电脑版