Stability AI · model directory
Stable Diffusion 是什么?一切都从中借来的开源模型
Stable Diffusion 是 Stability AI 开放发布的潜在扩散模型。解释“潜在扩散”的含义,以及开放权重为何如此重要。
Stable Diffusion at a glance
- 制作者
- Stability AI
- 架构
- 潜在扩散(latent diffusion)
- 权重
- 开放、可下载
- 运行环境
- 消费级 GPU
- 以…闻名
- 其生态
- 扩展
- LoRA、ControlNet、checkpoint
“不讲数学”的 latent diffusion 是什么
扩散模型的学习过程是“看着图片被破坏”。拿一张照片,加一点噪声,再加,再加,直到只剩下雪花点;训练一个网络去预测每一步被抹掉的内容。把这个过程从纯噪声反向运行,就能“画出”一张原本不存在的图。
在全分辨率上做这件事成本极高,因为每一步都要在每个像素上运算。“潜在”的诀窍是先把图像压缩成一个更小的表示,保留结构而丢掉像素级细节,在这个小空间里完成整个带噪过程,直到最后一步才解码回真实图像。
这一条决策让技术走进了普通人:生成成本大约下降了一个数量级,图像生成从“租一片集群”变成了“很多人家里已有的显卡就能跑”。
开放权重,以及它引发的一切
Stability 发布的是模型文件本身,而不是只给一个 API。这件事的影响最深,也最容易在成果满地后被低估。
因为任何人都能查看并修改模型,大家补齐了底模缺少的那层控制力。LoRA 让你用一个小文件就能教会特定风格或主体,而不用重训;ControlNet 让你把生成约束在姿态、深度或边缘线稿上;社区的 checkpoint 把底模细分成插画、摄影、建筑等专长。
那段时期冒出来的词汇,成了如今大家谈论图像生成的通用语言——seed、sampler、denoise 强度、CFG、inpainting。这些词是一个能被打开并改写的开源社区共同打磨出来的,所以本站术语表才会这么写。
自己跑到底是什么体验
比早年好,但还谈不上“随手”。有一键安装包,也有复杂到可搭积木的节点式界面;从“我生出一张图”到“我生出想要的那张图”,时间都花在这段距离上。
回报是托管产品给不了的控制力:精确的 seed、任意分辨率、随便换 checkpoint 或 LoRA、没有站在你和结果之间的内容流水线、买硬件之后没有按图计费、数据不出你的机器。
代价是你在运营一小段基础设施。模型文件动辄数 GB,扩展之间会互相打架,显存足够的显卡是入场券。只想要一张图的人更适合用托管服务;想要一套流程的人会留下来。
现在处在什么位置
在“原始输出质量”上它不再自动最佳,数个新模型——包括由部分 Stable Diffusion 贡献者参与的 FLUX——对 prompt 的字面遵循更好,也更能生成可读文本。
它保留的优势是生态。围绕旧版本累积的社区 checkpoint、风格适配器和控制工具的体量,不是新模型短时间能补齐的;对需要复现某种特定风格或已搭好流水线的人来说,这份库存往往比总体画质差距更重要。
后续版本的授权条款也比早期更“有条件”,在使用前要和你的用途逐条核对,别想当然。“开放权重”与“可免费用于一切”早就不是同一句话了。
用它来读懂本站其余内容
本站几乎每篇技巧文都在用这个模型普及的术语。denoise 强度决定图生图离开输入的幅度;seed 让生成可复现;inpainting 只改蒙版里,其他不动。这些概念换到任何模型上都适用。
这就是为什么即便你从不安装它,也值得理解 Stable Diffusion:它把自己的界面语言“泄漏”成了行业通用语言。学会一次,其他工具都更好读。
开放的模型
为什么“公开权重”比“模型本身”更重要
技术成就是把扩散推断做得足够省,使消费级显卡也能跑得起。真正影响深远的决定,是把文件发布出来,让任何人都能打开它。
之后的一切——LoRA、ControlNet、社区 checkpoints、乃至 seeds 和 samplers 的整套词汇——之所以存在,是因为成千上万人可以阅读并修改一个可用的图像模型,而不是隔着托管接口去摸黑调用。

生态的三层加法
大家实际加在基座之上的东西
直接更换模型本体
一个 checkpoint 就是一整套权重。把基础模型在更窄的图像域上做微调——摄影、插画、建筑——会得到默认气质与能力边界都不同的模型。
一次只加载一个,它对结果的影响最大。
- 每个体量数 GB。
- 一次只加载一个。
- 许可与来源良莠不齐。

不重训,单点增能
一个小文件,教会当前 checkpoint 一个特定风格、角色或物体。用一张消费级显卡训练,几分钟到数小时即可。
可以叠加多个并分别设权重——而大多数实际难点也正发生在这里:两个风格很强的 LoRA 会互相打架。
- 体量从几十到几百 MB。
- 可堆叠,强度可调。
- 绑定到特定的基座架构。

结构锁定,其它放飞
把生成约束到一个结构输入上——姿态骨架、深度图、边缘图——构图由你决定,其它交给模型。
这是把图像生成从“取样”变成“指挥”的关键能力,多数托管产品里没有干净等价物。
- 姿态、深度、边缘、分割。
- 构图固定,风格自由。
- 人们自托管的主要原因。

Stable Diffusion 常见问题
安装前该弄清楚的事
这些问题基本决定你是否适合自托管。
我实际需要什么硬件?
对这类工作,瓶颈是显存而不是算力。老一代但显存充足的显卡,往往比新一代但显存更小的卡跑得更稳。
现在学它还有价值吗?
如果你需要可复现、规模化、隐私或结构性控制,有。若只想要无需设置的好图,托管模型更快到达。
该用哪个版本?
完全取决于你要接入的生态。旧版本有极其丰富的社区工具;新版本有更好的基座质量,也常带更“有条件”的许可。
输出能商业使用吗?
检查你所用具体版本、以及栈里每个 checkpoint 与 LoRA 的许可。“开放权重”和“任意免费用”早就不是一回事了。
为什么我的结果比示例差?
几乎总是 checkpoint 的原因,而不是 prompt。社区示例通常用的是高度微调过的 checkpoint,而非基础模型。
它会被 FLUX 取代吗?
在画质上很大程度已被超越。但就 checkpoints、适配器和控制工具的库存而言,迄今还没有替代品。

继续探索
在 LaFoto 的其它位置
这里的概念适用于你最终选择的任何方案。
Stable Diffusion — questions people ask
- 什么是 Stable Diffusion?
- Stability AI 开放发布的文生图模型,基于潜在扩散,可下载到本地在消费级硬件上运行,而不必只通过 API 访问。
- Stable Diffusion 是免费的吗?
- 权重是开放的,本地运行不按图计费;但不同版本的许可不同,越新的版本通常限制越多。务必按你的用途核对具体版本的许可。
- 什么是潜在扩散(latent diffusion)?
- 模型在图像的压缩表示上工作,而不是在全分辨率像素上;最后一步再解码成图像。这让它能在普通显卡上以较低成本运行。
- Stable Diffusion 里的 LoRA 是什么?
- 一种小型增量文件,能把特定风格、主体或角色教给底模,而不用整模重训。它是社区共享专长的标准方式。
- 什么是 ControlNet?
- 一种扩展,把生成约束到结构性输入上,比如骨架姿态、深度图或边缘线稿,让你固定构图而把其余交给模型。
- 本地跑 Stable Diffusion 需要好显卡吗?
- 本地跑需要——视频内存是首要瓶颈。托管服务免去了显卡要求,但也牺牲了本地自跑的细粒度控制。
- Stable Diffusion 还是最好的图像模型吗?
- 若论原始画质,通常不是;更新的模型更能字面执行 prompt,也更会生成可读文字。它现在的优势在于庞大的社区工具生态。
- 为什么大家老在谈 seed 和 sampler?
- 这些是开源社区在使用这个模型时提炼并命名的控制项,随后扩散到整个领域,成了通用词汇。