跳到正文
LaFoto

Stability AI · model directory

Stable Diffusion 是什么?一切都从中借来的开源模型

Stable Diffusion 是 Stability AI 开放发布的潜在扩散模型。解释“潜在扩散”的含义,以及开放权重为何如此重要。

Stable Diffusion 是 Stability AI 的文生图模型,随开源权重一同发布,任何人都能下载并在本地硬件上运行。技术上它是“潜在扩散模型”(latent diffusion):不是在全分辨率图像上去噪,而是在压缩后的潜在空间里运算,最后再解码成图像,这正是它能在消费级显卡上以低成本运行的原因。

Stable Diffusion at a glance

制作者
Stability AI
架构
潜在扩散(latent diffusion)
权重
开放、可下载
运行环境
消费级 GPU
以…闻名
其生态
扩展
LoRA、ControlNet、checkpoint

“不讲数学”的 latent diffusion 是什么

扩散模型的学习过程是“看着图片被破坏”。拿一张照片,加一点噪声,再加,再加,直到只剩下雪花点;训练一个网络去预测每一步被抹掉的内容。把这个过程从纯噪声反向运行,就能“画出”一张原本不存在的图。

在全分辨率上做这件事成本极高,因为每一步都要在每个像素上运算。“潜在”的诀窍是先把图像压缩成一个更小的表示,保留结构而丢掉像素级细节,在这个小空间里完成整个带噪过程,直到最后一步才解码回真实图像。

这一条决策让技术走进了普通人:生成成本大约下降了一个数量级,图像生成从“租一片集群”变成了“很多人家里已有的显卡就能跑”。

开放权重,以及它引发的一切

Stability 发布的是模型文件本身,而不是只给一个 API。这件事的影响最深,也最容易在成果满地后被低估。

因为任何人都能查看并修改模型,大家补齐了底模缺少的那层控制力。LoRA 让你用一个小文件就能教会特定风格或主体,而不用重训;ControlNet 让你把生成约束在姿态、深度或边缘线稿上;社区的 checkpoint 把底模细分成插画、摄影、建筑等专长。

那段时期冒出来的词汇,成了如今大家谈论图像生成的通用语言——seed、sampler、denoise 强度、CFG、inpainting。这些词是一个能被打开并改写的开源社区共同打磨出来的,所以本站术语表才会这么写。

自己跑到底是什么体验

比早年好,但还谈不上“随手”。有一键安装包,也有复杂到可搭积木的节点式界面;从“我生出一张图”到“我生出想要的那张图”,时间都花在这段距离上。

回报是托管产品给不了的控制力:精确的 seed、任意分辨率、随便换 checkpoint 或 LoRA、没有站在你和结果之间的内容流水线、买硬件之后没有按图计费、数据不出你的机器。

代价是你在运营一小段基础设施。模型文件动辄数 GB,扩展之间会互相打架,显存足够的显卡是入场券。只想要一张图的人更适合用托管服务;想要一套流程的人会留下来。

现在处在什么位置

在“原始输出质量”上它不再自动最佳,数个新模型——包括由部分 Stable Diffusion 贡献者参与的 FLUX——对 prompt 的字面遵循更好,也更能生成可读文本。

它保留的优势是生态。围绕旧版本累积的社区 checkpoint、风格适配器和控制工具的体量,不是新模型短时间能补齐的;对需要复现某种特定风格或已搭好流水线的人来说,这份库存往往比总体画质差距更重要。

后续版本的授权条款也比早期更“有条件”,在使用前要和你的用途逐条核对,别想当然。“开放权重”与“可免费用于一切”早就不是同一句话了。

用它来读懂本站其余内容

本站几乎每篇技巧文都在用这个模型普及的术语。denoise 强度决定图生图离开输入的幅度;seed 让生成可复现;inpainting 只改蒙版里,其他不动。这些概念换到任何模型上都适用。

这就是为什么即便你从不安装它,也值得理解 Stable Diffusion:它把自己的界面语言“泄漏”成了行业通用语言。学会一次,其他工具都更好读。

开放的模型

为什么“公开权重”比“模型本身”更重要

技术成就是把扩散推断做得足够省,使消费级显卡也能跑得起。真正影响深远的决定,是把文件发布出来,让任何人都能打开它。

之后的一切——LoRA、ControlNet、社区 checkpoints、乃至 seeds 和 samplers 的整套词汇——之所以存在,是因为成千上万人可以阅读并修改一个可用的图像模型,而不是隔着托管接口去摸黑调用。

淡色工作台上,打开的技术手册旁放着照片联系片

生态的三层加法

大家实际加在基座之上的东西

直接更换模型本体

一个 checkpoint 就是一整套权重。把基础模型在更窄的图像域上做微调——摄影、插画、建筑——会得到默认气质与能力边界都不同的模型。

一次只加载一个,它对结果的影响最大。

  • 每个体量数 GB。
  • 一次只加载一个。
  • 许可与来源良莠不齐。
AI 生成的产品静物

Stable Diffusion 常见问题

安装前该弄清楚的事

这些问题基本决定你是否适合自托管。

我实际需要什么硬件?

对这类工作,瓶颈是显存而不是算力。老一代但显存充足的显卡,往往比新一代但显存更小的卡跑得更稳。

现在学它还有价值吗?

如果你需要可复现、规模化、隐私或结构性控制,有。若只想要无需设置的好图,托管模型更快到达。

该用哪个版本?

完全取决于你要接入的生态。旧版本有极其丰富的社区工具;新版本有更好的基座质量,也常带更“有条件”的许可。

输出能商业使用吗?

检查你所用具体版本、以及栈里每个 checkpoint 与 LoRA 的许可。“开放权重”和“任意免费用”早就不是一回事了。

为什么我的结果比示例差?

几乎总是 checkpoint 的原因,而不是 prompt。社区示例通常用的是高度微调过的 checkpoint,而非基础模型。

它会被 FLUX 取代吗?

在画质上很大程度已被超越。但就 checkpoints、适配器和控制工具的库存而言,迄今还没有替代品。

AI 生成的美食照片,日光下

继续探索

在 LaFoto 的其它位置

这里的概念适用于你最终选择的任何方案。

Stable Diffusion — questions people ask

什么是 Stable Diffusion?
Stability AI 开放发布的文生图模型,基于潜在扩散,可下载到本地在消费级硬件上运行,而不必只通过 API 访问。
Stable Diffusion 是免费的吗?
权重是开放的,本地运行不按图计费;但不同版本的许可不同,越新的版本通常限制越多。务必按你的用途核对具体版本的许可。
什么是潜在扩散(latent diffusion)?
模型在图像的压缩表示上工作,而不是在全分辨率像素上;最后一步再解码成图像。这让它能在普通显卡上以较低成本运行。
Stable Diffusion 里的 LoRA 是什么?
一种小型增量文件,能把特定风格、主体或角色教给底模,而不用整模重训。它是社区共享专长的标准方式。
什么是 ControlNet?
一种扩展,把生成约束到结构性输入上,比如骨架姿态、深度图或边缘线稿,让你固定构图而把其余交给模型。
本地跑 Stable Diffusion 需要好显卡吗?
本地跑需要——视频内存是首要瓶颈。托管服务免去了显卡要求,但也牺牲了本地自跑的细粒度控制。
Stable Diffusion 还是最好的图像模型吗?
若论原始画质,通常不是;更新的模型更能字面执行 prompt,也更会生成可读文字。它现在的优势在于庞大的社区工具生态。
为什么大家老在谈 seed 和 sampler?
这些是开源社区在使用这个模型时提炼并命名的控制项,随后扩散到整个领域,成了通用词汇。

今天就开始创作

用最佳 AI 图像生成器生成你的第一张图。

用一句话在数秒内生成成片、逼真的图像——随后精修每个细节。无需配置、无需 Discord、无需 GPU。

加入 4,200+ 位创作者正在使用 LaFoto