Stability AI · model directory
Что такое Stable Diffusion? Открытая модель, от которой отталкивались все остальные
Stable Diffusion — открыто выпущенная модель латентной диффузии от Stability AI. Что такое латентная диффузия и почему открытые веса так много изменили.
Stable Diffusion at a glance
- Разработчик
- Stability AI
- Архитектура
- Латентная диффузия
- Веса
- Открытые, можно скачать
- Работает на
- Потребительские GPU
- Известна благодаря
- Своей экосистеме
- Расширения
- LoRA, ControlNet, checkpoints
Что такое «латентная диффузия», без математики
Диффузионная модель учится, наблюдая, как разрушают изображения. Берём фото, добавляем немного шума, ещё, и так, пока не останется один статический шум, и обучаем сеть предсказывать, что убрали на каждом шаге. Запущенная в обратную сторону из чистого шума, сеть «рисует» картину, которой не было.
Делать это в полном разрешении очень дорого: каждый шаг трогает каждый пиксель. Латентный трюк — сначала сжать изображение в гораздо меньший вектор, сохраняющий структуру и отбрасывающий точные пиксели, прогнать весь шумовой процесс в этом малом пространстве и лишь в конце декодировать обратно в реальное изображение.
Это решение и вывело всё к обычным пользователям. Оно примерно на порядок снизило стоимость генерации и принесло генерацию изображений на железо, которое у человека уже может быть, а не в арендованный кластер.
Открытые веса и что они запустили
Stability выложила сами файлы модели, а не только API. Это факт с самыми долгими последствиями, и его легко недооценить сейчас, когда результаты повсюду.
Потому что каждый мог изучать и модифицировать модель, люди достроили слой контроля, которого не хватало базе. LoRA позволила обучать конкретный стиль или объект маленьким дополнительным файлом без переобучения. ControlNet дал возможность жёстко задавать позу, карту глубины или контур. Сообщество собирало checkpoints, специализируя базу под иллюстрацию, фотографию, архитектуру и многое другое.
Словарь того периода теперь стал языком всей области — seed, sampler, denoise strength, CFG, inpainting. Эти слова популяризировало открытое сообщество, читавшее и переписывавшее модель, которую можно открыть, — и поэтому глоссарий на этом сайте устроен именно так.
Как это на самом деле — запускать у себя
Лучше, чем было, но это всё ещё не «по щелчку». Есть один-клик инсталляторы и есть узловые интерфейсы реальной сложности, а расстояние между «я сгенерировал картинку» и «я получил именно то, что хотел» — это и есть Ваше время.
Награда — контроль, которого нет у хостингов: точные seed, произвольные разрешения, любой checkpoint или LoRA, отсутствие контентного конвейера между Вами и выходом, нулевая цена за кадр после покупки железа и ничего не покидает Вашу машину.
Цена — Вы эксплуатируете маленький кусок инфраструктуры. Файлы модели занимают гигабайты, расширения конфликтуют, а видеокарта с достаточной памятью — входной билет. Тем, кому «нужна картинка», обычно комфортнее на хостинге; остаются те, кому «нужен процесс».
Где она сейчас
Это уже не автоматически самый сильный вариант по сырому качеству, и несколько новых моделей — включая FLUX, частично созданную людьми, работавшими над Stable Diffusion, — буквально точнее читают prompts и гораздо лучше рисуют читабельный текст.
Сохраняется экосистема. Масштаб community-checkpoints, адаптеров стилей и средств контроля вокруг старых версий — не то, что новая модель наращивает быстро, и для тех, кому нужно воспроизвести конкретный стиль или чей пайплайн уже собран, этот инвентарь перевешивает общий разрыв по качеству.
Последующие версии также выходили под всё более условными лицензиями по сравнению с ранними релизами — это стоит сверять с Вашим использованием, а не предполагать. «Открытые веса» и «можно всё бесплатно» — это уже давно не одно и то же.
Как через неё читать остальной сайт
Почти каждая страница с техниками здесь использует термины, которые популяризировала эта модель. Denoise strength определяет, насколько результат image-to-image отходит от исходника. Seed делает генерацию воспроизводимой. Inpainting редактирует внутри маски и оставляет остальное нетронутым. Эти понятия работают в какой бы модели Вы ни оказались.
Вот честная причина понять Stable Diffusion, даже если Вы никогда её не установите: это модель, чей интерфейс просочился в язык. Разберитесь один раз — и любой другой инструмент читать легче.
Открытая модель
Почему важнее было выпустить веса, а не саму модель
Технический прорыв — сделать diffusion достаточно дешёвой для потребительской видеокарты. Последствие — опубликовать файлы, чтобы каждый мог их открыть.
Всё последующее — LoRA, ControlNet, пользовательские checkpoint, весь словарь seed и sampler — появилось потому, что тысячи людей смогли читать и модифицировать рабочую модель изображений, а не дергать её через «щель для монет».

Три слоя экосистемы
Что на практике добавляют поверх базовой модели
Меняем саму модель
Checkpoint — это полный набор весов. Дотюнинг базы на более узком корпусе изображений — фотография, иллюстрация, архитектура — даёт модель с иным характером по умолчанию и другими компетенциями.
Единовременно загружается ровно один — и это решение с наибольшим влиянием на результат.
- Каждый — несколько гигабайт.
- Загружается один за раз.
- Лицензии и происхождение сильно различаются.

Добавляем одно — без переобучения
Небольшой файл, который «учит» загруженный checkpoint конкретному стилю, персонажу или объекту. Можно обучить на одной потребительской карте за минуты-часы.
Несколько LoRA можно складывать со своими весами — и именно здесь живёт большинство практических сложностей: две сильные стилевые LoRA конфликтуют.
- Десятки–сотни мегабайт.
- Складываются, с регулируемой силой.
- Привязаны к конкретной базовой архитектуре.

Фиксируем структуру, остальное — свободно
Ограничивает генерацию структурным вводом — скелет позы, карта глубины, контурный рисунок — так что композицию задаёте вы, а остальное дорисовывает модель.
Именно эта возможность превратила генерацию из сэмплинга в режиссуру — и у большинства хостингов ей нет чистого аналога.
- Поза, глубина, контуры, сегментация.
- Композиция фиксирована, стиль свободен.
- Главная причина для self-host.

Вопросы по Stable Diffusion
Что знать до установки чего-либо
Вопросы, которые решают, стоит ли вам self-host.
Какое «железо» мне действительно нужно?
Критичен объём видеопамяти, а не «сырая» скорость. Старшие карты с большой памятью часто обгоняют новые с меньшей — именно для этой нагрузки.
Всё ещё есть смысл учиться?
Если вам нужна воспроизводимость, объём, приватность или структурный контроль — да. Если нужны хорошие картинки без настройки — хостинговая модель быстрее приведёт к цели.
Какую версию использовать?
Всё зависит от нужной вам экосистемы. У старых версий на порядки больше комьюнити-инструментов; у новых — выше базовое качество и чаще более жёсткие условные лицензии.
Можно ли коммерчески использовать результат?
Проверьте лицензию конкретной версии и каждого checkpoint и LoRA в стеке. «Открытые веса» и «свободно для всего» уже давно не одно и то же.
Почему мои результаты хуже примеров?
Почти всегда дело в checkpoint, а не в prompt. Примеры сообщества обычно сделаны на сильно дотюненном checkpoint, а не на базе.
Его заменяет FLUX?
По качеству выхода — во многом да. По количеству checkpoint, адаптеров и инструментов контроля — пока ничто не заменило.

Термины, которые дала эта модель
Словарь, выросший из открытой экосистемы
Исследуйте дальше
Другие разделы LaFoto
Эти концепции важны вне зависимости от выбранного решения.
- измените размер изображения
- JPG, PNG и WebP
- компрессор изображений
- кадрируйте по соотношению сторон
- пипетка цветов из изображения
- уберите фон
- просмотрщик EXIF
- ИИ-генератор prompt
- аниме-генератор на ИИ
- сделайте картинку мультяшной
- создайте пиксель-арт
- сравнение по рейтингу
- сравнение с Midjourney
- LaFoto против Leonardo AI
- сравнение с Ideogram
- сравнение с Canva
- воспроизведение изображения
- насколько результат может отклониться
- редактирование внутри маски
- журнал LaFoto
Stable Diffusion — questions people ask
- Что такое Stable Diffusion?
- Открыто выпущенная текст-в-изображение модель от Stability AI на основе латентной диффузии, которую можно скачать и запускать на потребительском железе, а не только вызывать через API.
- Stable Diffusion — бесплатная?
- Веса открыты и могут запускаться локально без поминутной платы за кадр, но условия лицензий различаются между версиями, а в поздних релизах ограничений больше. Проверьте лицензию конкретной версии под Ваши задачи.
- Что значит латентная диффузия?
- Модель работает в сжатом представлении изображения, а не на пикселях полного разрешения, а затем декодирует результат в конце. Именно это сделало запуск на обычной видеокарте достаточно дешёвым.
- Что такое LoRA в Stable Diffusion?
- Небольшой дополнительный файл, который «доучивает» базовую модель на конкретный стиль, объект или персонажа без переобучения всей модели. Это стандарт распространения специализаций в сообществе.
- Что такое ControlNet?
- Расширение, которое ограничивает генерацию структурным вводом — скелетом позы, картой глубины или контурным рисунком — чтобы фиксировать композицию и позволять модели решать остальное.
- Нужна ли мощная видеокарта для Stable Diffusion?
- Для локального запуска — да, узкое место это видеопамять. Хостинговые сервисы снимают это требование ценой того уровня контроля, который даёт локальный запуск.
- Остаётся ли Stable Diffusion лучшей моделью для изображений?
- Не по сырому качеству: новые модели в целом точнее следуют prompts и лучше рисуют текст. Её текущее преимущество — глубина комьюнити-инструментов вокруг неё.
- Почему все говорят про seeds и samplers?
- Это контролы, которые открытое сообщество обнаружило и назвало, работая с этой моделью, и оттуда словарь разошёлся по всей области.
Начните создавать сегодня
Сгенерируйте своё первое изображение в лучшем генераторе на ИИ.
Преобразуйте фразу в готовое, фотореалистичное изображение за секунды — а затем отточите каждую деталь. Без настройки, без Discord, без GPU.
К LaFoto уже присоединились 4 200+ авторов