Перейти к содержимому
LaFoto

Stability AI · model directory

Что такое Stable Diffusion? Открытая модель, от которой отталкивались все остальные

Stable Diffusion — открыто выпущенная модель латентной диффузии от Stability AI. Что такое латентная диффузия и почему открытые веса так много изменили.

Stable Diffusion — модель text-to-image от Stability AI, выпущенная с открытыми весами, чтобы любой мог скачать и запускать её на своём железе. Технически это модель латентной диффузии: вместо денойзинга полноразмерной картинки она работает в сжатом латентном пространстве и декодирует результат в конце — именно это сделало её достаточно дешёвой для запуска на потребительской видеокарте.

Stable Diffusion at a glance

Разработчик
Stability AI
Архитектура
Латентная диффузия
Веса
Открытые, можно скачать
Работает на
Потребительские GPU
Известна благодаря
Своей экосистеме
Расширения
LoRA, ControlNet, checkpoints

Что такое «латентная диффузия», без математики

Диффузионная модель учится, наблюдая, как разрушают изображения. Берём фото, добавляем немного шума, ещё, и так, пока не останется один статический шум, и обучаем сеть предсказывать, что убрали на каждом шаге. Запущенная в обратную сторону из чистого шума, сеть «рисует» картину, которой не было.

Делать это в полном разрешении очень дорого: каждый шаг трогает каждый пиксель. Латентный трюк — сначала сжать изображение в гораздо меньший вектор, сохраняющий структуру и отбрасывающий точные пиксели, прогнать весь шумовой процесс в этом малом пространстве и лишь в конце декодировать обратно в реальное изображение.

Это решение и вывело всё к обычным пользователям. Оно примерно на порядок снизило стоимость генерации и принесло генерацию изображений на железо, которое у человека уже может быть, а не в арендованный кластер.

Открытые веса и что они запустили

Stability выложила сами файлы модели, а не только API. Это факт с самыми долгими последствиями, и его легко недооценить сейчас, когда результаты повсюду.

Потому что каждый мог изучать и модифицировать модель, люди достроили слой контроля, которого не хватало базе. LoRA позволила обучать конкретный стиль или объект маленьким дополнительным файлом без переобучения. ControlNet дал возможность жёстко задавать позу, карту глубины или контур. Сообщество собирало checkpoints, специализируя базу под иллюстрацию, фотографию, архитектуру и многое другое.

Словарь того периода теперь стал языком всей области — seed, sampler, denoise strength, CFG, inpainting. Эти слова популяризировало открытое сообщество, читавшее и переписывавшее модель, которую можно открыть, — и поэтому глоссарий на этом сайте устроен именно так.

Как это на самом деле — запускать у себя

Лучше, чем было, но это всё ещё не «по щелчку». Есть один-клик инсталляторы и есть узловые интерфейсы реальной сложности, а расстояние между «я сгенерировал картинку» и «я получил именно то, что хотел» — это и есть Ваше время.

Награда — контроль, которого нет у хостингов: точные seed, произвольные разрешения, любой checkpoint или LoRA, отсутствие контентного конвейера между Вами и выходом, нулевая цена за кадр после покупки железа и ничего не покидает Вашу машину.

Цена — Вы эксплуатируете маленький кусок инфраструктуры. Файлы модели занимают гигабайты, расширения конфликтуют, а видеокарта с достаточной памятью — входной билет. Тем, кому «нужна картинка», обычно комфортнее на хостинге; остаются те, кому «нужен процесс».

Где она сейчас

Это уже не автоматически самый сильный вариант по сырому качеству, и несколько новых моделей — включая FLUX, частично созданную людьми, работавшими над Stable Diffusion, — буквально точнее читают prompts и гораздо лучше рисуют читабельный текст.

Сохраняется экосистема. Масштаб community-checkpoints, адаптеров стилей и средств контроля вокруг старых версий — не то, что новая модель наращивает быстро, и для тех, кому нужно воспроизвести конкретный стиль или чей пайплайн уже собран, этот инвентарь перевешивает общий разрыв по качеству.

Последующие версии также выходили под всё более условными лицензиями по сравнению с ранними релизами — это стоит сверять с Вашим использованием, а не предполагать. «Открытые веса» и «можно всё бесплатно» — это уже давно не одно и то же.

Как через неё читать остальной сайт

Почти каждая страница с техниками здесь использует термины, которые популяризировала эта модель. Denoise strength определяет, насколько результат image-to-image отходит от исходника. Seed делает генерацию воспроизводимой. Inpainting редактирует внутри маски и оставляет остальное нетронутым. Эти понятия работают в какой бы модели Вы ни оказались.

Вот честная причина понять Stable Diffusion, даже если Вы никогда её не установите: это модель, чей интерфейс просочился в язык. Разберитесь один раз — и любой другой инструмент читать легче.

Открытая модель

Почему важнее было выпустить веса, а не саму модель

Технический прорыв — сделать diffusion достаточно дешёвой для потребительской видеокарты. Последствие — опубликовать файлы, чтобы каждый мог их открыть.

Всё последующее — LoRA, ControlNet, пользовательские checkpoint, весь словарь seed и sampler — появилось потому, что тысячи людей смогли читать и модифицировать рабочую модель изображений, а не дергать её через «щель для монет».

раскрытое техническое руководство рядом с фотографическими контактными листами на светлом рабочем столе

Три слоя экосистемы

Что на практике добавляют поверх базовой модели

Меняем саму модель

Checkpoint — это полный набор весов. Дотюнинг базы на более узком корпусе изображений — фотография, иллюстрация, архитектура — даёт модель с иным характером по умолчанию и другими компетенциями.

Единовременно загружается ровно один — и это решение с наибольшим влиянием на результат.

  • Каждый — несколько гигабайт.
  • Загружается один за раз.
  • Лицензии и происхождение сильно различаются.
Сгенерированный ИИ предметный натюрморт

Вопросы по Stable Diffusion

Что знать до установки чего-либо

Вопросы, которые решают, стоит ли вам self-host.

Какое «железо» мне действительно нужно?

Критичен объём видеопамяти, а не «сырая» скорость. Старшие карты с большой памятью часто обгоняют новые с меньшей — именно для этой нагрузки.

Всё ещё есть смысл учиться?

Если вам нужна воспроизводимость, объём, приватность или структурный контроль — да. Если нужны хорошие картинки без настройки — хостинговая модель быстрее приведёт к цели.

Какую версию использовать?

Всё зависит от нужной вам экосистемы. У старых версий на порядки больше комьюнити-инструментов; у новых — выше базовое качество и чаще более жёсткие условные лицензии.

Можно ли коммерчески использовать результат?

Проверьте лицензию конкретной версии и каждого checkpoint и LoRA в стеке. «Открытые веса» и «свободно для всего» уже давно не одно и то же.

Почему мои результаты хуже примеров?

Почти всегда дело в checkpoint, а не в prompt. Примеры сообщества обычно сделаны на сильно дотюненном checkpoint, а не на базе.

Его заменяет FLUX?

По качеству выхода — во многом да. По количеству checkpoint, адаптеров и инструментов контроля — пока ничто не заменило.

ИИ‑сгенерированная фуд‑фотография при дневном свете

Исследуйте дальше

Другие разделы LaFoto

Эти концепции важны вне зависимости от выбранного решения.

создайте по описаниюГлавный генератор — от текста к итоговой картинке.ОткрытьГалерея prompt120 изображений и точные prompt, которыми их сделали.ОткрытьИзображение по изображениюСтартуйте с уже имеющейся картинки.Открытьредактирование фото на ИИМеняем часть фото, остальное сохраняем.Открытьupscale до 4KУвеличение до 4K без мыла.Открытьвосстановите старое фотоЭкспозиция, шум и реставрация старых снимков.Открытьудалите что-то с фотоМаскированное удаление с восстановлением фона.Открытьразмытие с учётом глубиныС учётом глубины, а не равномерный фильтр.Открытьдобавьте цвет старому фотоПравдоподобный цвет для ч/б снимков.Открытьсгенерируйте логотипЗнаки, читаемые даже на 16 пикселях.ОткрытьИИ-генератор татуировокЭскизы, которые переживут набивку.ОткрытьИИ-генератор артаИллюстрация и живопись, не фотографии.ОткрытьИИ-генератор хедшотовСтудийные портреты без студии.Открытьтехнические требования к фотоТочные требования и как им соответствовать.Открытьвизуализация интерьераПерестилем комнату, которую можно сфотографировать.ОткрытьСловарь по ИИ-изображениямSeed, denoise, inpainting — коротко и по делу.Открыть

Stable Diffusion — questions people ask

Что такое Stable Diffusion?
Открыто выпущенная текст-в-изображение модель от Stability AI на основе латентной диффузии, которую можно скачать и запускать на потребительском железе, а не только вызывать через API.
Stable Diffusion — бесплатная?
Веса открыты и могут запускаться локально без поминутной платы за кадр, но условия лицензий различаются между версиями, а в поздних релизах ограничений больше. Проверьте лицензию конкретной версии под Ваши задачи.
Что значит латентная диффузия?
Модель работает в сжатом представлении изображения, а не на пикселях полного разрешения, а затем декодирует результат в конце. Именно это сделало запуск на обычной видеокарте достаточно дешёвым.
Что такое LoRA в Stable Diffusion?
Небольшой дополнительный файл, который «доучивает» базовую модель на конкретный стиль, объект или персонажа без переобучения всей модели. Это стандарт распространения специализаций в сообществе.
Что такое ControlNet?
Расширение, которое ограничивает генерацию структурным вводом — скелетом позы, картой глубины или контурным рисунком — чтобы фиксировать композицию и позволять модели решать остальное.
Нужна ли мощная видеокарта для Stable Diffusion?
Для локального запуска — да, узкое место это видеопамять. Хостинговые сервисы снимают это требование ценой того уровня контроля, который даёт локальный запуск.
Остаётся ли Stable Diffusion лучшей моделью для изображений?
Не по сырому качеству: новые модели в целом точнее следуют prompts и лучше рисуют текст. Её текущее преимущество — глубина комьюнити-инструментов вокруг неё.
Почему все говорят про seeds и samplers?
Это контролы, которые открытое сообщество обнаружило и назвало, работая с этой моделью, и оттуда словарь разошёлся по всей области.

Начните создавать сегодня

Сгенерируйте своё первое изображение в лучшем генераторе на ИИ.

Преобразуйте фразу в готовое, фотореалистичное изображение за секунды — а затем отточите каждую деталь. Без настройки, без Discord, без GPU.

К LaFoto уже присоединились 4 200+ авторов