Stability AI · model directory
Какво е Stable Diffusion? Отвореният модел, от който всички останали заимстваха
Stable Diffusion е открито пуснат latent diffusion модел от Stability AI. Какво означава latent diffusion и защо отворените тегла бяха толкова важни.
Stable Diffusion at a glance
- Създател
- Stability AI
- Архитектура
- Латентна дифузия
- Тегла
- Отворени, за изтегляне
- Работи на
- Потребителски GPU-та
- Известен с
- Екосистемата си
- Разширения
- LoRA, ControlNet, checkpoints
Какво означава "latent diffusion", без математика
Diffusion модел се „учи“, като гледа как изображения се разрушават. Вземете фотография, добавете малко шум, после още, продължете докато не остане само статичен шум, и тренирайте мрежа да предсказва какво е премахнато на всяка стъпка. Пуснете мрежата обратно от чист шум и тя „рисува“ картина, която никога не е съществувала.
Да се прави това в пълна резолюция е изключително скъпо, защото всяка стъпка работи върху всеки пиксел. Латентният трик е първо да се компресира изображението в много по-малко представяне, което пази структурата, но изхвърля точните пиксели, да се изпълни целият шумов процес в този малък простор и чак накрая да се декодира обратно към истинско изображение.
Това едно решение е причината всичко това да стигне до обикновените хора. То намали цената на генерация приблизително с един порядък и донесе генерирането на изображения върху хардуер, който човек вече може да има, вместо на нает клъстър.
Отворените тегла и какво задействаха
Stability пусна самите файлове на модела, а не само API. Това е фактът с най-дълги последици и днес е лесно да се подцени, когато резултатите са навсякъде.
Понеже всеки можеше да инспектира и модифицира модела, хората построиха слоя контрол, който базовият модел нямаше. LoRA направи възможно да се научи специфичен стил или обект с малък допълнителен файл вместо пълно претрениране. ControlNet позволи да се ограничат генерациите към поза, depth map или контурен рисунък. Общностни checkpoints специализираха базовия модел за илюстрация, фотография, архитектура и какво ли още не.
Речникът, който излезе от този период, днес е начинът, по който се говори за генериране на изображения изобщо — seed, sampler, denoise strength, CFG, inpainting. Тези думи бяха популяризирани от отворена общност, която четеше и преписваше модел, който може реално да се отвори — и затова глосарът на този сайт е написан така.
Как наистина е да го пуснете сами
По-добре е отпреди, но още не е „ежедневно“. Има one-click инсталатори и има node-базирани интерфейси с реална сложност, а разстоянието между „генерирах картина“ и „получих точно тази, която исках“ е мястото, където отива времето.
Наградата е контрол, който хостваните продукти не предлагат: точни seed-ове, произволни резолюции, какъвто checkpoint или LoRA пожелаете, без содържателен пайплайн между Вас и изхода, без цена на изображение след хардуера и нищо, което напуска машината Ви.
Цената е, че вече оперирате малко парче инфраструктура. Файловете на моделите са по няколко гигабайта всеки, разширенията си пречат помежду си, а видеопаметта на картата е входният билет. Хора, които искат изображение, обикновено са по-щастливи с хостван модел; хора, които искат процес, са тези, които остават.
Къде е мястото му сега
Вече не е автоматично най-силният избор по сурово качество на изхода, а няколко по-нови модела — включително FLUX, създаден частично от хора, работили по Stable Diffusion — следват prompt-и по-буквално и рендерират четим текст значително по-добре.
Това, което запазва, е екосистемата. Обемът от общностни checkpoints, адаптери за стил и контролни инструменти, построени върху по-старите версии, не е нещо, което по-нов модел придобива бързо, и за всеки със специфичен стил за възпроизвеждане или вече построен пайплайн този инвентар надделява над общ дефицит в качеството.
Последващите версии също излизаха с все по-условни лицензи от ранните издания — струва си да ги проверите спрямо предвидената употреба, вместо да предполагате. „Отворени тегла“ и „свободни за всичко“ отдавна престанаха да означават едно и също.
Как да четете останалата част от сайта през него
Почти всяка страница за техника тук използва термини, които този модел популяризира. Denoise strength решава докъде image-to-image резултатът се отдалечава от входа. Seed прави генерацията възпроизводима. Inpainting редактира вътре в маска и оставя останалото непокътнато. Тези концепции важат, независимо кой модел в крайна сметка използвате.
Това е честната причина да разберете Stable Diffusion, дори никога да не го инсталирате: това е моделът, чийто интерфейс „изтече“ в езика. Научете го веднъж и всеки друг инструмент става по-лесен за четене.
Отвореният модел
Защо пускането на теглата беше по-важно от самия модел
Техническото постижение беше да се направи diffusion достатъчно евтин за потребителска видеокарта. Решението с последици беше публикуването на файловете, за да може всеки да ги отвори.
Всичко надолу по веригата — LoRA, ControlNet, общностните checkpoints, целият речник от seed-ове и samplers — съществува, защото хиляди хора можеха да четат и модифицират работещ модел за изображения, вместо да го разпитват през слот.

Три слоя от екосистемата
Какво всъщност добавят хората върху базовия модел
Смяна на самия модел
Checkpoint е целият набор от тегла. Допълнително обучение на базата върху по-тесен корпус изображения — фотография, илюстрация, архитектура — произвежда модел с различен по подразбиране характер и различни компетентности.
Зареждате точно един наведнъж и това е решението с най-голям ефект върху изхода.
- По няколко гигабайта всеки.
- Един зареден наведнъж.
- Лицензи и произход — силно различни.

Добавяне на едно нещо без пълно обучение
Малък файл, който учи заредения checkpoint на конкретен стил, персонаж или обект. Може да се обучи на една потребителска карта за минути до часове.
Няколко могат да се наслагват с индивидуални weights — там живее повечето практическа трудност: две силни стилови LoRA си пречат.
- Десетки до стотици мегабайти.
- Наслагваеми, с регулируема сила.
- Вързани за конкретна базова архитектура.

Фиксиране на структурата, свобода за останалото
Ограничава генерирането до структурен вход — скелет на поза, depth map, edge рисунка — така че композицията е ваша, а останалото — на модела.
Това е способността, която превърна image generation от „семплиране“ в режисура — и няма чист еквивалент в повечето хоствани продукти.
- Поза, дълбочина, контури, сегментация.
- Композиция фиксирана, стил свободен.
- Основната причина хората да self-host-ват.

Въпроси за Stable Diffusion
Какво да знаете преди да инсталирате каквото и да е
Въпросите, които решават дали self-hosting е за вас.
Какъв хардуер всъщност ми трябва?
Видео паметта е ограничаващият фактор, не суровата скорост. По-стари карти с щедра памет често превъзхождат по-нови с по-малко — за тази задача.
Още ли си струва да се учи?
Ако ви трябват възпроизводимост, обем, поверителност или структурен контрол — да. Ако искате добри изображения без настройка — хостван модел стига по-бързо.
Коя версия да използвам?
Зависи изцяло от екосистемата, която ви трябва. По-старите версии имат далеч повече общностни инструменти; по-новите — по-добро базово качество и по-условни лицензи.
Мога ли да ползвам изхода търговски?
Проверете лиценза на конкретната версия и на всеки checkpoint и LoRA в стека. „Отворени тегла“ и „свободен за всичко“ престанаха да значат едно и също отдавна.
Защо резултатите ми изглеждат по-зле от примерите?
Почти винаги заради checkpoint-а, а не prompt-а. Общностните примери обикновено са правени на силно дообучен checkpoint, а не на базовия модел.
Замества ли го FLUX?
По качество на изхода до голяма степен го изпревари. По наличност на checkpoints, адаптери и контролни инструменти — още нищо не го е заменило.

Термини, които този модел назова
Речник, роден от отворената екосистема
Продължете да изследвате
Другаде в LaFoto
Концепциите тук важат, каквото и да пуснете.
- преоразмерете изображение
- JPG, PNG и WebP
- компресор на изображения
- изрежете по съотношение
- вземане на цвят от изображение
- премахнете фон
- EXIF преглед
- AI генератор на prompt-и
- AI генератор на аниме
- превърнете снимка в карикатура
- създайте пиксел арт
- класирано сравнение
- сравнение с Midjourney
- LaFoto срещу Leonardo AI
- сравнение с Ideogram
- сравнение с Canva
- възпроизвеждане на изображение
- колко далеч може да се отклони резултатът
- редактиране вътре в маска
- дневникът на LaFoto
Stable Diffusion — questions people ask
- Какво е Stable Diffusion?
- Открито пуснат text-to-image модел от Stability AI, базиран на latent diffusion, който може да се изтегли и пусне на потребителски хардуер, а не само да се ползва през API.
- Безплатен ли е Stable Diffusion?
- Теглата са пуснати открито и могат да се стартират локално без цена на изображение, но лицензите се различават между версиите и по-късните издания имат повече условия. Проверете лиценза на конкретната версия спрямо предвидената употреба.
- Какво означава latent diffusion?
- Моделът работи върху компресирано представяне на изображението, а не върху пълна резолюция на пикселите, след което накрая декодира до изображение. Това го направи достатъчно евтин за пускане на обикновена графична карта.
- Какво е LoRA в Stable Diffusion?
- Малък добавъчен файл, който учи базовия модел на специфичен стил, обект или персонаж без да се претренира целият модел. Това е стандартният начин общността да споделя специализации.
- Какво е ControlNet?
- Разширение, което ограничава генерацията към структурен вход като скелет на поза, depth map или контурен рисунък, за да фиксирате композицията, докато моделът решава останалото.
- Нужна ли ми е добра видеокарта, за да пусна Stable Diffusion?
- За локално пускане — да; видеопаметта е ограничаващият ресурс. Хостваните услуги премахват това изискване срещу цената на контрола, който самостоятелното пускане дава.
- Все още ли е Stable Diffusion най-добрият модел за изображения?
- Не по сурово качество на изхода; по-нови модели обикновено следват prompt-и по-буквално и рендерират текст по-добре. Предимството му сега е дълбочината на общностните инструменти около него.
- Защо хората говорят за seeds и samplers?
- Това са контроли, които отворената общност извади на повърхността и назова, докато работеше с този модел — и речникът се разпространи оттам в цялата област.
Започнете да създавате днес
Генерирайте първото си изображение с най-добрия AI генератор на изображения.
Превърнете изречение във фотореалистичен, завършен кадър за секунди — после доизпипайте всеки детайл. Без настройка, без Discord, без мощен графичен процесор.
Присъединете се към 4200+ творци, които използват LaFoto