Към съдържанието
LaFoto

Stability AI · model directory

Какво е Stable Diffusion? Отвореният модел, от който всички останали заимстваха

Stable Diffusion е открито пуснат latent diffusion модел от Stability AI. Какво означава latent diffusion и защо отворените тегла бяха толкова важни.

Stable Diffusion е text-to-image модел от Stability AI, пуснат с отворени тегла, така че всеки да може да го изтегли и пусне на собствен хардуер. Технически това е latent diffusion модел: вместо да премахва шума от пълноразмерно изображение, работи в компресирано латентно пространство и декодира резултата накрая — именно това го направи достатъчно евтин за пускане на потребителска графична карта.

Stable Diffusion at a glance

Създател
Stability AI
Архитектура
Латентна дифузия
Тегла
Отворени, за изтегляне
Работи на
Потребителски GPU-та
Известен с
Екосистемата си
Разширения
LoRA, ControlNet, checkpoints

Какво означава "latent diffusion", без математика

Diffusion модел се „учи“, като гледа как изображения се разрушават. Вземете фотография, добавете малко шум, после още, продължете докато не остане само статичен шум, и тренирайте мрежа да предсказва какво е премахнато на всяка стъпка. Пуснете мрежата обратно от чист шум и тя „рисува“ картина, която никога не е съществувала.

Да се прави това в пълна резолюция е изключително скъпо, защото всяка стъпка работи върху всеки пиксел. Латентният трик е първо да се компресира изображението в много по-малко представяне, което пази структурата, но изхвърля точните пиксели, да се изпълни целият шумов процес в този малък простор и чак накрая да се декодира обратно към истинско изображение.

Това едно решение е причината всичко това да стигне до обикновените хора. То намали цената на генерация приблизително с един порядък и донесе генерирането на изображения върху хардуер, който човек вече може да има, вместо на нает клъстър.

Отворените тегла и какво задействаха

Stability пусна самите файлове на модела, а не само API. Това е фактът с най-дълги последици и днес е лесно да се подцени, когато резултатите са навсякъде.

Понеже всеки можеше да инспектира и модифицира модела, хората построиха слоя контрол, който базовият модел нямаше. LoRA направи възможно да се научи специфичен стил или обект с малък допълнителен файл вместо пълно претрениране. ControlNet позволи да се ограничат генерациите към поза, depth map или контурен рисунък. Общностни checkpoints специализираха базовия модел за илюстрация, фотография, архитектура и какво ли още не.

Речникът, който излезе от този период, днес е начинът, по който се говори за генериране на изображения изобщо — seed, sampler, denoise strength, CFG, inpainting. Тези думи бяха популяризирани от отворена общност, която четеше и преписваше модел, който може реално да се отвори — и затова глосарът на този сайт е написан така.

Как наистина е да го пуснете сами

По-добре е отпреди, но още не е „ежедневно“. Има one-click инсталатори и има node-базирани интерфейси с реална сложност, а разстоянието между „генерирах картина“ и „получих точно тази, която исках“ е мястото, където отива времето.

Наградата е контрол, който хостваните продукти не предлагат: точни seed-ове, произволни резолюции, какъвто checkpoint или LoRA пожелаете, без содържателен пайплайн между Вас и изхода, без цена на изображение след хардуера и нищо, което напуска машината Ви.

Цената е, че вече оперирате малко парче инфраструктура. Файловете на моделите са по няколко гигабайта всеки, разширенията си пречат помежду си, а видеопаметта на картата е входният билет. Хора, които искат изображение, обикновено са по-щастливи с хостван модел; хора, които искат процес, са тези, които остават.

Къде е мястото му сега

Вече не е автоматично най-силният избор по сурово качество на изхода, а няколко по-нови модела — включително FLUX, създаден частично от хора, работили по Stable Diffusion — следват prompt-и по-буквално и рендерират четим текст значително по-добре.

Това, което запазва, е екосистемата. Обемът от общностни checkpoints, адаптери за стил и контролни инструменти, построени върху по-старите версии, не е нещо, което по-нов модел придобива бързо, и за всеки със специфичен стил за възпроизвеждане или вече построен пайплайн този инвентар надделява над общ дефицит в качеството.

Последващите версии също излизаха с все по-условни лицензи от ранните издания — струва си да ги проверите спрямо предвидената употреба, вместо да предполагате. „Отворени тегла“ и „свободни за всичко“ отдавна престанаха да означават едно и също.

Как да четете останалата част от сайта през него

Почти всяка страница за техника тук използва термини, които този модел популяризира. Denoise strength решава докъде image-to-image резултатът се отдалечава от входа. Seed прави генерацията възпроизводима. Inpainting редактира вътре в маска и оставя останалото непокътнато. Тези концепции важат, независимо кой модел в крайна сметка използвате.

Това е честната причина да разберете Stable Diffusion, дори никога да не го инсталирате: това е моделът, чийто интерфейс „изтече“ в езика. Научете го веднъж и всеки друг инструмент става по-лесен за четене.

Отвореният модел

Защо пускането на теглата беше по-важно от самия модел

Техническото постижение беше да се направи diffusion достатъчно евтин за потребителска видеокарта. Решението с последици беше публикуването на файловете, за да може всеки да ги отвори.

Всичко надолу по веригата — LoRA, ControlNet, общностните checkpoints, целият речник от seed-ове и samplers — съществува, защото хиляди хора можеха да четат и модифицират работещ модел за изображения, вместо да го разпитват през слот.

Отворен технически наръчник до фотографски контактни листове върху бледа работна маса

Три слоя от екосистемата

Какво всъщност добавят хората върху базовия модел

Смяна на самия модел

Checkpoint е целият набор от тегла. Допълнително обучение на базата върху по-тесен корпус изображения — фотография, илюстрация, архитектура — произвежда модел с различен по подразбиране характер и различни компетентности.

Зареждате точно един наведнъж и това е решението с най-голям ефект върху изхода.

  • По няколко гигабайта всеки.
  • Един зареден наведнъж.
  • Лицензи и произход — силно различни.
AI-генериран продуктов натюрморт

Въпроси за Stable Diffusion

Какво да знаете преди да инсталирате каквото и да е

Въпросите, които решават дали self-hosting е за вас.

Какъв хардуер всъщност ми трябва?

Видео паметта е ограничаващият фактор, не суровата скорост. По-стари карти с щедра памет често превъзхождат по-нови с по-малко — за тази задача.

Още ли си струва да се учи?

Ако ви трябват възпроизводимост, обем, поверителност или структурен контрол — да. Ако искате добри изображения без настройка — хостван модел стига по-бързо.

Коя версия да използвам?

Зависи изцяло от екосистемата, която ви трябва. По-старите версии имат далеч повече общностни инструменти; по-новите — по-добро базово качество и по-условни лицензи.

Мога ли да ползвам изхода търговски?

Проверете лиценза на конкретната версия и на всеки checkpoint и LoRA в стека. „Отворени тегла“ и „свободен за всичко“ престанаха да значат едно и също отдавна.

Защо резултатите ми изглеждат по-зле от примерите?

Почти винаги заради checkpoint-а, а не prompt-а. Общностните примери обикновено са правени на силно дообучен checkpoint, а не на базовия модел.

Замества ли го FLUX?

По качество на изхода до голяма степен го изпревари. По наличност на checkpoints, адаптери и контролни инструменти — още нищо не го е заменило.

ИИ-генерирана снимка на храна на дневна светлина

Продължете да изследвате

Другаде в LaFoto

Концепциите тук важат, каквото и да пуснете.

генерирайте по описаниеОсновният генератор — от текст до готово изображение.ОтвориГалерия с prompt-и120 изображения с точните prompt-и, които са ги създали.ОтвориИзображение към изображениеСтарт от кадър, който вече имате.ОтвориAI редактиране на снимкиПроменете част от снимката, запазете останалото.Отвориupscale до 4KУголемяване до 4K без размазване.Отворивъзстановете стара снимкаЕкспонация, шум и възстановяване на стари снимки.Отворипремахнете нещо от снимкаМаскирано премахване с възстановен фон.Отворидълбочинно-зависимо замъгляванеСъобразено с дълбочината, не равномерен филтър.Отворидобавете цвят към стара снимкаПравдоподобен цвят за черно-бели кадри.Отворигенерирайте логоЗнаци, четими и при 16 пиксела.ОтвориAI генератор на татуировкиДизайни, които „оцеляват“ върху кожа.ОтвориAI генератор на изкуствоИлюстрация и живопис, не фотографии.ОтвориAI генератор на хедшотовеСтудийни портрети без студио.Отвориспецификацията на снимкатаТочната спецификация и как да я покриете.Отвориинтериорна визуализацияПрестилирайте стая, която можете да снимате.ОтвориРечник на AI изображениятаSeed, denoise, inpainting — обяснени.Отвори

Stable Diffusion — questions people ask

Какво е Stable Diffusion?
Открито пуснат text-to-image модел от Stability AI, базиран на latent diffusion, който може да се изтегли и пусне на потребителски хардуер, а не само да се ползва през API.
Безплатен ли е Stable Diffusion?
Теглата са пуснати открито и могат да се стартират локално без цена на изображение, но лицензите се различават между версиите и по-късните издания имат повече условия. Проверете лиценза на конкретната версия спрямо предвидената употреба.
Какво означава latent diffusion?
Моделът работи върху компресирано представяне на изображението, а не върху пълна резолюция на пикселите, след което накрая декодира до изображение. Това го направи достатъчно евтин за пускане на обикновена графична карта.
Какво е LoRA в Stable Diffusion?
Малък добавъчен файл, който учи базовия модел на специфичен стил, обект или персонаж без да се претренира целият модел. Това е стандартният начин общността да споделя специализации.
Какво е ControlNet?
Разширение, което ограничава генерацията към структурен вход като скелет на поза, depth map или контурен рисунък, за да фиксирате композицията, докато моделът решава останалото.
Нужна ли ми е добра видеокарта, за да пусна Stable Diffusion?
За локално пускане — да; видеопаметта е ограничаващият ресурс. Хостваните услуги премахват това изискване срещу цената на контрола, който самостоятелното пускане дава.
Все още ли е Stable Diffusion най-добрият модел за изображения?
Не по сурово качество на изхода; по-нови модели обикновено следват prompt-и по-буквално и рендерират текст по-добре. Предимството му сега е дълбочината на общностните инструменти около него.
Защо хората говорят за seeds и samplers?
Това са контроли, които отворената общност извади на повърхността и назова, докато работеше с този модел — и речникът се разпространи оттам в цялата област.

Започнете да създавате днес

Генерирайте първото си изображение с най-добрия AI генератор на изображения.

Превърнете изречение във фотореалистичен, завършен кадър за секунди — после доизпипайте всеки детайл. Без настройка, без Discord, без мощен графичен процесор.

Присъединете се към 4200+ творци, които използват LaFoto