Přeskočit na obsah
LaFoto

Stability AI · model directory

Co je Stable Diffusion? Otevřený model, ze kterého čerpal celý zbytek oboru

Stable Diffusion je otevřeně vydaný latentní difuzní model od Stability AI. Co znamená latentní difuze a proč na otevřených vahách tolik záleželo.

Stable Diffusion je text-to-image model od Stability AI, vydaný s otevřenými vahami, takže si ho může kdokoli stáhnout a spustit na vlastním hardwaru. Technicky jde o latentní difuzní model: místo denoisování obrázku v plném rozlišení pracuje v komprimovaném latentním prostoru a teprve na konci výsledek dekóduje, díky čemuž je dost levný na provoz na běžné grafické kartě.

Stable Diffusion at a glance

Výrobce
Stability AI
Architektura
Latentní difuze
Váhy
Otevřené, ke stažení
Běží na
Spotřebitelských GPU
Známý díky
Svému ekosystému
Rozšíření
LoRA, ControlNet, checkpointy

Co znamená „latentní difuze“, bez matematiky

Difuzní model se učí tak, že sleduje ničení obrázků. Vezmete fotografii, přidáte trochu šumu, přidáte víc, pokračujete, dokud nezůstane jen statický šum, a učíte síť předpovídat, co se v každém kroku odstranilo. Když síť spustíte pozpátku z čistého šumu, „namaluje“ obraz, který nikdy neexistoval.

Dělat to v plném rozlišení je nesmírně nákladné, protože každý krok pracuje s každým pixelem. Latentní trik spočívá v tom, že se obrázek nejprve zkomprimuje do mnohem menší reprezentace, která zachová strukturu a zahodí přesné pixely, celý šumový proces běží v tomto malém prostoru a skutečný obrázek se dekóduje až na samém konci.

Jedno toto rozhodnutí je důvod, proč se to dostalo k běžným lidem. Srazilo to náklady na generování zhruba o řád a přineslo generování obrázků na hardware, který už někdo mohl mít doma, místo pronajatého clusteru.

Otevřené váhy a co tím začalo

Stability vydala samotné soubory modelu, nejen API. To je fakt s nejdelším dozvukem, a dnes, když jsou výsledky všude, se snadno podceňuje.

Protože mohl kdokoli model zkoumat a upravovat, komunita vybudovala vrstvu kontroly, kterou základní model postrádal. LoRA umožnila naučit specifický styl nebo subjekt malým přídavným souborem místo přeučování čehokoli. ControlNet umožnil svázat generování s pózou, hloubkovou mapou nebo obrysovou kresbou. Komunitní checkpointy specializovaly základní model na ilustraci, fotografii, architekturu a všechno mezi tím.

Slovník, který z té doby vzešel, je dnes způsob, jakým se o generování obrázků mluví obecně — seed, sampler, denoise strength, CFG, inpainting. Ta slova zpopularizovala otevřená komunita, která četla a přepisovala model, do něhož mohla nahlédnout, a proto je i náš glosář napsaný právě tak.

Jaké to doopravdy je, když si ho spustíte sami

Lepší než dřív a pořád ne úplně nenáročné. Existují jednorázové instalátory a existují uzly a rozhraní skutečné komplexity — a vzdálenost mezi „vygeneroval(a) jsem obrázek“ a „dostal(a) jsem obrázek, který jsem chtěl(a)“ je to, kam mizí čas.

Odměnou je kontrola, kterou hostované produkty nenabízejí: přesné seedy, libovolná rozlišení, jakýkoli checkpoint nebo LoRA podle chuti, žádný obsahový pipeline mezi vámi a výstupem, žádné náklady za snímek po pořízení hardwaru a nic neodchází z vašeho stroje.

Cenou je, že provozujete malý kus infrastruktury. Soubory modelů mají i několik gigabajtů, rozšíření si navzájem lámou kompatibilitu a grafická karta s dostatkem paměti je vstupenka. Lidé, kteří chtějí obrázek, bývají spokojenější s hostovaným modelem; ti, kteří chtějí proces, u toho zůstávají.

Kde stojí dnes

Už to automaticky není nejsilnější volba na surovou kvalitu výstupu a několik novějších modelů — včetně FLUX, na němž se podíleli i lidé, kteří pracovali na Stable Diffusion — čte prompty doslovněji a výrazně lépe vykresluje čitelný text.

Co si drží, je ekosystém. Objem komunitních checkpointů, stylových adaptérů a řídicích nástrojů postavených na starších verzích není něco, co novější model rychle dožene, a pro každého, kdo potřebuje reprodukovat specifický styl nebo už má vybudovaný pipeline, převažuje tato zásoba nad obecným kvalitativním rozdílem.

Následné verze se také vydávají pod postupně podmíněnějšími licencemi než rané releasy, což je potřeba zkontrolovat vůči zamýšlenému použití a nic nepředpokládat. „Otevřené váhy“ a „zdarma na cokoli“ přestaly být totéž už před časem.

Jak skrze něj číst zbytek tohoto webu

Téměř každá stránka s technikami zde používá pojmy, které tento model zpopularizoval. Denoise strength určuje, jak daleko se image-to-image výsledek odchýlí od vstupu. Seed dělá generování opakovatelným. Inpainting upravuje uvnitř masky a zbytek nechává nedotčený. Tyto koncepty platí bez ohledu na to, jaký model nakonec použijete.

A to je poctivý důvod porozumět Stable Diffusion i v případě, že ho nikdy nenainstalujete: je to model, jehož rozhraní „prosáklo“ do jazyka. Naučíte se ho jednou a každý další nástroj se čte snáz.

Otevřený model

Proč bylo důležitější zveřejnit weights než samotný model

Technický průlom byl zlevnit diffusion natolik, aby běžela na spotřebitelské grafické kartě. Rozhodující krok bylo zveřejnit soubory, aby je kdokoli mohl otevřít.

Vše, co následovalo — LoRA, ControlNet, komunitní checkpointy, celý slovník seedů a samplerů — existuje proto, že tisíce lidí mohly číst a upravovat funkční obrazový model, místo aby ho jen dotazovaly přes okénko.

Otevřená technická příručka vedle fotografických kontaktních listů na světlém pracovním stole

Tři vrstvy ekosystému

Co si lidé ve skutečnosti přidávají nad základní model

Výměna samotného modelu

Checkpoint je celá sada weights. Dotrénování základu na užším korpusu snímků — fotografie, ilustrace, architektura — dá model s jiným výchozím charakterem a jinými dovednostmi.

Najednou načítáte právě jeden a je to rozhodnutí s největším dopadem na to, co vyleze ven.

  • Každý o gigabajtech.
  • Načten vždy jen jeden.
  • Licence a původ se velmi liší.
AI generované produktové zátiší

Otázky ke Stable Diffusion

Co vědět před instalací čehokoli

Otázky, které rozhodují, jestli je self-hosting pro vás.

Jaký hardware vlastně potřebuji?

Vázaným limitem je paměť videokarty, ne hrubý výkon. Starší karty se štědrou pamětí často v této zátěži předčí novější s menší.

Má smysl se to ještě učit?

Pokud potřebujete reprodukovatelnost, objem, soukromí nebo strukturální kontrolu, ano. Pokud chcete dobré obrázky bez nastavování, hostovaný model vás tam dovede rychleji.

Kterou verzi mám použít?

Zcela záleží na ekosystému, který potřebujete. Starší verze mají nesrovnatelně víc komunitních nástrojů; novější mají lepší základní kvalitu a podmíněnější licence.

Mohu výstupy používat komerčně?

Zkontrolujte licenci konkrétní verze a každého checkpointu i LoRA ve stacku. „Otevřené weights“ a „zdarma na cokoli“ už dávno není totéž.

Proč moje výsledky vypadají hůř než ukázky?

Téměř vždy jde o checkpoint, ne o prompt. Komunitní ukázky bývají generované na silně dotrénovaném checkpointu, ne na základním modelu.

Nahrazuje ho FLUX?

Kvalitou výstupu byl z velké části předstižen. Inventářem checkpointů, adaptérů a řídicích nástrojů ho zatím nic nenahradilo.

AI generovaná fotografie jídla za denního světla

Pokračujte v prozkoumávání

Jinde na LaFoto

Koncepty zde platí bez ohledu na to, co budete provozovat.

Stable Diffusion — questions people ask

Co je Stable Diffusion?
Otevřeně vydaný text-to-image model od Stability AI, založený na latentní difuzi, který lze stáhnout a spustit na spotřebitelském hardwaru, nejen přes API.
Je Stable Diffusion zdarma?
Váhy byly otevřeně vydány a lze je spouštět lokálně bez nákladů za snímek, ale licenční podmínky se mezi verzemi liší a novější releasy mají více omezení. Zkontrolujte licenci konkrétní verze vůči vašemu zamýšlenému použití.
Co znamená latentní difuze?
Model pracuje na komprimované reprezentaci obrázku místo na plnorozměrných pixelech a teprve na konci dekóduje zpět do obrazu. Právě to umožnilo provoz na běžné grafické kartě.
Co je LoRA ve Stable Diffusion?
Malý přídavný soubor, který naučí základní model konkrétnímu stylu, subjektu nebo postavě bez přeučení celého modelu. Je to standardní způsob, jak komunita sdílí specializace.
Co je ControlNet?
Rozšíření, které omezí generování na strukturální vstup, jako je kostra pózy, hloubková mapa nebo obrysová kresba, takže můžete zafixovat kompozici a zbytek nechat na modelu.
Potřebuji dobrou grafickou kartu pro běh Stable Diffusion?
Pro lokální běh ano — svazující je video paměť. Hostované služby tuto potřebu odstraňují za cenu ztráty kontroly, kterou vlastní provoz poskytuje.
Je Stable Diffusion stále nejlepší obrazový model?
Na hrubou kvalitu výstupu ne; novější modely obecně následují prompty doslovněji a lépe vykreslují text. Jeho výhodou je dnes hloubka komunitních nástrojů kolem něj.
Proč se mluví o seedech a samplerech?
To jsou ovladače, které otevřená komunita objevila a pojmenovala při práci s tímto modelom, a slovník se odtud rozšířil do celého oboru.

Začněte tvořit ještě dnes

Vytvořte svůj první obrázek v nejlepším AI generátoru obrázků.

Větu promění v hotový, fotorealistický obrázek během pár sekund — pak doladíte každý detail. Bez nastavování, bez Discordu, bez GPU.

Připojte se k 4 200+ tvůrcům používajícím LaFoto