Stability AI · model directory
Ce este Stable Diffusion? Modelul deschis de la care au pornit celelalte
Stable Diffusion este un model de latent diffusion lansat deschis de Stability AI. Ce înseamnă latent diffusion și de ce ponderile deschise au contat atât de mult.
Stable Diffusion at a glance
- Producător
- Stability AI
- Arhitectură
- difuzie latentă
- Greutăți
- Deschise, descărcabile
- Rulează pe
- GPU-uri pentru consumatori
- Cunoscut pentru
- Ecosistemul său
- Extensii
- LoRA, ControlNet, checkpoints
Ce înseamnă „latent diffusion”, fără matematică
Un model de diffusion învață uitându-se cum sunt distruse imaginile. Luați o fotografie, adăugați puțin zgomot, mai adăugați, continuați până nu mai rămâne decât statică, și antrenați o rețea să prezică ce a fost scos la fiecare pas. Rulați acea rețea invers din pură statică și pictează o imagine care nu a existat vreodată.
A face asta la rezoluție completă este enorm de costisitor, pentru că fiecare pas operează pe fiecare pixel. Șmecheria latentă este să comprimați mai întâi imaginea într-o reprezentare mult mai mică ce păstrează structura și aruncă pixelii exacți, să rulați întregul proces zgomotos în acel spațiu mic și să decodați înapoi într-o imagine reală abia la final.
Acea singură decizie este motivul pentru care totul a ajuns la oameni obișnuiți. A redus costul generării cu aproximativ un ordin de mărime și a adus generarea de imagini pe hardware pe care cineva l-ar putea deja deține, nu pe un cluster închiriat.
Greutăți deschise și ce au declanșat
Stability a lansat fișierele modelului, nu doar un API. Acesta este faptul cu cele mai lungi consecințe, ușor de subestimat acum că rezultatele sunt peste tot.
Pentru că oricine putea inspecta și modifica modelul, oamenii au construit stratul de control care lipsea modelului de bază. LoRA a făcut posibil să învățați un stil sau un subiect specific cu un fișier suplimentar mic, fără reantrenare. ControlNet a făcut posibil să constrângeți generarea la o poză, o hartă de profunzime sau o schiță de contururi. Checkpoint-urile comunitare au specializat modelul de bază pentru ilustrație, fotografie, arhitectură și orice altceva.
Vocabularul ieșit din acea perioadă este acum felul în care se vorbește, în general, despre generarea de imagini — seed, sampler, denoise strength, CFG, inpainting. Aceste cuvinte au fost popularizate de o comunitate deschisă care citea și rescria un model pe care îl putea deschide efectiv, iar de aceea glosarul de pe acest site este scris așa cum este.
Cum este, cu adevărat, să-l rulați local
Mai bine decât era și totuși nu lejer. Există instalatoare dintr-un clic și interfețe pe noduri de o complexitate reală, iar distanța dintre „am generat o imagine” și „am obținut imaginea pe care o voiam” este locul în care se duce timpul.
Răsplata este controlul pe care serviciile găzduite nu îl oferă: seed-uri exacte, rezoluții arbitrare, orice checkpoint sau LoRA doriți, niciun lanț de conținut între dumneavoastră și ieșire, niciun cost pe imagine după hardware și nimic care părăsește mașina dumneavoastră.
Costul este că acum operați o mică piesă de infrastructură. Fișierele de model ajung la câțiva gigabytes fiecare, extensiile se pot strica între ele, iar o placă grafică cu suficientă memorie este biletul de intrare. Cei care vor o imagine tind să fie mai fericiți cu un model găzduit; cei care vor un proces sunt cei care rămân.
Unde se află acum
Nu mai este automat cea mai puternică opțiune ca „raw output quality”, iar câteva modele mai noi — inclusiv FLUX, construit parțial de oameni care au lucrat la Stable Diffusion — urmează prompt-urile mai literal și redau text lizibil mult mai bine.
Ce păstrează este ecosistemul. Volumul de checkpoint-uri comunitare, adaptoare de stil și unelte de control construite pe versiunile mai vechi nu este ceva ce un model nou capătă rapid, iar pentru oricine are un stil specific de reprodus sau un pipeline deja construit, acel inventar cântărește mai mult decât un gol general de calitate.
Versiunile succesive au fost, de asemenea, livrate sub licențe progresiv mai condiționate decât lansările timpurii, lucru de verificat în raport cu utilizarea intenționată, nu de presupus. „Greutăți deschise” și „liber pentru orice” au încetat să mai fie aceeași afirmație de ceva timp.
Cum să citiți restul site-ului prin această lentilă
Aproape fiecare pagină de tehnică de aici folosește termeni pe care acest model i-a popularizat. Intensitatea denoise decide cât de mult un rezultat imagine-la-imagine se abate de la intrare. Un seed face o generare repetabilă. Inpainting editează în interiorul unei măști și lasă restul neatins. Aceste concepte se aplică indiferent ce model veți folosi în final.
Acesta este motivul onest să înțelegeți Stable Diffusion chiar dacă nu îl instalați niciodată: este modelul a cărui interfață a intrat în limbaj. Învățați-l o dată și orice alt instrument devine mai ușor de „citit”.
Modelul deschis
De ce publicarea greutăților a contat mai mult decât modelul în sine
Realizarea tehnică a fost să facă diffusion suficient de ieftin pentru o placă grafică de consum. Decizia cu impact a fost publicarea fișierelor astfel încât oricine să le poată deschide.
Tot ce a urmat — LoRA-urile, ControlNet, checkpoint-urile comunității, întregul vocabular al seed-urilor și samplerelor — există fiindcă mii de oameni au putut citi și modifica un model funcțional de imagini, în loc să-l interogheze printr-o interfață limitată.

Trei straturi ale ecosistemului
Ce adaugă efectiv oamenii peste modelul de bază
Schimbarea modelului în sine
Un checkpoint este setul complet de greutăți. Fine-tuning-ul bazei pe un corpus mai îngust de imagini — fotografie, ilustrație, arhitectură — produce un model cu un caracter implicit diferit și competențe diferite.
Încărcați exact unul la un moment dat, iar aceasta este decizia cu efectul cel mai mare asupra a ceea ce iese.
- Câțiva gigabytes fiecare.
- Unul încărcat la un moment dat.
- Licențele și proveniența variază mult.

Adăugarea unui singur lucru fără reantrenare
Un fișier mic care învață checkpoint-ului încărcat un anumit stil, personaj sau obiect. Se poate antrena pe o singură placă de consum în minute până la ore.
Mai multe pot fi stivuite cu greutăți individuale, aici aflându-se cea mai mare dificultate practică — două LoRA-uri de stil puternice se bat cap în cap.
- Zeci până la sute de megabytes.
- Stivuibile, cu intensitate ajustabilă.
- Legate de o anumită arhitectură de bază.

Fixarea structurii, libertate pentru restul
Constrânge o generare la un input structural — un schelet de poză, o hartă de adâncime, un desen de contur — astfel încât compoziția e decisă de dvs., iar restul de model.
Aceasta este capabilitatea care a transformat generarea de imagini din eșantionare în regie și nu are un echivalent curat în majoritatea serviciilor găzduite.
- Poză, adâncime, contururi, segmentare.
- Compoziție fixată, stil liber.
- Principalul motiv pentru care oamenii își găzduiesc local.

Întrebări despre Stable Diffusion
Ce să știți înainte să instalați ceva
Întrebările care decid dacă auto-găzduirea vi se potrivește.
Ce hardware îmi trebuie de fapt?
Memoria video (VRAM) este constrângerea principală, nu viteza brută. Plăci mai vechi, dar cu memorie generoasă, adesea depășesc plăci mai noi cu mai puțină memorie pe acest tip de sarcină.
Mai merită să învăț?
Dacă aveți nevoie de reproductibilitate, volum, confidențialitate sau control structural, da. Dacă doriți imagini bune fără configurare, un model găzduit vă duce mai repede acolo.
Ce versiune ar trebui să folosesc?
Depinde integral de ecosistemul de care aveți nevoie. Versiunile mai vechi au mult mai multe instrumente comunitare; cele noi au calitate de bază mai bună și licențe mai condiționate.
Pot folosi rezultatul comercial?
Verificați licența versiunii specifice și a fiecărui checkpoint și LoRA din stivă. „Greutăți deschise” și „liber pentru orice” nu mai sunt același lucru de ceva vreme.
De ce arată rezultatele mele mai slab decât exemplele?
Aproape întotdeauna din cauza checkpoint-ului, nu a promptului. Exemplele comunității sunt de obicei generate pe un checkpoint puternic fine-tuned, nu pe modelul de bază.
Este înlocuit de FLUX?
La calitatea rezultatului a fost în mare parte depășit. La inventarul de checkpoint-uri, adaptoare și instrumente de control, încă nu l-a înlocuit nimic.

Termenii pe care i-a numit acest model
Vocabular ieșit din ecosistemul deschis
Continuați explorarea
În alte secțiuni LaFoto
Conceptele de aici se aplică oricum ați rula.
- redimensionați o imagine
- JPG, PNG și WebP
- compresor de imagini
- decupați la un raport
- selector de culori din imagine
- înlăturați fundalul
- vizualizator EXIF
- generator de prompt AI
- generator de anime AI
- transformați o imagine în desen animat
- realizați pixel art
- comparația ierarhizată
- comparată cu Midjourney
- LaFoto vs Leonardo AI
- comparată cu Ideogram
- comparată cu Canva
- reproducerea unei imagini
- cât de mult poate devia rezultatul
- editare în interiorul unei măști
- jurnalul LaFoto
Stable Diffusion — questions people ask
- Ce este Stable Diffusion?
- Un model text-la-imagine lansat deschis de Stability AI, bazat pe latent diffusion, care poate fi descărcat și rulat pe hardware pentru consumatori, nu doar accesat printr-un API.
- Este Stable Diffusion gratuit?
- Greutățile au fost lansate deschis și pot fi rulate local fără cost pe imagine, dar termenii de licență diferă între versiuni, iar lansările mai noi au mai multe condiții. Verificați licența versiunii specifice în raport cu utilizarea intenționată.
- Ce înseamnă latent diffusion?
- Modelul își face treaba pe o reprezentare comprimată a unei imagini, nu pe pixeli la rezoluție completă, apoi decodează într-o imagine la final. Asta l-a făcut suficient de ieftin pentru a rula pe o placă grafică obișnuită.
- Ce este o LoRA în Stable Diffusion?
- Un fișier suplimentar mic care învață modelul de bază un stil, subiect sau personaj specific fără reantrenarea întregului model. Este modul standard în care comunitatea își distribuie specializările.
- Ce este ControlNet?
- O extensie care constrânge o generare la un input structural precum un schelet de poziție corporală, o hartă de profunzime sau o schiță de contururi, astfel încât puteți fixa compoziția lăsând modelului restul deciziilor.
- Am nevoie de o placă grafică bună pentru a rula Stable Diffusion?
- Pentru rulare locală, da — memoria video este constrângerea principală. Serviciile găzduite elimină această cerință cu prețul controlului pe care vi-l oferă rularea locală.
- Este Stable Diffusion încă cel mai bun model de imagini?
- Nu la calitatea brută a rezultatului; modelele mai noi urmează în general prompt-urile mai literal și redau mai bine textul. Avantajul său acum este profunzimea uneltelor comunitare construite în jurul lui.
- De ce vorbesc oamenii despre seeds și samplers?
- Acestea sunt controale pe care comunitatea deschisă le-a scos la iveală și le-a denumit lucrând cu acest model, iar vocabularul s-a răspândit apoi în restul domeniului.
Celelalte modele din director
Începeți să creați astăzi
Generați prima imagine cu cel mai bun generator de imagini AI.
Transformați o propoziție într-o imagine finală, fotorealistă, în câteva secunde — apoi rafinați fiecare detaliu. Fără configurare, fără Discord, fără GPU.
Alăturați-vă celor 4.200+ creatori care folosesc LaFoto