Săriți la conținut
LaFoto

Stability AI · model directory

Ce este Stable Diffusion? Modelul deschis de la care au pornit celelalte

Stable Diffusion este un model de latent diffusion lansat deschis de Stability AI. Ce înseamnă latent diffusion și de ce ponderile deschise au contat atât de mult.

Stable Diffusion este un model text-la-imagine de la Stability AI, lansat cu ponderi deschise astfel încât oricine să-l poată descărca și rula pe propriul hardware. Tehnic, este un model de latent diffusion: în loc să elimine zgomotul dintr-o imagine la rezoluție completă, lucrează într-un spațiu latent comprimat și decodează rezultatul la final, ceea ce l-a făcut suficient de ieftin pentru a rula pe o placă video obișnuită.

Stable Diffusion at a glance

Producător
Stability AI
Arhitectură
difuzie latentă
Greutăți
Deschise, descărcabile
Rulează pe
GPU-uri pentru consumatori
Cunoscut pentru
Ecosistemul său
Extensii
LoRA, ControlNet, checkpoints

Ce înseamnă „latent diffusion”, fără matematică

Un model de diffusion învață uitându-se cum sunt distruse imaginile. Luați o fotografie, adăugați puțin zgomot, mai adăugați, continuați până nu mai rămâne decât statică, și antrenați o rețea să prezică ce a fost scos la fiecare pas. Rulați acea rețea invers din pură statică și pictează o imagine care nu a existat vreodată.

A face asta la rezoluție completă este enorm de costisitor, pentru că fiecare pas operează pe fiecare pixel. Șmecheria latentă este să comprimați mai întâi imaginea într-o reprezentare mult mai mică ce păstrează structura și aruncă pixelii exacți, să rulați întregul proces zgomotos în acel spațiu mic și să decodați înapoi într-o imagine reală abia la final.

Acea singură decizie este motivul pentru care totul a ajuns la oameni obișnuiți. A redus costul generării cu aproximativ un ordin de mărime și a adus generarea de imagini pe hardware pe care cineva l-ar putea deja deține, nu pe un cluster închiriat.

Greutăți deschise și ce au declanșat

Stability a lansat fișierele modelului, nu doar un API. Acesta este faptul cu cele mai lungi consecințe, ușor de subestimat acum că rezultatele sunt peste tot.

Pentru că oricine putea inspecta și modifica modelul, oamenii au construit stratul de control care lipsea modelului de bază. LoRA a făcut posibil să învățați un stil sau un subiect specific cu un fișier suplimentar mic, fără reantrenare. ControlNet a făcut posibil să constrângeți generarea la o poză, o hartă de profunzime sau o schiță de contururi. Checkpoint-urile comunitare au specializat modelul de bază pentru ilustrație, fotografie, arhitectură și orice altceva.

Vocabularul ieșit din acea perioadă este acum felul în care se vorbește, în general, despre generarea de imagini — seed, sampler, denoise strength, CFG, inpainting. Aceste cuvinte au fost popularizate de o comunitate deschisă care citea și rescria un model pe care îl putea deschide efectiv, iar de aceea glosarul de pe acest site este scris așa cum este.

Cum este, cu adevărat, să-l rulați local

Mai bine decât era și totuși nu lejer. Există instalatoare dintr-un clic și interfețe pe noduri de o complexitate reală, iar distanța dintre „am generat o imagine” și „am obținut imaginea pe care o voiam” este locul în care se duce timpul.

Răsplata este controlul pe care serviciile găzduite nu îl oferă: seed-uri exacte, rezoluții arbitrare, orice checkpoint sau LoRA doriți, niciun lanț de conținut între dumneavoastră și ieșire, niciun cost pe imagine după hardware și nimic care părăsește mașina dumneavoastră.

Costul este că acum operați o mică piesă de infrastructură. Fișierele de model ajung la câțiva gigabytes fiecare, extensiile se pot strica între ele, iar o placă grafică cu suficientă memorie este biletul de intrare. Cei care vor o imagine tind să fie mai fericiți cu un model găzduit; cei care vor un proces sunt cei care rămân.

Unde se află acum

Nu mai este automat cea mai puternică opțiune ca „raw output quality”, iar câteva modele mai noi — inclusiv FLUX, construit parțial de oameni care au lucrat la Stable Diffusion — urmează prompt-urile mai literal și redau text lizibil mult mai bine.

Ce păstrează este ecosistemul. Volumul de checkpoint-uri comunitare, adaptoare de stil și unelte de control construite pe versiunile mai vechi nu este ceva ce un model nou capătă rapid, iar pentru oricine are un stil specific de reprodus sau un pipeline deja construit, acel inventar cântărește mai mult decât un gol general de calitate.

Versiunile succesive au fost, de asemenea, livrate sub licențe progresiv mai condiționate decât lansările timpurii, lucru de verificat în raport cu utilizarea intenționată, nu de presupus. „Greutăți deschise” și „liber pentru orice” au încetat să mai fie aceeași afirmație de ceva timp.

Cum să citiți restul site-ului prin această lentilă

Aproape fiecare pagină de tehnică de aici folosește termeni pe care acest model i-a popularizat. Intensitatea denoise decide cât de mult un rezultat imagine-la-imagine se abate de la intrare. Un seed face o generare repetabilă. Inpainting editează în interiorul unei măști și lasă restul neatins. Aceste concepte se aplică indiferent ce model veți folosi în final.

Acesta este motivul onest să înțelegeți Stable Diffusion chiar dacă nu îl instalați niciodată: este modelul a cărui interfață a intrat în limbaj. Învățați-l o dată și orice alt instrument devine mai ușor de „citit”.

Modelul deschis

De ce publicarea greutăților a contat mai mult decât modelul în sine

Realizarea tehnică a fost să facă diffusion suficient de ieftin pentru o placă grafică de consum. Decizia cu impact a fost publicarea fișierelor astfel încât oricine să le poată deschide.

Tot ce a urmat — LoRA-urile, ControlNet, checkpoint-urile comunității, întregul vocabular al seed-urilor și samplerelor — există fiindcă mii de oameni au putut citi și modifica un model funcțional de imagini, în loc să-l interogheze printr-o interfață limitată.

Un manual tehnic deschis lângă coli de contact fotografice pe o masă de lucru pală

Trei straturi ale ecosistemului

Ce adaugă efectiv oamenii peste modelul de bază

Schimbarea modelului în sine

Un checkpoint este setul complet de greutăți. Fine-tuning-ul bazei pe un corpus mai îngust de imagini — fotografie, ilustrație, arhitectură — produce un model cu un caracter implicit diferit și competențe diferite.

Încărcați exact unul la un moment dat, iar aceasta este decizia cu efectul cel mai mare asupra a ceea ce iese.

  • Câțiva gigabytes fiecare.
  • Unul încărcat la un moment dat.
  • Licențele și proveniența variază mult.
O natură moartă de produs generată de AI

Întrebări despre Stable Diffusion

Ce să știți înainte să instalați ceva

Întrebările care decid dacă auto-găzduirea vi se potrivește.

Ce hardware îmi trebuie de fapt?

Memoria video (VRAM) este constrângerea principală, nu viteza brută. Plăci mai vechi, dar cu memorie generoasă, adesea depășesc plăci mai noi cu mai puțină memorie pe acest tip de sarcină.

Mai merită să învăț?

Dacă aveți nevoie de reproductibilitate, volum, confidențialitate sau control structural, da. Dacă doriți imagini bune fără configurare, un model găzduit vă duce mai repede acolo.

Ce versiune ar trebui să folosesc?

Depinde integral de ecosistemul de care aveți nevoie. Versiunile mai vechi au mult mai multe instrumente comunitare; cele noi au calitate de bază mai bună și licențe mai condiționate.

Pot folosi rezultatul comercial?

Verificați licența versiunii specifice și a fiecărui checkpoint și LoRA din stivă. „Greutăți deschise” și „liber pentru orice” nu mai sunt același lucru de ceva vreme.

De ce arată rezultatele mele mai slab decât exemplele?

Aproape întotdeauna din cauza checkpoint-ului, nu a promptului. Exemplele comunității sunt de obicei generate pe un checkpoint puternic fine-tuned, nu pe modelul de bază.

Este înlocuit de FLUX?

La calitatea rezultatului a fost în mare parte depășit. La inventarul de checkpoint-uri, adaptoare și instrumente de control, încă nu l-a înlocuit nimic.

O fotografie culinară generată de AI în lumină de zi

Continuați explorarea

În alte secțiuni LaFoto

Conceptele de aici se aplică oricum ați rula.

Stable Diffusion — questions people ask

Ce este Stable Diffusion?
Un model text-la-imagine lansat deschis de Stability AI, bazat pe latent diffusion, care poate fi descărcat și rulat pe hardware pentru consumatori, nu doar accesat printr-un API.
Este Stable Diffusion gratuit?
Greutățile au fost lansate deschis și pot fi rulate local fără cost pe imagine, dar termenii de licență diferă între versiuni, iar lansările mai noi au mai multe condiții. Verificați licența versiunii specifice în raport cu utilizarea intenționată.
Ce înseamnă latent diffusion?
Modelul își face treaba pe o reprezentare comprimată a unei imagini, nu pe pixeli la rezoluție completă, apoi decodează într-o imagine la final. Asta l-a făcut suficient de ieftin pentru a rula pe o placă grafică obișnuită.
Ce este o LoRA în Stable Diffusion?
Un fișier suplimentar mic care învață modelul de bază un stil, subiect sau personaj specific fără reantrenarea întregului model. Este modul standard în care comunitatea își distribuie specializările.
Ce este ControlNet?
O extensie care constrânge o generare la un input structural precum un schelet de poziție corporală, o hartă de profunzime sau o schiță de contururi, astfel încât puteți fixa compoziția lăsând modelului restul deciziilor.
Am nevoie de o placă grafică bună pentru a rula Stable Diffusion?
Pentru rulare locală, da — memoria video este constrângerea principală. Serviciile găzduite elimină această cerință cu prețul controlului pe care vi-l oferă rularea locală.
Este Stable Diffusion încă cel mai bun model de imagini?
Nu la calitatea brută a rezultatului; modelele mai noi urmează în general prompt-urile mai literal și redau mai bine textul. Avantajul său acum este profunzimea uneltelor comunitare construite în jurul lui.
De ce vorbesc oamenii despre seeds și samplers?
Acestea sunt controale pe care comunitatea deschisă le-a scos la iveală și le-a denumit lucrând cu acest model, iar vocabularul s-a răspândit apoi în restul domeniului.

Începeți să creați astăzi

Generați prima imagine cu cel mai bun generator de imagini AI.

Transformați o propoziție într-o imagine finală, fotorealistă, în câteva secunde — apoi rafinați fiecare detaliu. Fără configurare, fără Discord, fără GPU.

Alăturați-vă celor 4.200+ creatori care folosesc LaFoto