Ugrás a tartalomra
LaFoto

Stability AI · model directory

Mi a Stable Diffusion? A nyílt modell, amelyből a többiek építkeztek

A Stable Diffusion a Stability AI nyíltan kiadott „latent diffusion” modellje. Mit jelent a latent diffusion, és miért számított ennyit a nyílt súlyok elérhetősége.

A Stable Diffusion a Stability AI szövegből képet készítő modellje, nyílt súlyokkal kiadva, így bárki letöltheti és futtathatja a saját hardverén. Technikailag „latent diffusion” modell: nem a teljes felbontású képet tisztítja meg a zajtól, hanem egy tömörített, látens térben dolgozik, és a végén dekódolja képpé — ez tette elég olcsóvá ahhoz, hogy fogyasztói videokártyán is elfusson.

Stable Diffusion at a glance

Készítő
Stability AI
Architektúra
Latens diffúzió
Súlyok
Nyíltak, letölthetők
Fut ezen
Fogyasztói GPU-kon
Erről ismert
Az ökoszisztémájáról
Kiterjesztések
LoRA, ControlNet, checkpointok

Mit jelent a „latent diffusion” — matematika nélkül

A diffusion modell úgy tanul, hogy figyeli, ahogy képek tönkremennek. Fogjon egy fotót, adjon hozzá egy kis zajt, még többet, és így tovább, míg csak statikus nem marad, majd tanítson egy hálót arra, hogy minden lépésben megjósolja, mi tűnt el. Ha ezt a hálót tiszta zajtól visszafelé futtatja, olyan képet fest, ami sosem létezett.

Ezt teljes felbontáson végezni óriási költség, mert minden lépés minden pixelen dolgozik. A látens trükk az, hogy a képet előbb jóval kisebb, a szerkezetet megőrző, de a konkrét pixeleket eldobó reprezentációba tömörítjük, a zajos folyamat egészét ebben a kis térben futtatjuk, és csak a legvégén dekódálunk vissza valódi képpé.

Ez az egy döntés juttatta el mindezt a hétköznapi felhasználókig. Körülbelül egy nagyságrenddel csökkentette a generálás költségét, és a képgenerálást olyan hardverre hozta, amellyel valaki már rendelkezhet, nem pedig bérelt klaszterre.

Nyílt súlyok, és amit elindítottak

A Stability magukat a modelfájlokat adta ki, nem csak egy API-t. Ez a leghosszabb következményekkel járó tény, és ma, hogy az eredmények mindenütt ott vannak, könnyű alábecsülni.

Mivel bárki megvizsgálhatta és módosíthatta a modellt, felépült az a kontrollréteg, ami az alapmodellből hiányzott. A LoRA lehetővé tette, hogy egy konkrét stílust vagy témát kis kiegészítő fájllal tanítsunk be, teljes újratanítás nélkül. A ControlNet megengedte, hogy a generálást pózhoz, mélységtérképhez vagy élrajzhoz rögzítsük. A közösségi checkpointok az alapmodellt illusztrációra, fotóra, építészetre és minden másra specializálták.

Az ebből az időszakból kijött szókészlet ma általános a képgenerálásról szóló beszédben — seed, sampler, denoise erősség, CFG, inpainting. Ezeket a szavakat egy nyílt közösség tette közkinccsé, miközben egy valóban megnyitható modellt olvastak és írtak át, és ezért van a glosszárium ezen az oldalon is így megfogalmazva.

Milyen valójában saját magának futtatni

Jobb, mint volt, de még nem „alkalmi”. Vannak egykattintásos telepítők, és vannak valóban összetett, node-alapú felületek, és az „Lett egy képem” és az „Azt a képet kaptam, amit akartam” közötti távolság viszi el az időt.

A jutalom az a kontroll, amit a hosztolt termékek nem kínálnak: pontos seedek, tetszőleges felbontások, bármilyen checkpoint vagy LoRA, nincs tartalmi csővezeték Ön és a kimenet között, nincs képenkénti költség a hardveren túl, és semmi nem hagyja el a gépét.

Az ára, hogy most egy kis infrastruktúrát üzemeltet. A modelfájlok darabonként több gigabájtosak, a kiterjesztések ütköznek egymással, és a belépő a kellő memóriájú grafikus kártya. Akinek képre van szüksége, gyakran boldogabb hosztolt modellel; akinek folyamat kell, az marad.

Hol tart most

Nyers kimeneti minőségben már nem automatikusan a legerősebb opció, és több újabb modell — köztük a FLUX, amelyen részben a Stable Diffusionon dolgozó emberek is munkáltak — szó szerint követi a promptokat, és sokkal olvashatóbb szöveget renderel.

Amit megtartott, az az ökoszisztéma. A közösségi checkpointok, stílusadapterek és vezérlő eszközök tömege a régi verziók körül nem olyasmi, amit egy új modell gyorsan megszerez, és akinek konkrét stílust kell reprodukálnia vagy már kész folyamata van, annak ez a készlet gyakran többet ér egy általános minőségbeli különbségnél.

Az egymást követő verziók egyre feltételesebb licencekkel érkeztek az első kiadásokhoz képest, amit érdemes az Ön szándékolt felhasználásához mérten ellenőrizni. A „nyílt súlyok” és a „szabad bármihez” állítás egy ideje már nem ugyanaz.

Így olvassa ezen az oldalon a többit

Szinte minden technikai oldal itt olyan kifejezéseket használ, amelyeket ez a modell népszerűsített. A denoise erősség dönti el, mennyire tér el egy image-to-image eredmény a bemenetétől. A seed megismételhetővé teszi a generálást. Az inpainting maszkban szerkeszt, és a többit érintetlenül hagyja. Ezek a fogalmak bármelyik modellnél érvényesek, amit végül használni fog.

Ez az őszinte ok megérteni a Stable Diffusiont akkor is, ha sosem telepíti: ez az a modell, amelynek az interfésze „kiszivárgott” a nyelvbe. Ha ezt egyszer megtanulja, minden más eszköz olvashatóbb lesz.

A nyílt modell

Miért számított jobban a súlyok közzététele, mint maga a modell

A technikai teljesítmény az volt, hogy a diffusion elég olcsóvá vált egy fogyasztói videokártyához. A sorsdöntő lépés az volt, hogy a fájlokat publikussá tették, így bárki megnyithatta őket.

Minden, ami utána jött — LoRA-k, ControlNet, közösségi checkpointok, a seedek és samplerek teljes szókészlete — azért létezik, mert ezrek olvashattak és módosíthattak egy működő képi modellt ahelyett, hogy egy nyíláson át kérdezték volna.

Nyitott műszaki kézikönyv fotós kontaktívekkel egy világos munkafelületen

Az ökoszisztéma három rétege

Amit valójában rátesznek az alaprendszerre

Maga a modell cseréje

A checkpoint a teljes súlykészlet. Az alapmodell finomhangolása szűkebb képanyagokra — fotó, illusztráció, építészet — más alapkarakterű és képességű modellt ad.

Egyszerre pontosan egyet tölt be, és ez a döntés hat a legerősebben a kimenetre.

  • Darabonként több gigabájt.
  • Egyszerre egy betöltve.
  • Licenc és eredet széles skálán mozog.
AI által generált termék csendélet

Stable Diffusion kérdések

Mit érdemes tudni telepítés előtt

Ezek a kérdések döntik el, hogy Önnek való-e a self-hosting.

Milyen hardverre van tényleg szükségem?

A kötött erőforrás a videomemória, nem a nyers sebesség. Régebbi, de bő memóriájú kártyák gyakran jobban teljesítenek az újabb, de kisebb memóriájúaknál ennél a feladatnál.

Megéri még megtanulni?

Ha reprodukálhatóság, mennyiség, adatvédelem vagy szerkezeti kontroll kell, igen. Ha jó képet szeretne beállítás nélkül, egy hosztolt modell gyorsabban odavisz.

Melyik verziót használjam?

Teljesen attól függ, melyik ökoszisztémára van szüksége. A régebbiekhez sokkal több közösségi eszköz van; az újak jobb alapszínvonalat és több feltételes licencet adnak.

Használhatom kereskedelmi célra a kimenetet?

Ellenőrizze a konkrét verzió és minden checkpoint és LoRA licencét a stackben. Az „open weights” és a „bármire szabad” állítás jó ideje nem ugyanaz.

Miért gyengébb a képem, mint a példák?

Szinte mindig a checkpoint, nem a prompt. A közösségi példák többnyire erősen finomhangolt checkpointon készülnek, nem az alapmodellen.

Leváltja a FLUX?

A kimeneti minőséget tekintve nagyrészt megelőzte. A checkpointok, adapterek és kontroll eszköztár készletében viszont még semmi nem váltotta le.

MI által generált élelmiszerfotó nappali fényben

Fedezze fel tovább

Máshol a LaFoto oldalán

Az itteni fogalmak akkor is érvényesek, bármit is futtat.

Stable Diffusion — questions people ask

Mi a Stable Diffusion?
Nyíltan kiadott, szövegből képet készítő modell a Stability AI-tól, „latent diffusion” alapokon, amely letölthető és fogyasztói hardveren is futtatható, nem csak API-n keresztül érhető el.
Ingyenes a Stable Diffusion?
A súlyok nyíltan elérhetők, és helyben futtatva nincs képenkénti költség, de a licencfeltételek verziónként eltérnek, és a későbbi kiadások szigorúbbak. Mindig ellenőrizze az adott verzió licencét a tervezett felhasználáshoz.
Mit jelent a latent diffusion?
A modell egy kép tömörített reprezentációján dolgozik, nem teljes felbontású pixeleken, majd a végén dekódál képpé. Ez tette elég olcsóvá ahhoz, hogy hétköznapi grafikus kártyán fusson.
Mi az a LoRA a Stable Diffusionben?
Kis kiegészítő fájl, amellyel az alapmodellt egy konkrét stílusra, témára vagy karakterre lehet „megtanítani” a teljes újratanítás nélkül. A közösség ezt használja a specializációk megosztására.
Mi a ControlNet?
Olyan kiterjesztés, amely a generálást szerkezeti bemenethez — például pózvázhoz, mélységtérképhez vagy élrajzhoz — köti, így rögzíthető a kompozíció, miközben a modell dönt minden másról.
Kell jó videokártya a Stable Diffusion futtatásához?
Helyi futtatáshoz igen — a videomemória a szűk keresztmetszet. A hosztolt szolgáltatások ezt a követelményt leveszik a válláról, a saját futtatás által adott kontroll árán.
Még mindig a legjobb képes modell a Stable Diffusion?
Nyers kimeneti minőségben nem; az újabb modellek általában szó szerint követik a promptokat és jobban írnak ki szöveget. Az előnye ma a köré épült közösségi eszközkészlet mélysége.
Miért beszél mindenki seedekről és samplerekről?
Ezeket a kontrollokat a nyílt közösség hozta felszínre és nevezte el, miközben ezzel a modellel dolgozott, és a szókészlet onnan terjedt át a teljes területre.

Kezdjen alkotni még ma

Generálja le első képét a legjobb AI képgenerátorral.

Egy mondatból másodpercek alatt kész, fotórealisztikus kép — majd finomítsa a részleteket. Nincs setup, nincs Discord, nincs GPU.

Csatlakozzon 4200+ alkotóhoz, akik a LaFotót használják