Hopp til innhold
LaFoto

Stability AI · model directory

Hva er Stable Diffusion? Den åpne modellen alt annet lånte fra

Stable Diffusion er en åpent utgitt latent diffusion-modell fra Stability AI. Hva latent diffusion betyr, og hvorfor åpne vekter var så viktige.

Stable Diffusion er en tekst-til-bilde-modell fra Stability AI, utgitt med åpne vekter slik at hvem som helst kan laste den ned og kjøre den på egen maskinvare. Teknisk er den en latent diffusion-modell: i stedet for å denoise et bilde i full oppløsning, jobber den i et komprimert latent rom og dekoder resultatet til slutt, noe som gjorde det billig nok til å kjøre på et vanlig grafikkort.

Stable Diffusion at a glance

Produsent
Stability AI
Arkitektur
Latent diffusjon
Vekter
Åpne, nedlastbare
Kjører på
Forbruker-grafikkort
Kjent for
Økosystemet
Utvidelser
LoRA, ControlNet, checkpoints

Hva «latent diffusion» betyr, uten matematikken

En diffusion-modell lærer ved å se bilder bli ødelagt. Ta et fotografi, tilsett litt støy, tilsett mer, fortsett til bare statisk gjenstår, og tren et nettverk til å forutsi hva som ble fjernet i hvert trinn. Kjør nettverket baklengs fra ren støy, og det maler et bilde som aldri var der.

Å gjøre dette i full oppløsning er enormt kostbart, fordi hvert trinn opererer på hver piksel. Latent-trikset er å komprimere bildet først til en mye mindre representasjon som bevarer strukturen og kaster de eksakte pikslene, kjøre hele støyprosessen i det lille rommet, og bare dekode tilbake til et ekte bilde helt til slutt.

Den ene beslutningen er grunnen til at dette nådde vanlige folk. Den kuttet generasjonskostnaden omtrent en størrelsesorden og brakte bildegenerering til maskinvare folk kan ha fra før, i stedet for en leid klynge.

Åpne vekter, og hva de utløste

Stability slapp selve modelfilene i stedet for bare et API. Det er faktumet med de lengste konsekvensene, og det er lett å undervurdere nå som resultatene er overalt.

Fordi hvem som helst kunne inspisere og modifisere modellen, bygde folk laget av kontroll som grunnmodellen manglet. LoRA-er gjorde det mulig å lære en spesifikk stil eller et motiv med en liten tilleggsfil i stedet for å trene alt på nytt. ControlNet gjorde det mulig å binde en generering til en positur, et dybdekart eller en kanttegning. Fellesskapets checkpoints spesialiserte grunnmodellen for illustrasjon, fotografi, arkitektur og alt annet.

Vokabularet som kom ut av den perioden, er nå måten folk snakker om bildegenerering generelt — seed, sampler, denoise strength, CFG, inpainting. De ordene ble popularisert av et åpent miljø som leste og omskrev en modell de faktisk kunne åpne, og er grunnen til at ordlisten på dette nettstedet er skrevet slik den er.

Hvordan det faktisk er å kjøre den selv

Bedre enn før og fortsatt ikke uanstrengt. Det finnes ett-klikk-installasjoner, og det finnes node-baserte grensesnitt med reell kompleksitet, og avstanden mellom «jeg genererte et bilde» og «jeg fikk bildet jeg ville ha», er der tiden går.

Gevinsten er kontroll som hostede produkter ikke tilbyr: eksakte seeds, vilkårlige oppløsninger, enhver checkpoint eller LoRA du vil, ingen innholdsprosess mellom deg og output, ingen per-bilde-kostnad etter maskinvaren, og ingenting som forlater maskinen din.

Kostnaden er at du nå driver et lite stykke infrastruktur. Modelfiler er på flere gigabyte hver, utvidelser kolliderer, og et grafikkort med nok minne er inngangsbilletten. Folk som vil ha et bilde, blir ofte mer fornøyd med en hostet modell; folk som vil ha en prosess, er de som blir.

Hvor det står nå

Det er ikke lenger automatisk det sterkeste alternativet på rå bildekvalitet, og flere nyere modeller — inkludert FLUX, delvis bygget av folk som jobbet på Stable Diffusion — følger prompter mer bokstavelig og gjengir lesbar tekst langt bedre.

Det som består, er økosystemet. Mengden fellesskaps-checkpoints, stiladaptere og kontrollverktøy bygget på de eldre versjonene er ikke noe en nyere modell får raskt, og for alle som har en spesifikk stil å reprodusere eller en pipeline allerede bygget, veier den beholdningen tyngre enn et generelt kvalitetsgap.

Påfølgende versjoner er også lansert med stadig mer betingede lisenser enn de tidlige utgavene, noe som er verdt å sjekke opp mot bruken du har tenkt, i stedet for å anta. «Åpne vekter» og «gratis til alt» sluttet å være det samme utsagnet for en tid siden.

Å lese resten av dette nettstedet gjennom den

Nesten hver teknikk-side her bruker termer denne modellen populariserte. Denoise strength bestemmer hvor langt et image-to-image-resultat får avvike fra input. En seed gjør en generering repeterbar. Inpainting redigerer innenfor en maske og lar resten være urørt. De konseptene gjelder uansett hvilken modell du til slutt bruker.

Det er den ærlige grunnen til å forstå Stable Diffusion selv om du aldri installerer den: det er modellen hvis grensesnitt lekket inn i språket. Lær det én gang, og hvert annet verktøy blir lettere å lese.

Den åpne modellen

Hvorfor det å slippe vektene betydde mer enn modellen i seg selv

Den tekniske bragden var å gjøre diffusion billig nok for et forbruker-grafikkort. Den avgjørende beslutningen var å publisere filene slik at alle kunne åpne dem.

Alt nedstrøms — LoRA-er, ControlNet, community-checkpoints, hele vokabularet av seeds og samplere — finnes fordi tusenvis kunne lese og endre en fungerende bildemodell i stedet for å spørre en gjennom en luke.

En åpen teknisk manual ved siden av fotografiske kontaktark på en lys arbeidsbenk

Tre lag i økosystemet

Hva folk faktisk legger oppå basismodellen

Bytte selve modellen

Et checkpoint er hele settet med vekter. Finjustering av basen på et smalere korpus — fotografi, illustrasjon, arkitektur — gir en modell med en annen grunnkarakter og andre ferdigheter.

Du laster nøyaktig ett om gangen, og det er beslutningen med størst effekt på hva som kommer ut.

  • Flere gigabyte hver.
  • Ett lastet om gangen.
  • Lisenser og proveniens varierer mye.
AI-generert produkt-stilleben

Stable Diffusion-spørsmål

Hva du bør vite før du installerer noe

Spørsmålene som avgjør om selvhosting passer for deg.

Hvilken maskinvare trenger jeg egentlig?

Videominne er den bindende begrensningen, ikke rå hastighet. Eldre kort med romslig minne overgår ofte nyere med mindre for denne arbeidslasten.

Er det fortsatt verdt å lære?

Hvis du trenger reproduserbarhet, volum, personvern eller strukturell kontroll, ja. Hvis du vil ha gode bilder uten oppsett, kommer en hostet modell raskere dit.

Hvilken versjon bør jeg bruke?

Det avhenger helt av hvilket økosystem du trenger. Eldre versjoner har langt mer community-verktøy; nyere har bedre grunnkvalitet og flere betingede lisenser.

Kan jeg bruke utdata kommersielt?

Sjekk lisensen for den spesifikke versjonen og for hvert checkpoint og hver LoRA i stakken. «Åpne vekter» og «fritt til alt» sluttet å være det samme for en tid siden.

Hvorfor ser resultatene mine dårligere ut enn eksemplene?

Nesten alltid checkpointet, ikke prompten. Community-eksempler er som regel generert på et tungt finjustert checkpoint, ikke på basemodellen.

Blir den erstattet av FLUX?

På bildekvalitet er den i stor grad forbigått. På beholdningen av checkpoints, adaptere og kontrollverktøy er den ennå ikke erstattet.

Et AI-generert matfoto i dagslys

Utforsk videre

Andre steder på LaFoto

Konseptene her gjelder uansett hva du ender med å kjøre.

Stable Diffusion — questions people ask

Hva er Stable Diffusion?
En åpent utgitt tekst-til-bilde-modell fra Stability AI, basert på latent diffusion, som kan lastes ned og kjøres på egen maskinvare i stedet for bare å nås via et API.
Er Stable Diffusion gratis?
Vektene er utgitt åpent og kan kjøres lokalt uten per-bilde-kostnad, men lisensvilkår varierer mellom versjoner og senere utgivelser har flere betingelser. Sjekk lisensen for den spesifikke versjonen opp mot bruken du planlegger.
Hva betyr latent diffusion?
Modellen gjør jobben sin på en komprimert representasjon av et bilde i stedet for på piksler i full oppløsning, og dekoder deretter til et bilde til slutt. Det er det som gjorde det billig nok til å kjøre på et vanlig grafikkort.
Hva er en LoRA i Stable Diffusion?
En liten tilleggsfil som lærer grunnmodellen en spesifikk stil, et motiv eller en karakter uten å trene hele modellen på nytt. Det er standardmåten fellesskapet deler spesialiseringer på.
Hva er ControlNet?
En utvidelse som begrenser en generering til et strukturelt input som et pose-skjelett, et dybdekart eller en kanttegning, slik at du kan låse komposisjonen mens modellen bestemmer alt annet.
Trenger jeg et godt grafikkort for å kjøre Stable Diffusion?
For å kjøre den lokalt, ja — videominne er den bindende begrensningen. Hostede tjenester fjerner kravet mot at du mister noe av kontrollen du får ved å kjøre selv.
Er Stable Diffusion fortsatt den beste bildemodellen?
Ikke på rå bildekvalitet; nyere modeller følger prompter mer bokstavelig og gjengir tekst bedre. Fordelen nå er dybden i fellesskapsverktøyene rundt den.
Hvorfor snakker folk om seeds og samplere?
Det er kontroller det åpne miljøet løftet frem og navnga mens de jobbet med denne modellen, og vokabularet spredte seg derfra til resten av feltet.

Start å skape i dag

Generer ditt første bilde med den beste AI-bildegeneratoren.

Gjør en setning om til et ferdig, fotorealistisk bilde på sekunder — og finpuss hver detalj. Ingen oppsett, ingen Discord, ingen GPU.

Bli med 4 200+ skapere som bruker LaFoto