Stability AI · model directory
Hva er Stable Diffusion? Den åpne modellen alt annet lånte fra
Stable Diffusion er en åpent utgitt latent diffusion-modell fra Stability AI. Hva latent diffusion betyr, og hvorfor åpne vekter var så viktige.
Stable Diffusion at a glance
- Produsent
- Stability AI
- Arkitektur
- Latent diffusjon
- Vekter
- Åpne, nedlastbare
- Kjører på
- Forbruker-grafikkort
- Kjent for
- Økosystemet
- Utvidelser
- LoRA, ControlNet, checkpoints
Hva «latent diffusion» betyr, uten matematikken
En diffusion-modell lærer ved å se bilder bli ødelagt. Ta et fotografi, tilsett litt støy, tilsett mer, fortsett til bare statisk gjenstår, og tren et nettverk til å forutsi hva som ble fjernet i hvert trinn. Kjør nettverket baklengs fra ren støy, og det maler et bilde som aldri var der.
Å gjøre dette i full oppløsning er enormt kostbart, fordi hvert trinn opererer på hver piksel. Latent-trikset er å komprimere bildet først til en mye mindre representasjon som bevarer strukturen og kaster de eksakte pikslene, kjøre hele støyprosessen i det lille rommet, og bare dekode tilbake til et ekte bilde helt til slutt.
Den ene beslutningen er grunnen til at dette nådde vanlige folk. Den kuttet generasjonskostnaden omtrent en størrelsesorden og brakte bildegenerering til maskinvare folk kan ha fra før, i stedet for en leid klynge.
Åpne vekter, og hva de utløste
Stability slapp selve modelfilene i stedet for bare et API. Det er faktumet med de lengste konsekvensene, og det er lett å undervurdere nå som resultatene er overalt.
Fordi hvem som helst kunne inspisere og modifisere modellen, bygde folk laget av kontroll som grunnmodellen manglet. LoRA-er gjorde det mulig å lære en spesifikk stil eller et motiv med en liten tilleggsfil i stedet for å trene alt på nytt. ControlNet gjorde det mulig å binde en generering til en positur, et dybdekart eller en kanttegning. Fellesskapets checkpoints spesialiserte grunnmodellen for illustrasjon, fotografi, arkitektur og alt annet.
Vokabularet som kom ut av den perioden, er nå måten folk snakker om bildegenerering generelt — seed, sampler, denoise strength, CFG, inpainting. De ordene ble popularisert av et åpent miljø som leste og omskrev en modell de faktisk kunne åpne, og er grunnen til at ordlisten på dette nettstedet er skrevet slik den er.
Hvordan det faktisk er å kjøre den selv
Bedre enn før og fortsatt ikke uanstrengt. Det finnes ett-klikk-installasjoner, og det finnes node-baserte grensesnitt med reell kompleksitet, og avstanden mellom «jeg genererte et bilde» og «jeg fikk bildet jeg ville ha», er der tiden går.
Gevinsten er kontroll som hostede produkter ikke tilbyr: eksakte seeds, vilkårlige oppløsninger, enhver checkpoint eller LoRA du vil, ingen innholdsprosess mellom deg og output, ingen per-bilde-kostnad etter maskinvaren, og ingenting som forlater maskinen din.
Kostnaden er at du nå driver et lite stykke infrastruktur. Modelfiler er på flere gigabyte hver, utvidelser kolliderer, og et grafikkort med nok minne er inngangsbilletten. Folk som vil ha et bilde, blir ofte mer fornøyd med en hostet modell; folk som vil ha en prosess, er de som blir.
Hvor det står nå
Det er ikke lenger automatisk det sterkeste alternativet på rå bildekvalitet, og flere nyere modeller — inkludert FLUX, delvis bygget av folk som jobbet på Stable Diffusion — følger prompter mer bokstavelig og gjengir lesbar tekst langt bedre.
Det som består, er økosystemet. Mengden fellesskaps-checkpoints, stiladaptere og kontrollverktøy bygget på de eldre versjonene er ikke noe en nyere modell får raskt, og for alle som har en spesifikk stil å reprodusere eller en pipeline allerede bygget, veier den beholdningen tyngre enn et generelt kvalitetsgap.
Påfølgende versjoner er også lansert med stadig mer betingede lisenser enn de tidlige utgavene, noe som er verdt å sjekke opp mot bruken du har tenkt, i stedet for å anta. «Åpne vekter» og «gratis til alt» sluttet å være det samme utsagnet for en tid siden.
Å lese resten av dette nettstedet gjennom den
Nesten hver teknikk-side her bruker termer denne modellen populariserte. Denoise strength bestemmer hvor langt et image-to-image-resultat får avvike fra input. En seed gjør en generering repeterbar. Inpainting redigerer innenfor en maske og lar resten være urørt. De konseptene gjelder uansett hvilken modell du til slutt bruker.
Det er den ærlige grunnen til å forstå Stable Diffusion selv om du aldri installerer den: det er modellen hvis grensesnitt lekket inn i språket. Lær det én gang, og hvert annet verktøy blir lettere å lese.
Den åpne modellen
Hvorfor det å slippe vektene betydde mer enn modellen i seg selv
Den tekniske bragden var å gjøre diffusion billig nok for et forbruker-grafikkort. Den avgjørende beslutningen var å publisere filene slik at alle kunne åpne dem.
Alt nedstrøms — LoRA-er, ControlNet, community-checkpoints, hele vokabularet av seeds og samplere — finnes fordi tusenvis kunne lese og endre en fungerende bildemodell i stedet for å spørre en gjennom en luke.

Tre lag i økosystemet
Hva folk faktisk legger oppå basismodellen
Bytte selve modellen
Et checkpoint er hele settet med vekter. Finjustering av basen på et smalere korpus — fotografi, illustrasjon, arkitektur — gir en modell med en annen grunnkarakter og andre ferdigheter.
Du laster nøyaktig ett om gangen, og det er beslutningen med størst effekt på hva som kommer ut.
- Flere gigabyte hver.
- Ett lastet om gangen.
- Lisenser og proveniens varierer mye.

Legge til én ting uten å trene på nytt
En liten fil som lærer det lastede checkpointet en spesifikk stil, figur eller gjenstand. Kan trenes på et enkelt forbrukerkort på minutter til timer.
Flere kan stables med individuelle styrker, og det er der mye av den praktiske vansken ligger — to sterke stil-LoRA-er kjemper mot hverandre.
- Titusener til hundrevis av megabyte.
- Kan stables, med justerbar styrke.
- Knyttet til en bestemt basiskonstruksjon.

Feste struktur, frigjøre resten
Begrenser en generering til et strukturelt innsignal — et poseskjelett, et dybdekart, en kanttegning — slik at komposisjonen bestemmes av deg og resten av modellen.
Dette er evnen som gjorde bildegenerering til regi i stedet for prøvetaking, og som ikke har noen ren ekvivalent i de fleste hostede produkter.
- Poser, dybde, kanter, segmentering.
- Komposisjon låst, stil fri.
- Hovedgrunnen til at folk selvhoster.

Stable Diffusion-spørsmål
Hva du bør vite før du installerer noe
Spørsmålene som avgjør om selvhosting passer for deg.
Hvilken maskinvare trenger jeg egentlig?
Videominne er den bindende begrensningen, ikke rå hastighet. Eldre kort med romslig minne overgår ofte nyere med mindre for denne arbeidslasten.
Er det fortsatt verdt å lære?
Hvis du trenger reproduserbarhet, volum, personvern eller strukturell kontroll, ja. Hvis du vil ha gode bilder uten oppsett, kommer en hostet modell raskere dit.
Hvilken versjon bør jeg bruke?
Det avhenger helt av hvilket økosystem du trenger. Eldre versjoner har langt mer community-verktøy; nyere har bedre grunnkvalitet og flere betingede lisenser.
Kan jeg bruke utdata kommersielt?
Sjekk lisensen for den spesifikke versjonen og for hvert checkpoint og hver LoRA i stakken. «Åpne vekter» og «fritt til alt» sluttet å være det samme for en tid siden.
Hvorfor ser resultatene mine dårligere ut enn eksemplene?
Nesten alltid checkpointet, ikke prompten. Community-eksempler er som regel generert på et tungt finjustert checkpoint, ikke på basemodellen.
Blir den erstattet av FLUX?
På bildekvalitet er den i stor grad forbigått. På beholdningen av checkpoints, adaptere og kontrollverktøy er den ennå ikke erstattet.

Begrepene denne modellen navnga
Vokabular som kom ut av det åpne økosystemet
Utforsk videre
Andre steder på LaFoto
Konseptene her gjelder uansett hva du ender med å kjøre.
- endre størrelsen på et bilde
- JPG, PNG og WebP
- bildekompressor
- beskjær til et sideforhold
- fargeplukker fra bilde
- fjern en bakgrunn
- EXIF-viser
- AI prompt-generator
- anime AI-generator
- gjør et bilde om til tegneserie
- lag pikselkunst
- den rangerte sammenligningen
- sammenlignet med Midjourney
- LaFoto vs Leonardo AI
- sammenlignet med Ideogram
- sammenlignet med Canva
- reprodusere et bilde
- hvor langt et resultat kan avvike
- redigering innenfor en maske
- LaFoto-journalen
Stable Diffusion — questions people ask
- Hva er Stable Diffusion?
- En åpent utgitt tekst-til-bilde-modell fra Stability AI, basert på latent diffusion, som kan lastes ned og kjøres på egen maskinvare i stedet for bare å nås via et API.
- Er Stable Diffusion gratis?
- Vektene er utgitt åpent og kan kjøres lokalt uten per-bilde-kostnad, men lisensvilkår varierer mellom versjoner og senere utgivelser har flere betingelser. Sjekk lisensen for den spesifikke versjonen opp mot bruken du planlegger.
- Hva betyr latent diffusion?
- Modellen gjør jobben sin på en komprimert representasjon av et bilde i stedet for på piksler i full oppløsning, og dekoder deretter til et bilde til slutt. Det er det som gjorde det billig nok til å kjøre på et vanlig grafikkort.
- Hva er en LoRA i Stable Diffusion?
- En liten tilleggsfil som lærer grunnmodellen en spesifikk stil, et motiv eller en karakter uten å trene hele modellen på nytt. Det er standardmåten fellesskapet deler spesialiseringer på.
- Hva er ControlNet?
- En utvidelse som begrenser en generering til et strukturelt input som et pose-skjelett, et dybdekart eller en kanttegning, slik at du kan låse komposisjonen mens modellen bestemmer alt annet.
- Trenger jeg et godt grafikkort for å kjøre Stable Diffusion?
- For å kjøre den lokalt, ja — videominne er den bindende begrensningen. Hostede tjenester fjerner kravet mot at du mister noe av kontrollen du får ved å kjøre selv.
- Er Stable Diffusion fortsatt den beste bildemodellen?
- Ikke på rå bildekvalitet; nyere modeller følger prompter mer bokstavelig og gjengir tekst bedre. Fordelen nå er dybden i fellesskapsverktøyene rundt den.
- Hvorfor snakker folk om seeds og samplere?
- Det er kontroller det åpne miljøet løftet frem og navnga mens de jobbet med denne modellen, og vokabularet spredte seg derfra til resten av feltet.
De andre modellene i katalogen
Start å skape i dag
Generer ditt første bilde med den beste AI-bildegeneratoren.
Gjør en setning om til et ferdig, fotorealistisk bilde på sekunder — og finpuss hver detalj. Ingen oppsett, ingen Discord, ingen GPU.
Bli med 4 200+ skapere som bruker LaFoto