Stability AI · model directory
Vad är Stable Diffusion? Den öppna modellen som allt annat lånade från
Stable Diffusion är en öppet släppt latent diffusion-modell från Stability AI. Vad latent diffusion betyder, och varför öppna vikter var så avgörande.
Stable Diffusion at a glance
- Utvecklare
- Stability AI
- Arkitektur
- Latent diffusion
- Vikter
- Öppna, nedladdningsbara
- Körs på
- Konsument-GPU:er
- Känd för
- Sitt ekosystem
- Tillägg
- LoRA, ControlNet, checkpoints
Vad ”latent diffusion” betyder, utan matematik
En diffusion-modell lär sig genom att se bilder förstöras. Ta ett fotografi, lägg på lite brus, lägg på mer, fortsätt tills bara brus återstår, och träna ett nät att förutsäga vad som togs bort i varje steg. Kör nätet baklänges från rent brus och det målar en bild som aldrig funnits.
Att göra detta i full upplösning är enormt dyrt, eftersom varje steg verkar på varje pixel. Tricket med latent är att först komprimera bilden till en mycket mindre representation som behåller strukturen och kastar bort exakta pixlar, köra hela brusprocessen i det lilla utrymmet och först i slutet dekoda tillbaka till en riktig bild.
Det enskilda beslutet är skälet till att detta nådde vanliga användare. Det kapade kostnaden för generering med ungefär en tiopotens och tog bildgenerering till hårdvara någon redan kan äga, i stället för till ett hyrt kluster.
Öppna vikter och vad de satte i rörelse
Stability släppte modelfilerna själva i stället för bara ett API. Det är faktumet med längst konsekvenser, och det är lätt att underskatta nu när resultaten finns överallt.
Eftersom vem som helst kunde inspektera och modifiera modellen byggde communityn det kontrollager som basmodellen saknade. LoRA gjorde det möjligt att lära in en specifik stil eller ett motiv med en liten tilläggsfil i stället för att träna om något. ControlNet gjorde det möjligt att begränsa en generering till en pose, en djupkarta eller en kantteckning. Community-checkpoints specialiserade basmodellen för illustration, fotografi, arkitektur och allt annat.
Vokabulären som kom ur den perioden är nu hur folk talar om bildgenerering generellt — seed, sampler, denoise-styrka, CFG, inpainting. De orden populariserades av en öppen community som läste och skrev om en modell de faktiskt kunde öppna, och de är skälet till att ordlistan på den här sajten är skriven som den är.
Hur det faktiskt är att köra själv
Bättre än förr och fortfarande inte slentrian. Det finns one-click-installers och node-baserade gränssnitt av verklig komplexitet, och avståndet mellan ”jag genererade en bild” och ”jag fick bilden jag ville ha” är där tiden går.
Belöningen är kontroll som hostade produkter inte erbjuder: exakta seeds, godtyckliga upplösningar, vilket checkpoint eller vilken LoRA du vill, ingen innehållskedja mellan dig och utdata, ingen per-bild-kostnad efter hårdvaran, och inget som lämnar din maskin.
Kostnaden är att du nu driver ett litet stycke infrastruktur. Modelfiler är på flera gigabyte styck, tillägg krockar med varandra, och ett grafikkort med tillräckligt minne är inträdesbiljetten. De som vill ha en bild är oftast nöjdare med en hostad modell; de som vill ha en process är de som stannar.
Var det står nu
Det är inte längre automatiskt starkast på rå output-kvalitet, och flera nyare modeller — inklusive FLUX, delvis byggd av personer som arbetat med Stable Diffusion — följer prompts mer bokstavligt och renderar läsbar text betydligt bättre.
Det som består är ekosystemet. Mängden community-checkpoints, stiladaptrar och kontrollverktyg byggda på äldre versioner är inget en ny modell snabbt skaffar sig, och för dig med en specifik stil att återskapa eller en pipeline redan byggd väger det lagret tyngre än en generell kvalitetslucka.
Efterföljande versioner har också skeppats under alltmer villkorade licenser jämfört med de tidiga släppen, vilket är värt att kontrollera mot din tänkta användning i stället för att anta. ”Öppna vikter” och ”fritt för allt” slutade vara samma sak för länge sedan.
Att läsa resten av sajten genom denna lins
Nästan varje tekniksida här använder termer som den här modellen populariserade. Denoise-styrka avgör hur långt ett image-to-image-resultat avviker från sin input. En seed gör en generering upprepbar. Inpainting redigerar inom en mask och lämnar resten orört. De koncepten gäller oavsett vilken modell du till slut använder.
Det är det ärliga skälet att förstå Stable Diffusion även om du aldrig installerar den: det är modellen vars gränssnitt läckte in i språket. Lär dig den en gång och varje annat verktyg blir lättare att läsa.
Den öppna modellen
Varför det betydde mer att släppa vikterna än modellen
Den tekniska bedriften var att göra diffusion tillräckligt billigt för ett konsumentgrafikkort. Det avgörande var att publicera filerna så att vem som helst kunde öppna dem.
Allt nedströms — LoRA:er, ControlNet, community-checkpoints, hela vokabulären av seeds och samplers — finns för att tusentals personer kunde läsa och ändra en fungerande bildmodell istället för att anropa en som en svart låda.

Tre lager i ekosystemet
Vad folk faktiskt lägger ovanpå basmodellen
Byta ut själva modellen
Ett checkpoint är hela viktsättet. Finjustering av basen på ett smalare bildurval — fotografi, illustration, arkitektur — ger en modell med annan grundkaraktär och andra kompetenser.
Du laddar in exakt ett åt gången, och det är beslutet som påverkar utgången mest.
- Flera gigabyte styck.
- Ett laddat åt gången.
- Licenser och proveniens varierar kraftigt.

Lägga till en sak utan omträning
En liten fil som lär det laddade checkpoint:et en specifik stil, figur eller ett objekt. Går att träna på ett enda konsumentkort på minuter till timmar.
Flera kan staplas med individuella vikter, vilket är där det mesta av den praktiska svårigheten ligger — två starka stil-LoRA:er motarbetar varandra.
- Tio till hundratals megabyte.
- Staplingsbara, med justerbar styrka.
- Bundna till en specifik basarkitektur.

Fixa struktur, frigör resten
Begränsar en generering till en strukturell indata — ett posesskelett, en djupkarta, en kantlinjeteckning — så att kompositionen bestäms av dig och resten av modellen.
Detta var förmågan som gjorde att bildgenerering gick från sampling till regi, och den har ingen ren motsvarighet i de flesta hostade produkter.
- Pose, djup, kanter, segmentering.
- Komposition fixerad, stil fri.
- Den främsta orsaken att själv-hosta.

Frågor om Stable Diffusion
Vad du bör veta innan du installerar något
Frågorna som avgör om självhosting passar dig.
Vilken hårdvara behöver jag egentligen?
Videominne är den bindande begränsningen snarare än rå hastighet. Äldre kort med gott om minne överträffar ofta nyare med mindre för just den här lasten.
Är det fortfarande värt att lära sig?
Behöver du reproducerbarhet, volym, integritet eller strukturell kontroll — ja. Vill du ha bra bilder utan setup går en hostad modell snabbare.
Vilken version ska jag använda?
Det beror helt på vilket ekosystem du behöver. Äldre versioner har vida mer community-verktyg; nyare har bättre baskvalitet och mer villkorade licenser.
Kan jag använda utgången kommersiellt?
Kontrollera licensen för den specifika versionen och för varje checkpoint och LoRA i stacken. "Öppna vikter" och "fri för allt" slutade vara samma sak för ett tag sedan.
Varför ser mina resultat sämre ut än exemplen?
Nästan alltid checkpoint:et snarare än prompten. Community-exempel genereras vanligtvis på ett hårt finjusterat checkpoint snarare än basmodellen.
Ersätts den av FLUX?
På utgångskvalitet har den till stor del blivit omsprungen. På inventoryn av checkpoints, adaptrar och kontrollverktyg har inget ersatt den ännu.

Termerna den här modellen namngav
Ordförråd som kom ur det öppna ekosystemet
Fortsätt utforska
På andra ställen på LaFoto
Koncepten här gäller oavsett vad du kör.
- ändra storlek på en bild
- JPG, PNG och WebP
- bildkompressor
- beskär till ett bildförhållande
- färgväljare från bild
- ta bort en bakgrund
- EXIF-visare
- AI-promptgenerator
- AI-generator för anime
- förvandla en bild till tecknad stil
- skapa pixelkonst
- den rankade jämförelsen
- jämfört med Midjourney
- LaFoto vs Leonardo AI
- jämfört med Ideogram
- jämfört med Canva
- återskapa en bild
- hur långt ett resultat kan avvika
- redigera innanför en mask
- LaFotos journal
Stable Diffusion — questions people ask
- Vad är Stable Diffusion?
- En öppet släppt text-till-bild-modell från Stability AI, baserad på latent diffusion, som kan laddas ned och köras på konsumenthårdvara i stället för att bara nås via ett API.
- Är Stable Diffusion gratis?
- Vikterna har släppts öppet och kan köras lokalt utan per-bild-kostnad, men licensvillkor skiljer mellan versioner och senare släpp har fler villkor. Kontrollera licensen för just den versionen mot din tänkta användning.
- Vad betyder latent diffusion?
- Modellen arbetar på en komprimerad representation av en bild i stället för på fullupplösta pixlar och dekodar sedan till en bild på slutet. Det är vad som gjorde den tillräckligt billig för att köra på ett vanligt grafikkort.
- Vad är en LoRA i Stable Diffusion?
- En liten tilläggsfil som lär basmodellen en specifik stil, ett motiv eller en karaktär utan att träna om hela modellen. Det är standardmetoden communityn delar specialiseringar med.
- Vad är ControlNet?
- Ett tillägg som begränsar en generering till en strukturell input såsom ett pos-skelett, en djupkarta eller en kantteckning, så att du kan låsa kompositionen medan modellen väljer resten.
- Behöver jag ett bra grafikkort för att köra Stable Diffusion?
- För att köra lokalt, ja — videominne är den bindande begränsningen. Hostade tjänster tar bort kravet till priset av den kontroll du får av att köra själv.
- Är Stable Diffusion fortfarande den bästa bildmodellen?
- Inte på rå output-kvalitet; nyare modeller följer generellt prompts mer bokstavligt och renderar text bättre. Dess fördel nu är djupet i communityns verktyg runt den.
- Varför pratar folk om seeds och samplers?
- Det är kontroller som den öppna communityn lyfte fram och namngav när de arbetade med den här modellen, och vokabulären spreds därifrån till resten av fältet.
De andra modellerna i katalogen
Börja skapa idag
Generera din första bild med den bästa AI-bildgeneratorn.
Gör en mening till en färdig, fotorealistisk bild på sekunder — och finslipa sedan varje detalj. Ingen setup, ingen Discord, inget GPU-krav.
Gå med bland 4 200+ kreatörer som använder LaFoto