Hoppa till innehåll
LaFoto

Stability AI · model directory

Vad är Stable Diffusion? Den öppna modellen som allt annat lånade från

Stable Diffusion är en öppet släppt latent diffusion-modell från Stability AI. Vad latent diffusion betyder, och varför öppna vikter var så avgörande.

Stable Diffusion är en text-till-bild-modell från Stability AI, släppt med öppna vikter så att vem som helst kan ladda ned och köra den på egen hårdvara. Tekniskt är det en latent diffusion-modell: i stället för att denoisa en bild i full upplösning arbetar den i ett komprimerat latent rum och dekodar resultatet i slutet, vilket gjorde den tillräckligt billig för att köra på ett konsumentgrafikkort.

Stable Diffusion at a glance

Utvecklare
Stability AI
Arkitektur
Latent diffusion
Vikter
Öppna, nedladdningsbara
Körs på
Konsument-GPU:er
Känd för
Sitt ekosystem
Tillägg
LoRA, ControlNet, checkpoints

Vad ”latent diffusion” betyder, utan matematik

En diffusion-modell lär sig genom att se bilder förstöras. Ta ett fotografi, lägg på lite brus, lägg på mer, fortsätt tills bara brus återstår, och träna ett nät att förutsäga vad som togs bort i varje steg. Kör nätet baklänges från rent brus och det målar en bild som aldrig funnits.

Att göra detta i full upplösning är enormt dyrt, eftersom varje steg verkar på varje pixel. Tricket med latent är att först komprimera bilden till en mycket mindre representation som behåller strukturen och kastar bort exakta pixlar, köra hela brusprocessen i det lilla utrymmet och först i slutet dekoda tillbaka till en riktig bild.

Det enskilda beslutet är skälet till att detta nådde vanliga användare. Det kapade kostnaden för generering med ungefär en tiopotens och tog bildgenerering till hårdvara någon redan kan äga, i stället för till ett hyrt kluster.

Öppna vikter och vad de satte i rörelse

Stability släppte modelfilerna själva i stället för bara ett API. Det är faktumet med längst konsekvenser, och det är lätt att underskatta nu när resultaten finns överallt.

Eftersom vem som helst kunde inspektera och modifiera modellen byggde communityn det kontrollager som basmodellen saknade. LoRA gjorde det möjligt att lära in en specifik stil eller ett motiv med en liten tilläggsfil i stället för att träna om något. ControlNet gjorde det möjligt att begränsa en generering till en pose, en djupkarta eller en kantteckning. Community-checkpoints specialiserade basmodellen för illustration, fotografi, arkitektur och allt annat.

Vokabulären som kom ur den perioden är nu hur folk talar om bildgenerering generellt — seed, sampler, denoise-styrka, CFG, inpainting. De orden populariserades av en öppen community som läste och skrev om en modell de faktiskt kunde öppna, och de är skälet till att ordlistan på den här sajten är skriven som den är.

Hur det faktiskt är att köra själv

Bättre än förr och fortfarande inte slentrian. Det finns one-click-installers och node-baserade gränssnitt av verklig komplexitet, och avståndet mellan ”jag genererade en bild” och ”jag fick bilden jag ville ha” är där tiden går.

Belöningen är kontroll som hostade produkter inte erbjuder: exakta seeds, godtyckliga upplösningar, vilket checkpoint eller vilken LoRA du vill, ingen innehållskedja mellan dig och utdata, ingen per-bild-kostnad efter hårdvaran, och inget som lämnar din maskin.

Kostnaden är att du nu driver ett litet stycke infrastruktur. Modelfiler är på flera gigabyte styck, tillägg krockar med varandra, och ett grafikkort med tillräckligt minne är inträdesbiljetten. De som vill ha en bild är oftast nöjdare med en hostad modell; de som vill ha en process är de som stannar.

Var det står nu

Det är inte längre automatiskt starkast på rå output-kvalitet, och flera nyare modeller — inklusive FLUX, delvis byggd av personer som arbetat med Stable Diffusion — följer prompts mer bokstavligt och renderar läsbar text betydligt bättre.

Det som består är ekosystemet. Mängden community-checkpoints, stiladaptrar och kontrollverktyg byggda på äldre versioner är inget en ny modell snabbt skaffar sig, och för dig med en specifik stil att återskapa eller en pipeline redan byggd väger det lagret tyngre än en generell kvalitetslucka.

Efterföljande versioner har också skeppats under alltmer villkorade licenser jämfört med de tidiga släppen, vilket är värt att kontrollera mot din tänkta användning i stället för att anta. ”Öppna vikter” och ”fritt för allt” slutade vara samma sak för länge sedan.

Att läsa resten av sajten genom denna lins

Nästan varje tekniksida här använder termer som den här modellen populariserade. Denoise-styrka avgör hur långt ett image-to-image-resultat avviker från sin input. En seed gör en generering upprepbar. Inpainting redigerar inom en mask och lämnar resten orört. De koncepten gäller oavsett vilken modell du till slut använder.

Det är det ärliga skälet att förstå Stable Diffusion även om du aldrig installerar den: det är modellen vars gränssnitt läckte in i språket. Lär dig den en gång och varje annat verktyg blir lättare att läsa.

Den öppna modellen

Varför det betydde mer att släppa vikterna än modellen

Den tekniska bedriften var att göra diffusion tillräckligt billigt för ett konsumentgrafikkort. Det avgörande var att publicera filerna så att vem som helst kunde öppna dem.

Allt nedströms — LoRA:er, ControlNet, community-checkpoints, hela vokabulären av seeds och samplers — finns för att tusentals personer kunde läsa och ändra en fungerande bildmodell istället för att anropa en som en svart låda.

En uppslagen teknisk manual bredvid fotografiska kontaktkartor på ett ljust arbetsbord

Tre lager i ekosystemet

Vad folk faktiskt lägger ovanpå basmodellen

Byta ut själva modellen

Ett checkpoint är hela viktsättet. Finjustering av basen på ett smalare bildurval — fotografi, illustration, arkitektur — ger en modell med annan grundkaraktär och andra kompetenser.

Du laddar in exakt ett åt gången, och det är beslutet som påverkar utgången mest.

  • Flera gigabyte styck.
  • Ett laddat åt gången.
  • Licenser och proveniens varierar kraftigt.
Ett AI-genererat produktstilleben

Frågor om Stable Diffusion

Vad du bör veta innan du installerar något

Frågorna som avgör om självhosting passar dig.

Vilken hårdvara behöver jag egentligen?

Videominne är den bindande begränsningen snarare än rå hastighet. Äldre kort med gott om minne överträffar ofta nyare med mindre för just den här lasten.

Är det fortfarande värt att lära sig?

Behöver du reproducerbarhet, volym, integritet eller strukturell kontroll — ja. Vill du ha bra bilder utan setup går en hostad modell snabbare.

Vilken version ska jag använda?

Det beror helt på vilket ekosystem du behöver. Äldre versioner har vida mer community-verktyg; nyare har bättre baskvalitet och mer villkorade licenser.

Kan jag använda utgången kommersiellt?

Kontrollera licensen för den specifika versionen och för varje checkpoint och LoRA i stacken. "Öppna vikter" och "fri för allt" slutade vara samma sak för ett tag sedan.

Varför ser mina resultat sämre ut än exemplen?

Nästan alltid checkpoint:et snarare än prompten. Community-exempel genereras vanligtvis på ett hårt finjusterat checkpoint snarare än basmodellen.

Ersätts den av FLUX?

På utgångskvalitet har den till stor del blivit omsprungen. På inventoryn av checkpoints, adaptrar och kontrollverktyg har inget ersatt den ännu.

Ett AI-genererat matfotografi i dagsljus

Fortsätt utforska

På andra ställen på LaFoto

Koncepten här gäller oavsett vad du kör.

Stable Diffusion — questions people ask

Vad är Stable Diffusion?
En öppet släppt text-till-bild-modell från Stability AI, baserad på latent diffusion, som kan laddas ned och köras på konsumenthårdvara i stället för att bara nås via ett API.
Är Stable Diffusion gratis?
Vikterna har släppts öppet och kan köras lokalt utan per-bild-kostnad, men licensvillkor skiljer mellan versioner och senare släpp har fler villkor. Kontrollera licensen för just den versionen mot din tänkta användning.
Vad betyder latent diffusion?
Modellen arbetar på en komprimerad representation av en bild i stället för på fullupplösta pixlar och dekodar sedan till en bild på slutet. Det är vad som gjorde den tillräckligt billig för att köra på ett vanligt grafikkort.
Vad är en LoRA i Stable Diffusion?
En liten tilläggsfil som lär basmodellen en specifik stil, ett motiv eller en karaktär utan att träna om hela modellen. Det är standardmetoden communityn delar specialiseringar med.
Vad är ControlNet?
Ett tillägg som begränsar en generering till en strukturell input såsom ett pos-skelett, en djupkarta eller en kantteckning, så att du kan låsa kompositionen medan modellen väljer resten.
Behöver jag ett bra grafikkort för att köra Stable Diffusion?
För att köra lokalt, ja — videominne är den bindande begränsningen. Hostade tjänster tar bort kravet till priset av den kontroll du får av att köra själv.
Är Stable Diffusion fortfarande den bästa bildmodellen?
Inte på rå output-kvalitet; nyare modeller följer generellt prompts mer bokstavligt och renderar text bättre. Dess fördel nu är djupet i communityns verktyg runt den.
Varför pratar folk om seeds och samplers?
Det är kontroller som den öppna communityn lyfte fram och namngav när de arbetade med den här modellen, och vokabulären spreds därifrån till resten av fältet.

Börja skapa idag

Generera din första bild med den bästa AI-bildgeneratorn.

Gör en mening till en färdig, fotorealistisk bild på sekunder — och finslipa sedan varje detalj. Ingen setup, ingen Discord, inget GPU-krav.

Gå med bland 4 200+ kreatörer som använder LaFoto