Spring til indhold
LaFoto

Stability AI · model directory

Hvad er Stable Diffusion? Den åbne model, alt andet lånte fra

Stable Diffusion er en åbent udgivet latent diffusion-model fra Stability AI. Hvad latent diffusion betyder, og hvorfor åbne vægte havde så stor betydning.

Stable Diffusion er en tekst-til-billede-model fra Stability AI, udgivet med åbne vægte, så alle kan downloade og køre den på eget hardware. Teknisk er det en latent diffusion-model: i stedet for at fjerne støj fra et billede i fuld opløsning arbejder den i et komprimeret latent rum og dekoder resultatet til sidst — hvilket gjorde det billigt nok til at køre på et helt almindeligt grafikkort.

Stable Diffusion at a glance

Udvikler
Stability AI
Arkitektur
latent diffusion
Vægte
Åbne, downloadbare
Kører på
Forbruger-GPU’er
Kendt for
Sitt økosystem
Udvidelser
LoRA, ControlNet, checkpoints

Hvad "latent diffusion" betyder — uden matematikken

En diffusion-model lærer ved at se billeder blive ødelagt. Tag et foto, tilføj lidt støj, tilføj mere, fortsæt indtil kun statisk er tilbage, og træn et netværk til at forudsige, hvad der blev fjernet i hvert trin. Kør netværket baglæns fra ren statisk, og det maler et billede, der aldrig var der.

At gøre dette i fuld opløsning er ekstremt dyrt, fordi hvert trin opererer på hver pixel. Tricket i latent-rummet er at komprimere billedet først til en meget mindre repræsentation, der bevarer strukturen og smider de præcise pixels væk, køre hele støjprocessen i det lille rum og kun dekode tilbage til et rigtigt billede allerøverst.

Den ene beslutning er grunden til, at det her nåede almindelige mennesker. Den sænkede omkostningen ved generering omtrent en størrelsesorden og bragte billedgenerering ned på hardware, man allerede kunne eje, i stedet for en lejet klynge.

Åbne vægte — og hvad de satte i gang

Stability udgav selve modelfilerne i stedet for kun en API. Det er den kendsgerning med de længste konsekvenser, og det er let at undervurdere nu, hvor resultaterne er overalt.

Fordi alle kunne inspicere og ændre modellen, byggede folk det kontrol-lag, basis-modellen manglede. LoRAer gjorde det muligt at lære en bestemt stil eller et motiv med en lille tilføjelsesfil i stedet for at retræne noget. ControlNet gjorde det muligt at begrænse en generering til et pose-skelet, et dybdemap eller en kanttegning. Community-checkpoints specialiserede basismodellen til illustration, fotografi, arkitektur og alt muligt andet.

Vokabularet, der kom ud af den periode, er i dag, hvordan folk taler om billedgenerering generelt — seed, sampler, denoise strength, CFG, inpainting. De ord blev populariseret af et åbent community, der læste og omskrev en model, de faktisk kunne åbne — og de er grunden til, at ordlisten på dette site er skrevet, som den er.

Hvordan det reelt er at køre den selv

Bedre end før og stadig ikke tilfældigt. Der findes one-click-installers, og der findes node-baserede interfaces med reel kompleksitet — og afstanden mellem "jeg genererede et billede" og "jeg fik det billede, jeg ville have" er der, tiden går.

Belønningen er kontrol, som hostede produkter ikke tilbyder: præcise seeds, vilkårlige opløsninger, ethvert checkpoint eller LoRA du vil, ingen indholds-pipeline mellem dig og outputtet, ingen per-billede-omkostning efter hardwaren, og intet der forlader din maskine.

Prisen er, at du nu driver et lille stykke infrastruktur. Modelfiler fylder adskillige gigabytes hver, udvidelser konflikter med hinanden, og et grafikkort med nok hukommelse er adgangsbilletten. Folk, der vil have et billede, er typisk gladere med en hosted model; folk, der vil have en proces, er dem, der bliver.

Hvor den står nu

Den er ikke længere automatisk det stærkeste valg på rå billedkvalitet, og flere nyere modeller — inklusive FLUX, delvist bygget af folk, der arbejdede på Stable Diffusion — følger prompts mere bogstaveligt og gengiver læsbar tekst langt bedre.

Det den bevarer, er økosystemet. Mængden af community-checkpoints, stiladaptere og kontrol-værktøjer bygget på de ældre versioner er ikke noget, en nyere model hurtigt opbygger — og for alle med en bestemt stil at genskabe eller en pipeline allerede etableret opvejer det lager en generel kvalitetsforskel.

Efterfølgende versioner er også udkommet under gradvist mere betingede licenser end de tidlige udgivelser — hvilket er værd at tjekke op mod din tiltænkte brug i stedet for at antage. "Åbne vægte" og "gratis til alt" holdt op med at være samme udsagn for noget tid siden.

At læse resten af sitet gennem den linse

Næsten hver teknikside her bruger termer, som denne model populariserede. Denoise strength afgør, hvor langt et image-to-image-resultat afviger fra sit input. Et seed gør en generering gentagelig. Inpainting redigerer inde i en maske og lader resten være urørt. De begreber gælder, uanset hvilken model du ender med at bruge.

Det er den ærlige grund til at forstå Stable Diffusion, selv hvis du aldrig installerer den: det er modellen, hvis interface sivede ud i sproget. Lær det én gang, og alle andre værktøjer bliver lettere at læse.

Den åbne model

Hvorfor det at frigive vægtene betød mere end modellen gjorde

Den tekniske bedrift var at gøre diffusion billig nok til et forbrugergrafikkort. Den beslutning, der fik konsekvenser, var at udgive filerne, så alle kunne åbne dem.

Alt nedstrøms — LoRAer, ControlNet, community-checkpoints, hele vokabularet af seeds og samplere — findes fordi tusinder kunne læse og ændre en fungerende billedmodel i stedet for kun at spørge en igennem en sluse.

En åben teknisk manual ved siden af fotografiske kontaktark på en lys arbejdsflade

Tre lag i økosystemet

Hvad folk faktisk lægger oven på basismodellen

At bytte selve modellen

Et checkpoint er hele sættet af vægte. Finjustering af basen på en smallere billedsamling — fotografi, illustration, arkitektur — giver en model med en anden grundkarakter og andre kompetencer.

Du indlæser præcis ét ad gangen, og det er den beslutning, der har størst effekt på, hvad der kommer ud.

  • Flere gigabyte hver.
  • Ét indlæst ad gangen.
  • Licenser og oprindelse varierer bredt.
AI-genereret produktstilleben

Stable Diffusion-spørgsmål

Det du bør vide før installation

Spørgsmålene der afgør, om selvhosting er for dig.

Hvilken hardware har jeg egentlig brug for?

Videohukommelse er den snærende begrænsning snarere end rå hastighed. Ældre kort med rigelig hukommelse overgår ofte nyere med mindre — til netop denne arbejdsbyrde.

Er det stadig værd at lære?

Hvis du har brug for reproducerbarhed, volumen, privatliv eller strukturel kontrol — ja. Hvis du vil have gode billeder uden opsætning, kommer en hostet model hurtigere i mål.

Hvilken version skal jeg bruge?

Det afhænger helt af, hvilket økosystem du har brug for. Ældre versioner har langt mere community-værktøj; nyere har bedre basiskvalitet og flere betingede licenser.

Må jeg bruge outputtet kommercielt?

Tjek licensen for den specifikke version og for hvert checkpoint og hver LoRA i stakken. "Åbne vægte" og "fri til alt" holdt op med at være det samme for længe siden.

Hvorfor ser mine resultater værre ud end eksemplerne?

Næsten altid checkpointet snarere end prompten. Community-eksempler er typisk lavet på et tungt finjusteret checkpoint — ikke på basismodellen.

Bliver den afløst af FLUX?

På outputkvalitet er den i høj grad overhalet. På beholdningen af checkpoints, adaptere og kontrolværktøjer er intet endnu trådt i stedet.

Et AI-genereret madfotografi i dagslys

Udforsk videre

Andre steder på LaFoto

Begreberne her gælder uanset hvad du ender med at køre.

Stable Diffusion — questions people ask

Hvad er Stable Diffusion?
En åbent udgivet tekst-til-billede-model fra Stability AI, baseret på latent diffusion, som kan downloades og køres på forbrugshardware i stedet for kun at være tilgængelig via en API.
Er Stable Diffusion gratis?
Vægtene er udgivet åbent og kan køres lokalt uden per-billede-omkostning, men licensvilkår varierer mellem versioner, og senere udgivelser har flere betingelser. Tjek licensen for den specifikke version mod din tiltænkte brug.
Hvad betyder latent diffusion?
Modellen arbejder på en komprimeret repræsentation af et billede i stedet for på pixels i fuld opløsning, og dekoder så til et billede til sidst. Det gjorde det billigt nok at køre på et almindeligt grafikkort.
Hvad er en LoRA i Stable Diffusion?
En lille tilføjelsesfil, der lærer basismodellen en specifik stil, et motiv eller en karakter uden at retræne hele modellen. Det er standardmåden, communityet deler specialiseringer på.
Hvad er ControlNet?
En udvidelse, der begrænser en generering til et strukturelt input som fx et pose-skelet, et dybdemap eller en kanttegning, så du kan låse kompositionen, mens modellen afgør resten.
Skal jeg have et godt grafikkort for at køre Stable Diffusion?
For at køre den lokalt, ja — videohukommelse er den begrænsende faktor. Hostede tjenester fjerner det krav mod, at du opgiver noget af kontrollen ved at køre selv.
Er Stable Diffusion stadig den bedste billedmodel?
Ikke på rå outputkvalitet; nyere modeller følger prompts mere bogstaveligt og gengiver tekst bedre. Dens fordel nu er dybden af community-værktøjer omkring den.
Hvorfor taler folk om seeds og samplers?
Det er kontroller, det åbne community overfladede og navngav, mens de arbejdede med denne model — og vokabularet spredte sig derfra til resten af feltet.

Begynd at skabe i dag

Generér dit første billede med den bedste AI-billedgenerator.

Gør en sætning til et færdigt, fotorealistisk billede på få sekunder — og finpuds derefter hver detalje. Ingen opsætning, ingen Discord, ingen GPU.

Slut dig til 4.200+ skabere, der bruger LaFoto