Direct naar inhoud
LaFoto

Stability AI · model directory

Wat is Stable Diffusion? Het open model waar de rest op leunde

Stable Diffusion is een openbaar uitgebracht latent-diffusion-model van Stability AI. Wat latent diffusion betekent, en waarom open gewichten zoveel uitmaakten.

Stable Diffusion is een text-to-image model van Stability AI, uitgebracht met open gewichten zodat iedereen het kan downloaden en op eigen hardware draaien. Technisch is het een latent diffusion-model: in plaats van een foto op volledige resolutie te denoisen, werkt het in een gecomprimeerde latente ruimte en decodeert het pas aan het eind, wat het goedkoop genoeg maakte voor een consumentenvideokaart.

Stable Diffusion at a glance

Fabrikant
Stability AI
Architectuur
Latente diffusie
Gewichten
Open, downloadbaar
Draait op
Consumenten-GPU’s
Bekend om
Het ecosysteem
Uitbreidingen
LoRA, ControlNet, checkpoints

Wat "latent diffusion" betekent, zonder de wiskunde

Een diffusion-model leert door te zien hoe beelden kapotgaan. Neem een foto, voeg een beetje ruis toe, voeg meer toe, ga door tot er alleen nog ruis overblijft, en train een netwerk om te voorspellen wat er bij elke stap is verwijderd. Voer dat netwerk achterwaarts uit vanaf pure ruis en het schildert een afbeelding die nooit bestond.

Dit op volledige resolutie doen is enorm kostbaar, omdat elke stap op elke pixel werkt. De latente truc is om de afbeelding eerst te comprimeren tot een veel kleinere representatie die de structuur bewaart en de exacte pixels weglaat, het hele ruisproces in die kleine ruimte te draaien en pas helemaal op het einde terug te decoderen naar een echte afbeelding.

Die ene keuze is waarom dit überhaupt gewone mensen bereikte. Het verlaagde de generatiekosten ruwweg met een orde van grootte en bracht beeldgeneratie naar hardware die iemand al kon hebben, in plaats van een gehuurde cluster.

Open gewichten, en wat dat in gang zette

Stability bracht de modelfiles zelf uit in plaats van alleen een API. Dat is het feit met de langste gevolgen, en het is gemakkelijk te onderschatten nu de resultaten overal zijn.

Omdat iedereen het model kon inzien en aanpassen, bouwden mensen de controlelaag die het basismodel miste. LoRA’s maakten het mogelijk om een specifieke stijl of onderwerp aan te leren met een klein add-on-bestand in plaats van iets helemaal te hertrainen. ControlNet maakte het mogelijk een generatie te begrenzen tot een pose, een dieptekaart of een lijnafbeelding. Community-checkpoints specialiseerden het basismodel voor illustratie, fotografie, architectuur en alles daartussen.

De woordenschat uit die periode is nu hoe men over beeldgeneratie praat — seed, sampler, denoise-sterkte, CFG, inpainting. Die termen zijn populair geworden door een open community die een model las en herschreef dat zij daadwerkelijk konden openen, en daarom is de glossariumsectie op deze site zo geschreven.

Hoe het echt is om het zelf te draaien

Beter dan vroeger en nog steeds niet achteloos. Er zijn one-click installers en er zijn node-based interfaces met echte complexiteit, en de afstand tussen "ik heb een afbeelding gegenereerd" en "ik kreeg de afbeelding die ik wilde" is waar de tijd gaat zitten.

De beloning is controle die hosted producten niet bieden: exacte seeds, willekeurige resoluties, elke checkpoint of LoRA die u wilt, geen contentpipeline tussen u en de output, geen kosten per afbeelding na de hardware, en niets dat uw machine verlaat.

De prijs is dat u nu een klein stuk infrastructuur beheert. Modelfiles lopen op tot meerdere gigabytes per stuk, uitbreidingen breken tegen elkaar, en een videokaart met genoeg geheugen is het toegangsbewijs. Mensen die een afbeelding willen, zijn doorgaans gelukkiger met een hosted model; mensen die een proces willen, zijn degenen die blijven.

Waar het nu staat

Het is niet langer automatisch de sterkste optie op ruwe outputkwaliteit, en meerdere nieuwere modellen — waaronder FLUX, deels gebouwd door mensen die aan Stable Diffusion werkten — volgen prompts letterlijker en renderen leesbare tekst veel beter.

Wat het behoudt is het ecosysteem. De omvang van community-checkpoints, stijladapters en controlegereedschap rond de oudere versies is niets wat een nieuwer model snel opbouwt, en voor iedereen met een specifieke stijl om te reproduceren of een bestaande pipeline weegt die inventaris zwaarder dan een algemeen kwaliteitsverschil.

Opeenvolgende versies zijn ook uitgebracht onder steeds voorwaardelijkere licenties dan de vroege releases, wat u moet toetsen aan uw beoogde gebruik in plaats van te veronderstellen. "Open gewichten" en "vrij voor alles" zijn al een tijdlang niet meer hetzelfde.

De rest van deze site hierdoor lezen

Bijna elke techniekpagina hier gebruikt termen die dit model populair maakte. Denoise-sterkte bepaalt hoe ver een image-to-image resultaat afwijkt van de input. Een seed maakt een generatie reproduceerbaar. Inpainting bewerkt binnen een masker en laat de rest onaangeroerd. Die concepten gelden welk model u uiteindelijk ook gebruikt.

Dat is de eerlijke reden om Stable Diffusion te begrijpen, zelfs als u het nooit installeert: het is het model waarvan de interface in de taal is gelekt. Leer het één keer en elk ander hulpmiddel wordt makkelijker te lezen.

Het open model

Waarom het vrijgeven van de gewichten belangrijker was dan het model zelf

De technische prestatie was diffusion goedkoop genoeg maken voor een consumentenvideokaart. De beslissende stap was de bestanden publiceren zodat iedereen ze kon openen.

Alles daarna — LoRA’s, ControlNet, community-checkpoints, de hele woordenschat van seeds en samplers — bestaat omdat duizenden mensen een werkend beeldmodel konden lezen en wijzigen in plaats van het via een loket te bevragen.

Een open technische handleiding naast fotografische contactvellen op een lichte werktafel

Drie lagen van het ecosysteem

Wat mensen daadwerkelijk boven op het basismodel zetten

Het model zelf wisselen

Een checkpoint is de volledige set gewichten. Het basismodel fijn-afstemmen op een smallere beeldverzameling — fotografie, illustratie, architectuur — levert een model op met een ander standaardkarakter en andere competenties.

U laadt er precies één tegelijk, en dit is de keuze met de grootste impact op de output.

  • Meerdere gigabytes per stuk.
  • Slechts één tegelijk geladen.
  • Licenties en herkomst variëren sterk.
Een door AI gegenereerd productstilleven

Stable Diffusion-vragen

Wat u wilt weten vóór u iets installeert

De vragen die bepalen of zelf-hosting bij u past.

Welke hardware heb ik echt nodig?

Videogeheugen is de beperkende factor, niet ruwe snelheid. Oudere kaarten met royaal geheugen presteren voor deze werklast vaak beter dan nieuwere met minder.

Is het nog de moeite waard om te leren?

Als u reproduceerbaarheid, volume, privacy of structurele controle nodig hebt: ja. Als u goede beelden zonder setup wilt: een hosted model brengt u er sneller.

Welke versie moet ik gebruiken?

Dat hangt volledig af van welk ecosysteem u nodig hebt. Oudere versies hebben veel meer community-tools; nieuwere hebben betere basiskwaliteit en vaker voorwaardelijke licenties.

Mag ik de output commercieel gebruiken?

Controleer de licentie van de specifieke versie én van elk checkpoint en elke LoRA in de stack. "Open gewichten" en "vrij voor alles" zijn al een tijd niet meer hetzelfde.

Waarom zien mijn resultaten er slechter uit dan de voorbeelden?

Bijna altijd het checkpoint, niet de prompt. Communityvoorbeelden zijn meestal gemaakt op een zwaar fijn-afgesteld checkpoint en niet op het basismodel.

Wordt het vervangen door FLUX?

Op outputkwaliteit is het grotendeels ingehaald. Op de voorraad aan checkpoints, adapters en controlegereedschap is er nog geen vervanger.

Een AI-gegenereerde foodfoto bij daglicht

Blijf ontdekken

Elders op LaFoto

De concepten hier gelden ongeacht wat u draait.

Stable Diffusion — questions people ask

Wat is Stable Diffusion?
Een openlijk vrijgegeven text-to-image model van Stability AI, gebaseerd op latent diffusion, dat u kunt downloaden en op consumentenhardeware kunt draaien in plaats van alleen via een API te benaderen.
Is Stable Diffusion gratis?
De gewichten zijn openlijk vrijgegeven en lokaal te draaien zonder kosten per afbeelding, maar licentievoorwaarden verschillen per versie en latere releases hebben meer beperkingen. Controleer de licentie van de specifieke versie tegen uw beoogde gebruik.
Wat betekent latent diffusion?
Het model werkt op een gecomprimeerde representatie van een afbeelding in plaats van op pixels op volledige resolutie, en decodeert pas op het eind naar een afbeelding. Dat maakte het goedkoop genoeg om op een gewone videokaart te draaien.
Wat is een LoRA in Stable Diffusion?
Een klein add-on-bestand dat het basismodel een specifieke stijl, onderwerp of personage aanleert zonder het hele model te hertrainen. Het is de standaardmanier waarop de community specialisaties deelt.
Wat is ControlNet?
Een uitbreiding die een generatie begrenst tot een structurele input zoals een pose-skelet, een dieptekaart of een randen-tekening, zodat u de compositie kunt vastzetten terwijl het model de rest bepaalt.
Heb ik een goede videokaart nodig om Stable Diffusion te draaien?
Lokaal wel — videogeheugen is de beperkende factor. Hosted diensten nemen die eis weg ten koste van de controle die zelf draaien geeft.
Is Stable Diffusion nog steeds het beste beeldmodel?
Niet op ruwe outputkwaliteit; nieuwere modellen volgen prompts doorgaans letterlijker en renderen tekst beter. Het voordeel is nu de diepte van de community-tools eromheen.
Waarom praten mensen over seeds en samplers?
Dat zijn regelaars die de open community boven water haalde en benoemde tijdens het werken met dit model, en de woordenschat is van daaruit naar de rest van het veld overgeslagen.

Begin vandaag

Genereer uw eerste beeld met de beste AI-beeldgenerator.

Zet een zin om in een afgewerkt, fotorealistisch beeld in seconden — en verfijn daarna elk detail. Geen installatie, geen Discord, geen GPU.

Sluit u aan bij 4.200+ makers die LaFoto gebruiken