Direct naar inhoud
LaFoto

Gids

Tekst-naar-beeld: hoe AI woorden omzet in foto’s

Tekst-naar-beeld is het proces waarbij een AI-afbeeldingsgenerator een geschreven beschrijving leest en er een passende foto bij maakt. U typt een prompt zoals "a golden retriever puppy on a rain-slicked city street at dusk", en binnen enkele seconden levert het model precies dat beeld op. Onder de motorkap zijn de meeste moderne tools diffusion-modellen: een text encoder zet uw woorden om in getallen die het model begrijpt, daarna begint het model vanuit pure willekeurige ruis en verwijdert die ruis stap voor stap, waarbij elke stap een zetje krijgt richting iets dat overeenkomt met uw beschrijving. Het resultaat is een volledig nieuwe afbeelding, geen zoekresultaat en geen aan elkaar geplakte collage. Er wordt niets één-op-één gekopieerd; het model heeft tijdens training statistische patronen geleerd van hoe woorden samenhangen met visuele scènes en reconstrueert van nul af aan een plausibele foto. De kwaliteit van wat u terugkrijgt hangt grotendeels af van twee zaken die u zelf bepaalt: hoe helder uw prompt het onderwerp, de setting, de belichting en de stijl beschrijft, en hoe goed het onderliggende model is. De rest van deze gids legt de pijplijn in begrijpelijke taal uit, benoemt de sleuteltermen en laat zien hoe u met woorden stuurt naar de foto in uw hoofd.
Door Het LaFoto-redactieteam

11 min lezen
Een illustratieve compositie die toont hoe tekst in een beeld verandert

Wat is tekst-naar-beeld?

Tekst-naar-beeld is een AI-categorie die een afbeelding genereert op basis van een geschreven prompt. U beschrijft in gewone taal wat u wilt, en een AI-afbeeldingsgenerator rendert daar een nieuwe afbeelding bij. De technische naam is een text-to-image-model, en volgens Wikipedia kwam dit na 2022 in een stroomversnelling toen tools zoals DALL·E 2, Imagen, Stable Diffusion en Midjourney beeld gingen produceren dat de kwaliteit van echte foto’s benadert.

Het cruciale punt voor nieuwkomers is dat de output wordt gegenereerd, niet opgehaald. Het model zoekt niet in een bibliotheek naar een al bestaande foto, en het plakt geen clipart aan elkaar. Het bouwt een nieuw beeld pixel voor pixel op, op basis van patronen die het tijdens training leerde. Daarom kunt u om iets vragen dat nooit is gefotografeerd, zoals "a teacup made of stained glass on a moss-covered piano", en toch een coherent resultaat krijgen.

De meeste mensen maken kennis met tekst-naar-beeld via een simpel veld: typ een zin, klik genereren, ontvang een beeld. Tekst-naar-foto werkt precies zo. Alles wat complex is gebeurt achter dat veld, en een globaal begrip daarvan maakt u direct veel effectiever in het krijgen van het resultaat dat u zoekt.

Hoe werkt tekst-naar-beeld in de praktijk?

De dominante aanpak in 2026 is het diffusion-model, vaak een latent diffusion model. De intuïtie is tegenintuïtief maar de moeite waard: het model leert afbeeldingen maken door eerst te leren ze te vernietigen. Tijdens training neemt het echte beelden, voegt ruis toe tot er alleen nog sneeuw overblijft, en leert dan dat proces om te keren. Om een nieuw beeld te genereren begint het met pure willekeurige ruis en voert het de omkering uit, gestuurd door uw prompt, totdat er een schoon beeld ontstaat.

Hier is de pijplijn in eenvoudige stappen, hetzelfde pad dat uw woorden afleggen elke keer dat u op genereren klikt.

  1. U schrijft een prompt. Dit is de enige instructie die het model krijgt; daarom is specificiteit zo belangrijk.
  2. Een text encoder leest de prompt. Een taal- of visueel-taalmodel (zoals een CLIP-text encoder of een groot taalmodel zoals T5 in Google’s Imagen) zet uw woorden om in een numerieke embedding die de betekenis vangt.
  3. Het model start vanuit willekeurige ruis. Het canvas begint als betekenisloze sneeuw, een willekeurige seed.
  4. Het verwijdert stap voor stap ruis. Over een reeks stappen haalt het model telkens een beetje ruis weg, en bij elke stap stuurt de text-embedding het resultaat richting uw beschrijving.
  5. Er wordt een afbeelding gedecodeerd. In een latent diffusion model gebeurt het werk in een gecomprimeerde latente ruimte voor snelheid; daarna zet een decoder (een VAE) het om naar een afbeelding op volledige resolutie.
  6. U krijgt een afgewerkte foto. De output is een nieuwe afbeelding, geconditioneerd op uw woorden, uw seed en de modelinstellingen.

Twee technische ideeën verklaren veel gedrag dat u zult zien. De seed is de specifieke willekeurige startruis; hergebruik dezelfde seed en prompt en u krijgt dezelfde afbeelding, wat gecontroleerd itereren mogelijk maakt. Guidance (vaak CFG-scale genoemd) bepaalt hoe strikt het model uw prompt volgt versus vrijer genereren; zet u die hoog, dan ligt het beeld dichter bij uw woorden maar kan het geforceerd ogen, zet u die lager, dan dwaalt het creatiever af.

Wat betekenen de belangrijkste tekst-naar-beeld-termen?

Een handvol termen komt steeds terug. Wie ze kent neemt het mysterie weg en leest de instellingen van elke AI-afbeeldingsgenerator met vertrouwen.

termBetekenis in gewone taalWaarom het voor u telt
PromptDe tekstbeschrijving die u schrijftUw enige stuurmiddel; specificiteit bepaalt het resultaat
negatieve promptEen lijst met zaken die u wilt uitsluitenHaalt terugkerende problemen weg zoals extra vingers, tekst of watermerken
DiffusieGenereren door stap voor stap ruis te verwijderenVerklaart waarom meer stappen meer detail én meer tijd kunnen betekenen
Latente ruimteEen gecomprimeerde interne representatie van de afbeeldingWaarom latent diffusion-modellen snel genoeg zijn voor interactief gebruik
tekstencoderZet uw woorden om in getallen die het model leestGroter/beter encoder betekent doorgaans beter prompt-begrip
SeedDe willekeurige startruisHergebruik om een beeld reproduceerbaar of gecontroleerd te itereren
guidance / CFG-schaalHoe strikt het model de prompt volgtTe hoog oogt geforceerd; te laag negeert uw woorden
StappenHoeveel denoising-passes het model draaitMeer stappen kunnen detail toevoegen maar kosten tijd, met afnemend rendement
BeeldverhoudingDe vorm van het kaderStel dit bewust in zodat uw compositie niet ongelukkig wordt bijgesneden

U hoeft dit niet telkens allemaal te gebruiken. De meeste tools bieden standaard een prompt-veld, een negative prompt en een beeldverhouding, en verbergen de rest onder geavanceerde instellingen. Maar wie weet wat elke hendel doet, weet welke knop om te zetten wanneer een resultaat net niet klopt.

Hoe verschilt tekst-naar-beeld van image-to-image en bewerken?

Tekst-naar-beeld is één modus tussen meerdere, en ze verwarren is een veelvoorkomende bron van frustratie. Het verschil draait om wat u het model als startpunt geeft.

  • Tekst-naar-beeld: de input is alleen woorden. Het model start vanuit ruis en bouwt de hele scène op uit uw beschrijving. Ideaal om iets geheel nieuws te maken.
  • Image-to-image: de input is woorden plus een startafbeelding. Het model gebruikt uw beeld als basis en transformeert het volgens de prompt, met behoud van de globale compositie. Ideaal om een bestaande foto te restylen of uit te werken.
  • Inpainting en bewerken: de input is een afbeelding plus een gemaskeerd gebied. Het model regenereert alleen het geselecteerde deel. Ideaal om één element te herstellen of te wisselen zonder het hele beeld opnieuw te rollen.
  • Outpainting: het model breidt een afbeelding uit voorbij de oorspronkelijke randen en verzint doorlopende omgeving. Ideaal om de beeldverhouding te wijzigen of extra marge toe te voegen.

In een echte workflow combineert u deze. U kunt een basis genereren met tekst-naar-beeld en daarna naar bewerken schakelen om één hand te corrigeren of een achtergrond te wisselen. Weten in welke modus u zit vertelt wat het model mag veranderen en wat het zal proberen te behouden.

Waarom krijgen twee mensen verschillende foto’s bij hetzelfde idee?

Typ hetzelfde idee in twee tools, of zelfs twee keer in dezelfde tool, en u kunt heel andere beelden krijgen. Dat is te verwachten, en drie factoren verklaren bijna alles.

Ten eerste het model. Verschillende AI-afbeeldingsgeneratoren zijn getraind op andere data met andere architecturen, dus elk heeft een eigen standaardlook en andere sterkten. Onderzoek zoals Google’s Imagen liet zien dat het opschalen van de text encoder, niet alleen het beeldmodel, zowel de fotorealiteit als de trouw aan de woorden sterk verbeterde. Daarom verschilt prompt-begrip zo sterk tussen tools.

Ten tweede de willekeur. Diffusion start vanuit ruis, dus een andere seed levert een ander beeld op, zelfs met een identieke prompt. Dat is een feature, geen bug; het maakt variaties genereren en de beste kiezen mogelijk.

Ten derde de prompt en instellingen. Vage prompts laten het model gaten vullen met zijn gemiddelde gok, waardoor kleine formuleringen het resultaat al sturen. Guidance, stappen en beeldverhouding verschuiven het nog verder. De praktische les: de beste AI-afbeeldingsgenerator voor u draait deels om modelkwaliteit en deels om hoe goed het prompt-begrip aansluit bij uw manier van beschrijven.

Hoe schrijft u een effectieve tekst-naar-beeld-prompt?

Omdat de prompt uw enige instructie is, is prompt-schrijven de belangrijkste vaardigheid in tekst-naar-beeld. De betrouwbare formule benoemt zaken in volgorde van belang: onderwerp eerst, dan setting, belichting en stijl, met technische kwalificaties op het eind en een aparte negative prompt voor wat u wilt uitsluiten.

  1. Noem het onderwerp en zijn kernkenmerken: "a woman in her 30s, soft confident smile, charcoal blazer."
  2. Plaats het in een setting: "seated against a neutral grey backdrop."
  3. Specificeer de belichting: "soft diffused window light from the left" — vaak de grootste hefboom voor realisme.
  4. Voeg camera, lens en stijl toe: "shot on 85mm lens, shallow depth of field, professional corporate portrait."
  5. Zet de sfeer en technische kwalificaties: "warm and approachable, sharp focus, aspect ratio 4:5."
  6. Voeg een negative prompt toe: "harsh shadows, blemishes, text, watermark."

Specificiteit verslaat lengte. Tien precieze woorden presteren meestal beter dan vijftig vage, omdat elk concreet detail het model wegstuurt van zijn gemiddelde gok. Wanneer een resultaat dichtbij maar net niet goed is, verander dan één variabele per keer zodat u ziet wat elke aanpassing deed. Voor een diepere walkthrough met kant-en-klare voorbeelden, zie onze gids over het schrijven van AI-foto-prompts, of laat de AI Prompt Generator uit een kort idee een volledige prompt opzetten.

Wat zijn vandaag de grenzen van tekst-naar-beeld?

Tekst-naar-beeld is krachtig maar geen magie; helder zijn over de grenzen voorkomt frustratie.

  • Fijne details gaan voorspelbaar mis. Handen, tanden, tekst ín het beeld en complexe reflecties zijn de klassieke artefact-zones; controleer ze steeds.
  • Het kan uw gedachten niet lezen. Het model weet alleen wat u schreef; alles wat u weglaat wordt ingevuld met zijn standaardaanname.
  • Exacte reproductie is lastig. Dezelfde specifieke persoon, product of logo consistent genereren is nog steeds moeilijk zonder gespecialiseerde tools.
  • Output is plausibel, niet feitelijk. Het model verzint detail, dus tekst-naar-beeld is ongeschikt voor alles wat accuraat moet zijn, zoals documentatie of bewijs.
  • Kwaliteit verschilt per model. Een zwakkere AI-afbeeldingsgenerator worstelt met complexe scènes die een sterkere wel aankan; de tool is dus net zo belangrijk als de prompt.

Geen van deze punten is een showstopper voor de meeste creatieve en marketingtaken. Ze betekenen simpelweg dat tekst-naar-beeld een startpunt is dat u verfijnt, geen orakel met één klik. Genereer, inspecteer, en herstel daarna gericht de paar dingen die fout zijn in plaats van het hele beeld opnieuw te rollen.

Bronnen

  1. 01Text-to-image model (overview)Wikipedia (geraadpleegd 2026-06-01)
  2. 02Latent diffusion modelWikipedia (geraadpleegd 2026-06-01)
  3. 03Diffusion modelWikipedia (geraadpleegd 2026-06-01)
  4. 04Contrastive Language–Image Pre-training (CLIP)Wikipedia (geraadpleegd 2026-06-01)
  5. 05Imagen: Text-to-Image Diffusion ModelsGoogle Research (geraadpleegd 2026-06-01)
  6. 06Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingSaharia et al., arXiv (geraadpleegd 2026-06-01)
  7. 07Prompt engineeringWikipedia (geraadpleegd 2026-06-01)

Veelgestelde vragen

Wat betekent tekst-naar-beeld?
Tekst-naar-beeld betekent dat u een volledig nieuwe afbeelding genereert op basis van een geschreven beschrijving. U typt een prompt en een AI-afbeeldingsgenerator rendert een bijpassende foto. De afbeelding wordt van nul af aan gegenereerd, niet opgehaald uit een bibliotheek of samengesteld uit bestaande beelden.
Hoe zet een AI-afbeeldingsgenerator woorden om in een foto?
De meeste gebruiken diffusion. Een text encoder zet uw prompt om in getallen, het model start vanuit willekeurige ruis en verwijdert die ruis stap voor stap terwijl uw prompt elke stap stuurt. Een decoder zet het resultaat daarna om naar een afbeelding op volledige resolutie.
Is tekst-naar-beeld gewoon zoeken naar bestaande afbeeldingen?
Nee. Het model zoekt of kopieert geen enkele bron. Het leerde tijdens training statistische patronen die woorden aan visuele scènes koppelen en reconstrueert bij elke generatie een nieuw, origineel beeld vanuit willekeurige ruis.
Wat is een diffusion-model?
Een diffusion-model leert afbeeldingen genereren door een ruisproces om te keren. Het oefent met het veranderen van echte beelden in ruis en leert dat te herstellen, zodat het vanuit willekeurige ruis kan starten en die kan denoisen tot een coherent beeld, gestuurd door uw prompt.
Wat is een seed in tekst-naar-beeld?
De seed is de specifieke willekeurige startruis. Door dezelfde seed en prompt te hergebruiken reproduceert u hetzelfde beeld, wat gecontroleerd itereren mogelijk maakt. Een andere seed geeft een andere variatie op hetzelfde idee.
Wat is CFG of guidance-scale?
Guidance, vaak CFG-scale genoemd, bepaalt hoe strikt het model uw prompt volgt. Hogere waarden sluiten nauwer aan bij uw woorden maar kunnen geforceerd ogen; lagere waarden laten het model vrijer genereren en afwijken van uw beschrijving.
Waarom krijg ik verschillende beelden bij dezelfde prompt?
Omdat diffusion vanuit willekeurige ruis start, levert een andere seed een ander beeld op, zelfs met identieke bewoording. Verschillende modellen en instellingen veranderen het resultaat verder. Het is verwacht gedrag en maakt genereren en kiezen uit variaties mogelijk.
Wat is het verschil tussen tekst-naar-beeld en image-to-image?
Tekst-naar-beeld start alleen met woorden en bouwt de hele scène op vanuit ruis. Image-to-image start met woorden plus een basisafbeelding en transformeert die, met behoud van de globale compositie. De een creëert vanaf nul; de ander werkt een bestaand beeld om.
Wat is de beste AI-afbeeldingsgenerator voor tekst-naar-beeld?
Dat hangt af van uw behoeften en van hoe goed het prompt-begrip van een tool aansluit bij uw manier van beschrijven. Modellen verschillen in standaardlook, sterkten en trouw aan de prompt, dus de beste AI-afbeeldingsgenerator is deels modelkwaliteit en deels fit.
Hoe krijg ik betere resultaten met tekst-naar-beeld?
Schrijf specifieke prompts: noem onderwerp, setting, belichting en stijl in volgorde van belang, voeg een negative prompt toe en stel de beeldverhouding in. Verander daarna één variabele per keer om te verfijnen, in plaats van alles tegelijk te herschrijven.

Geschreven door

Het LaFoto-redactieteam

Het redactieteam van LaFoto schrijft gidsen en vergelijkingen over AI-fotogeneratie, volgens een standaard van bronvermelding en nul-fabricatie.

Verder lezen

Begin vandaag

Genereer uw eerste beeld met de beste AI-beeldgenerator.

Zet een zin om in een afgewerkt, fotorealistisch beeld in seconden — en verfijn daarna elk detail. Geen installatie, geen Discord, geen GPU.

Sluit u aan bij 4.200+ makers die LaFoto gebruiken

Over deze gids

Geschreven door
De redactie van LaFoto
Op basis van
Onze eigen tests, niet andere artikelen
Modeladvies
Achterhaald, omdat gedrag verandert
Gesponsord
Nee — geen betaalde plaatsing
Correcties
Op de pagina doorgevoerd
Gecontroleerd
Opnieuw nagekeken wanneer modellen veranderen

In de praktijk

Wat er echt gebeurt tussen uw zin en het beeld

Diffusiemodellen worden getraind door echte beelden stap voor stap met ruis te vullen tot er alleen nog statische overblijft, en vervolgens te leren dat proces om te keren. Eenmaal getraind kan het model vanuit pure ruis starten en zich naar iets coherents toe denoise-en.

Uw prompt stuurt bij. Een taalkomponent zet woorden om naar een numerieke representatie van betekenis, en bij elke denoise-stap wordt het opkomende beeld een zetje richting die betekenis gegeven. Na genoeg stappen verandert ruis in de scène die u beschreef.

Een typemachinepagina met één getypte regel op warm papier, een voltooide fotoafdruk direct eronder

Drie manieren om te beginnen

Drie dingen die ertoe doen

Waarom reproduceerbaarheid telt

Een seed is de startruis. Zonder die te fixeren kunt u niet één woord wijzigen en zien wat dat woord deed, omdat het waargenomen verschil dan vooral door een ander startpunt komt.

  • Fixeer de seed om twee prompts te vergelijken.
  • Noteer die bij alles waar u op terug wilt komen.
  • Een seed is zinloos tussen verschillende modellen.
Een door AI gegenereerd productstilleven

Detail

Wat dit uitlegt

De mechaniek die verandert hoe u elke generator gebruikt.

Waarom gegenereerde beelden uniek zijn

Het model voorspelt plausibele pixels in plaats van een opgeslagen foto terug te halen, dus niets wat het terugstuurt is een stockbeeld dat iemand anders ook heeft.

Of diffusie de enige aanpak is

Nee — eerdere systemen gebruikten GAN’s en sommige pipelines combineren modeltypen. Voor dagelijks gebruik is het mentale model belangrijker dan de architectuur.

Waarom u de beeldverhouding vooraf kiest

Het model componeert voor het kader dat het krijgt, dus achteraf croppen gooit doelbewust gemaakte compositie weg.

Op welke resolutie u genereert

1024 is bij de meeste modellen de sweet spot. Genereer daar en upscale in plaats van om een groot canvas te vragen.

Of prompts worden opgeslagen

Hangt volledig van de aanbieder af. Het weegt het zwaarst wanneer een prompt commercieel gevoelige werkzaamheden beschrijft.

Een AI-gegenereerde productscène met rekwisieten en gecontroleerde schaduw

Gerelateerd

Pas de mechaniek toe

Blijf ontdekken

Waar deze mechaniek geldt

Elke surface hier draait op hetzelfde proces.