Spring til indhold
LaFoto

Vejledning

Tekst til billede: sådan omsætter AI ord til fotos

Tekst til billede er processen, hvor en AI-billedgenerator læser en skriftlig beskrivelse og laver et matchende foto. Du skriver en prompt som "en golden retriever-hvalp på en regnvåd bygade i skumringen", og inden for sekunder returnerer modellen et billede af netop det. Under motorhjelmen er de fleste moderne værktøjer diffusionsmodeller: en tekstkoder omsætter dine ord til tal, som modellen forstår, og derefter starter modellen fra ren tilfældig støj og fjerner den støj trin for trin, mens hvert trin skubbes i retning af noget, der matcher din beskrivelse. Resultatet er et helt nyt billede — ikke et søgeresultat eller en sammensat collage. Intet kopieres fra én enkelt kilde; modellen har lært de statistiske mønstre for, hvordan ord relaterer til visuelle scener, og rekonstruerer et plausibelt foto fra bunden. Kvaliteten af det, du får tilbage, afgøres mest af to ting, du selv styrer: hvor klart din prompt beskriver motiv, miljø, lys og stil, og hvor god den underliggende model er. Resten af denne guide forklarer, hvordan pipelinen fungerer i helt almindeligt sprog, hvad nøglebegreberne betyder, og hvordan du bruger ord til at styre den hen imod fotoet i dit hoved.
Af LaFoto-redaktionen

11 min. læsetid
En illustrativ komposition, der viser tekst forvandlet til et billede

Hvad er tekst til billede?

Tekst til billede er en kategori af AI, der genererer et billede ud fra en skrevet prompt. Du beskriver, hvad du vil have, i helt almindeligt sprog, og en AI-billedgenerator render et nyt billede, der matcher. Den tekniske betegnelse er en tekst-til-billede-model, og ifølge Wikipedia tog disse systemer fart efter 2022, da værktøjer som DALL·E 2, Imagen, Stable Diffusion og Midjourney begyndte at levere output tæt på kvaliteten af rigtige fotografier.

Det afgørende for nybegyndere er, at output bliver genereret, ikke hentet. Modellen søger ikke i et bibliotek efter et foto, der allerede findes, og den klistrer ikke clipart sammen. Den bygger et frisk billede pixel for pixel baseret på mønstre, den lærte under træningen. Derfor kan du bede om noget, der aldrig er blevet fotograferet, som "en tekop lavet af glasmosaik på et mosbegroet klaver", og stadig få et sammenhængende resultat.

De fleste møder tekst til billede gennem en simpel boks: skriv en sætning, tryk generér, få et billede. Tekst til foto fungerer præcis sådan. Alt det komplekse sker bag den boks, og forstår du det i grove træk, bliver du markant bedre til at få det resultat, du vil have.

Hvordan fungerer tekst til billede egentlig?

Den dominerende tilgang i 2026 er diffusionsmodellen, ofte en latent diffusionsmodel. Intuitionen er kontraintuitiv men værd at forstå: Modellen lærer at skabe billeder ved først at lære at ødelægge dem. Under træning tager den rigtige billeder, tilføjer støj, indtil de bliver til statisk, og lærer at vende den proces. For at generere et nyt billede starter den fra ren tilfældig støj og kører den omvendte proces, styret af din prompt, indtil et rent billede dukker op.

Her er pipelinen i enkle trin, den samme rute dine ord tager, hver gang du trykker generér.

  1. Du skriver en prompt. Det er den eneste instruktion, modellen får, og derfor betyder specificitet så meget.
  2. En tekstkoder læser den. En sprog- eller vision-sprog-model (såsom en CLIP-tekstkoder eller en stor sprogmodel som T5 i Googles Imagen) konverterer dine ord til en numerisk embedding, der indfanger deres betydning.
  3. Modellen starter fra tilfældig støj. Lærredet begynder som meningsløs statisk — et tilfældigt seed.
  4. Den fjerner støj trin for trin. Over en række trin fjerner modellen lidt støj ad gangen, og ved hvert trin styrer tekst-embedding’en resultatet i retning af din beskrivelse.
  5. Et billede dekodes. I en latent diffusionsmodel foregår arbejdet i et komprimeret latent rum for hastighed, og derefter udvider en dekoder (en VAE) resultatet til et billede i fuld opløsning.
  6. Du får et færdigt foto. Outputtet er et nyt billede betinget af dine ord, dit seed og modellens indstillinger.

To tekniske idéer forklarer meget af den adfærd, du lægger mærke til. Seed er den specifikke tilfældige startstøj; genbrug samme seed og prompt, og du får det samme billede, hvilket er måden at iterere kontrolleret på. Vejledning (ofte kaldet CFG-skala) styrer, hvor strengt modellen følger din prompt kontra genererer frit; skruer du op, lægger billedet sig tættere på dine ord, men det kan virke påtaget; skruer du ned, driver det mere kreativt.

Hvad betyder de vigtigste tekst-til-billede-begreber?

En håndfuld termer går igen hele tiden. Kender du dem, forsvinder det meste af mystikken, og du kan læse enhver AI-billedgenerators indstillingspanel med ro i maven.

betegnelseHverdagsforklaringHvorfor det betyder noget for dig
PromptDen tekstbeskrivelse, du skriverDit eneste rat; specificitet afgør resultatet
Negativ promptEn liste over ting, der skal udelukkesFjerner tilbagevendende problemer som ekstra fingre, tekst eller vandmærker
diffusionGenerering ved at fjerne støj trin for trinForklarer hvorfor flere trin kan give flere detaljer og mere tid
Latent rumEn komprimeret intern repræsentation af billedetDerfor er latente diffusionsmodeller hurtige nok til interaktiv brug
TekstkoderOmsætter dine ord til tal, modellen kan læseEn større, bedre koder giver typisk bedre prompt-forståelse
SeedDen tilfældige startstøjGenbrug det for at reproducere eller iterere kontrolleret på et billede
Vejledning / CFG-skalaHvor strengt modellen følger promptenFor højt ser påtaget ud; for lavt ignorerer dine ord
TrinHvor mange støjfjerner-pas modellen kørerFlere trin kan give detaljer men koster tid, med aftagende udbytte
FormatforholdRammens formSæt det med vilje, så din komposition ikke beskæres akavet

Du behøver ikke røre ved det hele hver gang. De fleste værktøjer viser som standard en prompt-boks, en negativ prompt og et formatforhold og gemmer resten under avancerede indstillinger. Men ved du, hvad hver enkelt hængsel gør, kan du, når et resultat er skævt, dreje på den rigtige knap.

Hvordan adskiller tekst til billede sig fra billede-til-billede og redigering?

Tekst til billede er én tilstand blandt flere, og forvekslingen imellem dem er en hyppig kilde til frustration. Forskellen handler om, hvad du giver modellen som udgangspunkt.

  • Tekst til billede: input er kun ord. Modellen starter fra tilfældig støj og bygger hele scenen ud fra din beskrivelse. Bedst til at skabe noget nyt fra bunden.
  • Billede til billede: input er ord plus et startbillede. Modellen bruger dit billede som base og transformerer det efter prompten, mens den bevarer den grove komposition. Bedst til at restyle eller omarbejde et eksisterende billede.
  • Inpainting og redigering: input er et billede plus et maskeret område. Modellen regenererer kun den del, du vælger. Bedst til at rette eller udskifte ét element uden at kaste hele billedet om.
  • Outpainting: modellen udvider et billede ud over dets oprindelige kanter og opfinder sceneri, der fortsætter rammen. Bedst til at ændre formatforhold eller give mere luft over hovedet.

I et rigtigt flow blander du disse. Du kan generere en base med tekst til billede og derefter skifte til redigering for at rette en enkelt hånd eller skifte baggrund. At vide, hvilken tilstand du er i, fortæller dig, hvad modellen må ændre, og hvad den vil forsøge at bevare.

Hvorfor får to personer forskellige fotos ud fra den samme idé?

Skriv den samme idé i to værktøjer — eller endda det samme værktøj to gange — og du kan få meget forskellige billeder. Det er forventet, og tre faktorer forklarer næsten det hele.

For det første modellen. Forskellige AI-billedgeneratorer er trænet på forskellige data med forskellige arkitekturer, så hver har et særpræget standardlook og forskellige styrker. Forskning som Googles Imagen viste, at opskalering af tekstkoderen — ikke kun billedmodellen — markant forbedrede både fotorealisme og hvor trofast billedet matchede ordene, hvilket er grunden til, at prompt-forståelse varierer så meget mellem værktøjer.

For det andet tilfældigheden. Diffusion starter fra tilfældig støj, så et andet seed giver et andet billede, selv med identisk prompt. Det er en funktion, ikke en fejl; det er det, der lader dig generere variationer og vælge den bedste.

For det tredje prompten og indstillingerne. Vage prompts lader modellen udfylde hullerne med sit gennemsnitsgæt, så små formuleringer kan ændre resultatet markant. Vejledning, trin og formatforhold flytter det yderligere. Den praktiske pointe er, at den bedste AI-billedgenerator for dig både handler om modelkvalitet og om, hvor godt dens prompt-forståelse matcher den måde, du beskriver ting på.

Hvordan skriver du en tekst-til-billede-prompt, der virker?

Fordi prompten er din eneste instruktion, er promptskrivning den vigtigste færdighed i tekst til billede. Den sikre opskrift navngiver ting i prioriteret rækkefølge: motiv først, derefter miljø, lys og stil, med tekniske kvalifikatorer til sidst og en separat negativ prompt for det, der skal udelukkes.

  1. Navngiv motivet og dets nøgleattributter: "en kvinde i 30’erne, blød, selvsikker smil, koksgrå blazer."
  2. Placer det i et miljø: "siddende mod en neutral grå baggrund."
  3. Angiv lyset: "blødt, diffust vindueslys fra venstre" — ofte den enkeltstørste løftestang for realisme.
  4. Tilføj kamera, objektiv og stil: "taget med 85mm objektiv, lav dybdeskarphed, professionelt corporate-portræt."
  5. Sæt stemning og tekniske kvalifikatorer: "varm og imødekommende, knivskarp fokus, formatforhold 4:5."
  6. Tilføj en negativ prompt: "hårde skygger, hudpletter, tekst, vandmærke."

Specificitet slår længde. Ti præcise ord overgår som regel halvtreds vage, fordi hver konkret detalje styrer modellen væk fra dens gennemsnitsgæt. Når et resultat er tæt på men ikke rigtigt, så ændr én variabel ad gangen, så du kan se, hvad hver redigering gjorde. For en dybere gennemgang med eksempler, der er klar til brug, se vores guide til, hvordan du skriver AI-fotoprompts, eller lad AI Prompt Generator bygge en fuld prompt ud fra en kort idé.

Hvad er begrænsningerne ved tekst til billede i dag?

Tekst til billede er stærkt, men ikke magi, og at se klart på begrænsningerne sparer dig for frustration.

  • Fine detaljer fejler forudsigeligt. Hænder, tænder, tekst i billedet og indviklede reflekser er de typiske problemzoner; tjek dem hver gang.
  • Den kan ikke læse dine tanker. Modellen ved kun, hvad du skrev, så alt, du udelader, udfyldes af dens standardantagelser.
  • Præcis reproduktion er svær. At generere den samme specifikke person, det samme produkt eller logo konsekvent på tværs af billeder er stadig vanskeligt uden specialværktøjer.
  • Output er plausibelt, ikke faktuelt. Modellen opfinder detaljer, så tekst til billede er uegnet til noget, der skal være korrekt, som dokumentation eller bevismateriale.
  • Kvaliteten varierer efter model. En svagere AI-billedgenerator vil kæmpe med komplekse scener, som en stærkere håndterer, så værktøjet betyder lige så meget som prompten.

Ingen af disse er showstoppere for de fleste kreative og marketingopgaver. De betyder blot, at tekst til billede er et udgangspunkt, du forfiner — ikke et ét-klik-orakel. Generér, inspicér, og ret så de få ting, der er forkerte, med en målrettet redigering i stedet for at rulle hele billedet om.

Kilder

  1. 01Text-to-image model (overview)Wikipedia (tilgået 2026-06-01)
  2. 02Latent diffusion modelWikipedia (tilgået 2026-06-01)
  3. 03Diffusion modelWikipedia (tilgået 2026-06-01)
  4. 04Contrastive Language–Image Pre-training (CLIP)Wikipedia (tilgået 2026-06-01)
  5. 05Imagen: Text-to-Image Diffusion ModelsGoogle Research (tilgået 2026-06-01)
  6. 06Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingSaharia et al., arXiv (tilgået 2026-06-01)
  7. 07Prompt engineeringWikipedia (tilgået 2026-06-01)

Ofte stillede spørgsmål

Hvad betyder tekst til billede?
Tekst til billede betyder at generere et helt nyt billede ud fra en skriftlig beskrivelse. Du skriver en prompt, og en AI-billedgenerator render et matchende foto. Billedet genereres fra bunden — ikke hentet fra et bibliotek eller sammensat af eksisterende billeder.
Hvordan omsætter en AI-billedgenerator ord til et foto?
De fleste bruger diffusion. En tekstkoder konverterer din prompt til tal, modellen starter fra tilfældig støj, og den fjerner den støj trin for trin, mens din prompt styrer hvert trin. En dekoder laver derefter resultatet om til et billede i fuld opløsning.
Er tekst til billede bare søgning efter eksisterende billeder?
Nej. Modellen søger ikke og kopierer ikke en enkelt kilde. Den har lært statistiske mønstre, der forbinder ord med visuelle scener, under træning, og rekonstruerer et nyt, originalt billede fra tilfældig støj, hver gang du genererer.
Hvad er en diffusionsmodel?
En diffusionsmodel lærer at generere billeder ved at vende en støjproces. Den øver sig i at gøre rigtige billeder til støj og lærer så at gøre det om, så den kan starte fra tilfældig støj og fjerne støjen til et sammenhængende billede, guidet af din prompt.
Hvad er et seed i tekst til billede?
Seed er den specifikke tilfældige startstøj. Genbruger du samme seed og prompt, får du det samme billede, hvilket er måden at iterere kontrolleret på. Skifter du seed, får du en anden variation af den samme idé.
Hvad er CFG eller vejledningsskala?
Vejledning, ofte kaldet CFG-skala, styrer hvor strengt modellen følger din prompt. Højere værdier matcher dine ord tættere, men kan se påtagede ud; lavere værdier lader modellen generere mere frit og drive fra din beskrivelse.
Hvorfor får jeg forskellige billeder fra den samme prompt?
Fordi diffusion starter fra tilfældig støj, giver et andet seed et andet billede — selv med identisk formulering. Forskellige modeller og indstillinger ændrer resultatet yderligere. Det er forventet adfærd og lader dig generere og vælge mellem variationer.
Hvad er forskellen på tekst til billede og billede til billede?
Tekst til billede starter kun fra ord og bygger hele scenen ud fra støj. Billede til billede starter fra ord plus et basebillede og transformerer det, mens den grove komposition bevares. Det ene skaber fra bunden; det andet omarbejder et eksisterende billede.
Hvilken AI-billedgenerator er bedst til tekst til billede?
Det afhænger af dine behov og hvor godt et værktøjs prompt-forståelse matcher den måde, du beskriver ting på. Modeller adskiller sig i standardlook, styrker og prompt-trofæsthed, så den bedste AI-billedgenerator handler både om modelkvalitet og om pasform.
Hvordan får jeg bedre resultater fra tekst til billede?
Skriv specifikke prompts: navngiv motiv, miljø, lys og stil i prioriteret rækkefølge, tilføj en negativ prompt, og sæt formatforholdet. Ændr derefter én variabel ad gangen for at forfine i stedet for at skrive det hele om på én gang.

Skrevet af

LaFoto-redaktionen

Redaktionen bag LaFoto skriver guider og sammenligninger om AI-fotogenerering — med kilder og uden opdigtede fakta.

Læs videre

Begynd at skabe i dag

Generér dit første billede med den bedste AI-billedgenerator.

Gør en sætning til et færdigt, fotorealistisk billede på få sekunder — og finpuds derefter hver detalje. Ingen opsætning, ingen Discord, ingen GPU.

Slut dig til 4.200+ skabere, der bruger LaFoto

Om denne guide

skrevet af
LaFoto-redaktionen
baseret på
Vores egne tests, ikke andres artikler
modelråd
Forældes hurtigt, fordi adfærden ændrer sig
sponsoreret
Nej — ingen betalt placering
rettelser
Laves direkte på siden
gennemgået
Tjekkes igen, når modeller ændrer sig

I praksis

Hvad der faktisk sker mellem din sætning og billedet

Diffusion-modeller trænes ved at tage rigtige billeder, tilføje støj trin for trin, indtil de er ren statik, og lære at vende processen. Når modellen er trænet, kan den starte fra ren støj og denoise sig hen imod noget sammenhængende.

Din prompt er rattet. En sprogkomponent omsætter ordene til en numerisk betydning, og ved hvert denoise-trin skubbes det fremvoksende billede i retning af den betydning. Efter nok trin bliver statik til den scene, du beskrev.

En skrivemaskineside med én maskinskrevet linje på varmt papir, et færdigt fotografisk print lige under

Tre veje ind

De tre ting, der er værd at forstå

Hvorfor reproducerbarhed betyder noget

Et seed er startstøjen. Uden at fastlåse det kan du ikke ændre ét ord og se, hvad netop det ord gjorde, fordi forskellen mest skyldes et andet udgangspunkt.

  • Fastlås seedet for at sammenligne to prompts.
  • Gem det ved alt, du vil kunne vende tilbage til.
  • Et seed giver ingen mening på tværs af forskellige modeller.
AI-genereret produktstilleben

Detalje

Hvad dette forklarer

Den mekanik, der ændrer, hvordan du bruger enhver generator.

Hvorfor genererede billeder er unikke

Modellen forudsiger plausible pixels i stedet for at hente et lagret foto, så intet, den returnerer, er et stockbillede, andre også har.

Om diffusion er den eneste tilgang

Nej — tidligere systemer brugte GANs, og nogle pipelines kombinerer modeltyper. Til hverdagsbrug er den mentale model vigtigere end arkitekturen.

Hvorfor du bør vælge billedformat fra start

Modellen komponerer til den ramme, den får. Beskæring bagefter smider bevidst komposition væk.

Hvilken opløsning du skal generere i

1024 er sweet spot på de fleste modeller. Generér der og upscale i stedet for at bede om et stort lærred.

Om prompts bliver gemt

Afhænger helt af udbyderen. Det betyder mest, når en prompt beskriver kommercielt følsomt arbejde.

En AI-genereret produktscene med rekvisitter og kontrolleret skygge

Relateret

Brug mekanikken

Udforsk videre

Hvor denne mekanik gælder

Alle overflader her kører samme proces.