Vejledning
Tekst til billede: sådan omsætter AI ord til fotos

Hvad er tekst til billede?
Tekst til billede er en kategori af AI, der genererer et billede ud fra en skrevet prompt. Du beskriver, hvad du vil have, i helt almindeligt sprog, og en AI-billedgenerator render et nyt billede, der matcher. Den tekniske betegnelse er en tekst-til-billede-model, og ifølge Wikipedia tog disse systemer fart efter 2022, da værktøjer som DALL·E 2, Imagen, Stable Diffusion og Midjourney begyndte at levere output tæt på kvaliteten af rigtige fotografier.
Det afgørende for nybegyndere er, at output bliver genereret, ikke hentet. Modellen søger ikke i et bibliotek efter et foto, der allerede findes, og den klistrer ikke clipart sammen. Den bygger et frisk billede pixel for pixel baseret på mønstre, den lærte under træningen. Derfor kan du bede om noget, der aldrig er blevet fotograferet, som "en tekop lavet af glasmosaik på et mosbegroet klaver", og stadig få et sammenhængende resultat.
De fleste møder tekst til billede gennem en simpel boks: skriv en sætning, tryk generér, få et billede. Tekst til foto fungerer præcis sådan. Alt det komplekse sker bag den boks, og forstår du det i grove træk, bliver du markant bedre til at få det resultat, du vil have.
Hvordan fungerer tekst til billede egentlig?
Den dominerende tilgang i 2026 er diffusionsmodellen, ofte en latent diffusionsmodel. Intuitionen er kontraintuitiv men værd at forstå: Modellen lærer at skabe billeder ved først at lære at ødelægge dem. Under træning tager den rigtige billeder, tilføjer støj, indtil de bliver til statisk, og lærer at vende den proces. For at generere et nyt billede starter den fra ren tilfældig støj og kører den omvendte proces, styret af din prompt, indtil et rent billede dukker op.
Her er pipelinen i enkle trin, den samme rute dine ord tager, hver gang du trykker generér.
- Du skriver en prompt. Det er den eneste instruktion, modellen får, og derfor betyder specificitet så meget.
- En tekstkoder læser den. En sprog- eller vision-sprog-model (såsom en CLIP-tekstkoder eller en stor sprogmodel som T5 i Googles Imagen) konverterer dine ord til en numerisk embedding, der indfanger deres betydning.
- Modellen starter fra tilfældig støj. Lærredet begynder som meningsløs statisk — et tilfældigt seed.
- Den fjerner støj trin for trin. Over en række trin fjerner modellen lidt støj ad gangen, og ved hvert trin styrer tekst-embedding’en resultatet i retning af din beskrivelse.
- Et billede dekodes. I en latent diffusionsmodel foregår arbejdet i et komprimeret latent rum for hastighed, og derefter udvider en dekoder (en VAE) resultatet til et billede i fuld opløsning.
- Du får et færdigt foto. Outputtet er et nyt billede betinget af dine ord, dit seed og modellens indstillinger.
To tekniske idéer forklarer meget af den adfærd, du lægger mærke til. Seed er den specifikke tilfældige startstøj; genbrug samme seed og prompt, og du får det samme billede, hvilket er måden at iterere kontrolleret på. Vejledning (ofte kaldet CFG-skala) styrer, hvor strengt modellen følger din prompt kontra genererer frit; skruer du op, lægger billedet sig tættere på dine ord, men det kan virke påtaget; skruer du ned, driver det mere kreativt.
Hvad betyder de vigtigste tekst-til-billede-begreber?
En håndfuld termer går igen hele tiden. Kender du dem, forsvinder det meste af mystikken, og du kan læse enhver AI-billedgenerators indstillingspanel med ro i maven.
| betegnelse | Hverdagsforklaring | Hvorfor det betyder noget for dig |
|---|---|---|
| Prompt | Den tekstbeskrivelse, du skriver | Dit eneste rat; specificitet afgør resultatet |
| Negativ prompt | En liste over ting, der skal udelukkes | Fjerner tilbagevendende problemer som ekstra fingre, tekst eller vandmærker |
| diffusion | Generering ved at fjerne støj trin for trin | Forklarer hvorfor flere trin kan give flere detaljer og mere tid |
| Latent rum | En komprimeret intern repræsentation af billedet | Derfor er latente diffusionsmodeller hurtige nok til interaktiv brug |
| Tekstkoder | Omsætter dine ord til tal, modellen kan læse | En større, bedre koder giver typisk bedre prompt-forståelse |
| Seed | Den tilfældige startstøj | Genbrug det for at reproducere eller iterere kontrolleret på et billede |
| Vejledning / CFG-skala | Hvor strengt modellen følger prompten | For højt ser påtaget ud; for lavt ignorerer dine ord |
| Trin | Hvor mange støjfjerner-pas modellen kører | Flere trin kan give detaljer men koster tid, med aftagende udbytte |
| Formatforhold | Rammens form | Sæt det med vilje, så din komposition ikke beskæres akavet |
Du behøver ikke røre ved det hele hver gang. De fleste værktøjer viser som standard en prompt-boks, en negativ prompt og et formatforhold og gemmer resten under avancerede indstillinger. Men ved du, hvad hver enkelt hængsel gør, kan du, når et resultat er skævt, dreje på den rigtige knap.
Hvordan adskiller tekst til billede sig fra billede-til-billede og redigering?
Tekst til billede er én tilstand blandt flere, og forvekslingen imellem dem er en hyppig kilde til frustration. Forskellen handler om, hvad du giver modellen som udgangspunkt.
- Tekst til billede: input er kun ord. Modellen starter fra tilfældig støj og bygger hele scenen ud fra din beskrivelse. Bedst til at skabe noget nyt fra bunden.
- Billede til billede: input er ord plus et startbillede. Modellen bruger dit billede som base og transformerer det efter prompten, mens den bevarer den grove komposition. Bedst til at restyle eller omarbejde et eksisterende billede.
- Inpainting og redigering: input er et billede plus et maskeret område. Modellen regenererer kun den del, du vælger. Bedst til at rette eller udskifte ét element uden at kaste hele billedet om.
- Outpainting: modellen udvider et billede ud over dets oprindelige kanter og opfinder sceneri, der fortsætter rammen. Bedst til at ændre formatforhold eller give mere luft over hovedet.
I et rigtigt flow blander du disse. Du kan generere en base med tekst til billede og derefter skifte til redigering for at rette en enkelt hånd eller skifte baggrund. At vide, hvilken tilstand du er i, fortæller dig, hvad modellen må ændre, og hvad den vil forsøge at bevare.
Hvorfor får to personer forskellige fotos ud fra den samme idé?
Skriv den samme idé i to værktøjer — eller endda det samme værktøj to gange — og du kan få meget forskellige billeder. Det er forventet, og tre faktorer forklarer næsten det hele.
For det første modellen. Forskellige AI-billedgeneratorer er trænet på forskellige data med forskellige arkitekturer, så hver har et særpræget standardlook og forskellige styrker. Forskning som Googles Imagen viste, at opskalering af tekstkoderen — ikke kun billedmodellen — markant forbedrede både fotorealisme og hvor trofast billedet matchede ordene, hvilket er grunden til, at prompt-forståelse varierer så meget mellem værktøjer.
For det andet tilfældigheden. Diffusion starter fra tilfældig støj, så et andet seed giver et andet billede, selv med identisk prompt. Det er en funktion, ikke en fejl; det er det, der lader dig generere variationer og vælge den bedste.
For det tredje prompten og indstillingerne. Vage prompts lader modellen udfylde hullerne med sit gennemsnitsgæt, så små formuleringer kan ændre resultatet markant. Vejledning, trin og formatforhold flytter det yderligere. Den praktiske pointe er, at den bedste AI-billedgenerator for dig både handler om modelkvalitet og om, hvor godt dens prompt-forståelse matcher den måde, du beskriver ting på.
Hvordan skriver du en tekst-til-billede-prompt, der virker?
Fordi prompten er din eneste instruktion, er promptskrivning den vigtigste færdighed i tekst til billede. Den sikre opskrift navngiver ting i prioriteret rækkefølge: motiv først, derefter miljø, lys og stil, med tekniske kvalifikatorer til sidst og en separat negativ prompt for det, der skal udelukkes.
- Navngiv motivet og dets nøgleattributter: "en kvinde i 30’erne, blød, selvsikker smil, koksgrå blazer."
- Placer det i et miljø: "siddende mod en neutral grå baggrund."
- Angiv lyset: "blødt, diffust vindueslys fra venstre" — ofte den enkeltstørste løftestang for realisme.
- Tilføj kamera, objektiv og stil: "taget med 85mm objektiv, lav dybdeskarphed, professionelt corporate-portræt."
- Sæt stemning og tekniske kvalifikatorer: "varm og imødekommende, knivskarp fokus, formatforhold 4:5."
- Tilføj en negativ prompt: "hårde skygger, hudpletter, tekst, vandmærke."
Specificitet slår længde. Ti præcise ord overgår som regel halvtreds vage, fordi hver konkret detalje styrer modellen væk fra dens gennemsnitsgæt. Når et resultat er tæt på men ikke rigtigt, så ændr én variabel ad gangen, så du kan se, hvad hver redigering gjorde. For en dybere gennemgang med eksempler, der er klar til brug, se vores guide til, hvordan du skriver AI-fotoprompts, eller lad AI Prompt Generator bygge en fuld prompt ud fra en kort idé.
Hvad er begrænsningerne ved tekst til billede i dag?
Tekst til billede er stærkt, men ikke magi, og at se klart på begrænsningerne sparer dig for frustration.
- Fine detaljer fejler forudsigeligt. Hænder, tænder, tekst i billedet og indviklede reflekser er de typiske problemzoner; tjek dem hver gang.
- Den kan ikke læse dine tanker. Modellen ved kun, hvad du skrev, så alt, du udelader, udfyldes af dens standardantagelser.
- Præcis reproduktion er svær. At generere den samme specifikke person, det samme produkt eller logo konsekvent på tværs af billeder er stadig vanskeligt uden specialværktøjer.
- Output er plausibelt, ikke faktuelt. Modellen opfinder detaljer, så tekst til billede er uegnet til noget, der skal være korrekt, som dokumentation eller bevismateriale.
- Kvaliteten varierer efter model. En svagere AI-billedgenerator vil kæmpe med komplekse scener, som en stærkere håndterer, så værktøjet betyder lige så meget som prompten.
Ingen af disse er showstoppere for de fleste kreative og marketingopgaver. De betyder blot, at tekst til billede er et udgangspunkt, du forfiner — ikke et ét-klik-orakel. Generér, inspicér, og ret så de få ting, der er forkerte, med en målrettet redigering i stedet for at rulle hele billedet om.
Kilder
- 01Text-to-image model (overview) — Wikipedia (tilgået 2026-06-01)
- 02Latent diffusion model — Wikipedia (tilgået 2026-06-01)
- 03Diffusion model — Wikipedia (tilgået 2026-06-01)
- 04Contrastive Language–Image Pre-training (CLIP) — Wikipedia (tilgået 2026-06-01)
- 05Imagen: Text-to-Image Diffusion Models — Google Research (tilgået 2026-06-01)
- 06Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding — Saharia et al., arXiv (tilgået 2026-06-01)
- 07Prompt engineering — Wikipedia (tilgået 2026-06-01)
Ofte stillede spørgsmål
- Hvad betyder tekst til billede?
- Tekst til billede betyder at generere et helt nyt billede ud fra en skriftlig beskrivelse. Du skriver en prompt, og en AI-billedgenerator render et matchende foto. Billedet genereres fra bunden — ikke hentet fra et bibliotek eller sammensat af eksisterende billeder.
- Hvordan omsætter en AI-billedgenerator ord til et foto?
- De fleste bruger diffusion. En tekstkoder konverterer din prompt til tal, modellen starter fra tilfældig støj, og den fjerner den støj trin for trin, mens din prompt styrer hvert trin. En dekoder laver derefter resultatet om til et billede i fuld opløsning.
- Er tekst til billede bare søgning efter eksisterende billeder?
- Nej. Modellen søger ikke og kopierer ikke en enkelt kilde. Den har lært statistiske mønstre, der forbinder ord med visuelle scener, under træning, og rekonstruerer et nyt, originalt billede fra tilfældig støj, hver gang du genererer.
- Hvad er en diffusionsmodel?
- En diffusionsmodel lærer at generere billeder ved at vende en støjproces. Den øver sig i at gøre rigtige billeder til støj og lærer så at gøre det om, så den kan starte fra tilfældig støj og fjerne støjen til et sammenhængende billede, guidet af din prompt.
- Hvad er et seed i tekst til billede?
- Seed er den specifikke tilfældige startstøj. Genbruger du samme seed og prompt, får du det samme billede, hvilket er måden at iterere kontrolleret på. Skifter du seed, får du en anden variation af den samme idé.
- Hvad er CFG eller vejledningsskala?
- Vejledning, ofte kaldet CFG-skala, styrer hvor strengt modellen følger din prompt. Højere værdier matcher dine ord tættere, men kan se påtagede ud; lavere værdier lader modellen generere mere frit og drive fra din beskrivelse.
- Hvorfor får jeg forskellige billeder fra den samme prompt?
- Fordi diffusion starter fra tilfældig støj, giver et andet seed et andet billede — selv med identisk formulering. Forskellige modeller og indstillinger ændrer resultatet yderligere. Det er forventet adfærd og lader dig generere og vælge mellem variationer.
- Hvad er forskellen på tekst til billede og billede til billede?
- Tekst til billede starter kun fra ord og bygger hele scenen ud fra støj. Billede til billede starter fra ord plus et basebillede og transformerer det, mens den grove komposition bevares. Det ene skaber fra bunden; det andet omarbejder et eksisterende billede.
- Hvilken AI-billedgenerator er bedst til tekst til billede?
- Det afhænger af dine behov og hvor godt et værktøjs prompt-forståelse matcher den måde, du beskriver ting på. Modeller adskiller sig i standardlook, styrker og prompt-trofæsthed, så den bedste AI-billedgenerator handler både om modelkvalitet og om pasform.
- Hvordan får jeg bedre resultater fra tekst til billede?
- Skriv specifikke prompts: navngiv motiv, miljø, lys og stil i prioriteret rækkefølge, tilføj en negativ prompt, og sæt formatforholdet. Ændr derefter én variabel ad gangen for at forfine i stedet for at skrive det hele om på én gang.
Skrevet af
Redaktionen bag LaFoto skriver guider og sammenligninger om AI-fotogenerering — med kilder og uden opdigtede fakta.
Læs videre
Begynd at skabe i dag
Generér dit første billede med den bedste AI-billedgenerator.
Gør en sætning til et færdigt, fotorealistisk billede på få sekunder — og finpuds derefter hver detalje. Ingen opsætning, ingen Discord, ingen GPU.
Slut dig til 4.200+ skabere, der bruger LaFoto




