Přeskočit na obsah
LaFoto

průvodce

Text na obrázek: jak AI převádí slova na fotografie

Text na obrázek je proces, kdy AI generátor obrázků přečte psaný popis a vytvoří odpovídající fotografii. Zadáte prompt jako „štěně zlatého retrívra na deštěm lesklé městské ulici za soumraku“ a během pár sekund model vrátí snímek přesně toho. Uvnitř většiny moderních nástrojů jsou diffusion modely: textový encoder převádí Vaše slova na čísla, kterým model rozumí, pak model začne z čistého náhodného šumu a krok za krokem tento šum odstraňuje, přičemž každý krok směřuje blíž k popisu. Výsledkem je zcela nový obraz, nikoli vyhledaný snímek ani slepená koláž. Nic se nekopíruje z jednoho zdroje; model se naučil statistické vzorce, jak slova souvisejí s obrazovými scénami, a z nich od nuly rekonstruuje věrohodnou fotografii. Kvalitu výstupu nejvíce určují dvě věci, které máte v rukou: jak srozumitelně Váš prompt popisuje objekt, prostředí, světlo a styl, a jak dobrý je použitý model. Zbytek tohoto průvodce vysvětluje, jak pipeline funguje lidskou řečí, co znamenají klíčové pojmy a jak pomocí slov nasměrovat generování k fotografii, kterou máte v hlavě.
Od Redakční tým LaFoto

11 min čtení
Ilustrační kompozice znázorňující proměnu textu v obrázek

Co je text na obrázek?

Text na obrázek je kategorie AI, která generuje obrázek z psaného promptu. V běžném jazyce popíšete, co chcete, a AI generátor vykreslí nový obraz, který odpovídá. Technicky jde o text-to-image model a podle Wikipedie se tyto systémy rozšířily po roce 2022, kdy nástroje jako DALL-E 2, Imagen, Stable Diffusion a Midjourney začaly produkovat výstupy blížící se kvalitě reálných fotografií.

Klíčové pro nováčky: výstup se generuje, nevyhledává. Model nehledá hotovou fotku v knihovně ani neskládá clipart. Staví nový obraz pixel po pixelu podle vzorců, které se naučil při tréninku. Proto můžete žádat něco, co nikdy nikdo nefotil, třeba „šálek z vitrážového skla na mechem porostlém pianu“, a přesto dostanete smysluplný výsledek.

Většina lidí se s textem na obrázek setká přes jednoduché políčko: napište větu, stiskněte generovat, získáte obrázek. Text na fotografii funguje přesně takto. Vše složité se děje za tímto oknem a pochopení jeho základní logiky Vás dramaticky zlepší v získávání požadovaného výsledku.

Jak text na obrázek ve skutečnosti funguje?

Dominantním přístupem v roce 2026 je diffusion model, často latent diffusion model. Intuice je proti očekávání, ale stojí za pochopení: model se naučí tvořit obrázky tím, že se nejdřív naučí je ničit. Během tréninku bere reálné snímky, přidává šum až do statického „sněžení“ a učí se proces vracet zpět. Když má generovat nový obraz, začne z čistého náhodného šumu a spustí opačný postup, vedený Vaším promptem, dokud se nevynoří čistý obrázek.

Zde je pipeline v prostých krocích — stejná cesta, kterou Vaše slova procházejí pokaždé, když stisknete generovat.

  1. Napíšete prompt. Je to jediný pokyn, který model dostane, proto tolik záleží na konkrétnosti.
  2. Přečte ho textový encoder. Jazykový nebo vision-language model (např. CLIP text encoder nebo velký jazykový model jako T5 v Google Imagen) převede Vaše slova na číselné embeddingy vystihující význam.
  3. Model začne od náhodného šumu. Plátno je na začátku beze smyslu — náhodný seed.
  4. Probíhá denoise krok za krokem. V průběhu řady kroků model po částech odstraňuje šum a embedding textu v každém kroku směřuje výsledek k Vašemu popisu.
  5. Obraz se dekóduje. U latent diffusion modelu se práce děje v komprimovaném latentním prostoru kvůli rychlosti, poté decoder (VAE) výsledek rozvine do plného rozlišení.
  6. Dostanete hotovou fotografii. Výstup je nový obraz podmíněný Vašimi slovy, seedem a nastavením modelu.

Dvě technické myšlenky vysvětlí mnoho chování, kterého si všimnete. Seed je konkrétní počáteční náhodný šum; znovu použijte tentýž seed a prompt a dostanete stejný obrázek — takto iterujete kontrolovaně. Guidance (často označované jako CFG scale) určuje, jak striktně model následuje Váš prompt versus jak volně generuje; čím výš, tím víc se obraz drží slov, ale může působit křečovitě, čím níž, tím tvořivěji driftuje.

Co znamenají klíčové pojmy u text-to-image?

Několik pojmů se objevuje neustále. Když je znáte, většina záhad zmizí a s jistotou přečtete panel nastavení jakéhokoli AI generátoru obrázků.

PojemVýznam lidskou řečíProč Vás to zajímá
PromptTextový popis, který píšeteVáš jediný volant; konkrétnost rozhoduje o výsledku
Negativní promptSeznam, co vyloučitOdstraní opakující se problémy jako přebytečné prsty, text nebo vodoznaky
DifuzeGenerování postupným odstraňováním šumuVysvětluje, proč více kroků může přidat detail i čas
latentní prostorKomprimovaná vnitřní reprezentace obrazuProč jsou latent diffusion modely dost rychlé pro interaktivní práci
textový enkodérPřevádí Vaše slova na čísla, která model čteVětší a lepší encoder obvykle lépe chápe prompty
SeedPočáteční náhodný šumZnovupoužitím reprodukujete nebo kontrolovaně iterujete
guidance / škála CFGJak striktně model následuje promptPříliš vysoko působí křečovitě; příliš nízko ignoruje slova
KrokyPočet denoise průchodů modeluVíce kroků může přidat detail, ale stojí čas a má klesající přínos
Poměr stranTvar záběruNastavte záměrně, ať kompozice není nešikovně oříznutá

Nemusíte pokaždé sahat na všechno. Většina nástrojů nabízí standardně políčko pro prompt, negative prompt a aspect ratio a zbytek skrývá v pokročilých nastaveních. Když ale víte, co který ovladač dělá, při nepovedeném výsledku víte, který knoflík otočit.

Jak se text na obrázek liší od image-to-image a úprav?

Text na obrázek je jeden z více režimů a jejich záměna bývá častým zdrojem frustrace. Rozdíl je v tom, co modelu dáte na začátek.

  • Text na obrázek: vstupem jsou jen slova. Model začíná z náhodného šumu a buduje celou scénu podle popisu. Nejlepší pro tvorbu od nuly.
  • Image to image: vstupem jsou slova plus výchozí obrázek. Model použije Váš snímek jako základ a transformuje ho podle promptu, přitom zachová hrubou kompozici. Nejlepší pro restylování či přepracování existující fotky.
  • Inpainting a úpravy: vstupem je obrázek plus maskovaná oblast. Model přegeneruje jen vybranou část. Nejlepší pro opravu či výměnu jednoho prvku bez rerollu celého záběru.
  • Outpainting: model rozšíří obrázek za původní okraje a vymyslí navazující scénu. Nejlepší pro změnu aspect ratio nebo přidání místa nad hlavou.

V praxi tyto režimy kombinujete. Základ vygenerujete textem na obrázek a pak přepnete do editace, abyste opravili jednu ruku nebo vyměnili pozadí. Znalost režimu Vám řekne, co model smí měnit a co se bude snažit zachovat.

Proč dva lidé dostanou od stejného nápadu různé fotky?

Napíšete stejný nápad do dvou nástrojů, nebo i dvakrát do téhož, a získáte velmi odlišné snímky. To je očekávané a tři faktory vysvětlují téměř vše.

Za prvé, samotný model. Různé AI generátory obrázků jsou trénované na odlišném datech a architekturách, proto mají specifický výchozí vzhled a jiné silné stránky. Výzkum jako Google Imagen ukázal, že škálování textového encoderu, nejen obrazového modelu, výrazně zlepšilo jak fotorealismus, tak věrnost popisu, což vysvětluje, proč se chápání promptů mezi nástroji tolik liší.

Za druhé, náhodnost. Diffusion začíná z náhodného šumu, takže jiný seed dá jiný obraz i při identickém promptu. Je to vlastnost, ne chyba; dovoluje generovat varianty a vybrat tu nejlepší.

Za třetí, prompt a nastavení. Vaginí prompty nechávají model domýšlet mezery svým průměrným odhadem, proto drobné změny slov zatahují výsledek jinam. Guidance, steps a aspect ratio ho posunou ještě dál. Prakticky z toho plyne, že nejlepší AI generátor pro Vás je částečně o kvalitě modelu a částečně o tom, jak dobře chápe prompty ve stylu, jakým věci popisujete.

Jak napsat text-to-image prompt, který funguje?

Protože prompt je Váš jediný pokyn, psaní promptů je u textu na obrázek nejdůležitější dovednost. Spolehlivý vzorec pojmenovává věci podle důležitosti: nejdřív subjekt, pak prostředí, světlo a styl, technické upřesnění na konec a samostatný negative prompt pro vyloučení nežádoucího.

  1. Pojmenujte subjekt a klíčové rysy: „žena kolem 30 let, jemný sebejistý úsměv, uhlový blazer“
  2. Umístěte ho do prostředí: „vsedě proti neutrálnímu šedému pozadí“
  3. Upřesněte světlo: „měkké difuzní denní okno zleva“ — často největší páka na realismus.
  4. Přidejte fotoaparát, objektiv a styl: „foceno na 85mm objektiv, malá hloubka ostrosti, profesionální korporátní portrét“
  5. Nastavte náladu a technická vodítka: „vřelé a přístupné, ostré zaostření, aspect ratio 4:5“
  6. Přidejte negative prompt: „tvrdé stíny, nedokonalosti pleti, text, watermark“

Konkrétnost vítězí nad délkou. Deset přesných slov obvykle překoná padesát vágních, protože každý konkrétní detail odtlačí model od jeho průměrného odhadu. Když je výsledek blízko, ale ne ono, měňte vždy jednu proměnnou, ať vidíte, co udělala. Podrobný postup s hotovými příklady najdete v našem návodu, jak psát AI photo prompty, nebo nechte AI Prompt Generator rozpracovat plný prompt z krátkého nápadu.

Jaké jsou dnešní limity textu na obrázek?

Text na obrázek je silný, ale není kouzelný. Střízlivý pohled na limity šetří frustraci.

  • Jemné detaily selhávají předvídatelně. Ruce, zuby, text v obraze a složité odrazy jsou obvyklé zóny artefaktů; vždy je zkontrolujte.
  • Nečte Vám myšlenky. Model ví jen to, co napíšete, takže vše nevyřčené doplní svými výchozími předpoklady.
  • Přesná reprodukce je těžká. Konzistentně generovat tutéž konkrétní osobu, produkt či logo napříč snímky je stále obtížné bez specializovaných nástrojů.
  • Výstup je věrohodný, ne faktický. Model si detaily vymýšlí, proto je text na obrázek nevhodný pro cokoliv, co musí být přesné, jako dokumentace nebo důkazy.
  • Kvalita se liší podle modelu. Slabší AI generátor bude zápasit se složitými scénami, které silnější zvládne — nástroj je stejně důležitý jako prompt.

Pro většinu kreativní a marketingové práce to nejsou překážky. Znamenají jen, že text na obrázek je výchozí bod k doladění, ne jediné kliknutí k cíli. Generujte, zkontrolujte a opravte několik chybných míst cílenou editací místo přegenerování celého snímku.

Zdroje

  1. 01Text-to-image model (overview)Wikipedia (přístup 2026-06-01)
  2. 02Latent diffusion modelWikipedia (přístup 2026-06-01)
  3. 03Diffusion modelWikipedia (přístup 2026-06-01)
  4. 04Contrastive Language–Image Pre-training (CLIP)Wikipedia (přístup 2026-06-01)
  5. 05Imagen: Text-to-Image Diffusion ModelsGoogle Research (přístup 2026-06-01)
  6. 06Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingSaharia et al., arXiv (přístup 2026-06-01)
  7. 07Prompt engineeringWikipedia (přístup 2026-06-01)

Často kladené otázky

Co znamená „text na obrázek“?
Text na obrázek znamená generování zcela nového obrázku z psaného popisu. Napíšete prompt a AI generátor obrázků vykreslí odpovídající fotografii. Obraz se vytváří od nuly, nevyhledává se v knihovně ani neskládá z existujících snímků.
Jak AI generátor obrázků promění slova ve fotografii?
Většina používá diffusion. Textový encoder převede Váš prompt na čísla, model začne z náhodného šumu a krok za krokem ho odstraňuje, zatímco Váš prompt řídí každý krok. Decoder pak výsledek převede do plného rozlišení.
Je text na obrázek jen hledání existujících obrázků?
Ne. Model nehledá ani nekopíruje jeden zdroj. Při tréninku se naučil statistické vzorce propojující slova s vizuálními scénami a pokaždé z náhodného šumu rekonstruuje nový, originální obraz.
Co je diffusion model?
Diffusion model se učí generovat obrázky tím, že obrací proces šumění. Procvičuje převod reálných snímků na šum a naučí se to vracet, aby mohl začít z náhodného šumu a denoise převést na ucelený obraz vedený Vaším promptem.
Co je seed u textu na obrázek?
Seed je konkrétní počáteční náhodný šum. Opakovaným použitím stejného seede a promptu zreprodukujete stejný obrázek — takto lze kontrolovaně iterovat. Změna seede dá jinou variantu téhož nápadu.
Co je CFG nebo guidance scale?
Guidance, často zvané CFG scale, určuje, jak striktně model následuje Váš prompt. Vyšší hodnoty se shodují s Vašimi slovy těsněji, ale mohou působit křečovitě; nižší dávají modelu volnost a mohou od popisu odplout.
Proč dostávám z téhož promptu jiné obrázky?
Protože diffusion začíná z náhodného šumu, jiný seed dá jiný obraz i při shodném znění. Rozdílné modely a nastavení výsledek dále mění. Je to očekávané chování a umožňuje generovat a vybírat z variant.
Jaký je rozdíl mezi textem na obrázek a image to image?
Text na obrázek začíná jen od slov a staví celou scénu ze šumu. Image to image začíná od slov plus výchozího obrázku a transformuje ho při zachování hrubé kompozice. Jeden tvoří od nuly, druhý přepracovává existující snímek.
Který AI generátor obrázků je pro text na obrázek nejlepší?
Záleží na Vašich potřebách a na tom, jak dobře nástroj chápe prompty ve stylu, jakým popisujete věci. Modely se liší výchozím vzhledem, silnými stránkami i věrností promptu, takže „nejlepší“ je částečně kvalita modelu a částečně shoda s Vámi.
Jak získám z textu na obrázek lepší výsledky?
Pište konkrétní prompty: pojmenujte subjekt, prostředí, světlo a styl v tomto pořadí, přidejte negative prompt a nastavte aspect ratio. Pak měňte vždy jednu proměnnou, abyste ladili výsledek, místo přepisování všeho najednou.

Napsal/a

Redakční tým LaFoto

Redakční tým LaFoto píše průvodce a srovnání o AI generování fotografií, vždy se zdroji a bez výmyslů.

Pokračovat ve čtení

Začněte tvořit ještě dnes

Vytvořte svůj první obrázek v nejlepším AI generátoru obrázků.

Větu promění v hotový, fotorealistický obrázek během pár sekund — pak doladíte každý detail. Bez nastavování, bez Discordu, bez GPU.

Připojte se k 4 200+ tvůrcům používajícím LaFoto

O tomto průvodci

Autor
Redakční tým LaFoto
Podle
Vlastní testování, ne přepisy cizích článků
Doporučení modelu
Zastarává, chování modelů se mění
Sponzorováno
Ne — žádná placená umístění
Opravy
Opravy přímo na této stránce
Recenzováno
Znovu kontrolováno při změně modelů

V praxi

Co se doopravdy děje mezi Vaší větou a obrázkem

Difuzní modely se trénují tak, že do reálných snímků krok za krokem přidávají šum, až z nich je statický obraz, a učí se proces obrátit. Po natrénování může model začít z čistého šumu a denoise procesem dojít k něčemu soudržnému.

Váš prompt je řízení. Jazyková složka převádí slova na číselnou reprezentaci významu a při každém kroku denoise se vznikající obraz postrkuje k tomuto významu. Po dostatečném počtu kroků se šum promění ve scénu, kterou jste popsali.

Stránka z psacího stroje s jediným napsaným řádkem na teplém papíře, hotový fotografický tisk leží přímo pod ní

Tři způsoby, jak začít

Tři věci, kterým stojí za to rozumět

Proč je důležitá reprodukovatelnost

Seed je počáteční šum. Bez jeho zafixování nemůžete změnit jediné slovo a vidět, co přesně udělalo — pozorovaný rozdíl bude většinou jen jiný start.

  • Zafixujte seed pro porovnání dvou promptů.
  • Zapisujte si ho u čehokoli, k čemu se chcete vrátit.
  • Seed mezi různými modely nedává smysl.
AI generované produktové zátiší

detail

Co zde vysvětlujeme

Mechanika, která změní, jak používáte jakýkoli generátor.

Proč jsou generované obrázky jedinečné

Model predikuje pravděpodobné pixely, nevybírá uloženou fotku, takže to, co vrátí, není stock, který má i někdo jiný.

Zda je diffusion jediný přístup

Není — dřívější systémy používaly GANy a některé pipeline typy modelů kombinují. Pro běžnou praxi je důležitější mentální model než architektura.

Proč zvolit poměr stran hned na začátku

Model komponuje pro daný rám, proto ořezem zpětně zahodíte kompozici, kterou záměrně vytvořil.

V jakém rozlišení generovat

1024 je u většiny modelů sweet spot. Generujte v něm a pak proveďte upscale, místo abyste chtěli obří plátno.

Zda se prompty ukládají

Záleží čistě na poskytovateli. Nejvíc to řešte, když prompt popisuje obchodně citlivou práci.

AI generovaná produktová scéna s rekvizitami a řízeným stínem

Související

Aplikujte mechaniku

Pokračujte v objevování

Kde tato mechanika platí

Všechna zdejší rozhraní běží na stejném procesu.