指南
文生图:AI 如何把文字变成照片

什么是文生图?
文生图是一类 AI:从一段文字 prompt 生成一张图片。你用自然语言描述想要的内容,AI 图像生成器就渲染出一张新的匹配图像。技术名称是“text-to-image 模型”。据维基百科,这类系统在 2022 年后迅速走红,当时像 DALL-E 2、Imagen、Stable Diffusion、Midjourney 等工具的输出已接近真实照片的质量。
给新手的关键提醒是:输出是生成出来的,不是检索来的。模型并不会去素材库里找已存在的照片,也不是把剪贴画拼在一起。它依据训练中学到的模式,一像素一像素地构建全新的图像。这也是为什么你可以要求从未被拍过的东西,比如“在覆满苔藓的钢琴上,一只由彩色玻璃制成的茶杯”,依然能得到自洽的结果。
大多数人是在一个简单的输入框里遇见文生图:打一句话,点击生成,拿到图。文字转照片就是这么用。复杂的部分都发生在输入框背后;对那套机制有个大概的了解,会显著提升你拿到理想结果的概率。
文生图到底如何工作?
2026 年的主流方法是 diffusion 模型,常见为 latent diffusion。直觉上有点反常,但很值得掌握:模型是通过“先学会破坏,再学会复原”来学会造图的。训练时它把真实图像不断加噪直至只剩雪花点,然后学习如何把噪声还原回图像。生成时,它从纯随机噪声出发,在你的 prompt 引导下逆向去噪,直到一张干净的图出现。
下面是这条流水线的白话分步,也是你每次点击生成时文字所走的相同路径。
- 你写一个 prompt。这是模型唯一的指令,所以具体性格外重要。
- 文本编码器读取它。一个语言或视觉-语言模型(例如 CLIP 文本编码器,或 Google 的 Imagen 使用的 T5 等大型语言模型)把你的文字转成捕捉语义的数值嵌入向量。
- 模型从随机噪声开始。画布一开始是一团无意义的雪花点,即一个随机 seed。
- 它逐步去噪。模型跨越若干步,每次去掉一点噪声;在每一步,文本嵌入都会把结果往你的描述方向拉。
- 图像被解码。在 latent diffusion 中,主要计算发生在压缩的潜在空间以提升速度,随后由解码器(VAE)把结果还原成全分辨率图像。
- 你得到成片。输出是一张受你的文字、seed 和模型设置共同条件约束的新图像。
两个技术概念能解释你会注意到的许多行为。seed 是那一团特定的随机起始噪声;复用相同的 seed 和 prompt 会得到同一张图,这就是可控迭代的方法。Guidance(常称 CFG scale)控制模型对 prompt 的服从度与自由发挥的权衡;拉高会更贴合文字但可能显得生硬,拉低会更有创意但更容易跑偏。
常见文生图术语都是什么意思?
有几个词会反复出现。弄懂它们,基本就能自信地看懂任何 AI 图像生成器的设置面板。
| 术语 | 通俗含义 | 与你的关系 |
|---|---|---|
| Prompt | 你写下的文字描述 | 你唯一的方向盘;具体性决定成片 |
| 负面 prompt | 要排除的要素清单 | 移除常见问题,如多余手指、画面文字或水印 |
| 扩散 | 通过逐步去噪来生成 | 解释了为何更多步骤往往更细致也更耗时 |
| 潜在空间 | 图像的压缩内部表示 | 说明为什么 latent diffusion 能够足够快以交互运行 |
| 文本编码器 | 把你的文字转成模型可读的数字 | 更大更强的编码器通常意味着更好的 prompt 理解 |
| Seed | 随机起始噪声 | 复用它即可可控地复现或迭代图像 |
| 引导/CFG scale | 模型对 prompt 的服从强度 | 过高显生硬;过低易忽略你的文字 |
| 步数 | 模型执行去噪的遍数 | 更多步数可能带来细节,但耗时且边际收益递减 |
| 纵横比 | 画幅长宽比 | 请有意识设置,避免构图被尴尬裁切 |
你不必每次都动齐这些参数。大多数工具默认只露出 prompt、negative prompt 和长宽比,其余藏在高级设置里。但知道每个“拉杆”做什么,能让你在结果跑偏时,迅速拧对那只旋钮。
文生图与图生图、编辑有何不同?
文生图只是多种模式中的一种,混淆它们是常见挫败来源。差异的本质在于你提供给模型的起点是什么。
- 文生图:输入只有文字。模型从随机噪声起步,完全依据你的描述搭建场景。适合从零创造全新画面。
- 图生图:输入是文字加一张起始图。模型以你的图为基底,按 prompt 转换,同时保留大致构图。适合改款、重绘、换风格。
- Inpainting 与编辑:输入是图像加一块遮罩区域。模型只重生你选中的部分。适合只修一个元素或替换局部,而不重骰整张图。
- Outpainting:模型把图像向原有边界外扩展,续写画面。适合改长宽比或增加留白/头部空间。
实际工作流里你会把它们混着用。你可能先用文生图打底,再切到编辑去修一只手或换个背景。搞清当前所处的模式,就知道模型“被允许改什么、会尽量保留什么”。
为什么同一个想法,不同人生成的图会不一样?
在两个工具里,甚至同一个工具里连试两次,同一想法也可能出现差异很大的图。这是预期行为,三件事几乎能解释全部原因。
首先是模型本身。不同的 AI 图像生成器训练数据与架构不同,因此默认风格、强项各异。像 Google 的 Imagen 等研究显示,扩大文本编码器的规模(不只是图像模型)会显著提升写实度与对文字的忠实度,这也是为何不同工具的 prompt 理解差异很大。
其次是随机性。diffusion 从随机噪声起步,所以即便 prompt 完全相同,不同 seed 也会产出不同图。这不是 bug,而是让你能生成一组变体、再挑最佳的机制。
第三是 prompt 与设置。含糊的 prompt 会让模型用“平均猜测”去补全空白,小小措辞变化都可能左右结果。Guidance、步数和长宽比也会继续推动偏移。实践上的结论是:对你来说“最好的 AI 图像生成器”,既取决于模型质量,也取决于它的 prompt 理解是否贴合你的表达方式。
怎么写一个好用的文生图 prompt?
因为 prompt 是你唯一的指令,写 prompt 是文生图里最重要的技能。一个稳妥的结构是按重要性排布:先主体,再场景、光线与风格,技术限定放在最后,另用 negative prompt 排除不想要的元素。
- 点名主体及关键特征:“30 多岁女性,柔和而自信的微笑,木炭灰西装外套。”
- 放进具体场景:“坐在中性灰背景前。”
- 明确光线:“左侧柔和漫射窗光”——往往是影响真实感的最大杠杆。
- 补上相机、镜头与风格:“85mm 镜头拍摄,浅景深,专业企业形象照。”
- 设定氛围与技术限定:“温暖亲和,焦点清晰,长宽比 4:5。”
- 加上 negative prompt:“强烈阴影、瑕疵、文字、水印。”
具体性胜过长篇大论。十个精准词胜过五十个空泛词,因为每个具体细节都在把模型从“平均猜测”中拉出来。当结果“差一点就对”时,一次只改一个变量,这样你能看清每次修改带来的影响。想看更系统、可直接复用的示例,去看我们的 AI 照片 prompt 写作指南,或用 AI Prompt Generator 把一个短想法扩展成完整 prompt。
今天的文生图有哪些局限?
文生图很强,但不是魔法。正视它的边界能省下不少挫败。
- 细节部位有规律地翻车。手、牙齿、画面里的文字、复杂反射是常见重灾区;每次都要检查。
- 它读不懂你的心思。模型只知道你写的内容,任何没写清的部分都会被它的默认假设填上。
- 精确复现很难。不借助专门工具,要在多张图中稳定生成同一个人、产品或 Logo 仍然困难。
- 输出是“看起来可信”,非事实陈述。模型会虚构细节,因此不适合要求准确性的场景,比如文档或证据。
- 质量因模型而异。弱一些的 AI 图像生成器会在复杂场景上吃力,而强模型能应对,因此工具本身与 prompt 同样重要。
对大多数创意与营销工作来说,这些都不是决定性障碍。它们只意味着:文生图是一个起点,需要你后续完善,而不是一键到位的神谕。先生成、再检查,然后用针对性的编辑把少数问题修好,而不是整张重来。
来源
- 01Text-to-image model (overview) — Wikipedia (访问于 2026-06-01)
- 02Latent diffusion model — Wikipedia (访问于 2026-06-01)
- 03Diffusion model — Wikipedia (访问于 2026-06-01)
- 04Contrastive Language–Image Pre-training (CLIP) — Wikipedia (访问于 2026-06-01)
- 05Imagen: Text-to-Image Diffusion Models — Google Research (访问于 2026-06-01)
- 06Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding — Saharia et al., arXiv (访问于 2026-06-01)
- 07Prompt engineering — Wikipedia (访问于 2026-06-01)
常见问题
- 文生图是什么意思?
- 文生图指的是从一段文字描述生成一张全新的图片。你输入一个 prompt,AI 图像生成器渲染出匹配的照片。图像是从零生成的,不是从素材库里检索,也不是拼接现有图片。
- AI 图像生成器如何把文字变成照片?
- 多数采用 diffusion。文本编码器把你的 prompt 转成数字,模型从随机噪声起步,在每一步去噪时都受你的文字引导。最后由解码器把结果还原成全分辨率图像。
- 文生图是在搜索现成图片吗?
- 不是。模型不会搜索或复制单一来源。它在训练中学到的是把文字与视觉场景关联的统计模式,每次生成都会从随机噪声中重建一张全新的原创图像。
- 什么是 diffusion 模型?
- diffusion 模型通过逆转加噪过程来学会生成图像。它先练习把真实图像变成噪声,再学习如何把噪声还原回去,从而能从随机噪声出发,在你的 prompt 引导下去噪成一张连贯的图片。
- 文生图里的 seed 是什么?
- seed 是那团特定的随机起始噪声。复用相同的 seed 与 prompt 会得到同一张图,这就是你进行可控迭代的方法。更换 seed 则会得到同一想法的不同变体。
- 什么是 CFG 或 guidance scale?
- Guidance(常称 CFG scale)控制模型对 prompt 的服从强度。数值更高会更贴近你的文字,但可能显得生硬;更低则更自由,结果也更容易偏离描述。
- 为什么同一个 prompt 我会得到不同的图?
- 因为 diffusion 从随机噪声起步,更换 seed 即使在措辞完全相同的情况下也会得到不同图。不同模型与不同设置会进一步放大差异。这是预期行为,也正因此你可以生成多种变体再挑选。
- 文生图与图生图有什么区别?
- 文生图只从文字起步,从噪声构建完整场景。图生图从文字加一张基底图起步,在保留大致构图的同时按描述转换。前者是从零创造,后者是重绘已有图片。
- 哪款 AI 图像生成器最适合文生图?
- 取决于你的需求,以及工具的 prompt 理解是否贴合你的表达方式。不同模型在默认风格、强项与对 prompt 的忠实度上都不同,因此“最佳”既关乎模型实力,也关乎匹配度。
- 如何让文生图的结果更好?
- 写具体的 prompt:按重要性依次写清主体、场景、光线与风格,加上 negative prompt,并设置合适的长宽比。随后一次只改一个变量去微调,而不是每次全改重写。
撰稿
LaFoto 编辑团队撰写 AI 照片生成的指南与对比,所有论断均有来源支撑,不编造。




