跳到正文
LaFoto

指南

文生图:AI 如何把文字变成照片

文生图是指 AI 图像生成器读取一段文字描述并产出匹配的照片。你输入一个 prompt,例如“黄昏、雨后路面反光的城市街道上一只金毛幼犬”,模型会在几秒内给出对应图像。底层大多是 diffusion 模型:文本编码器把你的文字转成模型能理解的数字,模型从完全随机的噪声起步,逐步去噪,每一步都朝着与你描述更一致的方向推进。结果是一张全新的图像,不是搜索结果,也不是拼贴。没有从单一来源复制;模型学到的是词与视觉场景的统计关系,并据此从零重建出可信的照片。你能影响的两个关键因素基本决定成片质量:你的 prompt 是否清楚地描述了主体、场景、光线和风格,以及底层模型本身的能力。接下来的指南会用通俗语言讲清这条流水线的工作方式、常见术语的含义,以及如何用文字把它引导到你脑海中的画面。
作者 LaFoto 编辑团队

11 分钟读完
一幅说明性构图,表现文字被转化为图像的过程

什么是文生图?

文生图是一类 AI:从一段文字 prompt 生成一张图片。你用自然语言描述想要的内容,AI 图像生成器就渲染出一张新的匹配图像。技术名称是“text-to-image 模型”。据维基百科,这类系统在 2022 年后迅速走红,当时像 DALL-E 2、Imagen、Stable Diffusion、Midjourney 等工具的输出已接近真实照片的质量。

给新手的关键提醒是:输出是生成出来的,不是检索来的。模型并不会去素材库里找已存在的照片,也不是把剪贴画拼在一起。它依据训练中学到的模式,一像素一像素地构建全新的图像。这也是为什么你可以要求从未被拍过的东西,比如“在覆满苔藓的钢琴上,一只由彩色玻璃制成的茶杯”,依然能得到自洽的结果。

大多数人是在一个简单的输入框里遇见文生图:打一句话,点击生成,拿到图。文字转照片就是这么用。复杂的部分都发生在输入框背后;对那套机制有个大概的了解,会显著提升你拿到理想结果的概率。

文生图到底如何工作?

2026 年的主流方法是 diffusion 模型,常见为 latent diffusion。直觉上有点反常,但很值得掌握:模型是通过“先学会破坏,再学会复原”来学会造图的。训练时它把真实图像不断加噪直至只剩雪花点,然后学习如何把噪声还原回图像。生成时,它从纯随机噪声出发,在你的 prompt 引导下逆向去噪,直到一张干净的图出现。

下面是这条流水线的白话分步,也是你每次点击生成时文字所走的相同路径。

  1. 你写一个 prompt。这是模型唯一的指令,所以具体性格外重要。
  2. 文本编码器读取它。一个语言或视觉-语言模型(例如 CLIP 文本编码器,或 Google 的 Imagen 使用的 T5 等大型语言模型)把你的文字转成捕捉语义的数值嵌入向量。
  3. 模型从随机噪声开始。画布一开始是一团无意义的雪花点,即一个随机 seed。
  4. 它逐步去噪。模型跨越若干步,每次去掉一点噪声;在每一步,文本嵌入都会把结果往你的描述方向拉。
  5. 图像被解码。在 latent diffusion 中,主要计算发生在压缩的潜在空间以提升速度,随后由解码器(VAE)把结果还原成全分辨率图像。
  6. 你得到成片。输出是一张受你的文字、seed 和模型设置共同条件约束的新图像。

两个技术概念能解释你会注意到的许多行为。seed 是那一团特定的随机起始噪声;复用相同的 seed 和 prompt 会得到同一张图,这就是可控迭代的方法。Guidance(常称 CFG scale)控制模型对 prompt 的服从度与自由发挥的权衡;拉高会更贴合文字但可能显得生硬,拉低会更有创意但更容易跑偏。

常见文生图术语都是什么意思?

有几个词会反复出现。弄懂它们,基本就能自信地看懂任何 AI 图像生成器的设置面板。

术语通俗含义与你的关系
Prompt你写下的文字描述你唯一的方向盘;具体性决定成片
负面 prompt要排除的要素清单移除常见问题,如多余手指、画面文字或水印
扩散通过逐步去噪来生成解释了为何更多步骤往往更细致也更耗时
潜在空间图像的压缩内部表示说明为什么 latent diffusion 能够足够快以交互运行
文本编码器把你的文字转成模型可读的数字更大更强的编码器通常意味着更好的 prompt 理解
Seed随机起始噪声复用它即可可控地复现或迭代图像
引导/CFG scale模型对 prompt 的服从强度过高显生硬;过低易忽略你的文字
步数模型执行去噪的遍数更多步数可能带来细节,但耗时且边际收益递减
纵横比画幅长宽比请有意识设置,避免构图被尴尬裁切

你不必每次都动齐这些参数。大多数工具默认只露出 prompt、negative prompt 和长宽比,其余藏在高级设置里。但知道每个“拉杆”做什么,能让你在结果跑偏时,迅速拧对那只旋钮。

文生图与图生图、编辑有何不同?

文生图只是多种模式中的一种,混淆它们是常见挫败来源。差异的本质在于你提供给模型的起点是什么。

  • 文生图:输入只有文字。模型从随机噪声起步,完全依据你的描述搭建场景。适合从零创造全新画面。
  • 图生图:输入是文字加一张起始图。模型以你的图为基底,按 prompt 转换,同时保留大致构图。适合改款、重绘、换风格。
  • Inpainting 与编辑:输入是图像加一块遮罩区域。模型只重生你选中的部分。适合只修一个元素或替换局部,而不重骰整张图。
  • Outpainting:模型把图像向原有边界外扩展,续写画面。适合改长宽比或增加留白/头部空间。

实际工作流里你会把它们混着用。你可能先用文生图打底,再切到编辑去修一只手或换个背景。搞清当前所处的模式,就知道模型“被允许改什么、会尽量保留什么”。

为什么同一个想法,不同人生成的图会不一样?

在两个工具里,甚至同一个工具里连试两次,同一想法也可能出现差异很大的图。这是预期行为,三件事几乎能解释全部原因。

首先是模型本身。不同的 AI 图像生成器训练数据与架构不同,因此默认风格、强项各异。像 Google 的 Imagen 等研究显示,扩大文本编码器的规模(不只是图像模型)会显著提升写实度与对文字的忠实度,这也是为何不同工具的 prompt 理解差异很大。

其次是随机性。diffusion 从随机噪声起步,所以即便 prompt 完全相同,不同 seed 也会产出不同图。这不是 bug,而是让你能生成一组变体、再挑最佳的机制。

第三是 prompt 与设置。含糊的 prompt 会让模型用“平均猜测”去补全空白,小小措辞变化都可能左右结果。Guidance、步数和长宽比也会继续推动偏移。实践上的结论是:对你来说“最好的 AI 图像生成器”,既取决于模型质量,也取决于它的 prompt 理解是否贴合你的表达方式。

怎么写一个好用的文生图 prompt?

因为 prompt 是你唯一的指令,写 prompt 是文生图里最重要的技能。一个稳妥的结构是按重要性排布:先主体,再场景、光线与风格,技术限定放在最后,另用 negative prompt 排除不想要的元素。

  1. 点名主体及关键特征:“30 多岁女性,柔和而自信的微笑,木炭灰西装外套。”
  2. 放进具体场景:“坐在中性灰背景前。”
  3. 明确光线:“左侧柔和漫射窗光”——往往是影响真实感的最大杠杆。
  4. 补上相机、镜头与风格:“85mm 镜头拍摄,浅景深,专业企业形象照。”
  5. 设定氛围与技术限定:“温暖亲和,焦点清晰,长宽比 4:5。”
  6. 加上 negative prompt:“强烈阴影、瑕疵、文字、水印。”

具体性胜过长篇大论。十个精准词胜过五十个空泛词,因为每个具体细节都在把模型从“平均猜测”中拉出来。当结果“差一点就对”时,一次只改一个变量,这样你能看清每次修改带来的影响。想看更系统、可直接复用的示例,去看我们的 AI 照片 prompt 写作指南,或用 AI Prompt Generator 把一个短想法扩展成完整 prompt。

今天的文生图有哪些局限?

文生图很强,但不是魔法。正视它的边界能省下不少挫败。

  • 细节部位有规律地翻车。手、牙齿、画面里的文字、复杂反射是常见重灾区;每次都要检查。
  • 它读不懂你的心思。模型只知道你写的内容,任何没写清的部分都会被它的默认假设填上。
  • 精确复现很难。不借助专门工具,要在多张图中稳定生成同一个人、产品或 Logo 仍然困难。
  • 输出是“看起来可信”,非事实陈述。模型会虚构细节,因此不适合要求准确性的场景,比如文档或证据。
  • 质量因模型而异。弱一些的 AI 图像生成器会在复杂场景上吃力,而强模型能应对,因此工具本身与 prompt 同样重要。

对大多数创意与营销工作来说,这些都不是决定性障碍。它们只意味着:文生图是一个起点,需要你后续完善,而不是一键到位的神谕。先生成、再检查,然后用针对性的编辑把少数问题修好,而不是整张重来。

来源

  1. 01Text-to-image model (overview)Wikipedia (访问于 2026-06-01)
  2. 02Latent diffusion modelWikipedia (访问于 2026-06-01)
  3. 03Diffusion modelWikipedia (访问于 2026-06-01)
  4. 04Contrastive Language–Image Pre-training (CLIP)Wikipedia (访问于 2026-06-01)
  5. 05Imagen: Text-to-Image Diffusion ModelsGoogle Research (访问于 2026-06-01)
  6. 06Photorealistic Text-to-Image Diffusion Models with Deep Language UnderstandingSaharia et al., arXiv (访问于 2026-06-01)
  7. 07Prompt engineeringWikipedia (访问于 2026-06-01)

常见问题

文生图是什么意思?
文生图指的是从一段文字描述生成一张全新的图片。你输入一个 prompt,AI 图像生成器渲染出匹配的照片。图像是从零生成的,不是从素材库里检索,也不是拼接现有图片。
AI 图像生成器如何把文字变成照片?
多数采用 diffusion。文本编码器把你的 prompt 转成数字,模型从随机噪声起步,在每一步去噪时都受你的文字引导。最后由解码器把结果还原成全分辨率图像。
文生图是在搜索现成图片吗?
不是。模型不会搜索或复制单一来源。它在训练中学到的是把文字与视觉场景关联的统计模式,每次生成都会从随机噪声中重建一张全新的原创图像。
什么是 diffusion 模型?
diffusion 模型通过逆转加噪过程来学会生成图像。它先练习把真实图像变成噪声,再学习如何把噪声还原回去,从而能从随机噪声出发,在你的 prompt 引导下去噪成一张连贯的图片。
文生图里的 seed 是什么?
seed 是那团特定的随机起始噪声。复用相同的 seed 与 prompt 会得到同一张图,这就是你进行可控迭代的方法。更换 seed 则会得到同一想法的不同变体。
什么是 CFG 或 guidance scale?
Guidance(常称 CFG scale)控制模型对 prompt 的服从强度。数值更高会更贴近你的文字,但可能显得生硬;更低则更自由,结果也更容易偏离描述。
为什么同一个 prompt 我会得到不同的图?
因为 diffusion 从随机噪声起步,更换 seed 即使在措辞完全相同的情况下也会得到不同图。不同模型与不同设置会进一步放大差异。这是预期行为,也正因此你可以生成多种变体再挑选。
文生图与图生图有什么区别?
文生图只从文字起步,从噪声构建完整场景。图生图从文字加一张基底图起步,在保留大致构图的同时按描述转换。前者是从零创造,后者是重绘已有图片。
哪款 AI 图像生成器最适合文生图?
取决于你的需求,以及工具的 prompt 理解是否贴合你的表达方式。不同模型在默认风格、强项与对 prompt 的忠实度上都不同,因此“最佳”既关乎模型实力,也关乎匹配度。
如何让文生图的结果更好?
写具体的 prompt:按重要性依次写清主体、场景、光线与风格,加上 negative prompt,并设置合适的长宽比。随后一次只改一个变量去微调,而不是每次全改重写。

撰稿

LaFoto 编辑团队

LaFoto 编辑团队撰写 AI 照片生成的指南与对比,所有论断均有来源支撑,不编造。

继续阅读

今天就开始创作

用最佳 AI 图像生成器生成你的第一张图。

用一句话在数秒内生成成片、逼真的图像——随后精修每个细节。无需配置、无需 Discord、无需 GPU。

加入 4,200+ 位创作者正在使用 LaFoto

关于本指南

作者
LaFoto 编辑团队
基于
我们自己的测试,不抄二手文章
模型建议
有时效性,因为行为会变
赞助
否 — 无付费植入
勘误
直接在页面更新
复核
模型变更时重新检查

实操

从一句话到一张图,中间到底发生了什么

扩散模型的训练,是拿真实图片逐步加噪到纯静态,再学习如何反向去噪。训练完之后,模型可以从纯噪声起步,沿着去噪路径走向一个连贯的画面。

你的 prompt 是方向盘。语言组件把文字转成数值语义表示,在每一步去噪时都把正在成形的图像往那个语义上轻推。步数够了,静态就会变成你描述的场景。

温暖纸上一页打字机纸,仅一行文字,正下方压着一张成品照片打印

三种切入

三件最值得弄懂的事

为什么可复现很重要

seed 就是起始噪声。不固定它,你就无法只改一个词并看清那个词的影响;你观察到的差异多半只是不同的起点。

  • 固定 seed 才能对比两个 prompt。
  • 任何值得回头的结果都要记录 seed。
  • 不同模型之间,seed 没有意义。
AI 生成的产品静物

细节

这篇解释了什么

会改变你使用任何生成器方式的底层机制。

为何生成图是独一无二的

模型是在预测合理像素,而不是取回一张存档照片,所以返回的都不是别人也有的“库存图”。

扩散是不是唯一路线

不是——更早有 GAN,也有流程会混用多种模型。日常使用时,理解心智模型比关心架构更重要。

为什么要先定画幅比例

模型会按给定画幅去构图,事后裁剪会丢掉它有意为之的构图。

应该生成多大分辨率

1024 是多数模型的甜点位。先在那儿生成,再放大,而不是直接要巨大画布。

prompt 会不会被存储

完全取决于服务商。若 prompt 描述了商业敏感内容,这点尤为重要。

AI 生成的产品场景,带道具与可控阴影

相关

把机制用起来

继续探索

这些机制适用的地方

这里的一切界面,都跑在同一流程上。