模型目录
AI 图像模型——重在用途,不做排名
七个用户真正在点名的模型,以及各自真正擅长的任务。不打分,因为答案完全取决于你的具体工作。
模型目录
- GoogleNano BananaGoogle 的对话式图像编辑器。多次编辑仍能保持人脸一致。
- Stability AIStable Diffusion开源模型之源头。LoRA、ControlNet、checkpoint。
- Black Forest LabsFLUX.1由前 Stable Diffusion 研究人员打造。更忠实理解 prompt,能生成可读文字。
- Midjourney, Inc.Midjourney自带一套固定审美的那款。风格强势、封闭、订阅制。
- RecraftRecraft能导出真正矢量的那款。为品牌与设计而建。
- ByteDanceSeedream字节跳动的模型。中英文文字渲染强,原生高分辨率。
- OpenAIgpt-image-1支撑 ChatGPT 生成图片的模型。指令遵循强,文字渲染出色。
如何在它们之间选择
首先看你是要从无到有生成图像,还是要改一张已有照片。从零生成更看重构图与对 prompt 的遵从;修改照片则需要模型不去触碰你没有提到的部分。这两者几乎是相反的要求,为其一侧而建的工具往往在另一侧表现平平。
其次看你是否需要结果可复现。封闭托管的模型会在你不知情时发生改变,你商业上依赖的风格可能在你无法控制的时间表上消失。开放权重能解决这个问题,但代价是你自己运行基础设施。
第三是输出格式,这点往往在为时已晚时才被发现。如果文件必须能在矢量编辑器中打开,或要打印到两米宽,这个约束会在谈质量之前就把列表的大多数排除掉。
这个目录是什么
- 条目数
- 7 个模型
- 是否排名
- 否 — 仅作说明
- 从属关系
- 与任何模型均无从属关系
- 定价
- 刻意不列出
- 版本
- 不固定 — 演进太快
- 更新
- 2026 年 8 月
如何阅读模型对比
几乎所有排名都在回答你并未提出的问题
“最佳图片模型”榜单通常用同一组 prompt 让各模型各出一图来评比。这只是在衡量这些 prompt 下它们的表现——除非你的工作恰好与这些 prompt 相似,否则意义有限;而那组为博文好看而挑的测试 prompt,往往与真实需求相去甚远。
更有用的问题是结构性的:它是生成还是编辑,它有没有审美倾向,你能否自托管运行,最后输出的是什么——像素还是曲线。这些属性不会因下个小版本而变,且在谈论“画质好坏”前,已经能把候选清掉大半。

三个能迅速缩小范围的问题
先按约束选择,再按质量取舍
第一个分叉,也是差异最大的
从描述生成图像,与编辑你已有的照片,是近乎相反的问题。前者看重构图与对 prompt 的遵从;后者看重对未提及区域的“保持原样”。
面向编辑的模型,能在连贯修改中保持主体身份;面向生成的模型,让你从零控制构图、光学与风格。真正两头都很强的,极少。
- 编辑现有照片:Nano Banana。
- 凭空生成:FLUX、Midjourney。
- 两者兼顾,用对话式:gpt-image-1。

谁在掌控你的关键依赖
封闭的托管模型会在你不掌控的节奏下变化。你为品牌打磨出的独特风格,可能在某次更新后不可复现,且没有可固定的版本。
开放权重能解决这个问题,但代价是基础设施:硬件、存储、更新,以及依赖动了就会断的流水线。
- 重视可复现性:Stable Diffusion、FLUX。
- 不想管基础设施:选择任一托管。
- 量与隐私通常推动自托管。

人们最后才发现的限制
如果输出必须能在矢量编辑器里打开、能放大到建筑尺度、或明年还能被别人重新着色,那么无论看起来多好,位图都是错的制品。
同理,若必须承载一门有大量字符的语言的可读文字,这个条件在开选前就会排除列表中的大多数。
- 可编辑曲线:Recraft。
- 中英文字体:Seedream。
- 其他情形:位图像素。

模型常见问答
选型前大家会问的事
简短回答;各模型自己的页面有更长版本。
为什么同一个 prompt 和模型会出不同的图?
因为起始噪声不同。用 seed 固定起始噪声,prompt + seed + 模型三者一致即可精确复现。改任一项,得到的都是“相关但不相同”的图。
新模型一定更好吗?
在“裸输出”上,多数时候是。在它周边的一切——社区工具、风格适配、许可清晰度、价格稳定性——则未必。Stable Diffusion 是靠生态延续生命力的最典型旧模型。
我的 prompt 能在模型之间通用吗?
主题与场景能迁移;参数与语法很少能。不同模型对权重、负面与风格 token 的理解各异;为某一模型深度调校的 prompt,换到别处通常就“过度规定”了。
开放权重到底给了我什么?
本地运行的能力、把版本永远固定、按次无成本地产生图、以及把素材留在第三方基础设施之外。代价是硬件与维护。
哪个能把文字渲染对?
已有几个能处理短字串,但没有哪个能替代专业排版。先把画面生成好,再在设计工具里加字,你就避开了一整类麻烦。
模型和 prompt 哪个更重要?
低于某个 prompt 水准线时,不重要。一个明确的 prompt 通过中档模型,往往好过一个含糊的 prompt 通过顶级模型——这也是为什么这里的 prompt 指南比目录本身还长。

继续探索
LaFoto 的其他去处
目录在讲工具;下面是用这些工具能做的事。
关于 AI 图像模型的问题
- 哪种 AI 图像模型最好?
- 没有唯一答案,所以这个目录是“描述”而非“排名”。Midjourney 会强加一种审美,FLUX 按字面理解你的指令,Nano Banana 能在不丢人的前提下编辑照片,Stable Diffusion 把零件都交给你,Recraft 输出矢量,Seedream 能中英混排,gpt-image-1 能正确解析复杂句子。按最贴近你问题的描述来选。
- 开源模型和闭源模型有什么区别?
- 开源权重可以下载到你自己的硬件上运行,你能把版本固定住、按张生成零边际成本、并且把素材留在自己手里不经过第三方服务器。闭源模型通过 API 或 App 访问,不用自建基础设施,但更新节奏按提供方而非你来。
- 为什么这些页面不列价格或版本号?
- 因为它们变化比目录页更新得更快,过期的数字看起来像在撒谎,而不是“只是过期”。这里写的是相对恒定的部分——谁做的、怎么使用、权重是否开源、它被设计来擅长什么。
- LaFoto 和这些模型有任何关联吗?
- 没有。我们不转售它们,也与其厂商没有商业往来。唯一用第一人称的地方是 FLUX 条目,在那里我们说明本网站的图片由哪个模型生成——画廊会一张卡一张卡地作证。
- 能把一个模型的 prompt 直接搬到另一个模型吗?
- 主体和场景大多能迁移;参数与语法往往不行。模型在权重语法、负面提示、风格 token 的理解上各不相同,为某个模型深度调过的 prompt 通常对另一个来说就是过度指定。
- 新模型一定比旧模型强吗?
- 在“原始画质”上,通常是。可在其周边——社区工具、风格适配、授权清晰度——却未必。Stable Diffusion 就是靠生态而非素质“硬实力”维持长期相关性的典型。
- 要编辑我已有的照片,该用哪种模型?
- 为编辑而生的模型,而不是仅为生成的。关键能力是能在多次连续修改中把主体稳定地保持为同一个人(或同一个物),多数文生图模型在一两次编辑后就会丢失这一点。
- 它们有哪个能稳定渲染文字吗?
- 有几款对短字串已足够可用,但都不能替代排版。先把画面生成好,再用设计工具加字——生成出来的字母无法在事后编辑、拼写检查或翻译。
今天就开始创作
用最佳 AI 图像生成器生成你的第一张图。
用一句话在数秒内生成成片、逼真的图像——随后精修每个细节。无需配置、无需 Discord、无需 GPU。
加入 4,200+ 位创作者正在使用 LaFoto