Stability AI · model directory
¿Qué es Stable Diffusion? El modelo abierto del que todo lo demás tomó prestado
Stable Diffusion es un modelo de difusión latente publicado abiertamente por Stability AI. Qué significa difusión latente y por qué los pesos abiertos importaron tanto.
Stable Diffusion at a glance
- Creador
- Stability AI
- Arquitectura
- Difusión latente
- Pesos
- Abiertos, descargables
- Se ejecuta en
- GPUs de consumo
- Conocido por
- Su ecosistema
- Extensiones
- LoRA, ControlNet, checkpoints
Qué significa «difusión latente», sin matemáticas
Un modelo de difusión aprende observando cómo se destruyen imágenes. Tome una fotografía, añada un poco de ruido, añada más, siga hasta que solo quede estática, y entrene una red para predecir qué se eliminó en cada paso. Ejecute esa red al revés desde estática pura y pintará una imagen que nunca estuvo ahí.
Hacer esto a resolución completa es enormemente caro, porque cada paso opera sobre cada píxel. El truco latente consiste en comprimir primero la imagen en una representación mucho más pequeña que conserve la estructura y descarte los píxeles exactos, ejecutar todo el proceso ruidoso en ese espacio pequeño y solo decodificar a una imagen real al final.
Esa sola decisión es la razón por la que todo esto llegó al público general. Redujo el coste de generación aproximadamente un orden de magnitud y llevó la generación de imágenes a hardware que alguien ya podría tener, en lugar de a un clúster alquilado.
Pesos abiertos y lo que desencadenaron
Stability publicó los propios archivos del modelo en lugar de solo una API. Ese es el hecho con consecuencias más duraderas, y es fácil infravalorarlo ahora que los resultados están en todas partes.
Como cualquiera podía inspeccionar y modificar el modelo, la gente construyó la capa de control que al modelo base le faltaba. Las LoRA permitieron enseñar un estilo o sujeto específico con un archivo pequeño accesorio en lugar de reentrenar nada. ControlNet permitió constreñir una generación a una pose, un mapa de profundidad o un dibujo de contornos. Los checkpoints de la comunidad especializaron el modelo base para ilustración, fotografía, arquitectura y todo lo demás.
El vocabulario que salió de ese periodo es ahora cómo se habla de generación de imágenes en general —seed, sampler, denoise strength, CFG, inpainting. Esas palabras las popularizó una comunidad abierta que leía y reescribía un modelo que realmente podía abrir, y por eso el glosario de este sitio está redactado como está.
Qué supone realmente ejecutarlo usted mismo
Mejor que antes y aún no casual. Hay instaladores de un clic y hay interfaces por nodos de verdadera complejidad, y la distancia entre «he generado una imagen» y «he obtenido la imagen que quería» es donde se va el tiempo.
La recompensa es un control que los productos hospedados no ofrecen: seeds exactas, resoluciones arbitrarias, cualquier checkpoint o LoRA que usted quiera, sin canal de contenido entre usted y la salida, sin coste por imagen tras el hardware y sin nada saliendo de su máquina.
El coste es que ahora está operando una pequeña pieza de infraestructura. Los archivos de modelo ocupan varios gigabytes cada uno, las extensiones se rompen entre sí y una tarjeta gráfica con memoria suficiente es el billete de entrada. Quien quiere una imagen suele estar más contento con un modelo hospedado; quien quiere un proceso es quien se queda.
Dónde está ahora
Ya no es automáticamente la opción más fuerte en calidad bruta de salida, y varios modelos más nuevos —incluido FLUX, desarrollado en parte por gente que trabajó en Stable Diffusion— siguen los prompts más literalmente y renderizan texto legible mucho mejor.
Lo que conserva es el ecosistema. El volumen de checkpoints comunitarios, adaptadores de estilo y herramientas de control construidos sobre las versiones anteriores no es algo que un modelo nuevo adquiera rápido, y para quien necesite reproducir un estilo específico o ya tenga una canalización montada, ese inventario pesa más que una brecha general de calidad.
Las versiones sucesivas también se han publicado con licencias progresivamente más condicionadas que las primeras, algo que conviene comprobar frente a su uso previsto en lugar de asumir. «Pesos abiertos» y «gratis para todo» dejaron de ser la misma afirmación hace tiempo.
Leer el resto de este sitio a través de él
Casi todas las páginas de técnicas aquí usan términos que este modelo popularizó. Denoise strength decide cuánto se aparta un resultado image-to-image de su entrada. Una seed hace repetible una generación. Inpainting edita dentro de una máscara y deja intacto lo demás. Esos conceptos aplican use usted el modelo que use al final.
Esa es la razón honesta para entender Stable Diffusion aunque nunca lo instale: es el modelo cuya interfaz se filtró al lenguaje. Apréndalo una vez y todas las demás herramientas serán más fáciles de leer.
El modelo abierto
Por qué publicar los pesos importó más que el propio modelo
El logro técnico fue abaratar la difusión hasta que cupiera en una tarjeta gráfica de consumo. La decisión trascendente fue publicar los archivos para que cualquiera pudiera abrirlos.
Todo lo que vino después —LoRAs, ControlNet, checkpoints de la comunidad, todo el vocabulario de seeds y samplers— existe porque miles de personas pudieron leer y modificar un modelo de imagen en funcionamiento en lugar de consultarlo a distancia mediante una interfaz cerrada.

Tres capas del ecosistema
Lo que la gente añade de verdad sobre el modelo base
Sustituir el propio modelo
Un checkpoint es el conjunto completo de pesos. Ajustar finamente la base con un corpus más estrecho —fotografía, ilustración, arquitectura— produce un modelo con un carácter por defecto distinto y competencias diferentes.
Se carga exactamente uno cada vez, y es la decisión con el mayor efecto en lo que sale.
- Varios gigabytes cada uno.
- Uno cargado cada vez.
- Licencias y procedencia muy dispares.

Añadir una cosa sin reentrenar
Un archivo pequeño que enseña al checkpoint cargado un estilo, personaje u objeto específico. Se puede entrenar en una sola tarjeta de consumo en minutos u horas.
Se pueden apilar varios con pesos individuales, que es donde vive gran parte de la dificultad práctica: dos LoRAs de estilo fuertes compiten entre sí.
- De decenas a cientos de megabytes.
- Apilables, con fuerza ajustable.
- Vinculadas a una arquitectura base concreta.

Fijar la estructura y liberar el resto
Restringe una generación a una entrada estructural —un esqueleto de pose, un mapa de profundidad, un trazado de bordes—, de modo que la composición la decide usted y el resto el modelo.
Esta es la capacidad que convirtió la generación de imágenes de un muestreo en una dirección, y no tiene equivalente limpio en la mayoría de productos alojados.
- Pose, profundidad, bordes, segmentación.
- Composición fija, estilo libre.
- La razón principal para autoalojar.

Preguntas sobre Stable Diffusion
Qué saber antes de instalar nada
Las preguntas que deciden si autoalojar es para usted.
¿Qué hardware necesito realmente?
La memoria de vídeo es la restricción determinante más que la velocidad cruda. Tarjetas antiguas con memoria generosa a menudo superan a otras más nuevas con menos en esta carga de trabajo.
¿Sigue mereciendo la pena aprenderlo?
Si necesita reproducibilidad, volumen, privacidad o control estructural, sí. Si quiere buenas imágenes sin configuración, un modelo alojado le lleva antes.
¿Qué versión debería usar?
Depende por completo del ecosistema que necesite. Las versiones antiguas tienen muchísima más herramienta comunitaria; las nuevas tienen mejor calidad base y licencias más condicionadas.
¿Puedo usar la salida comercialmente?
Compruebe la licencia de la versión concreta y de cada checkpoint y LoRA de la pila. "Pesos abiertos" y "libre para cualquier uso" dejaron de ser lo mismo hace tiempo.
¿Por qué mis resultados se ven peor que los ejemplos?
Casi siempre por el checkpoint y no por el prompt. Los ejemplos de la comunidad suelen generarse con un checkpoint muy afinado y no con el modelo base.
¿Lo está sustituyendo FLUX?
En calidad de salida ha sido ampliamente superado. En inventario de checkpoints, adaptadores y herramientas de control, nada lo ha reemplazado aún.

Los términos que nombró este modelo
Vocabulario surgido del ecosistema abierto
Siga explorando
En otros lugares de LaFoto
Los conceptos de aquí aplican use lo que use.
- redimensione una imagen
- JPG, PNG y WebP
- compresor de imágenes
- recorte a una relación
- selector de color desde una imagen
- elimine un fondo
- visor EXIF
- Generador de prompts con IA
- generador de anime con IA
- convertir una foto en dibujo animado
- cree pixel art
- la comparativa clasificada
- comparada con Midjourney
- LaFoto vs Leonardo AI
- comparada con Ideogram
- comparada con Canva
- reproducir una imagen
- hasta qué punto puede desviarse un resultado
- edición dentro de una máscara
- el blog de LaFoto
Stable Diffusion — questions people ask
- ¿Qué es Stable Diffusion?
- Un modelo texto-a-imagen publicado abiertamente por Stability AI, basado en difusión latente, que puede descargarse y ejecutarse en hardware de consumo en lugar de accederse solo por API.
- ¿Stable Diffusion es gratis?
- Los pesos se han publicado abiertamente y pueden ejecutarse en local sin coste por imagen, pero los términos de la licencia difieren entre versiones y los lanzamientos más recientes tienen más condiciones. Revise la licencia de la versión concreta frente a su uso previsto.
- ¿Qué significa difusión latente?
- El modelo trabaja sobre una representación comprimida de una imagen en lugar de sobre píxeles a resolución completa, y luego decodifica a imagen al final. Eso es lo que permitió ejecutarlo en una tarjeta gráfica corriente.
- ¿Qué es una LoRA en Stable Diffusion?
- Un archivo pequeño accesorio que enseña al modelo base un estilo, sujeto o personaje específico sin reentrenar el modelo completo. Es la forma estándar en que la comunidad comparte especializaciones.
- ¿Qué es ControlNet?
- Una extensión que constreñe una generación a una entrada estructural como un esqueleto de pose, un mapa de profundidad o un dibujo de contornos, para fijar la composición dejando que el modelo decida lo demás.
- ¿Necesito una buena tarjeta gráfica para ejecutar Stable Diffusion?
- Para ejecutarlo en local, sí — la memoria de vídeo es la restricción determinante. Los servicios hospedados eliminan ese requisito a costa del control que aporta ejecutarlo usted mismo.
- ¿Sigue siendo Stable Diffusion el mejor modelo de imagen?
- No en calidad bruta de salida; los modelos más nuevos suelen seguir los prompts más literalmente y renderizar mejor el texto. Su ventaja ahora es la profundidad de herramientas comunitarias a su alrededor.
- ¿Por qué la gente habla de seeds y samplers?
- Son controles que la comunidad abierta sacó a la luz y nombró trabajando con este modelo, y el vocabulario se extendió desde ahí al resto del campo.
Los otros modelos del directorio
Empiece a crear hoy
Genere su primera imagen con el mejor generador de imágenes con IA.
Convierta una frase en una imagen terminada y fotorrealista en segundos — y luego afine cada detalle. Sin configuración, sin Discord, sin GPU.
Únase a 4200+ creadores que usan LaFoto