Saltar al contenido
LaFoto

Stability AI · model directory

¿Qué es Stable Diffusion? El modelo abierto del que todo lo demás tomó prestado

Stable Diffusion es un modelo de difusión latente publicado abiertamente por Stability AI. Qué significa difusión latente y por qué los pesos abiertos importaron tanto.

Stable Diffusion es un modelo de texto a imagen de Stability AI, publicado con pesos abiertos para que cualquiera pueda descargarlo y ejecutarlo en su propio hardware. Técnicamente es un modelo de difusión latente: en lugar de eliminar ruido de una imagen a resolución completa, trabaja en un espacio latente comprimido y decodifica el resultado al final, lo que lo hizo lo bastante barato para ejecutarse en una tarjeta gráfica de consumo.

Stable Diffusion at a glance

Creador
Stability AI
Arquitectura
Difusión latente
Pesos
Abiertos, descargables
Se ejecuta en
GPUs de consumo
Conocido por
Su ecosistema
Extensiones
LoRA, ControlNet, checkpoints

Qué significa «difusión latente», sin matemáticas

Un modelo de difusión aprende observando cómo se destruyen imágenes. Tome una fotografía, añada un poco de ruido, añada más, siga hasta que solo quede estática, y entrene una red para predecir qué se eliminó en cada paso. Ejecute esa red al revés desde estática pura y pintará una imagen que nunca estuvo ahí.

Hacer esto a resolución completa es enormemente caro, porque cada paso opera sobre cada píxel. El truco latente consiste en comprimir primero la imagen en una representación mucho más pequeña que conserve la estructura y descarte los píxeles exactos, ejecutar todo el proceso ruidoso en ese espacio pequeño y solo decodificar a una imagen real al final.

Esa sola decisión es la razón por la que todo esto llegó al público general. Redujo el coste de generación aproximadamente un orden de magnitud y llevó la generación de imágenes a hardware que alguien ya podría tener, en lugar de a un clúster alquilado.

Pesos abiertos y lo que desencadenaron

Stability publicó los propios archivos del modelo en lugar de solo una API. Ese es el hecho con consecuencias más duraderas, y es fácil infravalorarlo ahora que los resultados están en todas partes.

Como cualquiera podía inspeccionar y modificar el modelo, la gente construyó la capa de control que al modelo base le faltaba. Las LoRA permitieron enseñar un estilo o sujeto específico con un archivo pequeño accesorio en lugar de reentrenar nada. ControlNet permitió constreñir una generación a una pose, un mapa de profundidad o un dibujo de contornos. Los checkpoints de la comunidad especializaron el modelo base para ilustración, fotografía, arquitectura y todo lo demás.

El vocabulario que salió de ese periodo es ahora cómo se habla de generación de imágenes en general —seed, sampler, denoise strength, CFG, inpainting. Esas palabras las popularizó una comunidad abierta que leía y reescribía un modelo que realmente podía abrir, y por eso el glosario de este sitio está redactado como está.

Qué supone realmente ejecutarlo usted mismo

Mejor que antes y aún no casual. Hay instaladores de un clic y hay interfaces por nodos de verdadera complejidad, y la distancia entre «he generado una imagen» y «he obtenido la imagen que quería» es donde se va el tiempo.

La recompensa es un control que los productos hospedados no ofrecen: seeds exactas, resoluciones arbitrarias, cualquier checkpoint o LoRA que usted quiera, sin canal de contenido entre usted y la salida, sin coste por imagen tras el hardware y sin nada saliendo de su máquina.

El coste es que ahora está operando una pequeña pieza de infraestructura. Los archivos de modelo ocupan varios gigabytes cada uno, las extensiones se rompen entre sí y una tarjeta gráfica con memoria suficiente es el billete de entrada. Quien quiere una imagen suele estar más contento con un modelo hospedado; quien quiere un proceso es quien se queda.

Dónde está ahora

Ya no es automáticamente la opción más fuerte en calidad bruta de salida, y varios modelos más nuevos —incluido FLUX, desarrollado en parte por gente que trabajó en Stable Diffusion— siguen los prompts más literalmente y renderizan texto legible mucho mejor.

Lo que conserva es el ecosistema. El volumen de checkpoints comunitarios, adaptadores de estilo y herramientas de control construidos sobre las versiones anteriores no es algo que un modelo nuevo adquiera rápido, y para quien necesite reproducir un estilo específico o ya tenga una canalización montada, ese inventario pesa más que una brecha general de calidad.

Las versiones sucesivas también se han publicado con licencias progresivamente más condicionadas que las primeras, algo que conviene comprobar frente a su uso previsto en lugar de asumir. «Pesos abiertos» y «gratis para todo» dejaron de ser la misma afirmación hace tiempo.

Leer el resto de este sitio a través de él

Casi todas las páginas de técnicas aquí usan términos que este modelo popularizó. Denoise strength decide cuánto se aparta un resultado image-to-image de su entrada. Una seed hace repetible una generación. Inpainting edita dentro de una máscara y deja intacto lo demás. Esos conceptos aplican use usted el modelo que use al final.

Esa es la razón honesta para entender Stable Diffusion aunque nunca lo instale: es el modelo cuya interfaz se filtró al lenguaje. Apréndalo una vez y todas las demás herramientas serán más fáciles de leer.

El modelo abierto

Por qué publicar los pesos importó más que el propio modelo

El logro técnico fue abaratar la difusión hasta que cupiera en una tarjeta gráfica de consumo. La decisión trascendente fue publicar los archivos para que cualquiera pudiera abrirlos.

Todo lo que vino después —LoRAs, ControlNet, checkpoints de la comunidad, todo el vocabulario de seeds y samplers— existe porque miles de personas pudieron leer y modificar un modelo de imagen en funcionamiento en lugar de consultarlo a distancia mediante una interfaz cerrada.

Un manual técnico abierto junto a hojas de contactos fotográficos sobre una mesa de trabajo pálida

Tres capas del ecosistema

Lo que la gente añade de verdad sobre el modelo base

Sustituir el propio modelo

Un checkpoint es el conjunto completo de pesos. Ajustar finamente la base con un corpus más estrecho —fotografía, ilustración, arquitectura— produce un modelo con un carácter por defecto distinto y competencias diferentes.

Se carga exactamente uno cada vez, y es la decisión con el mayor efecto en lo que sale.

  • Varios gigabytes cada uno.
  • Uno cargado cada vez.
  • Licencias y procedencia muy dispares.
Una naturaleza muerta de producto generada por IA

Preguntas sobre Stable Diffusion

Qué saber antes de instalar nada

Las preguntas que deciden si autoalojar es para usted.

¿Qué hardware necesito realmente?

La memoria de vídeo es la restricción determinante más que la velocidad cruda. Tarjetas antiguas con memoria generosa a menudo superan a otras más nuevas con menos en esta carga de trabajo.

¿Sigue mereciendo la pena aprenderlo?

Si necesita reproducibilidad, volumen, privacidad o control estructural, sí. Si quiere buenas imágenes sin configuración, un modelo alojado le lleva antes.

¿Qué versión debería usar?

Depende por completo del ecosistema que necesite. Las versiones antiguas tienen muchísima más herramienta comunitaria; las nuevas tienen mejor calidad base y licencias más condicionadas.

¿Puedo usar la salida comercialmente?

Compruebe la licencia de la versión concreta y de cada checkpoint y LoRA de la pila. "Pesos abiertos" y "libre para cualquier uso" dejaron de ser lo mismo hace tiempo.

¿Por qué mis resultados se ven peor que los ejemplos?

Casi siempre por el checkpoint y no por el prompt. Los ejemplos de la comunidad suelen generarse con un checkpoint muy afinado y no con el modelo base.

¿Lo está sustituyendo FLUX?

En calidad de salida ha sido ampliamente superado. En inventario de checkpoints, adaptadores y herramientas de control, nada lo ha reemplazado aún.

Una fotografía de comida generada con IA a la luz del día

Siga explorando

En otros lugares de LaFoto

Los conceptos de aquí aplican use lo que use.

Stable Diffusion — questions people ask

¿Qué es Stable Diffusion?
Un modelo texto-a-imagen publicado abiertamente por Stability AI, basado en difusión latente, que puede descargarse y ejecutarse en hardware de consumo en lugar de accederse solo por API.
¿Stable Diffusion es gratis?
Los pesos se han publicado abiertamente y pueden ejecutarse en local sin coste por imagen, pero los términos de la licencia difieren entre versiones y los lanzamientos más recientes tienen más condiciones. Revise la licencia de la versión concreta frente a su uso previsto.
¿Qué significa difusión latente?
El modelo trabaja sobre una representación comprimida de una imagen en lugar de sobre píxeles a resolución completa, y luego decodifica a imagen al final. Eso es lo que permitió ejecutarlo en una tarjeta gráfica corriente.
¿Qué es una LoRA en Stable Diffusion?
Un archivo pequeño accesorio que enseña al modelo base un estilo, sujeto o personaje específico sin reentrenar el modelo completo. Es la forma estándar en que la comunidad comparte especializaciones.
¿Qué es ControlNet?
Una extensión que constreñe una generación a una entrada estructural como un esqueleto de pose, un mapa de profundidad o un dibujo de contornos, para fijar la composición dejando que el modelo decida lo demás.
¿Necesito una buena tarjeta gráfica para ejecutar Stable Diffusion?
Para ejecutarlo en local, sí — la memoria de vídeo es la restricción determinante. Los servicios hospedados eliminan ese requisito a costa del control que aporta ejecutarlo usted mismo.
¿Sigue siendo Stable Diffusion el mejor modelo de imagen?
No en calidad bruta de salida; los modelos más nuevos suelen seguir los prompts más literalmente y renderizar mejor el texto. Su ventaja ahora es la profundidad de herramientas comunitarias a su alrededor.
¿Por qué la gente habla de seeds y samplers?
Son controles que la comunidad abierta sacó a la luz y nombró trabajando con este modelo, y el vocabulario se extendió desde ahí al resto del campo.

Empiece a crear hoy

Genere su primera imagen con el mejor generador de imágenes con IA.

Convierta una frase en una imagen terminada y fotorrealista en segundos — y luego afine cada detalle. Sin configuración, sin Discord, sin GPU.

Únase a 4200+ creadores que usan LaFoto