Stability AI · model directory
O que é o Stable Diffusion? O modelo aberto que serviu de base para todo o resto
Stable Diffusion é um modelo de difusão latente lançado abertamente pela Stability AI. O que significa difusão latente e por que pesos abertos importaram tanto.
Stable Diffusion at a glance
- Desenvolvedor
- Stability AI
- Arquitetura
- Difusão latente
- Pesos
- Abertos, para download
- Executa em
- GPUs de consumo
- Conhecido por
- Seu ecossistema
- Extensões
- LoRA, ControlNet, checkpoints
O que é "difusão latente", sem a matemática
Um modelo de difusão aprende observando imagens serem destruídas. Pegue uma fotografia, adicione um pouco de ruído, adicione mais, continue até restar só estática e treine uma rede para prever o que foi removido a cada passo. Execute essa rede ao contrário a partir de pura estática e ela pinta uma imagem que nunca existiu.
Fazer isso na resolução final é enormemente caro, porque cada etapa atua sobre cada pixel. O truque latente é comprimir a imagem antes em uma representação muito menor que preserva a estrutura e descarta os pixels exatos, executar todo o processo ruidoso nesse espaço pequeno e só decodificar de volta para uma imagem real no final.
Essa única decisão é o motivo de isso ter chegado ao público comum. Cortou o custo de geração em cerca de uma ordem de grandeza e trouxe a geração de imagens para hardware que alguém já podia ter, em vez de um cluster alugado.
Pesos abertos e o que eles desencadearam
A Stability lançou os próprios arquivos do modelo, e não apenas uma API. Esse é o fato de consequências mais longas — fácil de subestimar agora que os resultados estão por toda parte.
Como qualquer pessoa podia inspecionar e modificar o modelo, a comunidade construiu a camada de controle que o modelo base não tinha. LoRAs tornaram possível ensinar um estilo ou sujeito específico com um pequeno arquivo adicional, em vez de retreinar qualquer coisa. O ControlNet tornou possível restringir uma geração a uma pose, um mapa de profundidade ou um desenho de contorno. Checkpoints da comunidade especializaram o modelo base para ilustração, fotografia, arquitetura e tudo o mais.
O vocabulário que saiu desse período é hoje a forma como se fala de geração de imagens em geral — seed, sampler, denoise strength, CFG, inpainting. Essas palavras foram popularizadas por uma comunidade aberta que lia e reescrevia um modelo que podia de fato abrir — e são o motivo de o glossário deste site ser escrito como é.
Como é, de fato, rodá-lo por conta própria
Melhor do que era e ainda assim não é casual. Há instaladores de um clique e há interfaces nodais de complexidade real, e a distância entre "gerei uma imagem" e "obtive a imagem que eu queria" é onde o tempo vai embora.
A recompensa é um controle que produtos hospedados não oferecem: seeds exatas, resoluções arbitrárias, qualquer checkpoint ou LoRA que preferir, nenhum pipeline de conteúdo entre o(a) senhor(a) e a saída, nenhum custo por imagem depois do hardware e nada saindo da sua máquina.
O custo é que agora o(a) senhor(a) está operando uma pequena infraestrutura. Arquivos de modelo chegam a vários gigabytes cada, extensões entram em conflito entre si e uma placa de vídeo com memória suficiente é o ingresso. Quem quer uma imagem tende a ficar mais feliz com um modelo hospedado; quem quer um processo é quem permanece.
Onde está hoje
Já não é automaticamente a opção mais forte em qualidade bruta de saída, e vários modelos mais novos — incluindo o FLUX, feito em parte por pessoas que trabalharam no Stable Diffusion — seguem prompts mais literalmente e rendem texto legível muito melhor.
O que ele mantém é o ecossistema. O volume de checkpoints da comunidade, adaptadores de estilo e ferramentas de controle construídos sobre as versões antigas não é algo que um modelo novo adquira rapidamente e, para quem tem um estilo específico a reproduzir ou já tem uma pipeline montada, esse inventário pesa mais que uma diferença geral de qualidade.
Versões sucessivas também foram lançadas sob licenças progressivamente mais condicionais do que as primeiras — algo a conferir em relação ao seu uso pretendido, em vez de presumir. "Pesos abertos" e "gratuito para qualquer coisa" deixaram de ser a mesma frase faz tempo.
Lendo o restante deste site a partir dele
Quase toda página de técnica aqui usa termos que este modelo popularizou. Denoise strength decide o quanto um resultado de image-to-image se afasta de sua entrada. Uma seed torna uma geração repetível. Inpainting edita dentro de uma máscara e deixa o restante intocado. Esses conceitos se aplicam, qualquer que seja o modelo que o(a) senhor(a) venha a usar.
Esse é o motivo honesto para entender o Stable Diffusion mesmo que nunca o instale: é o modelo cujo modo de uso vazou para a linguagem. Aprenda uma vez e toda outra ferramenta fica mais fácil de ler.
O modelo aberto
Por que liberar os pesos foi mais importante do que o próprio modelo
A conquista técnica foi tornar a diffusion barata o suficiente para uma placa de vídeo de consumidor. A decisão consequente foi publicar os arquivos para que qualquer pessoa pudesse abri-los.
Tudo que veio depois — LoRAs, ControlNet, checkpoints da comunidade, todo o vocabulário de seeds e amostradores — existe porque milhares puderam ler e modificar um modelo de imagem funcional, em vez de acessá-lo por uma fenda.

Três camadas do ecossistema
O que as pessoas realmente acrescentam ao modelo base
Trocando o próprio modelo
Um checkpoint é o conjunto inteiro de pesos. O ajuste fino do modelo base num corpo mais restrito de imagens — fotografia, ilustração, arquitetura — produz um modelo com caráter padrão diferente e outras competências.
Carrega-se exatamente um por vez, e é a decisão com maior efeito no que sai.
- Vários gigabytes cada.
- Um carregado por vez.
- Licenças e procedência variam muito.

Acrescentar uma coisa sem retreinar
Um arquivo pequeno que ensina ao checkpoint carregado um estilo, personagem ou objeto específico. Treinável em uma única placa de consumidor, de minutos a horas.
Várias podem ser empilhadas com pesos individuais — é aí que mora a maior dificuldade prática: duas LoRAs de estilo fortes entram em conflito.
- De dezenas a centenas de megabytes.
- Empilháveis, com força ajustável.
- Atreladas a uma arquitetura base específica.

Fixar a estrutura e liberar o resto
Restringe uma geração a uma entrada estrutural — um esqueleto de pose, um mapa de profundidade, um desenho de contorno — de modo que a composição é decidida por quem cria, e o restante, pelo modelo.
É a capacidade que transformou geração de imagens de amostragem em direção, e não tem equivalente limpo na maioria dos produtos hospedados.
- Pose, profundidade, contornos, segmentação.
- Composição fixa, estilo livre.
- O principal motivo para autohospedar.

Perguntas sobre Stable Diffusion
O que saber antes de instalar qualquer coisa
As questões que determinam se autohospedar é para o seu caso.
De que hardware realmente preciso?
Memória de vídeo é a restrição determinante, mais do que velocidade bruta. Placas mais antigas com memória generosa frequentemente superam modelos novos com menos memória nesta carga de trabalho.
Ainda vale a pena aprender?
Se precisa de reprodutibilidade, volume, privacidade ou controle estrutural, sim. Se quer boas imagens sem configuração, um modelo hospedado chega lá mais rápido.
Qual versão devo usar?
Depende inteiramente do ecossistema de que necessita. Versões antigas têm muito mais ferramentas comunitárias; as novas trazem melhor qualidade base e licenças mais condicionais.
Posso usar a saída comercialmente?
Verifique a licença da versão específica e de cada checkpoint e LoRA na pilha. "Pesos abertos" e "livre para qualquer uso" deixaram de ser sinônimos há algum tempo.
Por que meus resultados parecem piores que os exemplos?
Quase sempre é o checkpoint, não o prompt. Exemplos da comunidade geralmente são gerados num checkpoint fortemente ajustado, não no modelo base.
Está sendo substituído pelo FLUX?
Em qualidade de saída, em grande parte foi superado. Em inventário de checkpoints, adaptadores e ferramentas de controle, nada o substituiu até agora.

Os termos que este modelo batizou
Vocabulário que saiu do ecossistema aberto
Continue explorando
Em outros locais na LaFoto
Os conceitos aqui servem, independentemente do que executar.
- redimensionar uma imagem
- JPG, PNG e WebP
- compactador de imagem
- cortar para uma proporção
- seletor de cores da imagem
- remover um fundo
- visualizador de EXIF
- gerador de prompt com IA
- gerador de anime com IA
- transformar uma imagem em desenho animado
- criar pixel art
- a comparação com ranking
- comparada ao Midjourney
- LaFoto vs Leonardo AI
- comparada ao Ideogram
- comparada ao Canva
- reproduzir uma imagem
- até onde o resultado pode se desviar
- edição dentro de uma máscara
- o jornal da LaFoto
Stable Diffusion — questions people ask
- O que é o Stable Diffusion?
- Um modelo texto-para-imagem lançado abertamente pela Stability AI, baseado em difusão latente, que pode ser baixado e executado em hardware de consumo, e não apenas acessado por API.
- O Stable Diffusion é gratuito?
- Os pesos foram abertos e podem ser executados localmente sem custo por imagem, mas os termos de licença variam entre versões e os lançamentos mais recentes trazem mais condições. Verifique a licença da versão específica em relação ao seu uso pretendido.
- O que significa difusão latente?
- O modelo trabalha em uma representação comprimida da imagem, e não em pixels na resolução final, e então decodifica para imagem no fim. Isso o tornou barato o suficiente para rodar em uma placa de vídeo comum.
- O que é uma LoRA no Stable Diffusion?
- Um pequeno arquivo adicional que ensina ao modelo base um estilo, sujeito ou personagem específico sem retreinar o modelo inteiro. É a forma padrão de a comunidade compartilhar especializações.
- O que é o ControlNet?
- Uma extensão que restringe a geração a uma entrada estrutural, como um esqueleto de pose, um mapa de profundidade ou um desenho de bordas — assim é possível fixar a composição e deixar o modelo decidir o restante.
- Preciso de uma boa placa de vídeo para rodar o Stable Diffusion?
- Para executar localmente, sim — memória de vídeo é a restrição principal. Serviços hospedados eliminam essa exigência ao custo do controle que rodar por conta própria proporciona.
- O Stable Diffusion ainda é o melhor modelo de imagem?
- Não em qualidade bruta de saída; modelos mais novos geralmente seguem prompts mais literalmente e rendem texto melhor. Sua vantagem hoje é a profundidade de ferramentas comunitárias ao redor dele.
- Por que as pessoas falam de seeds e samplers?
- São controles que a comunidade aberta revelou e nomeou ao trabalhar com este modelo, e o vocabulário se espalhou daí para o restante da área.
Os outros modelos do diretório
Comece a criar hoje
Gere sua primeira imagem com o melhor gerador de imagens por IA.
Transforme uma frase em uma imagem finalizada e fotorrealista em segundos — depois refine cada detalhe. Sem configuração, sem Discord, sem GPU.
Junte-se a 4.200+ criadores que usam a LaFoto