Pular para o conteúdo
LaFoto

Stability AI · model directory

O que é o Stable Diffusion? O modelo aberto que serviu de base para todo o resto

Stable Diffusion é um modelo de difusão latente lançado abertamente pela Stability AI. O que significa difusão latente e por que pesos abertos importaram tanto.

Stable Diffusion é um modelo texto-para-imagem da Stability AI, lançado com pesos abertos para que qualquer pessoa possa baixá-lo e executá-lo no próprio hardware. Tecnicamente, é um modelo de difusão latente: em vez de remover ruído em uma imagem na resolução final, trabalha em um espaço latente comprimido e decodifica o resultado no fim — o que o tornou barato o suficiente para rodar em uma placa de vídeo de consumo.

Stable Diffusion at a glance

Desenvolvedor
Stability AI
Arquitetura
Difusão latente
Pesos
Abertos, para download
Executa em
GPUs de consumo
Conhecido por
Seu ecossistema
Extensões
LoRA, ControlNet, checkpoints

O que é "difusão latente", sem a matemática

Um modelo de difusão aprende observando imagens serem destruídas. Pegue uma fotografia, adicione um pouco de ruído, adicione mais, continue até restar só estática e treine uma rede para prever o que foi removido a cada passo. Execute essa rede ao contrário a partir de pura estática e ela pinta uma imagem que nunca existiu.

Fazer isso na resolução final é enormemente caro, porque cada etapa atua sobre cada pixel. O truque latente é comprimir a imagem antes em uma representação muito menor que preserva a estrutura e descarta os pixels exatos, executar todo o processo ruidoso nesse espaço pequeno e só decodificar de volta para uma imagem real no final.

Essa única decisão é o motivo de isso ter chegado ao público comum. Cortou o custo de geração em cerca de uma ordem de grandeza e trouxe a geração de imagens para hardware que alguém já podia ter, em vez de um cluster alugado.

Pesos abertos e o que eles desencadearam

A Stability lançou os próprios arquivos do modelo, e não apenas uma API. Esse é o fato de consequências mais longas — fácil de subestimar agora que os resultados estão por toda parte.

Como qualquer pessoa podia inspecionar e modificar o modelo, a comunidade construiu a camada de controle que o modelo base não tinha. LoRAs tornaram possível ensinar um estilo ou sujeito específico com um pequeno arquivo adicional, em vez de retreinar qualquer coisa. O ControlNet tornou possível restringir uma geração a uma pose, um mapa de profundidade ou um desenho de contorno. Checkpoints da comunidade especializaram o modelo base para ilustração, fotografia, arquitetura e tudo o mais.

O vocabulário que saiu desse período é hoje a forma como se fala de geração de imagens em geral — seed, sampler, denoise strength, CFG, inpainting. Essas palavras foram popularizadas por uma comunidade aberta que lia e reescrevia um modelo que podia de fato abrir — e são o motivo de o glossário deste site ser escrito como é.

Como é, de fato, rodá-lo por conta própria

Melhor do que era e ainda assim não é casual. Há instaladores de um clique e há interfaces nodais de complexidade real, e a distância entre "gerei uma imagem" e "obtive a imagem que eu queria" é onde o tempo vai embora.

A recompensa é um controle que produtos hospedados não oferecem: seeds exatas, resoluções arbitrárias, qualquer checkpoint ou LoRA que preferir, nenhum pipeline de conteúdo entre o(a) senhor(a) e a saída, nenhum custo por imagem depois do hardware e nada saindo da sua máquina.

O custo é que agora o(a) senhor(a) está operando uma pequena infraestrutura. Arquivos de modelo chegam a vários gigabytes cada, extensões entram em conflito entre si e uma placa de vídeo com memória suficiente é o ingresso. Quem quer uma imagem tende a ficar mais feliz com um modelo hospedado; quem quer um processo é quem permanece.

Onde está hoje

Já não é automaticamente a opção mais forte em qualidade bruta de saída, e vários modelos mais novos — incluindo o FLUX, feito em parte por pessoas que trabalharam no Stable Diffusion — seguem prompts mais literalmente e rendem texto legível muito melhor.

O que ele mantém é o ecossistema. O volume de checkpoints da comunidade, adaptadores de estilo e ferramentas de controle construídos sobre as versões antigas não é algo que um modelo novo adquira rapidamente e, para quem tem um estilo específico a reproduzir ou já tem uma pipeline montada, esse inventário pesa mais que uma diferença geral de qualidade.

Versões sucessivas também foram lançadas sob licenças progressivamente mais condicionais do que as primeiras — algo a conferir em relação ao seu uso pretendido, em vez de presumir. "Pesos abertos" e "gratuito para qualquer coisa" deixaram de ser a mesma frase faz tempo.

Lendo o restante deste site a partir dele

Quase toda página de técnica aqui usa termos que este modelo popularizou. Denoise strength decide o quanto um resultado de image-to-image se afasta de sua entrada. Uma seed torna uma geração repetível. Inpainting edita dentro de uma máscara e deixa o restante intocado. Esses conceitos se aplicam, qualquer que seja o modelo que o(a) senhor(a) venha a usar.

Esse é o motivo honesto para entender o Stable Diffusion mesmo que nunca o instale: é o modelo cujo modo de uso vazou para a linguagem. Aprenda uma vez e toda outra ferramenta fica mais fácil de ler.

O modelo aberto

Por que liberar os pesos foi mais importante do que o próprio modelo

A conquista técnica foi tornar a diffusion barata o suficiente para uma placa de vídeo de consumidor. A decisão consequente foi publicar os arquivos para que qualquer pessoa pudesse abri-los.

Tudo que veio depois — LoRAs, ControlNet, checkpoints da comunidade, todo o vocabulário de seeds e amostradores — existe porque milhares puderam ler e modificar um modelo de imagem funcional, em vez de acessá-lo por uma fenda.

Um manual técnico aberto ao lado de folhas de contato fotográficas sobre uma bancada clara

Três camadas do ecossistema

O que as pessoas realmente acrescentam ao modelo base

Trocando o próprio modelo

Um checkpoint é o conjunto inteiro de pesos. O ajuste fino do modelo base num corpo mais restrito de imagens — fotografia, ilustração, arquitetura — produz um modelo com caráter padrão diferente e outras competências.

Carrega-se exatamente um por vez, e é a decisão com maior efeito no que sai.

  • Vários gigabytes cada.
  • Um carregado por vez.
  • Licenças e procedência variam muito.
Uma natureza-morta de produto gerada por IA

Perguntas sobre Stable Diffusion

O que saber antes de instalar qualquer coisa

As questões que determinam se autohospedar é para o seu caso.

De que hardware realmente preciso?

Memória de vídeo é a restrição determinante, mais do que velocidade bruta. Placas mais antigas com memória generosa frequentemente superam modelos novos com menos memória nesta carga de trabalho.

Ainda vale a pena aprender?

Se precisa de reprodutibilidade, volume, privacidade ou controle estrutural, sim. Se quer boas imagens sem configuração, um modelo hospedado chega lá mais rápido.

Qual versão devo usar?

Depende inteiramente do ecossistema de que necessita. Versões antigas têm muito mais ferramentas comunitárias; as novas trazem melhor qualidade base e licenças mais condicionais.

Posso usar a saída comercialmente?

Verifique a licença da versão específica e de cada checkpoint e LoRA na pilha. "Pesos abertos" e "livre para qualquer uso" deixaram de ser sinônimos há algum tempo.

Por que meus resultados parecem piores que os exemplos?

Quase sempre é o checkpoint, não o prompt. Exemplos da comunidade geralmente são gerados num checkpoint fortemente ajustado, não no modelo base.

Está sendo substituído pelo FLUX?

Em qualidade de saída, em grande parte foi superado. Em inventário de checkpoints, adaptadores e ferramentas de controle, nada o substituiu até agora.

Fotografia de comida gerada por IA à luz do dia

Continue explorando

Em outros locais na LaFoto

Os conceitos aqui servem, independentemente do que executar.

Stable Diffusion — questions people ask

O que é o Stable Diffusion?
Um modelo texto-para-imagem lançado abertamente pela Stability AI, baseado em difusão latente, que pode ser baixado e executado em hardware de consumo, e não apenas acessado por API.
O Stable Diffusion é gratuito?
Os pesos foram abertos e podem ser executados localmente sem custo por imagem, mas os termos de licença variam entre versões e os lançamentos mais recentes trazem mais condições. Verifique a licença da versão específica em relação ao seu uso pretendido.
O que significa difusão latente?
O modelo trabalha em uma representação comprimida da imagem, e não em pixels na resolução final, e então decodifica para imagem no fim. Isso o tornou barato o suficiente para rodar em uma placa de vídeo comum.
O que é uma LoRA no Stable Diffusion?
Um pequeno arquivo adicional que ensina ao modelo base um estilo, sujeito ou personagem específico sem retreinar o modelo inteiro. É a forma padrão de a comunidade compartilhar especializações.
O que é o ControlNet?
Uma extensão que restringe a geração a uma entrada estrutural, como um esqueleto de pose, um mapa de profundidade ou um desenho de bordas — assim é possível fixar a composição e deixar o modelo decidir o restante.
Preciso de uma boa placa de vídeo para rodar o Stable Diffusion?
Para executar localmente, sim — memória de vídeo é a restrição principal. Serviços hospedados eliminam essa exigência ao custo do controle que rodar por conta própria proporciona.
O Stable Diffusion ainda é o melhor modelo de imagem?
Não em qualidade bruta de saída; modelos mais novos geralmente seguem prompts mais literalmente e rendem texto melhor. Sua vantagem hoje é a profundidade de ferramentas comunitárias ao redor dele.
Por que as pessoas falam de seeds e samplers?
São controles que a comunidade aberta revelou e nomeou ao trabalhar com este modelo, e o vocabulário se espalhou daí para o restante da área.

Comece a criar hoje

Gere sua primeira imagem com o melhor gerador de imagens por IA.

Transforme uma frase em uma imagem finalizada e fotorrealista em segundos — depois refine cada detalhe. Sem configuração, sem Discord, sem GPU.

Junte-se a 4.200+ criadores que usam a LaFoto