Salta al contenuto
LaFoto

Stability AI · model directory

Che cos’è Stable Diffusion? Il modello open da cui tutto il resto ha preso in prestito

Stable Diffusion è un modello di latent diffusion rilasciato apertamente da Stability AI. Cosa significa latent diffusion e perché i pesi aperti hanno contato così tanto.

Stable Diffusion è un modello da testo a immagine di Stability AI, rilasciato con pesi aperti così che chiunque possa scaricarlo ed eseguirlo sull’hardware che già possiede. Tecnicamente è un modello di latent diffusion: invece di rimuovere il rumore da un’immagine a piena risoluzione, lavora in uno spazio latente compresso e decodifica il risultato alla fine, ed è questo che l’ha reso abbastanza economico da girare su una scheda grafica consumer.

Stable Diffusion at a glance

Sviluppatore
Stability AI
Architettura
Diffusione latente
Pesi
Aperti, scaricabili
Gira su
GPU consumer
Conosciuto per
Il suo ecosistema
Estensioni
LoRA, ControlNet, checkpoint

Cosa significa «latent diffusion», senza la matematica

Un modello di diffusion impara guardando immagini che vengono distrutte. Si prende una fotografia, si aggiunge un po’ di rumore, poi altro, si continua finché resta solo statica, e si addestra una rete a prevedere cosa è stato rimosso a ogni passo. Facendo poi girare la rete al contrario partendo dalla pura statica, dipinge un’immagine che prima non esisteva.

Farlo a piena risoluzione è enormemente costoso, perché ogni passo opera su ogni pixel. L’idea latente è comprimere prima l’immagine in una rappresentazione molto più piccola che mantiene la struttura e scarta i pixel esatti, eseguire tutto il processo rumoroso in quello spazio ridotto e decodificare in un’immagine reale solo alla fine.

Quella singola decisione è il motivo per cui tutto questo è arrivato alle persone comuni. Ha ridotto il costo di generazione di circa un ordine di grandezza e portato la generazione di immagini su hardware che qualcuno poteva già avere, invece che su un cluster a noleggio.

Pesi aperti, e cosa hanno innescato

Stability ha rilasciato i file del modello, non solo un’API. È il fatto con le conseguenze più durature, facile da sottovalutare ora che i risultati sono ovunque.

Poiché chiunque poteva ispezionare e modificare il modello, la community ha costruito lo strato di controllo che al modello base mancava. Le LoRA hanno reso possibile insegnare uno stile o un soggetto specifico con un piccolo file aggiuntivo invece di riaddestrare tutto. ControlNet ha reso possibile vincolare una generazione a una posa, a una mappa di profondità o a un disegno di contorno. I checkpoint della community hanno specializzato il modello base per illustrazione, fotografia, architettura e molto altro.

Il vocabolario nato in quel periodo è oggi il modo in cui si parla di generazione di immagini in generale — seed, sampler, denoise strength, CFG, inpainting. Quelle parole sono state diffuse da una community open che leggeva e riscriveva un modello che poteva davvero aprire, ed è il motivo per cui il glossario su questo sito è scritto così.

Com’è davvero eseguirlo in locale

Meglio di prima e non ancora immediato. Esistono installer a un clic ed esistono interfacce a nodi di vera complessità, e la distanza tra «ho generato un’immagine» e «ho ottenuto l’immagine che volevo» è dove si spende il tempo.

La ricompensa è un controllo che i servizi hosted non offrono: seed esatti, risoluzioni arbitrarie, qualsiasi checkpoint o LoRA si desideri, nessuna pipeline di contenuti tra Lei e l’output, nessun costo per immagine dopo l’hardware, e niente che lasci la Sua macchina.

Il costo è che ora sta operando un piccolo pezzo di infrastruttura. I file dei modelli pesano diversi gigabyte ciascuno, le estensioni entrano in conflitto, e il biglietto d’ingresso è una scheda video con memoria sufficiente. Chi vuole un’immagine tende a preferire un modello hosted; chi vuole un processo è chi resta.

Dove si colloca oggi

Non è più automaticamente l’opzione più forte per qualità grezza dell’output, e diversi modelli più recenti — incluso FLUX, sviluppato in parte da persone che hanno lavorato su Stable Diffusion — seguono i prompt in modo più letterale e rendono testo leggibile molto meglio.

Ciò che conserva è l’ecosistema. Il volume di checkpoint della community, adapter di stile e strumenti di controllo costruiti sulle versioni precedenti non è qualcosa che un modello nuovo acquisisce in fretta, e per chi ha uno stile specifico da riprodurre o una pipeline già costruita, quell’inventario pesa più di un gap di qualità generale.

Le versioni successive sono inoltre arrivate con licenze via via più condizionate rispetto ai primi rilasci; vale la pena verificarle rispetto all’uso previsto, senza dare per scontato nulla. «Pesi aperti» e «liberi per qualsiasi uso» hanno smesso di coincidere da tempo.

Leggere il resto del sito attraverso questo modello

Quasi ogni pagina di tecnica qui usa termini che questo modello ha popolarizzato. La denoise strength decide quanto un risultato image-to-image si discosta dall’input. Un seed rende ripetibile una generazione. L’inpainting modifica all’interno di una maschera e lascia il resto intatto. Questi concetti valgono qualunque modello si usi alla fine.

È il motivo sincero per comprendere Stable Diffusion anche se non lo installerà mai: è il modello la cui interfaccia è filtrata nel linguaggio. Lo si impara una volta e ogni altro strumento diventa più facile da leggere.

Il modello aperto

Perché rilasciare i pesi ha contato più del modello

Il risultato tecnico è stato rendere la diffusion abbastanza economica per una scheda grafica consumer. La decisione consequenziale è stata pubblicare i file così che chiunque potesse aprirli.

Tutto ciò che è seguito — LoRA, ControlNet, checkpoint della community, l’intero vocabolario di seed e sampler — esiste perché migliaia di persone hanno potuto leggere e modificare un modello di immagini funzionante invece di interrogarne uno attraverso un’interfaccia chiusa.

Manuale tecnico aperto accanto a provini a contatto fotografici su un piano di lavoro chiaro

Tre strati dell’ecosistema

Cosa si aggiunge davvero sopra il modello base

Sostituire il modello stesso

Un checkpoint è l’insieme completo dei pesi. Un fine-tuning del base su un corpus più stretto di immagini — fotografia, illustrazione, architettura — produce un modello con un carattere predefinito diverso e competenze diverse.

Se ne carica esattamente uno alla volta, ed è la decisione con l’effetto più grande su ciò che esce.

  • Ognuno pesa diversi gigabyte.
  • Uno caricato alla volta.
  • Licenze e provenienza variano molto.
Una natura morta di prodotto generata dall'AI

Domande su Stable Diffusion

Cosa sapere prima di installare qualsiasi cosa

Le domande che decidono se il self-hosting fa per Lei.

Che hardware serve davvero?

La memoria video è il vincolo principale, più della pura velocità. Schede più vecchie ma generose di memoria spesso superano quelle nuove con meno memoria in questo tipo di carico.

Vale ancora la pena impararlo?

Se Le servono riproducibilità, volume, privacy o controllo strutturale, sì. Se vuole buone immagini senza setup, un modello hosted ci arriva più in fretta.

Quale versione dovrei usare?

Dipende interamente dall’ecosistema di cui ha bisogno. Le versioni più vecchie hanno molti più strumenti della community; le più nuove hanno qualità base migliore e licenze più condizionate.

Posso usare l’output a scopi commerciali?

Controlli la licenza della versione specifica e di ogni checkpoint e LoRA nello stack. "Pesi aperti" e "libero per qualsiasi uso" hanno smesso di essere la stessa cosa da tempo.

Perché i miei risultati sembrano peggiori degli esempi?

Quasi sempre è il checkpoint, non il prompt. Gli esempi della community sono di solito generati su un checkpoint pesantemente fine-tuned, non sul modello base.

FLUX lo sta sostituendo?

Sulla qualità dell’output è in gran parte superato. Sull’inventario di checkpoint, adapter e strumenti di controllo, non è ancora stato sostituito da nulla.

Una fotografia di cibo generata con IA alla luce del giorno

Continui a esplorare

Altrove su LaFoto

I concetti qui valgono a prescindere da cosa eseguirà.

Stable Diffusion — questions people ask

Che cos’è Stable Diffusion?
Un modello da testo a immagine rilasciato apertamente da Stability AI, basato su latent diffusion, che può essere scaricato ed eseguito su hardware consumer invece che solo tramite API.
Stable Diffusion è gratuito?
I pesi sono stati rilasciati apertamente e possono essere eseguiti in locale senza costo per immagine, ma i termini di licenza differiscono tra versioni e le release più recenti hanno più condizioni. Controlli la licenza della versione specifica in base all’uso previsto.
Cosa significa latent diffusion?
Il modello lavora su una rappresentazione compressa di un’immagine invece che sui pixel a piena risoluzione, quindi decodifica in immagine alla fine. È ciò che l’ha reso abbastanza economico da girare su una scheda grafica comune.
Che cos’è una LoRA in Stable Diffusion?
Un piccolo file aggiuntivo che insegna al modello base uno stile, un soggetto o un personaggio specifico senza riaddestrare l’intero modello. È il modo standard con cui la community condivide specializzazioni.
Che cos’è ControlNet?
Un’estensione che vincola una generazione a un input strutturale come uno scheletro di posa, una mappa di profondità o un disegno dei bordi, così da fissare la composizione lasciando al modello il resto.
Serve una buona scheda grafica per eseguire Stable Diffusion?
Per eseguirlo in locale, sì — il vincolo principale è la memoria video. I servizi hosted eliminano quel requisito al costo del controllo che l’esecuzione autonoma offre.
Stable Diffusion è ancora il miglior modello di immagini?
Non sulla qualità grezza dell’output; i modelli più recenti seguono i prompt in modo più letterale e rendono meglio il testo. Il suo vantaggio oggi è la profondità degli strumenti della community costruiti intorno ad esso.
Perché si parla di seed e sampler?
Sono controlli che la community open ha messo in evidenza e nominato lavorando con questo modello, e quel vocabolario si è poi diffuso al resto del campo.

Cominci a creare oggi

Generi la Sua prima immagine con il miglior generatore di immagini AI.

Trasformi una frase in un’immagine finita e fotorealistica in pochi secondi — poi rifinisca ogni dettaglio. Nessuna configurazione, niente Discord, nessuna GPU.

Si unisca a 4200+ creator che usano LaFoto