Stability AI · model directory
Che cos’è Stable Diffusion? Il modello open da cui tutto il resto ha preso in prestito
Stable Diffusion è un modello di latent diffusion rilasciato apertamente da Stability AI. Cosa significa latent diffusion e perché i pesi aperti hanno contato così tanto.
Stable Diffusion at a glance
- Sviluppatore
- Stability AI
- Architettura
- Diffusione latente
- Pesi
- Aperti, scaricabili
- Gira su
- GPU consumer
- Conosciuto per
- Il suo ecosistema
- Estensioni
- LoRA, ControlNet, checkpoint
Cosa significa «latent diffusion», senza la matematica
Un modello di diffusion impara guardando immagini che vengono distrutte. Si prende una fotografia, si aggiunge un po’ di rumore, poi altro, si continua finché resta solo statica, e si addestra una rete a prevedere cosa è stato rimosso a ogni passo. Facendo poi girare la rete al contrario partendo dalla pura statica, dipinge un’immagine che prima non esisteva.
Farlo a piena risoluzione è enormemente costoso, perché ogni passo opera su ogni pixel. L’idea latente è comprimere prima l’immagine in una rappresentazione molto più piccola che mantiene la struttura e scarta i pixel esatti, eseguire tutto il processo rumoroso in quello spazio ridotto e decodificare in un’immagine reale solo alla fine.
Quella singola decisione è il motivo per cui tutto questo è arrivato alle persone comuni. Ha ridotto il costo di generazione di circa un ordine di grandezza e portato la generazione di immagini su hardware che qualcuno poteva già avere, invece che su un cluster a noleggio.
Pesi aperti, e cosa hanno innescato
Stability ha rilasciato i file del modello, non solo un’API. È il fatto con le conseguenze più durature, facile da sottovalutare ora che i risultati sono ovunque.
Poiché chiunque poteva ispezionare e modificare il modello, la community ha costruito lo strato di controllo che al modello base mancava. Le LoRA hanno reso possibile insegnare uno stile o un soggetto specifico con un piccolo file aggiuntivo invece di riaddestrare tutto. ControlNet ha reso possibile vincolare una generazione a una posa, a una mappa di profondità o a un disegno di contorno. I checkpoint della community hanno specializzato il modello base per illustrazione, fotografia, architettura e molto altro.
Il vocabolario nato in quel periodo è oggi il modo in cui si parla di generazione di immagini in generale — seed, sampler, denoise strength, CFG, inpainting. Quelle parole sono state diffuse da una community open che leggeva e riscriveva un modello che poteva davvero aprire, ed è il motivo per cui il glossario su questo sito è scritto così.
Com’è davvero eseguirlo in locale
Meglio di prima e non ancora immediato. Esistono installer a un clic ed esistono interfacce a nodi di vera complessità, e la distanza tra «ho generato un’immagine» e «ho ottenuto l’immagine che volevo» è dove si spende il tempo.
La ricompensa è un controllo che i servizi hosted non offrono: seed esatti, risoluzioni arbitrarie, qualsiasi checkpoint o LoRA si desideri, nessuna pipeline di contenuti tra Lei e l’output, nessun costo per immagine dopo l’hardware, e niente che lasci la Sua macchina.
Il costo è che ora sta operando un piccolo pezzo di infrastruttura. I file dei modelli pesano diversi gigabyte ciascuno, le estensioni entrano in conflitto, e il biglietto d’ingresso è una scheda video con memoria sufficiente. Chi vuole un’immagine tende a preferire un modello hosted; chi vuole un processo è chi resta.
Dove si colloca oggi
Non è più automaticamente l’opzione più forte per qualità grezza dell’output, e diversi modelli più recenti — incluso FLUX, sviluppato in parte da persone che hanno lavorato su Stable Diffusion — seguono i prompt in modo più letterale e rendono testo leggibile molto meglio.
Ciò che conserva è l’ecosistema. Il volume di checkpoint della community, adapter di stile e strumenti di controllo costruiti sulle versioni precedenti non è qualcosa che un modello nuovo acquisisce in fretta, e per chi ha uno stile specifico da riprodurre o una pipeline già costruita, quell’inventario pesa più di un gap di qualità generale.
Le versioni successive sono inoltre arrivate con licenze via via più condizionate rispetto ai primi rilasci; vale la pena verificarle rispetto all’uso previsto, senza dare per scontato nulla. «Pesi aperti» e «liberi per qualsiasi uso» hanno smesso di coincidere da tempo.
Leggere il resto del sito attraverso questo modello
Quasi ogni pagina di tecnica qui usa termini che questo modello ha popolarizzato. La denoise strength decide quanto un risultato image-to-image si discosta dall’input. Un seed rende ripetibile una generazione. L’inpainting modifica all’interno di una maschera e lascia il resto intatto. Questi concetti valgono qualunque modello si usi alla fine.
È il motivo sincero per comprendere Stable Diffusion anche se non lo installerà mai: è il modello la cui interfaccia è filtrata nel linguaggio. Lo si impara una volta e ogni altro strumento diventa più facile da leggere.
Il modello aperto
Perché rilasciare i pesi ha contato più del modello
Il risultato tecnico è stato rendere la diffusion abbastanza economica per una scheda grafica consumer. La decisione consequenziale è stata pubblicare i file così che chiunque potesse aprirli.
Tutto ciò che è seguito — LoRA, ControlNet, checkpoint della community, l’intero vocabolario di seed e sampler — esiste perché migliaia di persone hanno potuto leggere e modificare un modello di immagini funzionante invece di interrogarne uno attraverso un’interfaccia chiusa.

Tre strati dell’ecosistema
Cosa si aggiunge davvero sopra il modello base
Sostituire il modello stesso
Un checkpoint è l’insieme completo dei pesi. Un fine-tuning del base su un corpus più stretto di immagini — fotografia, illustrazione, architettura — produce un modello con un carattere predefinito diverso e competenze diverse.
Se ne carica esattamente uno alla volta, ed è la decisione con l’effetto più grande su ciò che esce.
- Ognuno pesa diversi gigabyte.
- Uno caricato alla volta.
- Licenze e provenienza variano molto.

Aggiungere una cosa senza riaddestrare
Un piccolo file che insegna al checkpoint caricato uno stile, un personaggio o un oggetto specifico. Addestrabile su una singola scheda consumer in minuti o ore.
Se ne possono impilare diversi con pesi individuali, ed è lì che vive gran parte della difficoltà pratica — due LoRA di stile forti si ostacolano a vicenda.
- Da decine a centinaia di megabyte.
- Impilabili, con intensità regolabile.
- Vincolate a una specifica architettura base.

Fissare la struttura, liberare il resto
Vincola una generazione a un input strutturale — uno scheletro di posa, una mappa di profondità, un disegno a contorni — così che la composizione la decide Lei e il resto il modello.
Questa è la capacità che ha trasformato la generazione di immagini da campionamento a regia, e non ha equivalenti netti nella maggior parte dei servizi hosted.
- Posa, profondità, contorni, segmentazione.
- Composizione fissata, stile libero.
- Il motivo principale per cui si fa self-hosting.

Domande su Stable Diffusion
Cosa sapere prima di installare qualsiasi cosa
Le domande che decidono se il self-hosting fa per Lei.
Che hardware serve davvero?
La memoria video è il vincolo principale, più della pura velocità. Schede più vecchie ma generose di memoria spesso superano quelle nuove con meno memoria in questo tipo di carico.
Vale ancora la pena impararlo?
Se Le servono riproducibilità, volume, privacy o controllo strutturale, sì. Se vuole buone immagini senza setup, un modello hosted ci arriva più in fretta.
Quale versione dovrei usare?
Dipende interamente dall’ecosistema di cui ha bisogno. Le versioni più vecchie hanno molti più strumenti della community; le più nuove hanno qualità base migliore e licenze più condizionate.
Posso usare l’output a scopi commerciali?
Controlli la licenza della versione specifica e di ogni checkpoint e LoRA nello stack. "Pesi aperti" e "libero per qualsiasi uso" hanno smesso di essere la stessa cosa da tempo.
Perché i miei risultati sembrano peggiori degli esempi?
Quasi sempre è il checkpoint, non il prompt. Gli esempi della community sono di solito generati su un checkpoint pesantemente fine-tuned, non sul modello base.
FLUX lo sta sostituendo?
Sulla qualità dell’output è in gran parte superato. Sull’inventario di checkpoint, adapter e strumenti di controllo, non è ancora stato sostituito da nulla.

I termini nati qui
Vocabolario uscito dall’ecosistema aperto
Continui a esplorare
Altrove su LaFoto
I concetti qui valgono a prescindere da cosa eseguirà.
- ridimensioni un'immagine
- JPG, PNG e WebP
- compressore di immagini
- ritagli con un rapporto
- selettore colori da immagine
- rimuova uno sfondo
- visualizzatore EXIF
- Generatore di prompt AI
- generatore anime AI
- trasformi una foto in cartoon
- crei pixel art
- il confronto in classifica
- confrontata con Midjourney
- LaFoto vs Leonardo AI
- confrontata con Ideogram
- confrontata con Canva
- riprodurre un'immagine
- quanto può deviare un risultato
- modifica all'interno di una maschera
- il blog di LaFoto
Stable Diffusion — questions people ask
- Che cos’è Stable Diffusion?
- Un modello da testo a immagine rilasciato apertamente da Stability AI, basato su latent diffusion, che può essere scaricato ed eseguito su hardware consumer invece che solo tramite API.
- Stable Diffusion è gratuito?
- I pesi sono stati rilasciati apertamente e possono essere eseguiti in locale senza costo per immagine, ma i termini di licenza differiscono tra versioni e le release più recenti hanno più condizioni. Controlli la licenza della versione specifica in base all’uso previsto.
- Cosa significa latent diffusion?
- Il modello lavora su una rappresentazione compressa di un’immagine invece che sui pixel a piena risoluzione, quindi decodifica in immagine alla fine. È ciò che l’ha reso abbastanza economico da girare su una scheda grafica comune.
- Che cos’è una LoRA in Stable Diffusion?
- Un piccolo file aggiuntivo che insegna al modello base uno stile, un soggetto o un personaggio specifico senza riaddestrare l’intero modello. È il modo standard con cui la community condivide specializzazioni.
- Che cos’è ControlNet?
- Un’estensione che vincola una generazione a un input strutturale come uno scheletro di posa, una mappa di profondità o un disegno dei bordi, così da fissare la composizione lasciando al modello il resto.
- Serve una buona scheda grafica per eseguire Stable Diffusion?
- Per eseguirlo in locale, sì — il vincolo principale è la memoria video. I servizi hosted eliminano quel requisito al costo del controllo che l’esecuzione autonoma offre.
- Stable Diffusion è ancora il miglior modello di immagini?
- Non sulla qualità grezza dell’output; i modelli più recenti seguono i prompt in modo più letterale e rendono meglio il testo. Il suo vantaggio oggi è la profondità degli strumenti della community costruiti intorno ad esso.
- Perché si parla di seed e sampler?
- Sono controlli che la community open ha messo in evidenza e nominato lavorando con questo modello, e quel vocabolario si è poi diffuso al resto del campo.
Gli altri modelli nell’elenco
Cominci a creare oggi
Generi la Sua prima immagine con il miglior generatore di immagini AI.
Trasformi una frase in un’immagine finita e fotorealistica in pochi secondi — poi rifinisca ogni dettaglio. Nessuna configurazione, niente Discord, nessuna GPU.
Si unisca a 4200+ creator che usano LaFoto