Stability AI · model directory
Qu’est-ce que Stable Diffusion ? Le modèle ouvert dont tout le reste s’est inspiré
Stable Diffusion est un modèle de diffusion latente publié ouvertement par Stability AI. Ce que signifie « diffusion latente », et pourquoi des poids ouverts ont autant compté.
Stable Diffusion at a glance
- Fabricant
- Stability AI
- architecture
- Diffusion latente
- Poids
- Ouverts, téléchargeables
- S’exécute sur
- GPUs grand public
- Réputé pour
- Son écosystème
- extensions
- LoRA, ControlNet, checkpoints
Ce que « diffusion latente » signifie, sans les maths
Un modèle de diffusion apprend en regardant des images se faire détruire. Prenez une photo, ajoutez un peu de bruit, puis davantage, jusqu’à ce qu’il ne reste que de la statique, et entraînez un réseau à prédire ce qui a été retiré à chaque étape. Exécutez ce réseau à l’envers depuis de la statique pure et il peint une image qui n’a jamais existé.
Faire cela en pleine résolution est extrêmement coûteux, car chaque étape opère sur chaque pixel. L’astuce latente est de compresser d’abord l’image dans une représentation beaucoup plus petite qui conserve la structure en jetant les pixels exacts, d’exécuter tout le processus bruité dans cet espace réduit, puis de ne décoder en image réelle qu’à la toute fin.
Cette seule décision a rendu tout cela accessible au grand public. Elle a réduit le coût de génération d’environ un ordre de grandeur et a amené la génération d’images sur du matériel que l’on pouvait déjà posséder, plutôt qu’un cluster loué.
Des poids ouverts, et ce que cela a déclenché
Stability a publié les fichiers du modèle eux-mêmes et pas seulement une API. C’est le fait aux plus longues conséquences, facile à sous-estimer maintenant que les résultats sont partout.
Parce que chacun pouvait inspecter et modifier le modèle, les gens ont construit la couche de contrôle qui manquait au modèle de base. Les LoRAs ont permis d’enseigner un style ou un sujet spécifique avec un petit fichier additionnel au lieu de réentraîner quoi que ce soit. ControlNet a permis de contraindre une génération à une pose, une carte de profondeur ou un tracé de contours. Des checkpoints communautaires ont spécialisé le modèle de base pour l’illustration, la photo, l’architecture et bien plus.
Le vocabulaire issu de cette période est devenu la façon de parler de la génération d’images en général — seed, sampler, denoise strength, CFG, inpainting. Ces mots ont été popularisés par une communauté ouverte lisant et réécrivant un modèle qu’elle pouvait réellement ouvrir, et c’est la raison pour laquelle le glossaire de ce site est rédigé ainsi.
Ce que l’exécuter vous-même signifie réellement
Mieux qu’avant et toujours non trivial. Il existe des installateurs en un clic et des interfaces nodales très riches, et la distance entre « j’ai généré une image » et « j’ai obtenu l’image voulue » est là où part le temps.
La récompense, c’est un contrôle que les services hébergés n’offrent pas : seeds exacts, résolutions arbitraires, n’importe quel checkpoint ou LoRA, aucun pipeline de contenu entre vous et la sortie, aucun coût par image une fois le matériel acquis, et rien ne quitte votre machine.
Le coût, c’est que vous opérez désormais un petit bout d’infrastructure. Les fichiers de modèles pèsent plusieurs gigaoctets chacun, des extensions se cassent entre elles, et une carte graphique avec suffisamment de mémoire est le ticket d’entrée. Celles et ceux qui veulent une image sont en général plus heureux avec un modèle hébergé ; celles et ceux qui veulent un processus sont ceux qui restent.
Où il en est aujourd’hui
Ce n’est plus automatiquement l’option la plus forte en qualité brute de sortie, et plusieurs modèles plus récents — dont FLUX, construit en partie par des personnes ayant travaillé sur Stable Diffusion — suivent les prompts plus littéralement et rendent un texte lisible bien mieux.
Ce qu’il conserve, c’est l’écosystème. Le volume de checkpoints communautaires, d’adaptateurs de style et d’outils de contrôle bâtis sur les anciennes versions ne s’acquiert pas vite pour un nouveau modèle, et pour quiconque doit reproduire un style précis ou dispose déjà d’un pipeline, cet inventaire pèse plus lourd qu’un écart de qualité générale.
Les versions successives ont aussi été publiées sous des licences de plus en plus conditionnelles par rapport aux premiers lots, ce qu’il faut confronter à votre usage prévu plutôt que de supposer. « Poids ouverts » et « libre pour tout » ont cessé d’être synonymes depuis un moment.
Lire le reste de ce site à travers lui
Presque toutes les pages de techniques ici utilisent des termes popularisés par ce modèle. Denoise strength décide jusqu’où un résultat image-vers-image s’écarte de son entrée. Un seed rend une génération reproductible. L’inpainting retouche à l’intérieur d’un masque et laisse le reste intact. Ces concepts s’appliquent quel que soit le modèle que vous utiliserez au final.
C’est la raison honnête d’appréhender Stable Diffusion même si vous ne l’installez jamais : c’est le modèle dont l’interface a déteint sur le langage. Apprenez-le une fois et chaque autre outil devient plus lisible.
Le modèle ouvert
Pourquoi publier les poids a compté plus que le modèle lui-même
L’exploit technique fut de rendre la diffusion assez peu coûteuse pour une carte graphique grand public. La décision déterminante fut de publier les fichiers pour que chacun puisse les ouvrir.
Tout ce qui a suivi — LoRA, ControlNet, checkpoints communautaires, tout le vocabulaire de seeds et de samplers — existe parce que des milliers de personnes pouvaient lire et modifier un modèle d’image opérationnel au lieu de l’interroger via une boîte noire.

Trois couches de l’écosystème
Ce que les gens ajoutent réellement au modèle de base
Changer de modèle lui-même
Un checkpoint est l’ensemble complet des poids. Un affinement du modèle de base sur un corpus plus étroit — photographie, illustration, architecture — produit un modèle au caractère par défaut différent, avec d’autres compétences.
Vous n’en chargez qu’un à la fois, et c’est la décision qui influence le plus ce qui sort.
- Plusieurs gigaoctets chacun.
- Un seul chargé à la fois.
- Licences et provenance très variables.

Ajouter une chose sans réentraîner
Un petit fichier qui apprend au checkpoint chargé un style, un personnage ou un objet précis. Entraînable sur une seule carte grand public en quelques minutes à heures.
Plusieurs peuvent être empilées avec des poids individuels, là où se loge l’essentiel de la difficulté pratique — deux LoRA de style fortes se contrarient.
- De quelques dizaines à quelques centaines de mégaoctets.
- Empilables, avec force ajustable.
- Liées à une architecture de base spécifique.

Fixer la structure, libérer le reste
Contraint une génération à un input structurel — squelette de pose, carte de profondeur, dessin de contours — pour que la composition soit décidée par vous et le reste par le modèle.
C’est la capacité qui a transformé la génération d’images d’un échantillonnage en une direction, et elle n’a pas d’équivalent propre dans la plupart des services hébergés.
- Pose, profondeur, contours, segmentation.
- Composition fixée, style libre.
- La raison principale de l’auto-hébergement.

Questions sur Stable Diffusion
À savoir avant d’installer quoi que ce soit
Les questions qui tranchent si l’auto-hébergement est pour vous.
De quel matériel ai-je réellement besoin ?
La mémoire vidéo est la contrainte déterminante, plus que la vitesse brute. Pour cette charge, d’anciennes cartes bien dotées en mémoire surpassent souvent des modèles récents moins pourvus.
Est-ce encore utile d’apprendre ?
Si vous avez besoin de reproductibilité, de volume, de confidentialité ou de contrôle structurel, oui. Si vous voulez de belles images sans configuration, un modèle hébergé vous y mènera plus vite.
Quelle version devrais-je utiliser ?
Cela dépend entièrement de l’écosystème dont vous avez besoin. Les versions plus anciennes disposent d’outils communautaires bien plus nombreux ; les plus récentes offrent une meilleure qualité de base et des licences plus conditionnelles.
Puis-je utiliser la sortie commercialement ?
Vérifiez la licence de la version précise et de chaque checkpoint et LoRA de la pile. « Poids ouverts » et « libre pour tout usage » ont cessé d’être synonymes depuis un moment.
Pourquoi mes résultats sont-ils pires que les exemples ?
Presque toujours le checkpoint plutôt que le prompt. Les exemples communautaires sont généralement générés avec un checkpoint fortement affiné, pas le modèle de base.
Est-il remplacé par FLUX ?
Sur la qualité de sortie, il est largement dépassé. Sur l’inventaire des checkpoints, adaptateurs et outils de contrôle, rien ne l’a encore remplacé.

Les termes nés de ce modèle
Le vocabulaire issu de l’écosystème ouvert
Continuez d’explorer
Ailleurs sur LaFoto
Ces notions s’appliquent quel que soit ce que vous faites tourner.
- redimensionner une image
- JPG, PNG et WebP
- compresseur d’images
- recadrer à un ratio
- pipette de couleurs depuis une image
- supprimer un arrière-plan
- visionneuse EXIF
- Générateur de prompt IA
- générateur d’anime IA
- cartooniser une image
- créer du pixel art
- la comparaison classée
- comparé à Midjourney
- LaFoto vs Leonardo AI
- comparé à Ideogram
- comparé à Canva
- reproduire une image
- jusqu’où le résultat peut dériver
- retouche à l’intérieur d’un masque
- le journal LaFoto
Stable Diffusion — questions people ask
- Qu’est-ce que Stable Diffusion ?
- Un modèle texte-vers-image publié ouvertement par Stability AI, fondé sur la diffusion latente, qui peut être téléchargé et exécuté sur du matériel grand public plutôt qu’uniquement via une API.
- Stable Diffusion est-il gratuit ?
- Les poids ont été publiés ouvertement et peuvent être exécutés en local sans coût par image, mais les conditions de licence varient selon les versions et les dernières sont plus restrictives. Vérifiez la licence de la version précise au regard de votre usage.
- Que signifie diffusion latente ?
- Le modèle travaille sur une représentation compressée d’une image plutôt que sur des pixels en pleine résolution, puis décode en image à la fin. C’est ce qui l’a rendu assez peu coûteux pour tourner sur une carte graphique ordinaire.
- Qu’est-ce qu’une LoRA dans Stable Diffusion ?
- Un petit fichier additionnel qui enseigne au modèle de base un style, un sujet ou un personnage spécifique sans réentraîner tout le modèle. C’est la manière standard dont la communauté partage ses spécialisations.
- Qu’est-ce que ControlNet ?
- Une extension qui contraint une génération à un apport structurel comme un squelette de pose, une carte de profondeur ou un tracé de contours, afin de figer la composition tout en laissant le modèle décider du reste.
- Ai-je besoin d’une bonne carte graphique pour faire tourner Stable Diffusion ?
- En local, oui — la mémoire vidéo est la contrainte déterminante. Les services hébergés lèvent cette exigence au prix du contrôle qu’offre l’exécution locale.
- Stable Diffusion est-il encore le meilleur modèle d’images ?
- Pas en qualité brute ; des modèles plus récents suivent en général les prompts plus littéralement et rendent mieux le texte. Son avantage est désormais la profondeur des outils communautaires qui l’entourent.
- Pourquoi les gens parlent-ils de seeds et de samplers ?
- Ce sont des contrôles que la communauté ouverte a mis en lumière et nommés en travaillant avec ce modèle, et le vocabulaire s’est diffusé de là à tout le domaine.
Les autres modèles du répertoire
Commencez dès aujourd’hui
Générez votre première image avec le meilleur générateur d’images IA.
Transformez une phrase en image finie et photoréaliste en quelques secondes — puis peaufinez chaque détail. Aucune configuration, pas de Discord, pas de GPU.
Rejoignez 4 200+ créateurs qui utilisent LaFoto