Siirry sisältöön
LaFoto

Stability AI · model directory

Mikä on Stable Diffusion? Avoin malli, josta muut lainasivat

Stable Diffusion on Stability AI:n avoimesti julkaistu latentti diffuusiomalli. Mitä latentti diffuusio tarkoittaa ja miksi avoimilla painoilla oli niin suuri merkitys.

Stable Diffusion on Stability AI:n tekstistä kuvaksi -malli, jonka mallipainot julkaistiin avoimesti, jotta kuka tahansa voi ladata ja ajaa sitä omalla laitteistolla. Teknisesti se on latentti diffuusiomalli: se ei poista kohinaa täysiresoluutioisesta kuvasta, vaan toimii pakatussa latenttiavaruudessa ja dekoodaa tuloksen lopuksi, mikä teki siitä niin kevyen, että se pyörii kuluttajatason näytönohjaimella.

Stable Diffusion at a glance

Valmistaja
Stability AI
Arkkitehtuuri
Latentti diffuusio
Mallipainot
Avoimet, ladattavissa
Toimii
kuluttajatason GPU:t
Tunnetaan
Ekosysteemistään
Laajennukset
LoRA, ControlNet, checkpointit

Mitä "latentti diffuusio" tarkoittaa ilman matematiikkaa

Diffuusiomalli oppii katsomalla, kun kuvia rikotaan. Ota valokuva, lisää hieman kohinaa, lisää lisää, jatka kunnes pelkkä kohina on jäljellä, ja kouluta verkko ennustamaan mitä poistettiin jokaisessa vaiheessa. Aja tuo verkko taaksepäin puhtaasta kohinasta ja se maalaa kuvan, jota ei ollut olemassa.

Tämän tekeminen täydessä resoluutiossa on valtavan kallista, koska jokainen vaihe koskee jokaista pikseliä. Latentti kikka on pakata kuva ensin paljon pienempään esitykseen, joka säilyttää rakenteen ja heittää pois tarkat pikselit, ajaa koko kohinaprosessi tuossa pienessä tilassa ja dekoodata oikeaksi kuvaksi vasta ihan lopussa.

Tuo yksi päätös on syy, miksi tämä tuli tavallisten ihmisten ulottuville. Se leikkasi generoinnin kustannusta noin kertaluokan ja toi kuvageneroinnin laitteille, jotka jollakulla saattoi jo olla, vuokratun klusterin sijaan.

Avoimet painot, ja mitä ne käynnistivät

Stability julkaisi itse mallin tiedostot, ei vain API:a. Se on pisimmälle kantava tosiasia, ja sitä on helppo aliarvioida nyt kun tuloksia on kaikkialla.

Koska kuka tahansa saattoi tutkia ja muokata mallia, ihmiset rakensivat ohjauskerroksen, joka perusmallista puuttui. LoRAt mahdollistivat tietyn tyylin tai kohteen opettamisen pienellä lisätiedostolla uudelleenkouluttamisen sijaan. ControlNet mahdollisti generoinnin rajaamisen asentoon, syvyyskarttaan tai reunapiirrokseen. Yhteisön checkpointit erikoistuivat kuvitukseen, valokuvaukseen, arkkitehtuuriin ja kaikkeen siltä väliltä.

Tuon ajan sanasto on nyt tapa, jolla kuvageneroinnista puhutaan yleensä — seed, sampler, denoise-vahvuus, ohjausvahvuus (CFG), inpainting. Nuo sanat yleistyivät avoimen yhteisön työstäessä ja kirjoittaessa mallia, jonka he saattoivat oikeasti avata, ja siksi tämän sivuston sanasto on kirjoitettu niin kuin on.

Millaista sen ajaminen itse oikeasti on

Parempaa kuin ennen, mutta ei vieläkään huoleton. On yhden klikin asennuksia ja on solmupohjaisia käyttöliittymiä todellisella monimutkaisuudella, ja matka "sain kuvan ulos" → "sain juuri haluamani kuvan" on se, mihin aika menee.

Palkintona on kontrolli, jota hostatut tuotteet eivät tarjoa: täsmälleen samat seedit, mielivaltaiset resoluutiot, mikä tahansa checkpoint tai LoRA, ei sisältöputkea sinun ja ulostulon välissä, ei kuva-kohtaista kustannusta laitteiston jälkeen, eikä mikään poistu koneeltasi.

Hinta on, että operoit nyt pientä infrastruktuuripalaa. Mallitiedostot ovat useita gigatavuja kukin, laajennukset rikkovat toisensa, ja riittävän muistin omaava näytönohjain on sisäänpääsylippu. Ihmiset, jotka haluavat kuvan, ovat yleensä onnellisempia hostatun mallin kanssa; ihmiset, jotka haluavat prosessin, ovat niitä, jotka jäävät.

Missä se seisoo nyt

Se ei ole enää automaattisesti vahvin vaihtoehto raakatulosten laadussa, ja useat uudemmat mallit — mukaan lukien FLUX, jonka tekijöissä on Stable Diffusionin parissa työskennelleitä — lukevat promptit kirjaimellisemmin ja tuottavat paljon luettavampaa tekstiä.

Mikä säilyy, on ekosysteemi. Yhteisön checkpointtien, tyyliadapterien ja ohjaustyökalujen määrä vanhempien versioiden ympärillä ei ole sellaista, jonka uudempi malli saa nopeasti, ja kenelle tahansa, jolla on tietty tyyli toistettavana tai jo rakennettu putki, tuo varanto painaa enemmän kuin yleinen laatuero.

Myös peräkkäiset versiot ovat tulleet ulos vähitellen ehdollisemmilla lisensseillä kuin varhaiset julkaisut, mikä kannattaa tarkistaa omaa käyttöä vasten oletuksen sijaan. "Avoimet painot" ja "vapaasti kaikkeen" lakkasivat olemasta sama lause jokin aika sitten.

Tämän sivuston lukeminen sen kautta

Lähes jokainen tekniikkasivu täällä käyttää termejä, joita tämä malli popularisoi. Denoise-vahvuus päättää, kuinka kauas image-to-image -tulos erkanee lähtökuvasta. Seed tekee generoinnista toistettavan. Inpainting muokkaa maskin sisällä ja jättää muun koskematta. Nuo käsitteet pätevät riippumatta siitä, mitä mallia lopulta käytät.

Se on rehellinen syy ymmärtää Stable Diffusion vaikka et sitä asentaisi: se on malli, jonka käyttöliittymä vuoti kieleen. Opit sen kerran, ja jokainen muu työkalu on helpompi lukea.

Avoin malli

Miksi weight-tiedostojen julkaisu oli tärkeämpää kuin itse malli

Tekninen saavutus oli tehdä diffuusiosta riittävän halpaa kuluttajan näytönohjaimelle. Seurauksiltaan merkittävä päätös oli julkaista tiedostot kaikkien avattaviksi.

Kaikki sen jälkeen — LoRA:t, ControlNet, yhteisön checkpointit, koko seedien ja samplerien sanasto — on olemassa, koska tuhannet ihmiset saattoivat lukea ja muokata toimivaa kuvamallia sen sijaan, että kyselisivät sitä luukun läpi.

avoin tekninen käsikirja valokuvien kontaktikopioiden vieressä vaalealla työpöydällä

Ekosysteemin kolme kerrosta

Mitä ihmiset oikeasti kasaavat perusmallin päälle

Itse mallin vaihtaminen

Checkpoint on koko weight-setti. Perusmallin hienosäätö kapeammalla kuvakorpuksella — valokuvaus, kuvitus, arkkitehtuuri — tuottaa mallin, jolla on eri perusluonne ja eri kyvykkyydet.

Lataat kerrallaan tasan yhden, ja se on päätös, jolla on suurin vaikutus lopputulokseen.

  • Kokoa useita gigatavuja kukin.
  • Vain yksi kerrallaan ladattuna.
  • Lisenssit ja alkuperä vaihtelevat suuresti.
tekoälyn tuottama tuoteasetelma

Stable Diffusion -kysymykset

Mitä tietää ennen kuin asennat mitään

Kysymykset, jotka ratkaisevat onko itsehostaus sinua varten.

Mitä rautaa oikeasti tarvitsen?

Videomuisti on sitova rajoite, ei raakanopeus. Vanhat kortit runsaalla muistilla voittavat usein uudemmat vähemmällä muistilla tässä työssä.

Onko tätä yhä järkeä opetella?

Jos tarvitset toistettavuutta, volyymia, yksityisyyttä tai rakenteellista ohjausta, kyllä. Jos haluat hyviä kuvia ilman säätöä, hostattu malli vie perille nopeammin.

Mitä versiota minun pitäisi käyttää?

Riippuu täysin, mitä ekosysteemiä tarvitset. Vanhammissa versioissa on valtavasti enemmän yhteisötyökaluja; uudemmissa on parempi perustaso ja ehdollisempia lisenssejä.

Voinko käyttää tuotoksia kaupallisesti?

Tarkista pinon jokaisen osan lisenssi: käytettävän version sekä jokaiseen checkpointiin ja LoRA:an liittyvät ehdot. "Avoimet weightit" ja "vapaa mihin tahansa" erkanivat toisistaan jokin aika sitten.

Miksi tulokseni näyttävät huonommilta kuin esimerkit?

Lähes aina syynä on checkpoint, ei prompt. Yhteisön esimerkit on tavallisesti tehty vahvasti hienosäädetyllä checkpointilla, eivät perusmallilla.

Onko FLUX jo korvannut sen?

Lopputuloksen laadussa se on paljolti ohittanut. Checkpoint-valikoimassa, adaptereissa ja ohjaustyökaluissa sitä ei ole vielä korvattu.

Tekoälyn luoma ruokakuva päivänvalossa

Jatka tutkimista

Muualla LaFotossa

Tämän sivun käsitteet pätevät riippumatta mitä ajat.

Stable Diffusion — questions people ask

Mikä on Stable Diffusion?
Avoimesti julkaistu tekstistä kuvaksi -malli Stability AI:lta, perustuu latenttiin diffuusioon, ja sen voi ladata ja ajaa kuluttajalaitteistolla pelkän API:n kautta käyttämisen sijaan.
Onko Stable Diffusion ilmainen?
Mallipainot on julkaistu avoimesti ja niitä voi ajaa paikallisesti ilman kuva-kohtaista maksua, mutta lisenssiehdot vaihtelevat versioittain ja uudemmissa julkaisuissa on enemmän ehtoja. Tarkista käyttötarkoitukseesi sopivan version lisenssi.
Mitä latentti diffuusio tarkoittaa?
Malli tekee työnsä kuvan pakatussa esityksessä eikä täyden resoluution pikseleissä, ja dekoodaa kuvan lopuksi. Se teki mallista riittävän kevyen pyörimään tavallisella näytönohjaimella.
Mikä on LoRA Stable Diffusionissa?
Pieni lisätiedosto, joka opettaa perusmallille tietyn tyylin, kohteen tai hahmon ilman koko mallin uudelleenkoulutusta. Se on yhteisön vakiotapa jakaa erikoistuksia.
Mikä on ControlNet?
Laajennus, joka rajoittaa generoinnin rakenteelliseen syötteeseen, kuten asentoluurankaan, syvyyskarttaan tai reunapiirrokseen, jotta voit lukita sommittelun ja antaa mallin päättää muun.
Tarvitsenko hyvän näytönohjaimen ajamaan Stable Diffusionia?
Paikallisesti ajettaessa kyllä — videomuisti on sitova rajoite. Hostatut palvelut poistavat vaatimuksen sillä hinnalla, että menetät osan itseajon kontrollista.
Onko Stable Diffusion yhä paras kuvamalli?
Ei raakatuloksen laadussa; uudemmat mallit seuraavat promptteja yleensä kirjaimellisemmin ja tuottavat paremmin luettavaa tekstiä. Sen etu on nyt ympärille rakennettu yhteisötyökalujen syvyys.
Miksi ihmiset puhuvat seedeistä ja samplereista?
Ne ovat ohjaimia, jotka avoin yhteisö nosti esiin ja nimesi työskennellessään tämän mallin kanssa, ja sanasto levisi sieltä muualle alalle.

Aloita luominen tänään

Luo ensimmäinen kuvasi parhaalla tekoälykuvageneraattorilla.

Muunna lause valmiiksi, fotorealistiseksi kuvaksi sekunneissa — ja hio jokaista yksityiskohtaa. Ei asennusta, ei Discordia, ei GPU:ta.

Liity 4 200+ tekijän joukkoon, jotka käyttävät LaFotoa