Lewati ke konten
LaFoto

Stability AI · model directory

Apa itu Stable Diffusion? Model terbuka yang jadi rujukan banyak lainnya

Stable Diffusion adalah model latent diffusion yang dirilis terbuka oleh Stability AI. Apa arti latent diffusion, dan mengapa bobot terbuka sangat berpengaruh.

Stable Diffusion adalah model text-to-image dari Stability AI, dirilis dengan bobot terbuka sehingga siapa pun dapat mengunduh dan menjalankannya di perangkat sendiri. Secara teknis ini adalah model latent diffusion: alih-alih mendenoise gambar beresolusi penuh, ia bekerja di ruang laten terkompresi dan mendekode hasilnya di akhir, yang membuatnya cukup murah dijalankan di kartu grafis konsumen.

Stable Diffusion at a glance

Pengembang
Stability AI
Arsitektur
difusi laten
Bobot
Terbuka, dapat diunduh
Berjalan di
GPU konsumen
Dikenal karena
Ekosistemnya
Ekstensi
LoRA, ControlNet, checkpoints

Arti "latent diffusion" tanpa matematika

Model diffusion belajar dengan menyaksikan gambar dihancurkan. Ambil sebuah foto, tambahkan sedikit noise, tambah lagi, teruskan sampai hanya tersisa statik, lalu latih jaringan untuk memprediksi apa yang dihapus di setiap langkah. Jalankan jaringan itu mundur dari statik murni dan ia melukis gambar yang sebelumnya tidak ada.

Melakukannya pada resolusi penuh sangat mahal, karena setiap langkah menyentuh setiap piksel. Trik laten adalah mengompresi gambar terlebih dulu ke representasi yang jauh lebih kecil yang mempertahankan struktur dan membuang detail piksel, jalankan seluruh proses bising itu di ruang kecil tersebut, dan hanya mendekode kembali ke gambar nyata di paling akhir.

Keputusan tunggal itu alasan mengapa ini sampai ke pengguna umum. Ia memangkas biaya generasi sekitar satu orde magnitudo dan membawa pembuatan gambar ke perangkat keras yang mungkin sudah dimiliki seseorang, bukan klaster sewaan.

Bobot terbuka, dan dampak lanjutannya

Stability merilis berkas modelnya, bukan hanya API. Itulah fakta dengan konsekuensi terpanjang, dan mudah diremehkan sekarang ketika hasilnya ada di mana-mana.

Karena siapa pun bisa memeriksa dan memodifikasi model, orang membangun lapisan kontrol yang tidak dimiliki model dasar. LoRA memungkinkan mengajarkan gaya atau subjek spesifik dengan berkas tambahan kecil alih-alih melatih ulang apa pun. ControlNet memungkinkan membatasi generasi pada pose, peta kedalaman, atau gambar tepi. Checkpoint komunitas memfokuskan model dasar untuk ilustrasi, fotografi, arsitektur, dan lainnya.

Kosakata yang lahir dari periode itu kini menjadi cara orang membicarakan pembuatan gambar secara umum — seed, sampler, denoise strength, CFG, inpainting. Istilah-istilah itu dipopulerkan komunitas terbuka yang membaca dan menulis ulang model yang benar-benar bisa mereka buka, dan itulah alasan glosarium di situs ini ditulis seperti adanya.

Seperti apa menjalankannya sendiri, secara nyata

Lebih baik daripada dulu namun tetap tidak santai. Ada penginstal sekali-klik dan ada antarmuka berbasis node yang sangat kompleks, dan jarak antara "Saya menghasilkan sebuah gambar" dan "Saya mendapatkan gambar yang saya inginkan" adalah tempat waktu habis terpakai.

Ganjarannya adalah kontrol yang tidak ditawarkan produk hosted: seed persis, resolusi sekehendak, checkpoint atau LoRA apa pun yang Anda suka, tanpa pipeline konten di antara Anda dan keluaran, tanpa biaya per gambar setelah perangkat keras, dan tidak ada yang keluar dari mesin Anda.

Biayanya adalah Anda kini mengoperasikan sepotong infrastruktur kecil. Berkas model berukuran beberapa gigabita tiapnya, ekstensi saling bentrok, dan kartu grafis dengan memori cukup adalah tiket masuk. Orang yang hanya ingin gambar biasanya lebih senang dengan model hosted; mereka yang menginginkan proses adalah yang bertahan.

Posisinya sekarang

Ia tidak lagi otomatis menjadi opsi terkuat pada kualitas keluaran mentah, dan beberapa model lebih baru — termasuk FLUX, yang sebagian dibangun oleh orang yang pernah mengerjakan Stable Diffusion — lebih harfiah mengikuti prompt dan jauh lebih baik merender teks yang terbaca.

Yang tetap dimilikinya adalah ekosistem. Jumlah checkpoint komunitas, adaptor gaya, dan alat kontrol yang dibangun di versi-versi lama bukan sesuatu yang cepat dimiliki model baru, dan bagi siapa pun yang harus mereproduksi gaya spesifik atau sudah punya pipeline, inventaris itu sering mengalahkan selisih kualitas umum.

Versi-versi berikutnya juga dirilis dengan lisensi yang makin bersyarat dibanding rilis awal, yang perlu Anda cocokkan dengan rencana penggunaan alih-alih berasumsi. "Bobot terbuka" dan "gratis untuk apa pun" sudah lama berhenti menjadi pernyataan yang sama.

Membaca sisa situs ini lewat kacamata itu

Hampir setiap halaman teknik di sini memakai istilah yang dipopulerkan model ini. Denoise strength menentukan seberapa jauh hasil image-to-image menyimpang dari inputnya. Seed membuat generasi dapat diulang. Inpainting mengedit di dalam mask dan membiarkan sisanya tak tersentuh. Konsep-konsep itu berlaku apa pun model yang akhirnya Anda pakai.

Itulah alasan jujur untuk memahami Stable Diffusion meski Anda tidak pernah menginstalnya: ini model yang antarmukanya merembes ke bahasa. Pelajari sekali dan setiap alat lain lebih mudah dibaca.

Model terbuka

Mengapa merilis bobot lebih penting daripada modelnya

Capaian teknisnya: membuat diffusion cukup murah untuk kartu grafis konsumen. Keputusan bersekuensinya: memublikasikan berkas sehingga siapa pun bisa membukanya.

Segala yang menyusul — LoRA, ControlNet, checkpoint komunitas, seluruh kosakata seed dan sampler — ada karena ribuan orang bisa membaca dan memodifikasi model gambar yang berfungsi, alih-alih hanya mengajukannya lewat antarmuka tertutup.

Buku manual teknis terbuka di samping lembar kontak foto di meja kerja pucat

Tiga lapis ekosistem

Yang benar-benar ditambahkan orang di atas model dasar

Menukar model itu sendiri

Sebuah checkpoint adalah seluruh set bobot. Fine-tuning pada korpus gambar yang lebih sempit — fotografi, ilustrasi, arsitektur — menghasilkan model dengan karakter dasar dan kompetensi yang berbeda.

Anda memuat tepat satu pada satu waktu, dan ini keputusan dengan dampak terbesar pada apa yang keluar.

  • Masing-masing berukuran beberapa gigabita.
  • Satu dimuat pada satu waktu.
  • Lisensi dan asal-usul sangat bervariasi.
Still life produk hasil AI

Pertanyaan Stable Diffusion

Yang perlu diketahui sebelum menginstal apa pun

Pertanyaan yang menentukan apakah swakelola cocok bagi Anda.

Perangkat keras apa yang benar-benar saya butuhkan?

Memori video adalah kendala utama, bukan kecepatan mentah. Kartu lama dengan memori lega sering mengungguli kartu baru dengan memori lebih kecil untuk beban kerja ini.

Masih layak dipelajari?

Jika Anda butuh reprodusibilitas, volume, privasi, atau kontrol struktural, ya. Jika Anda ingin gambar bagus tanpa penyiapan, model di-host akan lebih cepat membawa Anda ke sana.

Versi mana yang sebaiknya saya pakai?

Sepenuhnya tergantung ekosistem yang Anda perlukan. Versi lama punya jauh lebih banyak perkakas komunitas; versi baru punya kualitas dasar lebih baik dan lisensi yang lebih bersyarat.

Bisakah saya gunakan hasilnya secara komersial?

Periksa lisensi versi spesifik dan setiap checkpoint serta LoRA dalam tumpukan. "Bobot terbuka" dan "bebas untuk apa saja" sudah lama bukan pernyataan yang sama.

Mengapa hasil saya lebih buruk dari contoh?

Hampir selalu karena checkpoint, bukan prompt. Contoh komunitas biasanya dihasilkan pada checkpoint yang sangat di-fine-tune, bukan model dasar.

Apakah sedang digantikan oleh FLUX?

Dalam kualitas keluaran, sebagian besar sudah terkejar. Dalam inventaris checkpoint, adapter, dan perkakas kontrol, belum ada yang menggantikannya.

Foto makanan yang dihasilkan AI dalam cahaya siang

Terus jelajahi

Di tempat lain di LaFoto

Konsep di sini berlaku apa pun yang Anda jalankan.

Stable Diffusion — questions people ask

Apa itu Stable Diffusion?
Model text-to-image yang dirilis terbuka dari Stability AI, berbasis latent diffusion, yang dapat diunduh dan dijalankan di perangkat keras konsumen, bukan hanya diakses lewat API.
Apakah Stable Diffusion gratis?
Bobotnya dirilis terbuka dan dapat dijalankan secara lokal tanpa biaya per gambar, tetapi ketentuan lisensi berbeda antar versi dan rilis yang lebih baru membawa lebih banyak syarat. Periksa lisensi untuk versi spesifik terhadap rencana penggunaan Anda.
Apa arti latent diffusion?
Model melakukan pekerjaannya pada representasi terkompresi dari sebuah gambar alih-alih pada piksel beresolusi penuh, lalu mendekode menjadi gambar di akhir. Itulah yang membuatnya cukup murah dijalankan pada kartu grafis biasa.
Apa itu LoRA di Stable Diffusion?
Berkas tambahan kecil yang mengajarkan gaya, subjek, atau karakter spesifik ke model dasar tanpa melatih ulang seluruh model. Ini cara standar komunitas berbagi spesialisasi.
Apa itu ControlNet?
Ekstensi yang membatasi generasi pada masukan struktural seperti kerangka pose, peta kedalaman, atau gambar tepi, sehingga Anda bisa memaku komposisi sambil membiarkan model memutuskan hal lainnya.
Apakah saya perlu kartu grafis yang bagus untuk menjalankan Stable Diffusion?
Untuk menjalankannya secara lokal, ya — memori video adalah kendala utamanya. Layanan hosted menghilangkan kebutuhan itu dengan mengorbankan tingkat kontrol yang diberikan oleh menjalankannya sendiri.
Apakah Stable Diffusion masih model gambar terbaik?
Bukan pada kualitas keluaran mentah; model yang lebih baru umumnya lebih harfiah mengikuti prompt dan lebih baik merender teks. Keunggulannya kini adalah kedalaman tooling komunitas yang dibangun di sekelilingnya.
Mengapa orang membicarakan seed dan sampler?
Itu adalah kontrol yang digali dan dinamai komunitas terbuka saat bekerja dengan model ini, dan kosakatanya menyebar dari sana ke seluruh bidang.

Mulai berkarya hari ini

Hasilkan gambar pertama Anda dengan generator gambar AI terbaik.

Ubah satu kalimat menjadi gambar jadi yang fotorealistis dalam hitungan detik — lalu sempurnakan tiap detail. Tanpa setup, tanpa Discord, tanpa GPU.

Bergabunglah dengan 4.200+ kreator yang menggunakan LaFoto