ข้ามไปยังเนื้อหา
LaFoto

Stability AI · model directory

Stable Diffusion คืออะไร โมเดลเปิดที่อีกหลายตัวหยิบยืมแนวทาง

Stable Diffusion คือโมเดล latent diffusion แบบเปิดจาก Stability AI อธิบายความหมายของ latent diffusion และเหตุผลที่น้ำหนักเปิดสำคัญมาก

Stable Diffusion คือโมเดลข้อความเป็นภาพจาก Stability AI เปิดน้ำหนักโมเดลให้ทุกคนดาวน์โหลดและรันบนฮาร์ดแวร์ของตนเอง เชิงเทคนิคมันคือโมเดลแบบ latent diffusion: แทนที่จะ denoise ภาพเต็มความละเอียด มันทำงานใน latent ที่บีบอัดแล้วและถอดรหัสผลลัพธ์ในตอนท้าย ซึ่งทำให้ต้นทุนถูกพอจะรันบนการ์ดจอผู้ใช้ทั่วไปได้

Stable Diffusion at a glance

ผู้พัฒนา
Stability AI
สถาปัตยกรรม
latent diffusion
น้ำหนักโมเดล
เปิดและดาวน์โหลดได้
ทำงานบน
GPU ระดับผู้ใช้ทั่วไป
เป็นที่รู้จักเรื่อง
ระบบนิเวศของมัน
ส่วนขยาย
LoRA, ControlNet, checkpoints

ความหมายของ “latent diffusion” แบบไม่ลงคณิต

โมเดล diffusion เรียนรู้ด้วยการดูภาพถูกทำลาย นำภาพถ่ายมา เพิ่ม noise เล็กน้อย เพิ่มต่อไป จนเหลือแต่สัญญาณรบกวน แล้วฝึกเครือข่ายให้ทำนายสิ่งที่ถูกลบในแต่ละขั้น ตอนรันย้อนกลับจากสัญญาณรบกวนล้วน มันจะวาดภาพที่ไม่เคยมีอยู่จริงขึ้นมา

การทำเช่นนี้ที่ความละเอียดเต็มแพงมาก เพราะทุกขั้นต้องคำนวณทุกพิกเซล กลเม็ด latent คือบีบอัดภาพก่อนให้เหลือตัวแทนที่เล็กลงมากซึ่งรักษาโครงสร้างไว้แต่ทิ้งพิกเซลจริง ๆ ไป รันกระบวนการมี noise ทั้งหมดในพื้นที่เล็กนั้น แล้วค่อยถอดรหัสกลับเป็นภาพจริงตอนสุดท้าย

การตัดสินใจเดียวนี้ทำให้เทคโนโลยีเข้าถึงผู้ใช้ทั่วไปได้จริง ต้นทุนการสร้างภาพลดลงราวหนึ่งลำดับขนาด และพาการสร้างภาพมาสู่ฮาร์ดแวร์ที่คนทั่วไปมี แทนการเช่าโหนดจำนวนมาก

น้ำหนักเปิด และผลที่ตามมา

Stability ปล่อยไฟล์โมเดลจริง ไม่ได้ให้แค่ API นั่นคือข้อเท็จจริงที่ส่งผลยาวนาน และวันนี้อาจถูกมองข้ามได้ง่ายเพราะผลลัพธ์มีอยู่ดาษดื่น

เพราะใคร ๆ เปิดดูและแก้ไขโมเดลได้ ผู้คนจึงสร้างชั้นควบคุมที่ตัวโมเดลฐานขาดอยู่ LoRA ทำให้สอนได้ทั้งสไตล์และตัวแบบเฉพาะด้วยไฟล์เสริมขนาดเล็กแทนการฝึกใหม่ ControlNet ทำให้จำกัดการสร้างให้อยู่ในกรอบอย่างโครงท่าโพส แผนที่ความลึก หรือเส้นขอบลวดลายได้ checkpoints ของชุมชนทำให้โมเดลฐานเชี่ยวชาญขึ้นสำหรับงานอย่างภาพประกอบ การถ่ายภาพ สถาปัตย์ และอื่น ๆ

คำศัพท์จากช่วงเวลานั้นกลายเป็นภาษากลางของงานสร้างภาพ — seed, sampler, denoise strength, CFG, inpainting คำเหล่านี้แพร่จากชุมชนเปิดที่ได้อ่านและเขียนโมเดลที่เปิดดูได้จริง และนั่นคือเหตุผลที่อภิธานศัพท์บนไซต์นี้เขียนแบบนั้น

ประสบการณ์รันเองจริง ๆ เป็นอย่างไร

ดีกว่าเมื่อก่อนมาก แต่ยังไม่ใช่งานลวก ๆ มีตัวติดตั้งแบบคลิกเดียว และมีอินเทอร์เฟซแบบโหนดที่ซับซ้อนจริง ระยะทางระหว่าง “ฉันสร้างภาพได้แล้ว” กับ “ฉันได้ภาพที่ต้องการ” คือที่ที่เวลาถูกใช้ไป

รางวัลคือการควบคุมที่บริการโฮสต์ให้ไม่ได้: เลือก seed ตรงเป๊ะ ความละเอียดตามใจ เลือก checkpoint หรือ LoRA ใดก็ได้ ไม่มีท่อคอนเทนต์คั่นกลางระหว่างท่านกับผลลัพธ์ ไม่มีต้นทุนต่อภาพหลังจากมีฮาร์ดแวร์ และไม่มีข้อมูลออกจากเครื่องของท่าน

ต้นทุนคือท่านกำลังดูแลโครงสร้างพื้นฐานขนาดเล็ก ไฟล์โมเดลมีขนาดหลาย GB ส่วนขยายบางตัวชนกันเอง และการ์ดจอที่มีหน่วยความจำพอคือบัตรผ่านเข้า ผู้ที่แค่อยากได้รูปมักพอใจกับบริการโฮสต์ ผู้ที่อยากได้กระบวนการคือกลุ่มที่อยู่ต่อ

สถานะปัจจุบัน

มันไม่ได้ดีที่สุดโดยอัตโนมัติในแง่คุณภาพผลลัพธ์ดิบ และโมเดลรุ่นใหม่หลายตัว — รวมถึง FLUX ซึ่งสร้างโดยทีมที่บางส่วนเคยทำ Stable Diffusion — อ่าน prompt ตรงกว่าและเรนเดอร์ข้อความที่อ่านออกได้ดีกว่า

สิ่งที่ยังมีเหนือกว่าคือระบบนิเวศ ปริมาณ checkpoints ของชุมชน ตัวแปลงสไตล์ และเครื่องมือควบคุมที่สร้างบนรุ่นเก่า ไม่ใช่สิ่งที่โมเดลใหม่จะได้มารวดเร็ว สำหรับใครที่ต้องทำซ้ำสไตล์เฉพาะหรือมีสายงานอยู่แล้ว สต็อกทรัพยากรนั้นมีค่านำหน้าช่องว่างคุณภาพทั่วไป

รุ่นถัด ๆ มาก็มักปล่อยภายใต้สัญญาอนุญาตที่มีเงื่อนไขมากขึ้นกว่ารุ่นแรก ๆ ซึ่งควรตรวจสอบให้ตรงกับการใช้งานของท่าน แทนที่จะคิดว่า “เปิดน้ำหนัก” เท่ากับ “ใช้ฟรีทุกอย่าง” เพราะสองอย่างนี้แยกจากกันมาพักใหญ่แล้ว

มองหน้าอื่น ๆ ของไซต์นี้ผ่านเลนส์รุ่นนี้

แทบทุกหน้าวิธีการบนไซต์นี้ใช้คำที่โมเดลนี้ทำให้แพร่หลาย ค่า denoise strength กำหนดว่าผล image-to-image จะห่างจากอินพุตได้แค่ไหน seed ทำให้การสร้างซ้ำได้ Inpainting คือการแก้ในมาสก์และปล่อยส่วนที่เหลือไม่แตะ แนวคิดเหล่านี้ใช้ได้กับไม่ว่าโมเดลไหนที่ท่านเลือกในท้ายที่สุด

นี่คือเหตุผลตามตรงที่ควรเข้าใจ Stable Diffusion แม้ไม่เคยติดตั้ง: มันคือโมเดลที่อินเทอร์เฟซรั่วไหลออกมาเป็นภาษา เรียนครั้งเดียวแล้วเครื่องมืออื่นอ่านง่ายขึ้นถ้วนหน้า

โมเดลเปิด

ทำไมการปล่อย weights จึงสำคัญยิ่งกว่าโมเดล

ความก้าวหน้าทางเทคนิคคือทำให้ diffusion ถูกพอสำหรับการ์ดจอผู้ใช้ทั่วไป การตัดสินใจที่ส่งผลต่อเนื่องคือการเผยแพร่ไฟล์ให้ทุกคนเปิดดูได้

สิ่งที่ตามมาทั้งหมด — LoRA, ControlNet, community checkpoint วจนานุกรมของ seed และ sampler — เกิดขึ้นเพราะคนจำนวนมากอ่านและแก้ไขโมเดลภาพที่ใช้งานได้จริง แทนที่จะต้องส่งคำสั่งผ่านช่องเดียว

คู่มือเทคนิคที่เปิดอยู่ ข้างคอนแทคชีตภาพถ่ายบนโต๊ะทำงานสีอ่อน

สามชั้นของระบบนิเวศ

สิ่งที่ผู้ใช้เติมบนฐานโมเดลจริง ๆ

สลับตัวโมเดลทั้งก้อน

Checkpoint คือชุด weights ทั้งหมด การปรับจูนฐานด้วยชุดภาพที่แคบลง—ภาพถ่าย ภาพประกอบ สถาปัตยกรรม—ทำให้ได้โมเดลที่คาแรกเตอร์ตั้งต้นและความสามารถต่างกัน

โหลดได้ครั้งละหนึ่ง และนี่คือปัจจัยที่ส่งผลต่อผลลัพธ์มากที่สุด

  • ขนาดหลายกิกะไบต์ต่อไฟล์
  • โหลดได้ครั้งละหนึ่ง
  • สัญญาอนุญาตและที่มาแตกต่างกันมาก
ภาพสติลไลฟ์สินค้าสร้างด้วย AI

คำถามเกี่ยวกับ Stable Diffusion

ควรรู้อะไรก่อนติดตั้ง

คำถามที่ชี้ชะตาว่าควรโฮสต์เองหรือไม่

ฮาร์ดแวร์ที่ต้องใช้จริง ๆ คืออะไร?

หน่วยความจำวิดีโอคือข้อจำกัดหลัก มากกว่าความเร็วดิบ การ์ดรุ่นเก่าที่แรมมาก มักทำงานนี้ได้ดีกว่ารุ่นใหม่ที่แรมน้อย

ยังคุ้มที่จะเรียนรู้อยู่ไหม?

ถ้าท่านต้องการการทำซ้ำได้ ปริมาณ ความเป็นส่วนตัว หรือการควบคุมโครงสร้าง คุ้ม ถ้าต้องการภาพดี ๆ โดยไม่ต้องตั้งค่า บริการโฮสต์พาไปถึงเร็วกว่า

ควรใช้เวอร์ชันไหน?

ขึ้นกับระบบนิเวศที่ท่านต้องการล้วน ๆ เวอร์ชันเก่ามีเครื่องมือชุมชนจำนวนมากกว่า เวอร์ชันใหม่ให้คุณภาพฐานที่ดีขึ้นและมีสัญญาอนุญาตแบบมีเงื่อนไขมากขึ้น

ใช้เชิงพาณิชย์ได้ไหม?

ตรวจสัญญาอนุญาตของเวอร์ชันที่ใช้ และของทุก checkpoint และ LoRA ในสแตก “เปิด weights” กับ “ใช้ฟรีทุกอย่าง” ไม่ได้แปลว่าอย่างเดียวกันมาพักใหญ่แล้ว

ทำไมงานฉันแย่กว่าตัวอย่าง?

แทบทั้งหมดเป็นเรื่อง checkpoint ไม่ใช่ prompt ตัวอย่างชุมชนมักใช้โมเดลที่ปรับจูนหนักแล้ว ไม่ใช่ฐานเดิม

กำลังจะถูก FLUX แทนที่หรือยัง?

ด้านคุณภาพผลลัพธ์ ถูกแซงไปมากแล้ว ด้านคลัง checkpoint ตัวปรับ และเครื่องมือควบคุมโครงสร้าง ยังไม่มีอะไรมาแทน

ภาพถ่ายอาหารที่สร้างด้วยเอไอในแสงกลางวัน

สำรวจต่อ

หน้าอื่น ๆ บน LaFoto

แนวคิดในหน้านี้ใช้ได้ไม่ว่าท่านจะรันอะไร

สร้างจากข้อความบรรยายตัวสร้างหลัก — จากข้อความสู่ภาพพร้อมใช้เปิดแกลเลอรี promptภาพตัวอย่าง 120 ภาพ พร้อม prompt ที่ใช้จริงแบบคำต่อคำเปิดภาพสู่ภาพเริ่มจากภาพที่ท่านมีอยู่แล้วเปิดการแก้ไขภาพด้วย AIเปลี่ยนบางส่วนของภาพ ส่วนที่เหลือคงเดิมเปิดอัปสเกลเป็น 4Kขยายถึง 4K โดยไม่เละเป็นปื้นเปิดกู้คืนภาพถ่ายเก่าแก้แสง เก็บนอยซ์ และกู้ภาพเก่าเปิดลบสิ่งไม่ต้องการออกจากภาพลบแบบมาสก์ พร้อมต่อเติมฉากหลังให้ครบเปิดเบลอแบบรับรู้ความลึกรู้เชิงระยะลึก ไม่ใช่ฟิลเตอร์ทึบเท่า ๆ กันเปิดเติมสีให้ภาพเก่าลงสีภาพขาวดำให้สมจริงน่าเชื่อเปิดสร้างโลโก้โลโก้ที่ยังอ่านออกแม้ 16 พิกเซลเปิดตัวสร้างรอยสัก AIลายที่ยังดูดีเมื่อลงเข็มจริงเปิดตัวสร้างงานศิลปะ AIงานศิลปะและภาพวาด ไม่ใช่ภาพถ่ายเปิดตัวสร้างภาพเฮดช็อต AIพอร์เทรตระดับสตูดิโอโดยไม่ต้องเข้าสตูดิโอเปิดสเปกรูปถ่ายสเปคที่ต้องเป๊ะ และวิธีทำให้ผ่านเปิดภาพจำลองงานออกแบบภายในปรับสไตล์ห้องจากภาพถ่ายของท่านเปิดอภิธานศัพท์ภาพ AIseed, denoise, inpainting อธิบายให้เข้าใจเปิด

Stable Diffusion — questions people ask

Stable Diffusion คืออะไร
โมเดลข้อความเป็นภาพที่เปิดเผยต่อสาธารณะจาก Stability AI บนหลักการ latent diffusion สามารถดาวน์โหลดและรันบนฮาร์ดแวร์ผู้ใช้ทั่วไป แทนการเข้าถึงผ่าน API อย่างเดียว
Stable Diffusion ฟรีไหม
น้ำหนักโมเดลถูกปล่อยแบบเปิดและรันโลคัลได้โดยไม่มีต้นทุนต่อภาพ แต่เงื่อนไขสัญญาอนุญาตต่างกันไปตามรุ่น และรุ่นหลัง ๆ มีข้อกำหนดมากขึ้น โปรดตรวจใบอนุญาตของรุ่นที่ใช้ให้ตรงกับการใช้งานของท่าน
latent diffusion หมายถึงอะไร
โมเดลทำงานบนตัวแทนภาพที่ถูกบีบอัด แทนที่จะทำบนพิกเซลเต็มความละเอียด แล้วค่อยถอดรหัสเป็นภาพตอนท้าย นี่คือเหตุผลที่ต้นทุนต่ำพอจะรันบนการ์ดจอทั่วไปได้
LoRA ใน Stable Diffusion คืออะไร
ไฟล์เสริมขนาดเล็กที่สอนโมเดลฐานให้รู้สไตล์ ตัวแบบ หรือคาแรกเตอร์เฉพาะ โดยไม่ต้องฝึกทั้งโมเดล เป็นวิธีมาตรฐานที่ชุมชนใช้แบ่งปันความเชี่ยวชาญเฉพาะทาง
ControlNet คืออะไร
ส่วนขยายที่จำกัดการสร้างให้อิงอินพุตเชิงโครงสร้าง เช่น โครงท่าโพส แผนที่ความลึก หรือภาพเส้นขอบ ทำให้ตรึงองค์ประกอบได้ขณะปล่อยให้โมเดลตัดสินใจส่วนที่เหลือ
ต้องมีการ์ดจอแรง ๆ เพื่อรัน Stable Diffusion ไหม
ถ้าจะรันบนเครื่องตนเอง ต้องมี — หน่วยความจำวิดีโอคือข้อจำกัดหลัก บริการแบบโฮสต์ช่วยตัดข้อจำกัดนี้ได้ แต่แลกกับการควบคุมที่การรันเองมีให้
Stable Diffusion ยังเป็นโมเดลภาพที่ดีที่สุดไหม
ไม่ใช่ในแง่คุณภาพผลลัพธ์ดิบ โมเดลใหม่ ๆ มักตาม prompt ได้ตรงกว่าและเรนเดอร์ข้อความได้ดีกว่า จุดแข็งปัจจุบันคือความลึกของเครื่องมือชุมชนที่สร้างรายรอบมัน
ทำไมคนถึงพูดถึง seed และ sampler
เพราะเป็นตัวควบคุมที่ชุมชนเปิดหยิบยกและตั้งชื่อขึ้นขณะทำงานกับโมเดลนี้ แล้วคำเหล่านั้นแพร่ไปสู่ทั้งวงการ

เริ่มสร้างวันนี้

สร้างภาพแรกของท่านด้วยตัวสร้างภาพ AI ที่ดีที่สุด

แปลงประโยคเป็นภาพจริงสมจริงในไม่กี่วินาที — แล้วปรับรายละเอียดได้ครบ ไม่ต้องตั้งค่า ไม่ต้องใช้ Discord หรือ GPU

เข้าร่วมกับครีเอเตอร์ 4,200+ คนที่ใช้ LaFoto