Stability AI · model directory
Stable Diffusion คืออะไร โมเดลเปิดที่อีกหลายตัวหยิบยืมแนวทาง
Stable Diffusion คือโมเดล latent diffusion แบบเปิดจาก Stability AI อธิบายความหมายของ latent diffusion และเหตุผลที่น้ำหนักเปิดสำคัญมาก
Stable Diffusion at a glance
- ผู้พัฒนา
- Stability AI
- สถาปัตยกรรม
- latent diffusion
- น้ำหนักโมเดล
- เปิดและดาวน์โหลดได้
- ทำงานบน
- GPU ระดับผู้ใช้ทั่วไป
- เป็นที่รู้จักเรื่อง
- ระบบนิเวศของมัน
- ส่วนขยาย
- LoRA, ControlNet, checkpoints
ความหมายของ “latent diffusion” แบบไม่ลงคณิต
โมเดล diffusion เรียนรู้ด้วยการดูภาพถูกทำลาย นำภาพถ่ายมา เพิ่ม noise เล็กน้อย เพิ่มต่อไป จนเหลือแต่สัญญาณรบกวน แล้วฝึกเครือข่ายให้ทำนายสิ่งที่ถูกลบในแต่ละขั้น ตอนรันย้อนกลับจากสัญญาณรบกวนล้วน มันจะวาดภาพที่ไม่เคยมีอยู่จริงขึ้นมา
การทำเช่นนี้ที่ความละเอียดเต็มแพงมาก เพราะทุกขั้นต้องคำนวณทุกพิกเซล กลเม็ด latent คือบีบอัดภาพก่อนให้เหลือตัวแทนที่เล็กลงมากซึ่งรักษาโครงสร้างไว้แต่ทิ้งพิกเซลจริง ๆ ไป รันกระบวนการมี noise ทั้งหมดในพื้นที่เล็กนั้น แล้วค่อยถอดรหัสกลับเป็นภาพจริงตอนสุดท้าย
การตัดสินใจเดียวนี้ทำให้เทคโนโลยีเข้าถึงผู้ใช้ทั่วไปได้จริง ต้นทุนการสร้างภาพลดลงราวหนึ่งลำดับขนาด และพาการสร้างภาพมาสู่ฮาร์ดแวร์ที่คนทั่วไปมี แทนการเช่าโหนดจำนวนมาก
น้ำหนักเปิด และผลที่ตามมา
Stability ปล่อยไฟล์โมเดลจริง ไม่ได้ให้แค่ API นั่นคือข้อเท็จจริงที่ส่งผลยาวนาน และวันนี้อาจถูกมองข้ามได้ง่ายเพราะผลลัพธ์มีอยู่ดาษดื่น
เพราะใคร ๆ เปิดดูและแก้ไขโมเดลได้ ผู้คนจึงสร้างชั้นควบคุมที่ตัวโมเดลฐานขาดอยู่ LoRA ทำให้สอนได้ทั้งสไตล์และตัวแบบเฉพาะด้วยไฟล์เสริมขนาดเล็กแทนการฝึกใหม่ ControlNet ทำให้จำกัดการสร้างให้อยู่ในกรอบอย่างโครงท่าโพส แผนที่ความลึก หรือเส้นขอบลวดลายได้ checkpoints ของชุมชนทำให้โมเดลฐานเชี่ยวชาญขึ้นสำหรับงานอย่างภาพประกอบ การถ่ายภาพ สถาปัตย์ และอื่น ๆ
คำศัพท์จากช่วงเวลานั้นกลายเป็นภาษากลางของงานสร้างภาพ — seed, sampler, denoise strength, CFG, inpainting คำเหล่านี้แพร่จากชุมชนเปิดที่ได้อ่านและเขียนโมเดลที่เปิดดูได้จริง และนั่นคือเหตุผลที่อภิธานศัพท์บนไซต์นี้เขียนแบบนั้น
ประสบการณ์รันเองจริง ๆ เป็นอย่างไร
ดีกว่าเมื่อก่อนมาก แต่ยังไม่ใช่งานลวก ๆ มีตัวติดตั้งแบบคลิกเดียว และมีอินเทอร์เฟซแบบโหนดที่ซับซ้อนจริง ระยะทางระหว่าง “ฉันสร้างภาพได้แล้ว” กับ “ฉันได้ภาพที่ต้องการ” คือที่ที่เวลาถูกใช้ไป
รางวัลคือการควบคุมที่บริการโฮสต์ให้ไม่ได้: เลือก seed ตรงเป๊ะ ความละเอียดตามใจ เลือก checkpoint หรือ LoRA ใดก็ได้ ไม่มีท่อคอนเทนต์คั่นกลางระหว่างท่านกับผลลัพธ์ ไม่มีต้นทุนต่อภาพหลังจากมีฮาร์ดแวร์ และไม่มีข้อมูลออกจากเครื่องของท่าน
ต้นทุนคือท่านกำลังดูแลโครงสร้างพื้นฐานขนาดเล็ก ไฟล์โมเดลมีขนาดหลาย GB ส่วนขยายบางตัวชนกันเอง และการ์ดจอที่มีหน่วยความจำพอคือบัตรผ่านเข้า ผู้ที่แค่อยากได้รูปมักพอใจกับบริการโฮสต์ ผู้ที่อยากได้กระบวนการคือกลุ่มที่อยู่ต่อ
สถานะปัจจุบัน
มันไม่ได้ดีที่สุดโดยอัตโนมัติในแง่คุณภาพผลลัพธ์ดิบ และโมเดลรุ่นใหม่หลายตัว — รวมถึง FLUX ซึ่งสร้างโดยทีมที่บางส่วนเคยทำ Stable Diffusion — อ่าน prompt ตรงกว่าและเรนเดอร์ข้อความที่อ่านออกได้ดีกว่า
สิ่งที่ยังมีเหนือกว่าคือระบบนิเวศ ปริมาณ checkpoints ของชุมชน ตัวแปลงสไตล์ และเครื่องมือควบคุมที่สร้างบนรุ่นเก่า ไม่ใช่สิ่งที่โมเดลใหม่จะได้มารวดเร็ว สำหรับใครที่ต้องทำซ้ำสไตล์เฉพาะหรือมีสายงานอยู่แล้ว สต็อกทรัพยากรนั้นมีค่านำหน้าช่องว่างคุณภาพทั่วไป
รุ่นถัด ๆ มาก็มักปล่อยภายใต้สัญญาอนุญาตที่มีเงื่อนไขมากขึ้นกว่ารุ่นแรก ๆ ซึ่งควรตรวจสอบให้ตรงกับการใช้งานของท่าน แทนที่จะคิดว่า “เปิดน้ำหนัก” เท่ากับ “ใช้ฟรีทุกอย่าง” เพราะสองอย่างนี้แยกจากกันมาพักใหญ่แล้ว
มองหน้าอื่น ๆ ของไซต์นี้ผ่านเลนส์รุ่นนี้
แทบทุกหน้าวิธีการบนไซต์นี้ใช้คำที่โมเดลนี้ทำให้แพร่หลาย ค่า denoise strength กำหนดว่าผล image-to-image จะห่างจากอินพุตได้แค่ไหน seed ทำให้การสร้างซ้ำได้ Inpainting คือการแก้ในมาสก์และปล่อยส่วนที่เหลือไม่แตะ แนวคิดเหล่านี้ใช้ได้กับไม่ว่าโมเดลไหนที่ท่านเลือกในท้ายที่สุด
นี่คือเหตุผลตามตรงที่ควรเข้าใจ Stable Diffusion แม้ไม่เคยติดตั้ง: มันคือโมเดลที่อินเทอร์เฟซรั่วไหลออกมาเป็นภาษา เรียนครั้งเดียวแล้วเครื่องมืออื่นอ่านง่ายขึ้นถ้วนหน้า
โมเดลเปิด
ทำไมการปล่อย weights จึงสำคัญยิ่งกว่าโมเดล
ความก้าวหน้าทางเทคนิคคือทำให้ diffusion ถูกพอสำหรับการ์ดจอผู้ใช้ทั่วไป การตัดสินใจที่ส่งผลต่อเนื่องคือการเผยแพร่ไฟล์ให้ทุกคนเปิดดูได้
สิ่งที่ตามมาทั้งหมด — LoRA, ControlNet, community checkpoint วจนานุกรมของ seed และ sampler — เกิดขึ้นเพราะคนจำนวนมากอ่านและแก้ไขโมเดลภาพที่ใช้งานได้จริง แทนที่จะต้องส่งคำสั่งผ่านช่องเดียว

สามชั้นของระบบนิเวศ
สิ่งที่ผู้ใช้เติมบนฐานโมเดลจริง ๆ
สลับตัวโมเดลทั้งก้อน
Checkpoint คือชุด weights ทั้งหมด การปรับจูนฐานด้วยชุดภาพที่แคบลง—ภาพถ่าย ภาพประกอบ สถาปัตยกรรม—ทำให้ได้โมเดลที่คาแรกเตอร์ตั้งต้นและความสามารถต่างกัน
โหลดได้ครั้งละหนึ่ง และนี่คือปัจจัยที่ส่งผลต่อผลลัพธ์มากที่สุด
- ขนาดหลายกิกะไบต์ต่อไฟล์
- โหลดได้ครั้งละหนึ่ง
- สัญญาอนุญาตและที่มาแตกต่างกันมาก

เติม “สิ่งเดียว” โดยไม่ต้องเทรนใหม่
ไฟล์เล็ก ๆ ที่สอนสไตล์ ตัวละคร หรือวัตถุเฉพาะให้ checkpoint ที่โหลดอยู่ เทรนได้บนการ์ดผู้ใช้ภายในนาทีถึงชั่วโมง
ซ้อนหลายตัวได้พร้อมปรับน้ำหนักแยกกัน ซึ่งนี่แหละคือจุดยากเชิงปฏิบัติ—LoRA สไตล์แรง ๆ สองตัวมักตีกัน
- ตั้งแต่หลักสิบถึงหลักร้อย MB
- ซ้อนได้และปรับความแรงได้
- ผูกกับสถาปัตยกรรมฐานเฉพาะ

ตรึงโครงสร้าง ปล่อยอย่างอื่นอิสระ
บังคับการสร้างภาพให้ยึดอินพุตเชิงโครงสร้าง—โครงท่าทาง แผนที่ความลึก เส้นขอบ—ให้ท่านเป็นผู้กำหนดคอมโพส แล้วปล่อยให้โมเดลจัดการสไตล์
นี่คือความสามารถที่เปลี่ยนงานสร้างภาพจากการ “สุ่มตัวอย่าง” เป็น “การกำกับ” และยังไม่มีของเทียบเท่าในบริการโฮสต์ส่วนใหญ่
- ท่าทาง ความลึก เส้นขอบ การแบ่งส่วน
- คอมโพสตายตัว สไตล์อิสระ
- เหตุผลหลักที่คนยังโฮสต์เอง

คำถามเกี่ยวกับ Stable Diffusion
ควรรู้อะไรก่อนติดตั้ง
คำถามที่ชี้ชะตาว่าควรโฮสต์เองหรือไม่
ฮาร์ดแวร์ที่ต้องใช้จริง ๆ คืออะไร?
หน่วยความจำวิดีโอคือข้อจำกัดหลัก มากกว่าความเร็วดิบ การ์ดรุ่นเก่าที่แรมมาก มักทำงานนี้ได้ดีกว่ารุ่นใหม่ที่แรมน้อย
ยังคุ้มที่จะเรียนรู้อยู่ไหม?
ถ้าท่านต้องการการทำซ้ำได้ ปริมาณ ความเป็นส่วนตัว หรือการควบคุมโครงสร้าง คุ้ม ถ้าต้องการภาพดี ๆ โดยไม่ต้องตั้งค่า บริการโฮสต์พาไปถึงเร็วกว่า
ควรใช้เวอร์ชันไหน?
ขึ้นกับระบบนิเวศที่ท่านต้องการล้วน ๆ เวอร์ชันเก่ามีเครื่องมือชุมชนจำนวนมากกว่า เวอร์ชันใหม่ให้คุณภาพฐานที่ดีขึ้นและมีสัญญาอนุญาตแบบมีเงื่อนไขมากขึ้น
ใช้เชิงพาณิชย์ได้ไหม?
ตรวจสัญญาอนุญาตของเวอร์ชันที่ใช้ และของทุก checkpoint และ LoRA ในสแตก “เปิด weights” กับ “ใช้ฟรีทุกอย่าง” ไม่ได้แปลว่าอย่างเดียวกันมาพักใหญ่แล้ว
ทำไมงานฉันแย่กว่าตัวอย่าง?
แทบทั้งหมดเป็นเรื่อง checkpoint ไม่ใช่ prompt ตัวอย่างชุมชนมักใช้โมเดลที่ปรับจูนหนักแล้ว ไม่ใช่ฐานเดิม
กำลังจะถูก FLUX แทนที่หรือยัง?
ด้านคุณภาพผลลัพธ์ ถูกแซงไปมากแล้ว ด้านคลัง checkpoint ตัวปรับ และเครื่องมือควบคุมโครงสร้าง ยังไม่มีอะไรมาแทน

คำที่โมเดลนี้ทำให้แพร่หลาย
ศัพท์ที่เกิดจากระบบนิเวศแบบเปิด
สำรวจต่อ
หน้าอื่น ๆ บน LaFoto
แนวคิดในหน้านี้ใช้ได้ไม่ว่าท่านจะรันอะไร
- ปรับขนาดภาพ
- JPG, PNG and WebP
- ตัวบีบอัดภาพ
- ครอปตามอัตราส่วน
- ดึงค่าสีจากภาพ
- ลบฉากหลัง
- EXIF viewer
- ตัวสร้าง prompt ด้วย AI
- ตัวสร้างอนิเมะ AI
- ทำภาพให้เป็นการ์ตูน
- สร้างพิกเซลอาร์ต
- การจัดอันดับเปรียบเทียบ
- เทียบกับ Midjourney
- LaFoto เทียบกับ Leonardo AI
- เทียบกับ Ideogram
- เทียบกับ Canva
- ทำซ้ำภาพเดิม
- ผลลัพธ์จะไหลออกจากต้นฉบับได้ไกลแค่ไหน
- แก้ไขภายในมาสก์
- บันทึกของ LaFoto
Stable Diffusion — questions people ask
- Stable Diffusion คืออะไร
- โมเดลข้อความเป็นภาพที่เปิดเผยต่อสาธารณะจาก Stability AI บนหลักการ latent diffusion สามารถดาวน์โหลดและรันบนฮาร์ดแวร์ผู้ใช้ทั่วไป แทนการเข้าถึงผ่าน API อย่างเดียว
- Stable Diffusion ฟรีไหม
- น้ำหนักโมเดลถูกปล่อยแบบเปิดและรันโลคัลได้โดยไม่มีต้นทุนต่อภาพ แต่เงื่อนไขสัญญาอนุญาตต่างกันไปตามรุ่น และรุ่นหลัง ๆ มีข้อกำหนดมากขึ้น โปรดตรวจใบอนุญาตของรุ่นที่ใช้ให้ตรงกับการใช้งานของท่าน
- latent diffusion หมายถึงอะไร
- โมเดลทำงานบนตัวแทนภาพที่ถูกบีบอัด แทนที่จะทำบนพิกเซลเต็มความละเอียด แล้วค่อยถอดรหัสเป็นภาพตอนท้าย นี่คือเหตุผลที่ต้นทุนต่ำพอจะรันบนการ์ดจอทั่วไปได้
- LoRA ใน Stable Diffusion คืออะไร
- ไฟล์เสริมขนาดเล็กที่สอนโมเดลฐานให้รู้สไตล์ ตัวแบบ หรือคาแรกเตอร์เฉพาะ โดยไม่ต้องฝึกทั้งโมเดล เป็นวิธีมาตรฐานที่ชุมชนใช้แบ่งปันความเชี่ยวชาญเฉพาะทาง
- ControlNet คืออะไร
- ส่วนขยายที่จำกัดการสร้างให้อิงอินพุตเชิงโครงสร้าง เช่น โครงท่าโพส แผนที่ความลึก หรือภาพเส้นขอบ ทำให้ตรึงองค์ประกอบได้ขณะปล่อยให้โมเดลตัดสินใจส่วนที่เหลือ
- ต้องมีการ์ดจอแรง ๆ เพื่อรัน Stable Diffusion ไหม
- ถ้าจะรันบนเครื่องตนเอง ต้องมี — หน่วยความจำวิดีโอคือข้อจำกัดหลัก บริการแบบโฮสต์ช่วยตัดข้อจำกัดนี้ได้ แต่แลกกับการควบคุมที่การรันเองมีให้
- Stable Diffusion ยังเป็นโมเดลภาพที่ดีที่สุดไหม
- ไม่ใช่ในแง่คุณภาพผลลัพธ์ดิบ โมเดลใหม่ ๆ มักตาม prompt ได้ตรงกว่าและเรนเดอร์ข้อความได้ดีกว่า จุดแข็งปัจจุบันคือความลึกของเครื่องมือชุมชนที่สร้างรายรอบมัน
- ทำไมคนถึงพูดถึง seed และ sampler
- เพราะเป็นตัวควบคุมที่ชุมชนเปิดหยิบยกและตั้งชื่อขึ้นขณะทำงานกับโมเดลนี้ แล้วคำเหล่านั้นแพร่ไปสู่ทั้งวงการ
เริ่มสร้างวันนี้
สร้างภาพแรกของท่านด้วยตัวสร้างภาพ AI ที่ดีที่สุด
แปลงประโยคเป็นภาพจริงสมจริงในไม่กี่วินาที — แล้วปรับรายละเอียดได้ครบ ไม่ต้องตั้งค่า ไม่ต้องใช้ Discord หรือ GPU
เข้าร่วมกับครีเอเตอร์ 4,200+ คนที่ใช้ LaFoto