Stability AI · model directory
Stable Diffusion क्या है? वह ओपन मॉडल जिससे बाक़ी सबने उधार लिया
Stable Diffusion, Stability AI का openly जारी किया गया latent diffusion मॉडल है। latent diffusion का मतलब क्या है, और ओपन वेट्स इतने निर्णायक क्यों रहे।
Stable Diffusion at a glance
- निर्माता
- Stability AI
- आर्किटेक्चर
- लेटेंट डिफ्यूजन
- वेट्स
- ओपन, डाउनलोड करने योग्य
- किस पर चलता है
- उपभोक्ता-स्तरीय ग्राफ़िक्स कार्ड
- खासियत
- इसका इकोसिस्टम
- एक्सटेंशन
- LoRA, ControlNet, checkpoints
“latent diffusion” का मतलब—बिना गणित के
एक diffusion मॉडल तस्वीरों को नष्ट होते देखते हुए सीखता है। एक फ़ोटो लीजिए, थोड़ा शोर मिलाइए, फिर और, फिर और—जब तक सिर्फ़ स्टैटिक न रह जाए—और एक नेटवर्क को हर क़दम पर हटाई गई चीज़ का अनुमान लगाना सिखाइए। फिर उसी नेटवर्क को उल्टा चलाइए—ख़ाली स्टैटिक से—तो वह एक ऐसी तस्वीर रंग देता है जो पहले थी ही नहीं।
इसे फुल रिज़ोल्यूशन पर करना बेहद महँगा है, क्योंकि हर क़दम हर पिक्सल पर चलता है। latent तरकीब है पहले इमेज को एक छोटे रिप्रज़ेंटेशन में कंप्रेस करना—जो स्ट्रक्चर बचाए रखे और सटीक पिक्सल छोड़ दे—पूरा noisy प्रोसेस उसी छोटे स्पेस में चलाना, और आख़िर में असली इमेज में डिकोड करना।
यही एक फ़ैसला वह वजह है जिससे यह आम लोगों तक पहुँचा। इसने लागत क़रीब एक क्रम (order of magnitude) घटाई और इमेज जनरेशन को किराए के क्लस्टर के बजाय किसी के अपने हार्डवेयर पर ला दिया।
ओपन वेट्स—और उससे क्या शुरू हुआ
Stability ने सिर्फ़ एप्लीकेशन प्रोग्रामिंग इंटरफ़ेस नहीं, मॉडल फ़ाइलें ही जारी कर दीं। सबसे दूरगामी असर यही बात लाई—और आज जब नतीजे हर जगह दिखते हैं, इसे कम आँकना आसान है।
क्योंकि कोई भी मॉडल को देख-समझ और बदल सकता था, लोगों ने वह कंट्रोल-लेयर बनाई जो बेस मॉडल में नहीं थी। LoRAs ने किसी ख़ास स्टाइल/सब्जेक्ट को छोटे add-on फ़ाइल से सिखाना मुमकिन किया—बिना दोबारा ट्रेन किए। ControlNet ने पोज़, डेप्थ मैप या ऐज ड्रॉइंग जैसे स्ट्रक्चरल इनपुट पर जेनरेशन को बाँधना मुमकिन किया। कम्युनिटी checkpoints ने बेस मॉडल को इलस्ट्रेशन, फ़ोटोग्राफ़ी, आर्किटेक्चर—हर चीज़—के लिए specialise किया।
जो शब्दावली वहाँ से निकली, वही आज इमेज जनरेशन की भाषा है—seed, sampler, denoise strength, CFG, inpainting। ये शब्द एक ओपन कम्युनिटी ने एक खुले मॉडल को पढ़ते-लिखते लोकप्रिय किए—और इसी वजह से इस साइट की glossary उसी भाषा में लिखी है।
इसे ख़ुद चलाना असल में कैसा है
पहले से बेहतर—पर अब भी कैज़ुअल नहीं। एक-क्लिक इंस्टॉलर भी हैं और काफ़ी जटिल नोड-आधारित इंटरफ़ेस भी; “मैंने तस्वीर बना ली” और “मेरी मनचाही तस्वीर बनी”—इनके बीच की दूरी में ही समय जाता है।
इनाम है वह कंट्रोल जो hosted प्रोडक्ट्स नहीं देते: exact seeds, मनचाही रिज़ोल्यूशन, कोई भी checkpoint या LoRA, आपके और आउटपुट के बीच कोई कंटेंट पाइपलाइन नहीं, हार्डवेयर के बाद प्रति-इमेज कोई लागत नहीं, और कुछ भी आपकी मशीन से बाहर नहीं जाता।
कीमत यह कि अब आप एक छोटा इन्फ्रास्ट्रक्चर चला रहे हैं। मॉडल फ़ाइलें कई-कई GB तक होती हैं, एक्सटेंशन एक-दूसरे से टकराते हैं, और पर्याप्त मेमोरी वाला ग्राफ़िक्स कार्ड एंट्री टिकट है। जिन्हें सिर्फ़ इमेज चाहिए, वे hosted मॉडल से ज़्यादा खुश रहते हैं; जिन्हें प्रोसेस चाहिए, वे टिके रहते हैं।
आज यह कहाँ खड़ा है
कच्चे आउटपुट क्वालिटी पर यह अब अपने-आप सबसे मज़बूत विकल्प नहीं—कई नए मॉडल, जिनमें FLUX भी है (कुछ Stable Diffusion पर काम कर चुके लोगों ने बनाया), prompts को ज़्यादा शब्दशः मानते हैं और पठनीय टेक्स्ट बहुत बेहतर बनाते हैं।
जो बचा है, वह है इकोसिस्टम। कम्युनिटी checkpoints, स्टाइल एडॉप्टर्स और कंट्रोल टूलिंग की मात्रा—जो पुराने वर्ज़नों पर बनी—कुछ नया मॉडल जल्दी नहीं पा लेता। किसी ख़ास स्टाइल की नकल या बने-बनाए पाइपलाइन के लिए यह इन्वेंट्री एक सामान्य क्वालिटी-गैप से भारी पड़ती है।
लगातार वर्ज़न पहले की तुलना में ज़्यादा शर्तों वाले लाइसेंस के साथ आए हैं—जो आपके उपयोग-इरादे के ख़िलाफ़ जाँचने लायक़ है। “ओपन वेट्स” और “कुछ भी करने को मुफ़्त”—काफ़ी समय पहले अलग बातें हो चुकी हैं।
इस साइट के बाक़ी हिस्से को इसके ज़रिये पढ़ना
लगभग हर तकनीक पेज यहाँ उन्हीं terms का इस्तेमाल करता है जिन्हें इस मॉडल ने लोकप्रिय किया। denoise strength यह तय करता है कि image-to-image नतीजा इनपुट से कितनी दूर जाएगा। seed जेनरेशन को रिपीटेबल बनाता है। inpainting मास्क के भीतर एडिट करता है और बाक़ी अछूता छोड़ता है। ये कॉन्सेप्ट आप किसी भी मॉडल पर लागू करेंगे।
यही ईमानदार वजह है कि Stable Diffusion समझना फ़ायदेमंद है—भले आप इसे कभी इंस्टॉल न करें: यही वह मॉडल है जिसकी इंटरफ़ेस भाषा सबमें घुस गई। एक बार सीखिए—बाक़ी हर टूल पढ़ना आसान होगा।
खुला मॉडल
मॉडल से ज्यादा वेट्स रिलीज़ करना क्यों अहम था
तकनीकी उपलब्धि यह थी कि diffusion को इतना सस्ता बनाना कि कंज़्यूमर ग्राफिक्स कार्ड पर चल सके। परिणामकारी फ़ैसला यह था कि फ़ाइलें पब्लिश कर दी जाएँ ताकि कोई भी उन्हें खोल सके।
इसके बाद की हर चीज़ — LoRAs, ControlNet, कम्युनिटी checkpoints, सीड्स और सैंपलरों की पूरी शब्दावली — इसलिए बनी क्योंकि हज़ारों लोग एक काम करते इमेज मॉडल को पढ़ और बदल सकते थे, सिर्फ एक स्लॉट के ज़रिये क्वेरी करने के बजाय।

इकोसिस्टम की तीन परतें
बेस मॉडल पर लोग असल में क्या जोड़ते हैं
मॉडल ही को बदलना
एक checkpoint पूरे वेट्स का सेट है। बेस को किसी संकरे इमेज कॉर्पस — फोटोग्राफी, इलेस्ट्रेशन, आर्किटेक्चर — पर फाइन-ट्यून करने से अलग डिफ़ॉल्ट कैरेक्टर और अलग कुशलताओं वाला मॉडल बनता है।
आप एक समय में ठीक एक ही लोड करते हैं, और आउटपुट पर सबसे बड़ा असर इसी निर्णय का होता है।
- हर एक कई गिगाबाइट।
- एक समय में एक लोड।
- लाइसेंस और उत्पत्ति बहुत भिन्न।

री-ट्रेनिंग बिना एक चीज़ जोड़ना
एक छोटी फ़ाइल जो लोडेड checkpoint को कोई ख़ास स्टाइल, किरदार या ऑब्जेक्ट सिखाती है। एक ही कंज़्यूमर कार्ड पर मिनटों से घंटों में ट्रेन हो सकती है।
कई LoRA साथ स्टैक हो सकती हैं और हर एक की स्ट्रेंथ अलग सेट होती है — और व्यावहारिक कठिनाई यहीं आती है: दो मज़बूत स्टाइल LoRA आपस में भिड़ जाती हैं।
- दसियों से सैकड़ों मेगाबाइट।
- स्टैकेबल, स्ट्रेंथ समायोज्य।
- किसी खास बेस आर्किटेक्चर से बंधी।

स्ट्रक्चर फिक्स, बाकी आज़ाद
जनरेशन को किसी स्ट्रक्चरल इनपुट — पोज़ स्केलेटन, डेप्थ मैप, एज ड्रॉइंग — से कस देता है, ताकि कम्पोज़िशन आप तय करें और बाकी मॉडल।
यही क्षमता थी जिसने इमेज जनरेशन को सैंपलिंग से डायरेक्शन में बदला, और ज्यादातर होस्टेड प्रोडक्ट में इसका साफ़ समकक्ष नहीं है।
- पोज़, डेप्थ, एजेस, सेगमेंटेशन।
- कम्पोज़िशन तय, स्टाइल मुक्त।
- लोगों के सेल्फ-होस्ट करने की बड़ी वजह।

Stable Diffusion से जुड़े सवाल
कुछ भी इंस्टॉल करने से पहले क्या जानें
यही सवाल तय करते हैं कि सेल्फ-होस्टिंग आपके लिए है या नहीं।
मुझे असल में कौन-सा हार्डवेयर चाहिए?
रॉ स्पीड से ज्यादा बाध्यकारी सीमा वीडियो मेमोरी है। इस वर्कलोड में ज्यादा मेमोरी वाले पुराने कार्ड, कम मेमोरी वाले नए कार्डों से अक्सर बेहतर चलते हैं।
क्या इसे सीखना अब भी फ़ायदेमंद है?
यदि आपको रिप्रोड्यूसिबिलिटी, वॉल्यूम, प्राइवेसी या स्ट्रक्चरल कंट्रोल चाहिए, तो हाँ। यदि आपको बिना सेटअप के अच्छी इमेज चाहिए, तो कोई होस्टेड मॉडल तेज़ी से वहाँ पहुँचा देता है।
मुझे कौन-सा वर्ज़न इस्तेमाल करना चाहिए?
पूरी तरह इस पर निर्भर है कि किस इकोसिस्टम की ज़रूरत है। पुराने वर्ज़न में कम्युनिटी टूलिंग बहुत ज्यादा है; नए वर्ज़न में बेस क्वालिटी बेहतर है और अधिक शर्तों वाले लाइसेंस हैं।
क्या मैं आउटपुट कमर्शियली इस्तेमाल कर सकता/सकती हूँ?
स्टैक में मौजूद खास वर्ज़न, हर checkpoint और हर LoRA का लाइसेंस देखें। "ओपन वेट्स" और "कुछ भी करने के लिए फ्री" काफी समय पहले से एक ही बात नहीं रहे।
मेरे नतीजे उदाहरणों से ख़राब क्यों दिखते हैं?
लगभग हमेशा checkpoint की वजह से, prompt की नहीं। कम्युनिटी उदाहरण अक्सर बेस मॉडल पर नहीं, बल्कि खूब फाइन-ट्यून किए गए checkpoint पर जनरेट होते हैं।
क्या इसका स्थान FLUX ले रहा है?
आउटपुट क्वालिटी पर यह काफी हद तक पीछे छूट चुका है। लेकिन checkpoints, एडॉप्टर और कंट्रोल टूलिंग की इन्वेंटरी पर अभी इसे किसी ने नहीं बदला है।

वह शब्द जो इस मॉडल ने गढ़े
ओपन इकोसिस्टम से निकली शब्दावली
खोज जारी रखें
LaFoto पर और भी
यहाँ की अवधारणाएँ आप जो भी चलाएँ, लागू होती हैं।
- इमेज का आकार बदलें
- JPG, PNG और WebP
- इमेज कंप्रेसर
- अनुपात के अनुसार क्रॉप करें
- इमेज कलर पिकर
- बैकग्राउंड हटाएं
- EXIF व्यूअर
- AI prompt जनरेटर
- एनीमे AI जनरेटर
- तस्वीर को कार्टूनाइज़ करें
- पिक्सेल आर्ट बनाएं
- रैंक-की गई तुलना
- Midjourney की तुलना में
- LaFoto बनाम Leonardo AI
- Ideogram से तुलना
- Canva की तुलना में
- किसी इमेज का पुनरुत्पादन
- परिणाम कितना विचलित हो सकता है
- मास्क के भीतर एडिट करना
- LaFoto जर्नल
Stable Diffusion — questions people ask
- Stable Diffusion क्या है?
- Stability AI का openly जारी किया गया text-to-image मॉडल—latent diffusion पर आधारित—जिसे डाउनलोड कर उपभोक्ता-स्तरीय हार्डवेयर पर चलाया जा सकता है, सिर्फ़ एप्लीकेशन प्रोग्रामिंग इंटरफ़ेस से एक्सेस नहीं।
- क्या Stable Diffusion मुफ़्त है?
- वेट्स ओपनली जारी हुए हैं और लोकली चलाने पर प्रति-इमेज कोई लागत नहीं, पर लाइसेंस शर्तें वर्ज़न के साथ बदलती हैं—बाद के रिलीज़ में ज़्यादा शर्तें हैं। अपने उपयोग के इरादे के हिसाब से उस वर्ज़न का लाइसेंस जाँचिए।
- latent diffusion का मतलब क्या है?
- मॉडल फुल-रिज़ोल्यूशन पिक्सल्स पर नहीं, इमेज के compressed रिप्रज़ेंटेशन पर काम करता है—और अंत में उसे इमेज में डिकोड करता है। इसी से यह आम ग्राफ़िक्स कार्ड पर किफ़ायती हुआ।
- Stable Diffusion में LoRA क्या है?
- एक छोटा add-on फ़ाइल जो बेस मॉडल को किसी ख़ास स्टाइल, सब्जेक्ट या किरदार सिखाता है—पूरे मॉडल को दोबारा ट्रेन किए बिना। कम्युनिटी स्पेशलाइज़ेशन बाँटने का मानक तरीक़ा यही है।
- ControlNet क्या है?
- एक एक्सटेंशन जो जेनरेशन को पोज़ स्केलेटन, डेप्थ मैप या ऐज ड्रॉइंग जैसे स्ट्रक्चरल इनपुट से बाँध देता है—ताकि कंपोज़िशन तय रहे और बाक़ी मॉडल तय करे।
- Stable Diffusion चलाने के लिए क्या अच्छे ग्राफ़िक्स कार्ड चाहिए?
- लोकली चलाने के लिए हाँ—वीडियो मेमोरी बाइंडिंग कंस्ट्रेंट है। hosted सेवाएँ यह आवश्यकता हटा देती हैं—मगर उसके बदले आपसे सेल्फ-होस्ट की मिलने वाली बारीक कंट्रोल छूटती है।
- क्या Stable Diffusion अब भी सबसे अच्छा इमेज मॉडल है?
- कच्ची क्वालिटी पर नहीं; नए मॉडल आम तौर पर prompts को ज़्यादा शब्दशः मानते हैं और टेक्स्ट बेहतर रेंडर करते हैं। इसका फ़ायदा अब इकोसिस्टम की गहराई है।
- लोग seed और sampler की बात क्यों करते हैं?
- ये वही कंट्रोल्स हैं जिन्हें ओपन कम्युनिटी ने इस मॉडल के साथ काम करते हुए सतह पर लाया और नाम दिया—और वहीं से यह शब्दावली पूरे क्षेत्र में फैल गई।
आज ही बनाना शुरू करें
सबसे अच्छे AI इमेज जेनरेटर से अपनी पहली इमेज जनरेट करें।
एक वाक्य को कुछ सेकंड में तैयार, फ़ोटो-यथार्थवादी इमेज में बदलें — फिर हर डिटेल रिफ़ाइन करें। कोई सेटअप नहीं, कोई Discord नहीं, कोई GPU नहीं।
LaFoto इस्तेमाल करने वाले 4,200+ क्रिएटर्स से जुड़ें