कंटेंट पर जाएँ
LaFoto

Stability AI · model directory

Stable Diffusion क्या है? वह ओपन मॉडल जिससे बाक़ी सबने उधार लिया

Stable Diffusion, Stability AI का openly जारी किया गया latent diffusion मॉडल है। latent diffusion का मतलब क्या है, और ओपन वेट्स इतने निर्णायक क्यों रहे।

Stable Diffusion, Stability AI का text-to-image मॉडल है, जिसे ओपन वेट्स के साथ जारी किया गया ताकि कोई भी इसे डाउनलोड कर अपने हार्डवेयर पर चला सके। तकनीकी रूप से यह latent diffusion मॉडल है: फुल-रिज़ोल्यूशन तस्वीर को denoise करने के बजाय यह compressed latent space में काम करता है और अंत में नतीजे को डिकोड करता है—यही कारण था कि इसे कंज़्यूमर ग्राफ़िक्स कार्ड पर चलाना किफ़ायती हुआ।

Stable Diffusion at a glance

निर्माता
Stability AI
आर्किटेक्चर
लेटेंट डिफ्यूजन
वेट्स
ओपन, डाउनलोड करने योग्य
किस पर चलता है
उपभोक्ता-स्तरीय ग्राफ़िक्स कार्ड
खासियत
इसका इकोसिस्टम
एक्सटेंशन
LoRA, ControlNet, checkpoints

“latent diffusion” का मतलब—बिना गणित के

एक diffusion मॉडल तस्वीरों को नष्ट होते देखते हुए सीखता है। एक फ़ोटो लीजिए, थोड़ा शोर मिलाइए, फिर और, फिर और—जब तक सिर्फ़ स्टैटिक न रह जाए—और एक नेटवर्क को हर क़दम पर हटाई गई चीज़ का अनुमान लगाना सिखाइए। फिर उसी नेटवर्क को उल्टा चलाइए—ख़ाली स्टैटिक से—तो वह एक ऐसी तस्वीर रंग देता है जो पहले थी ही नहीं।

इसे फुल रिज़ोल्यूशन पर करना बेहद महँगा है, क्योंकि हर क़दम हर पिक्सल पर चलता है। latent तरकीब है पहले इमेज को एक छोटे रिप्रज़ेंटेशन में कंप्रेस करना—जो स्ट्रक्चर बचाए रखे और सटीक पिक्सल छोड़ दे—पूरा noisy प्रोसेस उसी छोटे स्पेस में चलाना, और आख़िर में असली इमेज में डिकोड करना।

यही एक फ़ैसला वह वजह है जिससे यह आम लोगों तक पहुँचा। इसने लागत क़रीब एक क्रम (order of magnitude) घटाई और इमेज जनरेशन को किराए के क्लस्टर के बजाय किसी के अपने हार्डवेयर पर ला दिया।

ओपन वेट्स—और उससे क्या शुरू हुआ

Stability ने सिर्फ़ एप्लीकेशन प्रोग्रामिंग इंटरफ़ेस नहीं, मॉडल फ़ाइलें ही जारी कर दीं। सबसे दूरगामी असर यही बात लाई—और आज जब नतीजे हर जगह दिखते हैं, इसे कम आँकना आसान है।

क्योंकि कोई भी मॉडल को देख-समझ और बदल सकता था, लोगों ने वह कंट्रोल-लेयर बनाई जो बेस मॉडल में नहीं थी। LoRAs ने किसी ख़ास स्टाइल/सब्जेक्ट को छोटे add-on फ़ाइल से सिखाना मुमकिन किया—बिना दोबारा ट्रेन किए। ControlNet ने पोज़, डेप्थ मैप या ऐज ड्रॉइंग जैसे स्ट्रक्चरल इनपुट पर जेनरेशन को बाँधना मुमकिन किया। कम्युनिटी checkpoints ने बेस मॉडल को इलस्ट्रेशन, फ़ोटोग्राफ़ी, आर्किटेक्चर—हर चीज़—के लिए specialise किया।

जो शब्दावली वहाँ से निकली, वही आज इमेज जनरेशन की भाषा है—seed, sampler, denoise strength, CFG, inpainting। ये शब्द एक ओपन कम्युनिटी ने एक खुले मॉडल को पढ़ते-लिखते लोकप्रिय किए—और इसी वजह से इस साइट की glossary उसी भाषा में लिखी है।

इसे ख़ुद चलाना असल में कैसा है

पहले से बेहतर—पर अब भी कैज़ुअल नहीं। एक-क्लिक इंस्टॉलर भी हैं और काफ़ी जटिल नोड-आधारित इंटरफ़ेस भी; “मैंने तस्वीर बना ली” और “मेरी मनचाही तस्वीर बनी”—इनके बीच की दूरी में ही समय जाता है।

इनाम है वह कंट्रोल जो hosted प्रोडक्ट्स नहीं देते: exact seeds, मनचाही रिज़ोल्यूशन, कोई भी checkpoint या LoRA, आपके और आउटपुट के बीच कोई कंटेंट पाइपलाइन नहीं, हार्डवेयर के बाद प्रति-इमेज कोई लागत नहीं, और कुछ भी आपकी मशीन से बाहर नहीं जाता।

कीमत यह कि अब आप एक छोटा इन्फ्रास्ट्रक्चर चला रहे हैं। मॉडल फ़ाइलें कई-कई GB तक होती हैं, एक्सटेंशन एक-दूसरे से टकराते हैं, और पर्याप्त मेमोरी वाला ग्राफ़िक्स कार्ड एंट्री टिकट है। जिन्हें सिर्फ़ इमेज चाहिए, वे hosted मॉडल से ज़्यादा खुश रहते हैं; जिन्हें प्रोसेस चाहिए, वे टिके रहते हैं।

आज यह कहाँ खड़ा है

कच्चे आउटपुट क्वालिटी पर यह अब अपने-आप सबसे मज़बूत विकल्प नहीं—कई नए मॉडल, जिनमें FLUX भी है (कुछ Stable Diffusion पर काम कर चुके लोगों ने बनाया), prompts को ज़्यादा शब्दशः मानते हैं और पठनीय टेक्स्ट बहुत बेहतर बनाते हैं।

जो बचा है, वह है इकोसिस्टम। कम्युनिटी checkpoints, स्टाइल एडॉप्टर्स और कंट्रोल टूलिंग की मात्रा—जो पुराने वर्ज़नों पर बनी—कुछ नया मॉडल जल्दी नहीं पा लेता। किसी ख़ास स्टाइल की नकल या बने-बनाए पाइपलाइन के लिए यह इन्वेंट्री एक सामान्य क्वालिटी-गैप से भारी पड़ती है।

लगातार वर्ज़न पहले की तुलना में ज़्यादा शर्तों वाले लाइसेंस के साथ आए हैं—जो आपके उपयोग-इरादे के ख़िलाफ़ जाँचने लायक़ है। “ओपन वेट्स” और “कुछ भी करने को मुफ़्त”—काफ़ी समय पहले अलग बातें हो चुकी हैं।

इस साइट के बाक़ी हिस्से को इसके ज़रिये पढ़ना

लगभग हर तकनीक पेज यहाँ उन्हीं terms का इस्तेमाल करता है जिन्हें इस मॉडल ने लोकप्रिय किया। denoise strength यह तय करता है कि image-to-image नतीजा इनपुट से कितनी दूर जाएगा। seed जेनरेशन को रिपीटेबल बनाता है। inpainting मास्क के भीतर एडिट करता है और बाक़ी अछूता छोड़ता है। ये कॉन्सेप्ट आप किसी भी मॉडल पर लागू करेंगे।

यही ईमानदार वजह है कि Stable Diffusion समझना फ़ायदेमंद है—भले आप इसे कभी इंस्टॉल न करें: यही वह मॉडल है जिसकी इंटरफ़ेस भाषा सबमें घुस गई। एक बार सीखिए—बाक़ी हर टूल पढ़ना आसान होगा।

खुला मॉडल

मॉडल से ज्यादा वेट्स रिलीज़ करना क्यों अहम था

तकनीकी उपलब्धि यह थी कि diffusion को इतना सस्ता बनाना कि कंज़्यूमर ग्राफिक्स कार्ड पर चल सके। परिणामकारी फ़ैसला यह था कि फ़ाइलें पब्लिश कर दी जाएँ ताकि कोई भी उन्हें खोल सके।

इसके बाद की हर चीज़ — LoRAs, ControlNet, कम्युनिटी checkpoints, सीड्स और सैंपलरों की पूरी शब्दावली — इसलिए बनी क्योंकि हज़ारों लोग एक काम करते इमेज मॉडल को पढ़ और बदल सकते थे, सिर्फ एक स्लॉट के ज़रिये क्वेरी करने के बजाय।

फीकी वर्कटेबल पर खुला तकनीकी मैनुअल, पास में फोटोग्राफिक कॉन्टैक्ट शीट्स

इकोसिस्टम की तीन परतें

बेस मॉडल पर लोग असल में क्या जोड़ते हैं

मॉडल ही को बदलना

एक checkpoint पूरे वेट्स का सेट है। बेस को किसी संकरे इमेज कॉर्पस — फोटोग्राफी, इलेस्ट्रेशन, आर्किटेक्चर — पर फाइन-ट्यून करने से अलग डिफ़ॉल्ट कैरेक्टर और अलग कुशलताओं वाला मॉडल बनता है।

आप एक समय में ठीक एक ही लोड करते हैं, और आउटपुट पर सबसे बड़ा असर इसी निर्णय का होता है।

  • हर एक कई गिगाबाइट।
  • एक समय में एक लोड।
  • लाइसेंस और उत्पत्ति बहुत भिन्न।
AI-जनित प्रोडक्ट स्टिल लाइफ

Stable Diffusion से जुड़े सवाल

कुछ भी इंस्टॉल करने से पहले क्या जानें

यही सवाल तय करते हैं कि सेल्फ-होस्टिंग आपके लिए है या नहीं।

मुझे असल में कौन-सा हार्डवेयर चाहिए?

रॉ स्पीड से ज्यादा बाध्यकारी सीमा वीडियो मेमोरी है। इस वर्कलोड में ज्यादा मेमोरी वाले पुराने कार्ड, कम मेमोरी वाले नए कार्डों से अक्सर बेहतर चलते हैं।

क्या इसे सीखना अब भी फ़ायदेमंद है?

यदि आपको रिप्रोड्यूसिबिलिटी, वॉल्यूम, प्राइवेसी या स्ट्रक्चरल कंट्रोल चाहिए, तो हाँ। यदि आपको बिना सेटअप के अच्छी इमेज चाहिए, तो कोई होस्टेड मॉडल तेज़ी से वहाँ पहुँचा देता है।

मुझे कौन-सा वर्ज़न इस्तेमाल करना चाहिए?

पूरी तरह इस पर निर्भर है कि किस इकोसिस्टम की ज़रूरत है। पुराने वर्ज़न में कम्युनिटी टूलिंग बहुत ज्यादा है; नए वर्ज़न में बेस क्वालिटी बेहतर है और अधिक शर्तों वाले लाइसेंस हैं।

क्या मैं आउटपुट कमर्शियली इस्तेमाल कर सकता/सकती हूँ?

स्टैक में मौजूद खास वर्ज़न, हर checkpoint और हर LoRA का लाइसेंस देखें। "ओपन वेट्स" और "कुछ भी करने के लिए फ्री" काफी समय पहले से एक ही बात नहीं रहे।

मेरे नतीजे उदाहरणों से ख़राब क्यों दिखते हैं?

लगभग हमेशा checkpoint की वजह से, prompt की नहीं। कम्युनिटी उदाहरण अक्सर बेस मॉडल पर नहीं, बल्कि खूब फाइन-ट्यून किए गए checkpoint पर जनरेट होते हैं।

क्या इसका स्थान FLUX ले रहा है?

आउटपुट क्वालिटी पर यह काफी हद तक पीछे छूट चुका है। लेकिन checkpoints, एडॉप्टर और कंट्रोल टूलिंग की इन्वेंटरी पर अभी इसे किसी ने नहीं बदला है।

दिन के उजाले में एआई-जनित खाद्य फोटो

खोज जारी रखें

LaFoto पर और भी

यहाँ की अवधारणाएँ आप जो भी चलाएँ, लागू होती हैं।

विवरण से इमेज बनाएंमुख्य जनरेटर — टेक्स्ट से तैयार इमेज।खोलेंप्रॉम्प्ट गैलरी120 इमेज और उन्हें बनाने वाले ठीक-ठीक prompts।खोलेंइमेज-टू-इमेजजिस तस्वीर से शुरू करना हो, वही लें।खोलेंAI फोटो एडिटिंगफोटो का हिस्सा बदलें, बाकी सुरक्षित रखें।खोलें4K तक अपस्केल करें4K तक बड़ा करें, बिना स्मियरिंग के।खोलेंपुरानी फोटो बहाल करेंएक्सपोज़र, नॉइज़ और पुरानी फोटो बहाली।खोलेंफोटो से कुछ भी हटाएंमास्क्ड रिमूवल जो बैकग्राउंड फिर से बनाता है।खोलेंडेप्थ-अवेयर ब्लरडेप्थ-अवेयर, एक-सा फ़िल्टर नहीं।खोलेंपुरानी फोटो में रंग जोड़ेंब्लैक-एंड-व्हाइट के लिए विश्वसनीय रंग।खोलेंलोगो जनरेट करेंमार्क जो 16 पिक्सल पर भी पठनीय रहे।खोलेंAI टैटू जनरेटरडिज़ाइन जो टैटू होने पर भी टिके।खोलेंAI आर्ट जनरेटरइलेस्ट्रेशन और पेंटिंग, फोटो नहीं।खोलेंAI हेडशॉट जनरेटरस्टूडियो-ग्रेड पोर्ट्रेट, बिना स्टूडियो।खोलेंफोटो विनिर्देशठीक वही स्पेसिफिकेशन और उसे कैसे पाना है।खोलेंइंटीरियर विज़ुअलाइज़ेशनजिस कमरे की फोटो ले सकें, उसे रिस्टाइल करें।खोलेंAI इमेज शब्दावलीseed, denoise, inpainting — समझाया।खोलें

Stable Diffusion — questions people ask

Stable Diffusion क्या है?
Stability AI का openly जारी किया गया text-to-image मॉडल—latent diffusion पर आधारित—जिसे डाउनलोड कर उपभोक्ता-स्तरीय हार्डवेयर पर चलाया जा सकता है, सिर्फ़ एप्लीकेशन प्रोग्रामिंग इंटरफ़ेस से एक्सेस नहीं।
क्या Stable Diffusion मुफ़्त है?
वेट्स ओपनली जारी हुए हैं और लोकली चलाने पर प्रति-इमेज कोई लागत नहीं, पर लाइसेंस शर्तें वर्ज़न के साथ बदलती हैं—बाद के रिलीज़ में ज़्यादा शर्तें हैं। अपने उपयोग के इरादे के हिसाब से उस वर्ज़न का लाइसेंस जाँचिए।
latent diffusion का मतलब क्या है?
मॉडल फुल-रिज़ोल्यूशन पिक्सल्स पर नहीं, इमेज के compressed रिप्रज़ेंटेशन पर काम करता है—और अंत में उसे इमेज में डिकोड करता है। इसी से यह आम ग्राफ़िक्स कार्ड पर किफ़ायती हुआ।
Stable Diffusion में LoRA क्या है?
एक छोटा add-on फ़ाइल जो बेस मॉडल को किसी ख़ास स्टाइल, सब्जेक्ट या किरदार सिखाता है—पूरे मॉडल को दोबारा ट्रेन किए बिना। कम्युनिटी स्पेशलाइज़ेशन बाँटने का मानक तरीक़ा यही है।
ControlNet क्या है?
एक एक्सटेंशन जो जेनरेशन को पोज़ स्केलेटन, डेप्थ मैप या ऐज ड्रॉइंग जैसे स्ट्रक्चरल इनपुट से बाँध देता है—ताकि कंपोज़िशन तय रहे और बाक़ी मॉडल तय करे।
Stable Diffusion चलाने के लिए क्या अच्छे ग्राफ़िक्स कार्ड चाहिए?
लोकली चलाने के लिए हाँ—वीडियो मेमोरी बाइंडिंग कंस्ट्रेंट है। hosted सेवाएँ यह आवश्यकता हटा देती हैं—मगर उसके बदले आपसे सेल्फ-होस्ट की मिलने वाली बारीक कंट्रोल छूटती है।
क्या Stable Diffusion अब भी सबसे अच्छा इमेज मॉडल है?
कच्ची क्वालिटी पर नहीं; नए मॉडल आम तौर पर prompts को ज़्यादा शब्दशः मानते हैं और टेक्स्ट बेहतर रेंडर करते हैं। इसका फ़ायदा अब इकोसिस्टम की गहराई है।
लोग seed और sampler की बात क्यों करते हैं?
ये वही कंट्रोल्स हैं जिन्हें ओपन कम्युनिटी ने इस मॉडल के साथ काम करते हुए सतह पर लाया और नाम दिया—और वहीं से यह शब्दावली पूरे क्षेत्र में फैल गई।

आज ही बनाना शुरू करें

सबसे अच्छे AI इमेज जेनरेटर से अपनी पहली इमेज जनरेट करें।

एक वाक्य को कुछ सेकंड में तैयार, फ़ोटो-यथार्थवादी इमेज में बदलें — फिर हर डिटेल रिफ़ाइन करें। कोई सेटअप नहीं, कोई Discord नहीं, कोई GPU नहीं।

LaFoto इस्तेमाल करने वाले 4,200+ क्रिएटर्स से जुड़ें