دليل
النص إلى صورة: كيف يحوّل الذكاء الاصطناعي الكلمات إلى صور

ما هو «النص إلى صورة»؟
«النص إلى صورة» فئة من تقنيات الذكاء الاصطناعي تُولّد صورة انطلاقًا من prompt مكتوب. تصف ما تريد بلغة واضحة، فيقوم مولّد الصور بالذكاء الاصطناعي بإنشاء صورة جديدة تطابقه. الاسم التقني هو نموذج نص-إلى-صورة، ووفق Wikipedia انطلقت هذه النظم بعد 2022 عندما بدأت أدوات مثل DALL·E 2 وImagen وStable Diffusion وMidjourney بإنتاج مخرجات تقترب من جودة الصور الفوتوغرافية الحقيقية.
النقطة الحاسمة للمبتدئين هي أنّ المخرج مُولَّد، لا مُسترجَع. النموذج لا يفتّش مكتبة عن صورة موجودة، ولا يلصق «كليب آرت» معًا. يبني صورة جديدة بكسلًا بكسلًا استنادًا إلى أنماط تعلّمها أثناء التدريب. لذا يمكنك طلب شيء لم يُصوَّر من قبل، مثل "فنجان شاي مصنوع من زجاج معشّق فوق بيانو مغطّى بالطحالب"، ومع ذلك تحصل على نتيجة متماسكة.
يتعرّف معظم الناس إلى «النص إلى صورة» عبر صندوق بسيط: اكتب جملة، اضغط توليد، احصل على صورة. يعمل «النص إلى صورة» هكذا تمامًا. كل التعقيد يحدث خلف هذا الصندوق، وفهم شكله العام يجعلك أفضل بكثير في الوصول إلى النتيجة التي تريدها.
كيف يعمل «النص إلى صورة» فعليًا؟
النهج السائد في 2026 هو نموذج diffusion، وغالبًا نموذج diffusion كامن. الحدس معاكس للتوقّع لكنه مهم: يتعلّم النموذج إنشاء الصور عبر أن يتعلّم أولًا كيف يفسدها. أثناء التدريب يأخذ صورًا حقيقية، يضيف إليها ضوضاء حتى تصبح ثلجية، ويتعلّم عكس هذه العملية. وعند توليد صورة جديدة يبدأ من ضوضاء عشوائية صِرف ويجري العكس، مُسترشدًا بالـprompt، حتى تظهر صورة نظيفة.
إليك خط الأنابيب بخطوات واضحة، وهو المسار نفسه الذي تسلكه كلماتك كل مرة تضغط فيها توليد.
- تكتب prompt. هذه هي التعليمات الوحيدة التي يتلقّاها النموذج، لذا تكتسب الدقّة أهميّة كبيرة.
- يقرأه مُرمِّز نصّي. نموذج لغوي أو رؤيوي-لغوي (مثل مُرمِّز نصوص CLIP، أو نموذج لغوي كبير مثل T5 في Google's Imagen) يُحوّل كلماتك إلى تضمين عددي يلتقط معناها.
- يبدأ النموذج من ضوضاء عشوائية. اللوحة تبدأ كضغطات ساكنة بلا معنى، seed عشوائي.
- يُجري denoise خطوة بخطوة. عبر سلسلة من الخطوات يزيل النموذج الضوضاء قليلًا في كل مرة، وفي كل خطوة يدفع تضمين النص النتيجة نحو وصفك.
- تُفكّك الصورة. في نموذج diffusion الكامن يحدث العمل في فضاء كامن مضغوط للسرعة، ثم يقوم مُفكِّك (VAE) بتوسيع النتيجة إلى صورة كاملة الدقّة.
- تحصل على صورة منتهية. المخرج صورة جديدة مشروطة بكلماتك وseed وإعدادات النموذج.
فكرتان تقنيّتان تفسّران كثيرًا من السلوك الذي ستلاحظه. الseed هو الضوضاء الابتدائية المحدّدة؛ بإعادة استخدام seed نفسه مع prompt نفسه تحصل على الصورة ذاتها، وهذا ما يتيح لك التكرار بشكل مُتحكَّم. الGuidance (ويُسمّى كثيرًا مقياس CFG) يتحكّم بمدى التزام النموذج بالـprompt مقابل توليد حر؛ رفعه يجعل الصورة أقرب لكلماتك لكنه قد يبدو مُفتعلًا، وخفضه يمنح النموذج حرية إبداعية أكبر لكنه يبتعد عن وصفك.
ماذا تعني مصطلحات النص-إلى-صورة الأساسية؟
هناك حفنة مصطلحات تتكرّر باستمرار. معرفتها يزيل معظم الغموض ويجعلك تقرأ لوحة إعدادات أي مولّد صور بالذكاء الاصطناعي بثقة.
| المصطلح | المعنى المبسّط | لماذا يهمّك |
|---|---|---|
| Prompt | الوصف النصّي الذي تكتبه | مقبض التوجيه الوحيد لديك؛ الدقّة تحسم النتيجة |
| prompt سلبي | قائمة بما تريد استبعاده | يُزيل المشاكل المتكرّرة مثل الأصابع الزائدة أو النص أو العلامات المائية |
| الانتشار | التوليد عبر إزالة الضوضاء خطوة بخطوة | يشرح لماذا قد تعني خطوات أكثر تفاصيل أكثر ووقتًا أطول |
| الفضاء الكامن | تمثيل داخلي مضغوط للصورة | ولهذا نماذج diffusion الكامنة سريعة بما يكفي للتفاعل اللحظي |
| مشفّر النص | يحوّل كلماتك إلى أرقام يقرأها النموذج | مُرمِّز أكبر وأفضل يعني عادة فهمًا أدقّ للـprompt |
| Seed | الضوضاء الابتدائية العشوائية | أعِد استخدامه لتكرار صورة أو التكرار عليها بضبط مُتحكَّم |
| مقياس التوجيه / CFG | مدى التزام النموذج بالـprompt | القيمة العالية تبدو مُفتعلة؛ والمنخفضة تتجاهل كلماتك |
| الخطوات | عدد تمريرات إزالة الضوضاء | المزيد قد يضيف تفاصيل لكنه يكلّف وقتًا مع عوائد متناقصة |
| نسبة الأبعاد | شكل الإطار هندسيًا | اضبطه عمدًا كي لا تُقصّ تركيبتك على نحو مُربك |
لا يلزم لمس كل هذه العناصر في كل مرة. تعرض معظم الأدوات صندوق prompt وNegative prompt ونسبة الأبعاد افتراضيًا، وتخفي الباقي خلف الإعدادات المتقدّمة. لكن معرفتك بوظيفة كل مقبض تعني أنه حين تخرج نتيجة عن المطلوب، تعرف أي قرص تدير.
كيف يختلف «النص إلى صورة» عن «صورة إلى صورة» والتحرير؟
«النص إلى صورة» وضع واحد ضمن عدة أوضاع، وخلطها مصدر شائع للإحباط. الفرق يعود إلى ما تُدخله للنموذج كنقطة بداية.
- Text to image: الإدخال كلمات فقط. يبدأ النموذج من ضوضاء عشوائية ويبني المشهد كاملًا من وصفك. أفضل لإنشاء شيء جديد من الصفر.
- Image to image: الإدخال كلمات بالإضافة إلى صورة بداية. يستخدم النموذج صورتك كقاعدة ويحوّلها وفق الـprompt مع الحفاظ على التركيب التقريبي. أفضل لإعادة الأسلوب أو إعادة العمل على صورة قائمة.
- Inpainting والتحرير: الإدخال صورة مع منطقة مُقنَّعة. يُعيد النموذج توليد الجزء الذي تحدّده فقط. أفضل لإصلاح عنصر واحد أو استبداله دون إعادة توليد الصورة كاملة.
- Outpainting: يوسّع النموذج الصورة خارج حدودها الأصلية، مُبتكرًا مشهدًا يُكمل الإطار. أفضل لتغيير نسبة الأبعاد أو إضافة حيّز علوي.
في سير عمل حقيقي ستُمزج هذه الأوضاع. قد تُولّد أساسًا عبر «النص إلى صورة»، ثم تنتقل للتحرير لإصلاح يد واحدة أو تبديل الخلفية. معرفتك بالوضع الذي تعمل فيه تُخبرك بما يُسمح للنموذج بتغييره وما سيحاول الحفاظ عليه.
لماذا يحصل شخصان على صور مختلفة للفكرة نفسها؟
اكتب الفكرة نفسها في أداتين، أو حتى في الأداة نفسها مرتين، وقد تحصل على صور مختلفة جدًا. هذا متوقَّع، وثلاثة عوامل تفسّر معظم ذلك.
أولًا، النموذج. تختلف مولّدات الصور بالذكاء الاصطناعي في بيانات التدريب والهندسة، لذا يمتلك كلٌّ «طابعًا» افتراضيًا وقوًى مختلفة. أظهر بحث مثل Google's Imagen أن توسيع مُرمِّز النص، وليس نموذج الصورة فقط، حسّن بشدّة كلًا من الواقعية الضوئية ومدى تطابق الصورة مع الكلمات، ولهذا يختلف فهم الـprompt كثيرًا بين الأدوات.
ثانيًا، العشوائية. تبدأ diffusion من ضوضاء عشوائية، لذا يُنتج seed مختلف صورة مختلفة حتى مع prompt مطابق. هذه ميزة لا عيب؛ فهي ما يسمح بتوليد تنويعات واختيار الأفضل.
ثالثًا، الprompt والإعدادات. الprompts المبهمة تترك للنموذج ملء الفراغات بتخمينه المتوسّط، لذا تغييرات صياغة صغيرة تقلب النتيجة. الGuidance والخطوات ونسبة الأبعاد تغيّرها أكثر. الخلاصة العملية: أفضل مولّد صور بالذكاء الاصطناعي لك يتعلّق جزئيًا بجودة النموذج وجزئيًا بمدى توافق فهمه للprompts مع طريقتك في الوصف.
كيف تكتب prompt نص-إلى-صورة يعمل فعلًا؟
لأن الـprompt هو تعليماتك الوحيدة، فصياغته هي المهارة الأهم في «النص إلى صورة». الصيغة الموثوقة تسمّي الأشياء حسب الأهمية: الموضوع أولًا، ثم المشهد، فالإضاءة، فالأسلوب، مع محدّدات تقنية في النهاية وNegative prompt منفصل لما تُريد استبعاده.
- سمِّ الموضوع وخصائصه المفصلية: "امرأة في الثلاثينيات، ابتسامة واثقة ناعمة، جاكيت تشارکول".
- ضعه في مشهد: "جالسة أمام خلفية رمادية حيادية".
- حدّد الإضاءة: "إضاءة نافذة رخوة منتشرة من اليسار" — غالبًا الرافعة الأكبر للواقعية.
- أضف الكاميرا والعدسة والأسلوب: "مصوّر على عدسة 85mm، عمق مجال ضحل، بورتريه مهني للشركات".
- اضبط المزاج والمحدّدات التقنية: "دافئ وقابل للتواصل، حدّة عالية، نسبة أبعاد 4:5".
- أضف Negative prompt: "ظلال قاسية، شوائب، نص، علامة مائية".
الدقّة تتفوّق على الطول. عشر كلمات دقيقة تتغلّب غالبًا على خمسين كلمة مبهمة، لأن كل تفصيل ملموس يبعد النموذج عن تخمينه المتوسّط. عندما تقترب النتيجة لكنها ليست صحيحة، غيّر متغيّرًا واحدًا في كل مرة لترى أثر كل تعديل. لشرح أعمق مع أمثلة جاهزة للنسخ، راجع دليلنا حول كيفية كتابة prompts لصور الذكاء الاصطناعي، أو دع مُنشئ الprompt بالذكاء الاصطناعي يبني prompt كاملًا انطلاقًا من فكرة قصيرة.
ما حدود «النص إلى صورة» اليوم؟
«النص إلى صورة» قوي لكنه ليس سحرًا، ورؤية حدوده بوضوح تُجنّبك الإحباط.
- التفاصيل الدقيقة تتعثر بشكل متوقّع. اليدان، الأسنان، النص داخل الصورة، والانعكاسات المعقّدة هي مناطق العيوب المعتادة؛ افحصها كل مرة.
- هو لا يقرأ نواياك. لا يعرف النموذج إلا ما كتبتَه، لذا كل ما تُهمله سيُملأ بافتراضاته الافتراضية.
- التطابق الحرفي صعب. إنتاج الشخص أو المنتج أو الشعار نفسه بثبات عبر صور متعدّدة لا يزال صعبًا من دون أدوات متخصصة.
- المخرجات معقولة لا واقعية. النموذج يخترع تفاصيل، لذا «النص إلى صورة» غير مناسب لما يجب أن يكون دقيقًا، مثل التوثيق أو الأدلة.
- الجودة تختلف حسب النموذج. مولّد أضعف سيكافح مع مشاهد معقّدة يتعامل معها أقوى بسهولة، لذا الأداة أهم بقدر أهمية الـprompt.
لا شيء من ذلك يُعدّ عائقًا لمعظم الأعمال الإبداعية والتسويقية. بل يعني ببساطة أن «النص إلى صورة» نقطة انطلاق تُنقِّحها، لا عرّاف نقرة واحدة. ولِّد، وافحص، ثم أصلِح الأشياء القليلة الخاطئة بتحرير مُستهدف بدل إعادة التوليد الكامل.
المصادر
- 01Text-to-image model (overview) — Wikipedia (تم الوصول في 2026-06-01)
- 02Latent diffusion model — Wikipedia (تم الوصول في 2026-06-01)
- 03Diffusion model — Wikipedia (تم الوصول في 2026-06-01)
- 04Contrastive Language–Image Pre-training (CLIP) — Wikipedia (تم الوصول في 2026-06-01)
- 05Imagen: Text-to-Image Diffusion Models — Google Research (تم الوصول في 2026-06-01)
- 06Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding — Saharia et al., arXiv (تم الوصول في 2026-06-01)
- 07Prompt engineering — Wikipedia (تم الوصول في 2026-06-01)
أسئلة متكررة
- ماذا يعني «النص إلى صورة»؟
- يعني «النص إلى صورة» توليد صورة جديدة بالكامل من وصف مكتوب. تكتب prompt ويقوم مولّد الصور بالذكاء الاصطناعي برسم صورة مطابقة. الصورة مُولَّدة من الصفر، لا مُسترجَعة من مكتبة ولا مركّبة من صور قائمة.
- كيف يحوّل مولّد الصور بالذكاء الاصطناعي الكلمات إلى صورة؟
- معظمها يستخدم diffusion. مُرمِّز نصّي يُحوّل الـprompt إلى أرقام، يبدأ النموذج من ضوضاء عشوائية، ويُزيل تلك الضوضاء خطوة بخطوة بينما يقود الـprompt كل خطوة. ثم يُحوّل مُفكِّك النتائج إلى صورة كاملة الدقّة.
- هل «النص إلى صورة» مجرد بحث عن صور موجودة؟
- لا. النموذج لا يبحث ولا ينسخ مصدرًا واحدًا. تعلّم أنماطًا إحصائية تربط الكلمات بالمشاهد البصرية أثناء التدريب ويُعيد كل مرة بناء صورة أصلية جديدة من ضوضاء عشوائية.
- ما هو نموذج diffusion؟
- نموذج diffusion يتعلّم توليد الصور بعكس عملية إضافة الضوضاء. يتدرّب على تحويل صور حقيقية إلى ضوضاء، ثم يتعلّم التراجع عن ذلك، بحيث يمكنه البدء من ضوضاء عشوائية وإزالة الضوضاء حتى تتكوّن صورة متماسكة يقودها الـprompt.
- ما هو الseed في «النص إلى صورة»؟
- الseed هو الضوضاء الابتدائية المحدّدة. إعادة استخدام seed نفسه مع prompt نفسه تُعيد إنتاج الصورة ذاتها، وهو ما يتيح لك التكرار المُتحكَّم. تغيير الseed يمنحك تنويعًا مختلفًا للفكرة نفسها.
- ما هو CFG أو مقياس الGuidance؟
- الGuidance، ويُسمّى غالبًا مقياس CFG، يتحكّم بمدى التزام النموذج بالـprompt. القيم الأعلى تُطابق كلماتك على نحو أوثق لكنها قد تبدو مُفتعلة؛ القيم الأدنى تمنح النموذج حرية أكبر وقد تبتعد عن وصفك.
- لماذا أحصل على صور مختلفة من نفس الـprompt؟
- لأن diffusion يبدأ من ضوضاء عشوائية، فإن seed مختلف يُنتج صورة مختلفة حتى مع صياغة متطابقة. النماذج والإعدادات المختلفة تغيّر النتيجة أكثر. هذا سلوك متوقَّع ويتيح لك توليد تنويعات والاختيار بينها.
- ما الفرق بين «النص إلى صورة» و«صورة إلى صورة»؟
- «النص إلى صورة» يبدأ من كلمات فقط ويبني المشهد كله من الضوضاء. «صورة إلى صورة» يبدأ من كلمات زائد صورة أساس ويحوّلها مع الحفاظ على التركيب التقريبي. الأول ينشئ من الصفر؛ والثاني يُعيد العمل على صورة موجودة.
- ما أفضل مولّد صور بالذكاء الاصطناعي لـ«النص إلى صورة»؟
- يعتمد ذلك على احتياجاتك وعلى مدى توافق فهم الأداة للprompts مع طريقتك في الوصف. تختلف النماذج في الطابع الافتراضي ونقاط القوة ودقّة الالتزام بالـprompt، لذا الأفضل يجمع بين جودة النموذج وملاءمته لك.
- كيف أحصل على نتائج أفضل من «النص إلى صورة»؟
- اكتب prompts محدّدة: سمِّ الموضوع والمشهد والإضاءة والأسلوب حسب الأهمية، أضف Negative prompt، واضبط نسبة الأبعاد. ثم غيّر متغيّرًا واحدًا في كل مرة للتحسين، بدل إعادة الصياغة كاملة دفعة واحدة.
كتبها
يكتب الفريق التحريري في LaFoto أدلة ومقارنات عن توليد الصور بالذكاء الاصطناعي، وفق معيار صارم بالاستناد إلى مصادر ودون تلفيق.
واصل القراءة
ابدؤوا الإنشاء اليوم
ولّدوا أول صورة لكم بأفضل مُولِّد صور بالذكاء الاصطناعي.
حوّلوا جملة إلى صورة منتهية واقعية في ثوانٍ — ثم نقّحوا كل تفصيلة. بلا إعداد، بلا Discord، بلا GPU.
انضمّ 4,200+ من المُنشئين إلى LaFoto




