คู่มือ
Text to Image: AI แปลงข้อความเป็นภาพอย่างไร

Text to image คืออะไร
Text to image คือหมวดหนึ่งของ AI ที่สร้างรูปภาพจาก prompt ที่พิมพ์ ท่านบรรยายสิ่งที่ต้องการเป็นภาษาธรรมดา แล้ว AI image generator จะเรนเดอร์ภาพใหม่ให้ตรงตามนั้น ชื่อทางเทคนิคคือ text-to-image model และตามที่วิกิพีเดียบันทึกไว้ ระบบเหล่านี้เริ่มบูมหลังปี 2022 เมื่อเครื่องมืออย่าง DALL·E 2, Imagen, Stable Diffusion และ Midjourney ให้ผลลัพธ์ที่เข้าใกล้ภาพถ่ายจริง
ประเด็นสำคัญสำหรับผู้เริ่มต้นคือผลลัพธ์ “ถูกสร้างขึ้น” ไม่ใช่ “ถูกค้นเจอ” โมเดลไม่ได้ค้นหาจากคลังภาพที่มีอยู่ และไม่ได้แปะคลิปอาร์ตรวมกัน แต่มันประกอบสร้างภาพใหม่ทีละพิกเซลจากรูปแบบที่มันเรียนรู้ระหว่างการฝึก นั่นจึงเป็นเหตุผลว่าท่านขอสิ่งที่ไม่เคยมีใครถ่ายได้ เช่น “ถ้วยชาที่ทำจากกระจกสี วางบนเปียโนที่ปกคลุมด้วยมอส” และยังได้ผลลัพธ์ที่สอดคล้องกัน
คนส่วนใหญ่พบ text to image ผ่านกล่องง่ายๆ กล่องหนึ่ง: พิมพ์ประโยค กดสร้าง ได้ภาพ “ข้อความเป็นภาพถ่าย” ก็ทำงานเช่นนั้นทุกประการ ความซับซ้อนเกิดขึ้นหลังกล่องนั้น การเข้าใจภาพรวมคร่าวๆ จะช่วยให้ท่านได้ผลลัพธ์ตรงใจขึ้นมาก
Text to image ทำงานจริงๆ อย่างไร
แนวทางหลักในปี 2026 คือโมเดลแบบ diffusion โดยมากเป็น latent diffusion ความเข้าใจเชิงสัญชาตญาณอาจขัดกับความคุ้นเคย แต่คุ้มที่จะจับให้ได้: โมเดลเรียนรู้การสร้างภาพด้วยการเรียนรู้ “การทำลายภาพ” ก่อน ระหว่างการฝึก มันจะรับภาพจริง เติมสัญญาณรบกวนจนกลายเป็นสแตติก แล้วเรียนรู้วิธีย้อนกระบวนการนั้น เมื่อต้องการสร้างภาพใหม่ มันจะเริ่มจากสัญญาณรบกวนแบบสุ่มล้วน แล้วรันกระบวนการย้อนกลับ โดยมี prompt ของท่านคอยกำกับ จนภาพใสสะอาดโผล่ออกมา
นี่คือ pipeline แบบขั้นตอนง่ายๆ เส้นทางเดียวกับที่คำของท่านเดินทางทุกครั้งที่กดสร้างภาพ
- ท่านเขียน prompt ซึ่งเป็นคำสั่งเพียงอย่างเดียวของโมเดล จึงยิ่งต้องเฉพาะเจาะจง
- ตัวเข้ารหัสข้อความอ่านมัน โมเดลภาษา/วิสัยทัศน์-ภาษา (เช่น CLIP text encoder หรือโมเดลภาษาขนาดใหญ่เช่น T5 ใน Imagen ของ Google) จะแปลงคำของท่านเป็นเวกเตอร์ตัวเลขที่จับความหมายได้
- โมเดลเริ่มจากสัญญาณรบกวนแบบสุ่ม ผืนผ้าใบเริ่มต้นคือสแตติกไร้ความหมาย เป็น seed แบบสุ่ม
- มัน denoise ทีละขั้น ชุดของขั้นตอนที่โมเดลค่อยๆ ลบสัญญาณรบกวน และทุกขั้นจะถูกเวกเตอร์ข้อความพาให้เข้าใกล้คำบรรยายของท่าน
- ถอดรหัสเป็นภาพ ในโมเดล latent diffusion การคำนวณเกิดใน latent space ที่ถูกบีบอัดเพื่อความเร็ว แล้วตัวถอดรหัส (VAE) จะขยายผลเป็นภาพความละเอียดเต็ม
- ท่านได้ภาพถ่ายที่เสร็จสมบูรณ์ เอาต์พุตคือภาพใหม่ที่ถูกปรับตามคำของท่าน seed และการตั้งค่าของโมเดล
มีแนวคิดเทคนิค 2 ข้อที่อธิบายพฤติกรรมส่วนใหญ่ได้ Seed คือสัญญาณรบกวนตั้งต้นแบบเฉพาะ เจาะจง seed และ prompt เดิม จะได้ภาพเดิม ซึ่งช่วยให้ไล่แก้ทีละจุดได้อย่างคุมได้ Guidance (มักเรียกสเกล CFG) คือความเคร่งครัดในการทำตาม prompt เปิดค่าสูง ภาพจะเกาะคำพูดมากขึ้นแต่เสี่ยงดูฝืน เปิดค่าต่ำ ภาพจะลื่นไหลสร้างสรรค์ขึ้นแต่ลอยจากคำบรรยายได้
ศัพท์หลักของ text-to-image หมายถึงอะไร
มีคำไม่กี่คำที่เจอบ่อย รู้ความหมายแล้วอ่านหน้าตั้งค่าของ AI image generator ตัวใดก็ได้อย่างมั่นใจ
| คำ | ความหมายแบบภาษาคน | ทำไมสำคัญกับท่าน |
|---|---|---|
| Prompt | ข้อความบรรยายที่ท่านเขียน | พวงมาลัยเพียงอันเดียว; ความเฉพาะเจาะจงกำหนดผลลัพธ์ |
| prompt เชิงลบ | รายการสิ่งที่ต้องตัดออก | ตัดปัญหาซ้ำๆ เช่น นิ้วเกิน ข้อความ หรือวอเตอร์มาร์ก |
| ดิฟฟิวชัน | การสร้างภาพด้วยการลบสัญญาณรบกวนทีละขั้น | อธิบายว่าทำไมเพิ่มขั้นตอนจึงเพิ่มรายละเอียดและใช้เวลามากขึ้น |
| พื้นที่แฝง | ตัวแทนภาพแบบย่อภายในโมเดล | เหตุผลที่ latent diffusion เร็วพอสำหรับงานแบบโต้ตอบ |
| ตัวเข้ารหัสข้อความ | ตัวแปลงคำของท่านเป็นตัวเลขที่โมเดลอ่านออก | ตัวเข้ารหัสที่ใหญ่และดีขึ้น มักแปลว่าความเข้าใจ prompt ดีขึ้น |
| Seed | สัญญาณรบกวนตั้งต้นแบบสุ่ม | ใช้ซ้ำเพื่อทำซ้ำภาพหรือไล่ปรับแบบคุมได้ |
| การชี้นำ / สเกล CFG | ระดับความเคร่งครัดในการทำตาม prompt | สูงไปดูฝืน; ต่ำไปอาจไม่ฟังคำบรรยาย |
| ขั้นตอน | จำนวนรอบการ denoise ที่โมเดลรัน | เพิ่มรอบช่วยเพิ่มรายละเอียดแต่กินเวลา ผลตอบแทนลดลงเรื่อยๆ |
| อัตราส่วนกว้างยาว | สัดส่วนกรอบภาพ | ตั้งให้ตรงจุดเพื่อไม่ให้องค์ประกอบถูกครอบเก้อๆ |
ท่านไม่จำเป็นต้องแตะทุกตัวทุกครั้ง เครื่องมือส่วนใหญ่เปิดให้ใส่ prompt, negative prompt และอัตราส่วนกว้างยาวเป็นค่าเริ่มต้น ที่เหล้าซ่อนไว้ในโหมดขั้นสูง แต่เมื่อรู้ว่าแต่ละคันโยกทำอะไร เวลาได้ผลลัพธ์เพี้ยน ท่านจะรู้ว่าต้องหมุนปุ่มไหน
Text to image ต่างจาก image-to-image และการแก้อย่างไร
Text to image เป็นเพียงหนึ่งโหมด ความสับสนมักมาจากการปนกัน ความต่างอยู่ที่อินพุตตั้งต้นที่ป้อนให้โมเดล
- Text to image: อินพุตคือคำล้วน โมเดลเริ่มจากสัญญาณรบกวนแบบสุ่ม แล้วสร้างทั้งฉากจากคำบรรยาย เหมาะสุดเมื่ออยากสร้างสิ่งใหม่ตั้งแต่ศูนย์
- Image to image: อินพุตคือคำบวกภาพตั้งต้น โมเดลใช้ภาพของท่านเป็นฐานแล้วแปลงตาม prompt โดยเก็บโครงร่างองค์ประกอบคร่าวๆ ไว้ เหมาะสำหรับรีสไตล์หรือปรับภาพที่มีอยู่
- Inpainting และการแก้ไข: อินพุตคือภาพบวกบริเวณที่มาสก์ไว้ โมเดลจะสร้างใหม่เฉพาะส่วนที่เลือก เหมาะเมื่อจะแก้หรือสลับองค์ประกอบเพียงจุด โดยไม่ต้องสุ่มทั้งภาพใหม่
- Outpainting: โมเดลขยายภาพออกไปนอกขอบเดิม สร้างฉากต่อเนื่อง เหมาะสำหรับเปลี่ยนอัตราส่วนกว้างยาวหรือเพิ่มพื้นที่ด้านบน/ด้านข้าง
ในงานจริงท่านจะผสมหลายโหมด ท่านอาจสร้างฐานด้วย text to image แล้วสลับไปแก้ไขเพื่อจัดนิ้วมือเดียว หรือสลับฉากหลัง การรู้ว่าอยู่ในโหมดไหนจะบอกว่าโมเดลได้รับอนุญาตให้เปลี่ยนอะไร และจะพยายามคงอะไรไว้
ทำไมคนสองคนถึงได้ภาพต่างกันจากไอเดียเดียวกัน
พิมพ์ไอเดียเดียวกันในเครื่องมือต่างกัน หรือแม้แต่เครื่องมือเดียวกันสองครั้ง ก็ได้ภาพต่างกัน นี่เป็นเรื่องปกติ และสามปัจจัยนี้อธิบายได้แทบทั้งหมด
หนึ่ง โมเดล AI image generator ต่างกันถูกฝึกด้วยข้อมูลและสถาปัตยกรรมต่างกัน จึงมีลุคพื้นฐานและจุดแข็งต่างกัน งานวิจัยอย่าง Imagen ของ Google แสดงให้เห็นว่าการขยายขนาดตัวเข้ารหัสข้อความ ไม่ใช่แค่โมเดลภาพ ช่วยยกระดับทั้งความสมจริงและความตรงกับคำบรรยาย ซึ่งเป็นเหตุผลว่าทำไมความเข้าใจ prompt จึงต่างกันมากระหว่างเครื่องมือ
สอง ความสุ่ม Diffusion เริ่มจากสัญญาณรบกวนแบบสุ่ม ดังนั้นเปลี่ยน seed ก็ได้ภาพที่ต่าง แม้ prompt จะเหมือนเดิม นี่คือคุณสมบัติ ไม่ใช่บั๊ก มันคือวิธีสร้างเวอร์ชันหลายแบบแล้วคัดตัวที่ดีที่สุด
สาม ตัว prompt และการตั้งค่า Prompt กว้างๆ ปล่อยให้โมเดลเติมช่องว่างด้วย “ค่าเฉลี่ย” ของมันเอง จึงทำให้คำที่ต่างเล็กน้อยเหวี่ยงผลลัพธ์ได้ Guidance จำนวน steps และอัตราส่วนกว้างยาวยิ่งขยับผลไปอีก บทสรุปเชิงปฏิบัติ: เครื่องมือที่ “ดีที่สุด” สำหรับท่าน ขึ้นกับทั้งคุณภาพโมเดลและระดับที่ความเข้าใจ prompt ของมันเข้ากับวิธีที่ท่านอธิบายสิ่งต่างๆ
เขียน text-to-image prompt อย่างไรให้ได้ผล
เพราะ prompt คือคำสั่งเดียว ทักษะการเขียน prompt จึงเป็นคันโยกที่มีอิทธิพลที่สุด สูตรที่ไว้ใจได้คือ ไล่ตามลำดับความสำคัญ: ตัวแบบก่อน แล้วฉาก แสง และสไตล์ ส่วนคุณสมบัติทางเทคนิคไว้ท้าย และใช้ negative prompt แยกสำหรับสิ่งที่ต้องตัดออก
- ระบุตัวแบบและคุณลักษณะสำคัญ: “หญิงวัย 30 รอยยิ้มอ่อนโยนมั่นใจ เสื้อเบลเซอร์สีชาร์โคล”
- วางไว้ในฉาก: “นั่งหน้าฉากหลังสีเทากลางๆ แบบเรียบ”
- ระบุแสง: “แสงหน้าต่างนุ่มฟุ้งจากด้านซ้าย” — มักเป็นคันโยกที่มีผลต่อความสมจริงสูงสุด
- เพิ่มกล้อง เลนส์ และสไตล์: “ถ่ายด้วยเลนส์ 85mm ระยะชัดตื้น ภาพบุคคลสายคอร์ปอเรตระดับมืออาชีพ”
- กำหนดอารมณ์และคุณสมบัติเทคนิค: “อบอุ่น เป็นมิตร โฟกัสคม อัตราส่วน 4:5”
- ใส่ negative prompt: “เงาแข็ง สิว ข้อความ วอเตอร์มาร์ก”
ความเฉพาะเจาะจงชนะความยาว คำที่แม่นยำ 10 คำ มักชนะคำกว้างๆ 50 คำ เพราะรายละเอียดเชิงรูปธรรมแต่ละข้อจะพาโมเดลหนีจาก “ค่าเฉลี่ย” ของมัน เมื่อผลลัพธ์ใกล้เคียงแต่ยังไม่ใช่ ให้เปลี่ยนตัวแปรทีละอย่างเพื่อเห็นชัดว่าแต่ละแก้ไขทำอะไร หากต้องการตัวอย่างพร้อมใช้ โปรดดูคู่มือการเขียน AI photo prompt ของเรา หรือให้ AI Prompt Generator ช่วยโครง prompt เต็มจากไอเดียสั้นๆ
ข้อจำกัดของ text to image ในปัจจุบันคืออะไร
Text to image ทรงพลังแต่ไม่ใช่เวทมนตร์ การรู้ข้อจำกัดช่วยลดความหงุดหงิด
- รายละเอียดจุกจิกมักพังเป็นจุดๆ มือ ฟัน ข้อความในภาพ และเงาสะท้อนซับซ้อนคือโซนที่มักมีอาร์ติแฟกต์ ตรวจทุกรอบ
- มันอ่านใจท่านไม่ได้ โมเดลรู้แค่สิ่งที่ท่านเขียน สิ่งที่ไม่ระบุจะถูกเติมด้วยสมมติฐานพื้นฐานของมัน
- การทำซ้ำแบบเด๊ะๆ ยาก สร้างคนเดิม ผลิตภัณฑ์เดิม หรือโลโก้เดิมให้คงที่ข้ามภาพยังยากหากไม่มีเครื่องมือเฉพาะทาง
- เอาต์พุตคือสิ่งที่ “เป็นไปได้” ไม่ใช่ข้อเท็จจริง โมเดลเติมรายละเอียดเอง จึงไม่เหมาะกับงานที่ต้องแม่นจริง เช่น เอกสารหรือหลักฐาน
- คุณภาพขึ้นกับโมเดล AI image generator ที่อ่อนแรงจะลำบากกับฉากซับซ้อนที่โมเดลแข็งแรงทำได้สบาย จึงสำคัญพอๆ กับ prompt
ข้อจำกัดเหล่านี้ไม่ใช่ตัวตัดใจสำหรับงานครีเอทีฟและมาร์เก็ตติ้งส่วนใหญ่ มันแค่หมายความว่า text to image คือจุดเริ่มที่ต้องขัดเกลาต่อ ไม่ใช่ปุ่มเดียวจบ สร้างภาพ ตรวจ แล้วแก้จุดที่เพี้ยนด้วยการแก้เฉพาะจุด แทนที่จะสุ่มใหม่ทั้งภาพ
แหล่งที่มา
- 01Text-to-image model (overview) — Wikipedia (เข้าถึงเมื่อ 2026-06-01)
- 02Latent diffusion model — Wikipedia (เข้าถึงเมื่อ 2026-06-01)
- 03Diffusion model — Wikipedia (เข้าถึงเมื่อ 2026-06-01)
- 04Contrastive Language–Image Pre-training (CLIP) — Wikipedia (เข้าถึงเมื่อ 2026-06-01)
- 05Imagen: Text-to-Image Diffusion Models — Google Research (เข้าถึงเมื่อ 2026-06-01)
- 06Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding — Saharia et al., arXiv (เข้าถึงเมื่อ 2026-06-01)
- 07Prompt engineering — Wikipedia (เข้าถึงเมื่อ 2026-06-01)
คำถามที่พบบ่อย
- Text to image หมายถึงอะไร
- Text to image คือการสร้างภาพใหม่เอี่ยมจากคำบรรยายที่พิมพ์ ท่านพิมพ์ prompt แล้ว AI image generator จะเรนเดอร์ภาพที่สอดคล้อง ผลลัพธ์ถูกสร้างขึ้นตั้งแต่ศูนย์ ไม่ได้ดึงจากคลังหรือเย็บจากภาพที่มีอยู่
- AI image generator แปลงคำให้เป็นภาพถ่ายได้อย่างไร
- ส่วนใหญ่ใช้ diffusion ตัวเข้ารหัสข้อความจะแปลง prompt เป็นตัวเลข โมเดลเริ่มจากสัญญาณรบกวนแบบสุ่ม แล้วค่อยๆ ลบสัญญาณรบกวนโดยมี prompt ของท่านคุมทุกขั้น จากนั้นตัวถอดรหัสจะแปลงผลให้เป็นภาพความละเอียดเต็ม
- Text to image แค่ค้นหารูปที่มีอยู่แล้วหรือไม่
- ไม่ โมเดลไม่ได้ค้นหาและไม่ได้คัดลอกจากแหล่งเดียว มันเรียนรู้รูปแบบเชิงสถิติที่เชื่อมคำกับฉากภาพระหว่างการฝึก และสร้างภาพต้นฉบับใหม่จากสัญญาณรบกวนทุกครั้งที่ท่านสั่งสร้าง
- Diffusion model คืออะไร
- Diffusion model เรียนรู้การสร้างภาพด้วยการย้อนกระบวนการใส่สัญญาณรบกวน มันฝึกจากการทำภาพจริงให้กลายเป็นสแตติก แล้วเรียนรู้วิธีย้อนกลับ จึงสามารถเริ่มจากสัญญาณรบกวนแบบสุ่มและ denoise ให้เป็นภาพที่ชัด โดยมี prompt ของท่านคุมทิศทาง
- Seed ใน text to image คืออะไร
- Seed คือสัญญาณรบกวนตั้งต้นแบบเฉพาะ ใช้ seed และ prompt เดิมจะได้ภาพซ้ำ ซึ่งช่วยให้ไล่ปรับแบบคุมได้ เปลี่ยน seed ก็ได้เวอร์ชันใหม่ของไอเดียเดิม
- CFG หรือ guidance scale คืออะไร
- Guidance หรือสเกล CFG คือระดับความเคร่งครัดในการทำตาม prompt ค่าสูงจะเกาะคำของท่านมากขึ้นแต่อาจดูฝืน ค่าต่ำเปิดให้โมเดลสร้างอิสระและอาจลอยจากคำบรรยาย
- ทำไมได้ภาพต่างกันทั้งที่ใช้ prompt เดียวกัน
- เพราะ diffusion เริ่มจากสัญญาณรบกวนแบบสุ่ม เปลี่ยน seed ก็เปลี่ยนภาพแม้ถ้อยคำเหมือนกัน ต่างโมเดลและการตั้งค่ายังทำให้ผลต่างอีก นี่เป็นพฤติกรรมปกติและเปิดโอกาสให้สร้างและเลือกจากหลายเวอร์ชัน
- ต่างกันอย่างไรระหว่าง text to image กับ image to image
- Text to image เริ่มจากคำล้วนแล้วประกอบสร้างทั้งฉากจากสัญญาณรบกวน Image to image เริ่มจากคำบวกภาพฐาน แล้วแปลงภาพนั้นโดยคงองค์ประกอบคร่าวๆ แบบแรกสร้างจากศูนย์ แบบหลังดัดแปลงภาพที่มีอยู่
- AI image generator ไหนดีที่สุดสำหรับ text to image
- ขึ้นกับความต้องการของท่าน และระดับที่ความเข้าใจ prompt ของเครื่องมือนั้นเข้ากับวิธีที่ท่านอธิบายสิ่งต่างๆ โมเดลต่างกันมีลุคพื้นฐาน ความถนัด และความซื่อต่อคำต่างกัน “ดีที่สุด” จึงขึ้นกับทั้งคุณภาพโมเดลและความเข้ากันกับท่าน
- จะได้ผลลัพธ์จาก text to image ให้ดีขึ้นได้อย่างไร
- เขียน prompt ให้เฉพาะ: ระบุตัวแบบ ฉาก แสง และสไตล์ตามลำดับความสำคัญ ใส่ negative prompt และตั้งอัตราส่วนกว้างยาว จากนั้นเปลี่ยนทีละตัวแปรเพื่อไล่ปรับ แทนการเขียนใหม่ยกแผง
เขียนโดย
ทีมบรรณาธิการของ LaFoto เขียนคู่มือและงานเปรียบเทียบด้านการสร้างภาพถ่ายด้วย AI โดยยึดมาตรฐานอ้างอิงแหล่งที่มา ไม่แต่งข้อมูล
อ่านต่อ
เริ่มสร้างวันนี้
สร้างภาพแรกของท่านด้วยตัวสร้างภาพ AI ที่ดีที่สุด
แปลงประโยคเป็นภาพจริงสมจริงในไม่กี่วินาที — แล้วปรับรายละเอียดได้ครบ ไม่ต้องตั้งค่า ไม่ต้องใช้ Discord หรือ GPU
เข้าร่วมกับครีเอเตอร์ 4,200+ คนที่ใช้ LaFoto




