Google · model directory
Nano Banana คืออะไร? อธิบายโมเดลแก้ไขภาพของ Google
Nano Banana คือชื่อเล่นของโมเดลภาพ Gemini ของ Google ออกแบบมาสำหรับการแก้ไขแบบสนทนาที่รักษาตัวแบบให้คงเดิมแม้แก้หลายครั้ง
Nano Banana at a glance
- ผู้พัฒนา
- ตระกูล
- Gemini
- วิธีเข้าถึง
- แอป Gemini และส่วนติดต่อโปรแกรม (API)
- จุดเด่น
- แก้ไขได้โดยคงตัวละครให้เหมือนเดิม
- น้ำหนักโมเดล
- ปิด
- รูปแบบการใช้งาน
- เชิงสนทนา
ชื่อมาจากไหน
เดิมไม่ใช่ชื่อสินค้า โมเดลที่ไม่ติดป้ายปรากฏในสนามทดสอบแบบประจันหน้าสาธารณะ ที่ให้ผู้ใช้เปรียบเทียบผลลัพธ์โดยไม่รู้ว่าออกมาจากระบบใด ภายใต้ชื่อชั่วคราวว่า “nano banana” มันชนะบ่อย ผู้คนเริ่มจับตามอง และการคาดเดาว่าใครอยู่เบื้องหลังยืดเยื้ออยู่หลายสัปดาห์ก่อนที่ Google จะยืนยัน
จากนั้น Google ก็ทำสิ่งที่ไม่ปกติ คือคงชื่อเล่นนั้นไว้ นี่จึงเป็นเหตุที่โครงสร้างพื้นฐานจริงจังชิ้นหนึ่งถูกเรียกด้วยชื่อเล่น ส่วนตัวตนอย่างเป็นทางการคือโมเดลภาพในตระกูล Gemini แต่ชื่อที่คนค้นหาคือกล้วย
เรื่องนี้ควรรู้ไว้ เพราะอธิบายได้ว่าทำไมคำนี้ถึงมีพฤติกรรมแปลก ๆ บนการค้นหา ความสนใจเกิดก่อนงานการตลาด คำถามที่คนถามจึงเป็นสไตล์ข่าวลือ — มันคืออะไร ใครทำ มันของจริงไหม — มากกว่าคำถามเชิงสินค้า
จริง ๆ แล้วมันทำต่างจากที่อื่นอย่างไร
ส่วนใหญ่โมเดลภาพถูกออกแบบมาเพื่อสร้างภาพจากคำบรรยาย Nano Banana ถูกออกแบบมาเพื่อเปลี่ยนภาพที่มีอยู่แล้ว และส่วนที่ยากคือทุกอย่างที่ท่านไม่ได้สั่งให้เปลี่ยน
ถ้าขอให้โมเดลเอนกประสงค์เปลี่ยนให้ “คนในภาพนี้ใส่เสื้อโค้ตสีแดง” มักจะได้คนใส่เสื้อโค้ตสีแดงที่หน้าไม่ใช่คนเดิมนัก — กรามต่าง ระยะห่างตาต่าง หน้าที่เหมือนพี่น้อง เอกลักษณ์จะรอดหนึ่งครั้งและเสื่อมลงเมื่อแก้หลายครั้ง Nano Banana ถูกสร้างมาเพื่อยึดเอกลักษณ์นั้นไว้ข้ามคำสั่งต่อเนื่องหลายรอบ
แบบปฏิสัมพันธ์ก็ตามนั้น ท่านไม่ได้เขียน prompt ยาวครั้งเดียวแล้วรับผล แต่สนทนาปรับผลลัพธ์รอบต่อรอบ ขยับแสง ตอนนี้ให้เป็นเวลาเย็น ตอนนี้พาเขาออกไปข้างนอก วงจรนั้นแหละคือผลิตภัณฑ์
เหมาะกับงานอะไรในทางปฏิบัติ
งานที่ต้องให้ตัวแบบเดิมปรากฏหลายครั้ง ถ่ายภาพสินค้าในหลายฉาก ตัวละครเดียวกันตลอดลำดับช่อง ภาพพอร์ตเทรตเวอร์ชันต่าง ๆ หลายแบบ ม็อกอัปที่ต้องแสดงห้องเดียวกันในสี่โทนสี
ยังให้อภัยผู้ใช้ที่ไม่อยากเรียนไวยากรณ์ prompt เป็นพิเศษ เพราะคำสั่งเป็นการแก้ไข ไม่ใช่สเปกใหม่ ประโยคธรรมดาก็ใช้ได้ และเมื่อคำสั่งกว้างเกินไป ผลลัพธ์มักเปลี่ยนเพียงเล็กน้อย แทนที่จะกลายเป็นภาพไม่รู้เรื่อง
จุดที่ไม่ถนัดคือกรณีหน้าเปล่า เมื่อไม่มีภาพต้นทางและไม่มีตัวแบบให้รักษา กลไกรักษาความคงที่ก็ไม่มีงานทำ โมเดลที่สร้างจากข้อความล้วนมักให้การควบคุมกรอบภาพ เลนส์ และสไตล์ได้มากกว่าเมื่อเริ่มจากศูนย์
เมื่อเทียบกับตัวเลือกอื่น
เมื่อเทียบกับ Midjourney เส้นแบ่งคือการกำกับเชิงสุนทรียะ Midjourney มีสไตล์ประจำตัวชัด มักใช้เพื่อสร้างภาพโดดเด่น ส่วน Nano Banana พยายามไม่แตะส่วนที่ท่านไม่ได้สั่ง หนึ่งคือสไตลิสต์ อีกหนึ่งคือรีทัชเชอร์
เมื่อเทียบกับโมเดลเปิด — Stable Diffusion และ FLUX — เส้นแบ่งคือจุดที่การควบคุมอาศัยอยู่ น้ำหนักเปิดทำให้ผู้ใช้ต่อพ่วง ControlNet, LoRA และสายงาน inpainting เพื่อควบคุมละเอียดได้ แต่ต้องประกอบสายงานเอง Nano Banana ซ่อนส่วนควบคุมแคบกว่านั้นไว้หลังประโยคเดียว ถึงได้เร็วกว่าและยากจะผลักให้เกินกรอบ
เมื่อเทียบกับ gpt-image-1 ทั้งสองใกล้กันกว่าที่ใกล้สิ่งอื่น: ปิด, ทำตามคำสั่ง, ขับเคลื่อนด้วยบทสนทนา และผูกกับผู้ช่วยขนาดใหญ่ ความต่างเชิงปฏิบัติที่ผู้ใช้ส่วนมากพบคือใครรักษาใบหน้าได้ดีกว่าข้ามหลายรอบ ซึ่งควรทดสอบกับงานของท่านเองมากกว่าจะเชื่อกระดานจัดอันดับ
เกี่ยวอะไรกับ LaFoto
ไม่เกี่ยวเชิงพาณิชย์ — เราไม่เป็นพันธมิตรกับ Google และไม่รีเซลล์โมเดลของเขา หน้านี้มีอยู่เพราะคนถามว่าสิ่งนี้คืออะไร และคำตอบตามตรงสั้นมาก และสารบบที่อธิบายแค่โมเดลที่เราชอบย่อมไม่ใช่สารบบ
ควรอ่านควบคู่หน้าการแก้ไขบนไซต์นี้ เพราะคำศัพท์ถ่ายโอนกันได้ สิ่งที่ Nano Banana ทำแบบสนทนา ในระบบเปิดทำผ่านเทคนิคมีชื่อ: inpainting สำหรับแก้ในมาสก์, outpainting สำหรับขยายเกินกรอบ, ค่า denoise strength สำหรับกำหนดระยะที่ผลลัพธ์อนุญาตให้ไกลจากต้นฉบับ การรู้คำเหล่านี้ทำให้เข้าใจชัดขึ้นว่าเครื่องมือแก้ไขใดกำลังทำหรือไม่ทำอะไร
การแก้ไขเทียบกับการสร้างภาพ
ปัญหาที่โมเดลนี้ถูกสร้างมาแก้
ขอให้โมเดลภาพแบบครอบจักรวาลแก้รูปคนเพียงอย่างเดียว ก็มักได้คนที่ “คล้ายแต่ไม่ใช่” กรามขยับ ดวงตาวางต่างไป หน้าดูเป็นญาติมากกว่าคนเดิม แก้ครั้งเดียวพอรอด แก้สี่ครั้งติดกันมักหลุดตัวตน
การคง “ตัวตน” ไว้ขณะเปลี่ยนทุกอย่างตามที่สั่งคือโจทย์วิศวกรรมเฉพาะ และนี่คือเป้าของโมเดลนี้ จึงเรียกมันว่าเครื่องมือแก้ไขมากกว่าเครื่องมือสร้าง แม้ทำได้ทั้งคู่

สามงานที่ใช้จริง
เมื่อ “ความคงเส้นคงวาข้ามภาพ” คือข้อกำหนด
วัตถุเดียวกันในหกโลเคชัน
ถ่ายสินค้าครั้งเดียว แล้ววางบนเคาน์เตอร์ครัว โต๊ะคาเฟ่ ม้านั่งกลางแจ้ง และฉากสตูดิโอ โดยยังคงเป็นชิ้นเดียวกันที่จำได้ตลอด
สั่งตัวสร้างภาพให้ทำสินค้าชิ้นเดิมหกครั้ง มักได้สินค้าที่ “คล้ายกันหกชิ้น” นี่แหละคือเหตุผลเชิงพาณิชย์ทั้งหมดของโมเดลแนวแก้ไข
- ถ่ายครั้งเดียว วางได้หลายครั้ง
- วัตถุต้องรอดจากการเปลี่ยนฉาก
- ตรวจฉลากและโลโก้ทุกภาพผลลัพธ์

งานลำดับต่อเนื่องที่ต้องกลมกลืน
คอมิก สตอรีบอร์ด ลำดับภาพอธิบาย และหนังสือเด็ก ล้มตรงจุดเดียวกันคือตัวละครไม่ใช่คนเดิมตั้งแต่เฟรมที่ห้า
กรณีนี้ระบบเปิดแก้ด้วยการเทรน LoRA ส่วนตัวแก้ไขแบบสนทนาพาไปใกล้เคียงกันได้โดยไม่ต้องเทรน แต่ต้องแลกด้วยการควบคุมที่ละเอียดน้อยลง
- ไม่ต้องมีขั้นตอนเทรน
- ยังมีดริฟต์สะสมหากรันยาว
- ย้อนยึดกับภาพต้นฉบับเป็นระยะ

ออกตัวเลือกจากภาพที่มีอยู่แล้ว
พอร์เทรตเดียว ลองหลายแสง หลายฉากหลัง หรือหลายชุด เพื่อให้ลูกค้าเลือก โดยไม่ต้องจองสตูดิโออีก
ข้อจำกัดที่ตรงไปตรงมาคือ ไม่มีอันไหนเป็น “ภาพถ่ายของสิ่งที่เกิดขึ้นจริง” เป็นแค่ทางเลือกที่สมเหตุผล ใช้ได้กับมูดบอร์ด ไม่ใช่บันทึกหลักฐาน
- สำรวจไอเดียได้เร็วกว่าออกกองใหม่
- ไม่ใช่สิ่งทดแทนการถ่ายจริง
- ห้ามใช้กับเอกสารยืนยันตัวตน

คำถามเกี่ยวกับ Nano Banana
สิ่งที่มักถามหลังลองรอบแรก
ประเด็นที่เริ่มโผล่มาหลังความใหม่หมดไป
ทำไมสุดท้ายหน้าถึงยังดริฟต์?
แต่ละการแก้ถูกปรับตามผลลัพธ์ครั้งก่อน ไม่ใช่ภาพต้นฉบับ จึงเกิดการสะสมความคลาดเคลื่อน การป้อนภาพต้นทางกลับเข้าไปทุก ๆ ไม่กี่รอบจะรีเซ็ตจุดอ้างอิงและหยุดการไหลเลื่อนช้า ๆ ได้
ทำผลลัพธ์ซ้ำให้เหมือนเดิมได้หรือไม่?
ไม่เสถียรพอ การแก้ไขแบบสนทนาไม่เปิดเผย seed แบบสายระบบเปิด ซึ่งเป็นข้อแลกระหว่างความเรียบง่ายของอินเทอร์เฟซกับการทำซ้ำเป๊ะ ๆ
ดีกว่า inpainting ไหม?
ง่ายกว่า Inpainting ที่มีหน้ากากระบุพิกเซลชัดเจนให้การควบคุมแบบเป๊ะ ส่วนประโยคคำสั่งปล่อยให้โมเดลตัดสินใจ งานที่ต้องความแม่นยำยังต้องการหน้ากากอยู่ดี
ใช้ภาพอ้างอิงมากกว่าหนึ่งภาพได้ไหม?
การผสมหลายอ้างอิงเป็นคำขอที่พบบ่อย และความรองรับต่างกันตามผิวงานและเวอร์ชัน ทดสอบกับวัสดุของท่านเอง อย่าพึ่งคำอธิบายจากที่อื่น
มันไม่เก่งเรื่องอะไร?
การเริ่มจากศูนย์ เมื่อไม่มีภาพต้นทาง กลไกรักษาความคงเส้นคงวาไม่มีอะไรให้ยึด และโมเดลที่ออกแบบมาเพื่อ text-to-image จะให้การควบคุมมุมมองและออปติกมากกว่า
ใช้กับวัตถุที่ไม่ใช่มนุษย์ได้ไหม?
ได้ และมักเสถียรกว่า—สินค้า หรืออาคารมีองค์ประกอบให้คนจับผิดน้อยกว่าใบหน้ามนุษย์

แนวคิดเดิมในชื่อที่ต่าง
ศัพท์ที่อยู่เบื้องหลังการแก้ไขแบบสนทนา
สำรวจต่อ
หน้าอื่น ๆ บน LaFoto
การแก้ไขคือหนึ่งงาน งานอื่นมีดังนี้
- เครื่องมือปรับขนาดภาพฟรี
- JPG, PNG and WebP
- ตัวบีบอัดภาพ
- ครอปภาพ
- พาเลตต์สีจากภาพ
- ลบฉากหลัง
- ตรวจสอบข้อมูล EXIF
- วางโครงสร้าง prompt
- ตัวสร้างอนิเมะ AI
- ทำภาพให้เป็นการ์ตูน
- ตัวสร้างพิกเซลอาร์ต
- ตัวสร้างภาพ AI ที่ดีที่สุด
- LaFoto เทียบกับ Midjourney
- ทางเลือกแทน Leonardo AI
- เทียบกับ Ideogram
- LaFoto เทียบกับ Canva
- ทำซ้ำภาพเดิม
- denoise strength คืออะไร
- อธิบาย inpainting
- คู่มือและบทอธิบาย
Nano Banana — questions people ask
- Nano Banana คืออะไร
- ชื่อเล่นที่ปัจจุบันใช้อย่างเป็นทางการของโมเดลสร้างและแก้ไขภาพ Gemini จาก Google ออกแบบมาสำหรับการแก้ไขแบบสนทนาที่รักษาตัวแบบให้คงเดิมข้ามการแก้หลายรอบ
- ใครเป็นผู้พัฒนา Nano Banana
- Google เป็นส่วนหนึ่งของตระกูล Gemini
- ทำไมถึงชื่อ Nano Banana
- มันปรากฏตัวแบบไม่เปิดเผยในสนามเปรียบเทียบโมเดลสาธารณะภายใต้ชื่อนั้น ทำผลงานโดดเด่น และชื่อติดปาก Google เลือกรับมาใช้แทนการฝืนเปลี่ยน
- Nano Banana เป็นโอเพนซอร์สไหม
- ไม่ใช่ น้ำหนักโมเดลเป็นแบบปิด และเข้าถึงผ่านแอปและส่วนติดต่อโปรแกรม (API) ของ Google
- Nano Banana ถนัดเรื่องใดที่สุด
- การแก้ไขภาพที่มีอยู่โดยคงตัวแบบให้จดจำได้ — ใบหน้าเดิมข้ามการแก้หลายรอบ ซึ่งโมเดลภาพส่วนใหญ่จะเริ่มหลุดเพียงหลังหนึ่งหรือสองครั้ง
- Nano Banana ดีกว่า Midjourney ไหม
- งานคนละแบบ Midjourney มีสไตล์จัด ใช้สร้างภาพเด่นจากศูนย์ ส่วน Nano Banana พยายามเปลี่ยนเฉพาะที่สั่งและปล่อยให้ส่วนที่เหลือของภาพจริงคงเดิม
- Nano Banana สร้างภาพจากข้อความล้วนได้ไหม
- ได้ แต่ไม่ใช่จุดแข็ง จุดต่างคือการคงตัวแบบผ่านการแก้ไข ซึ่งต้องมีภาพต้นทางให้รักษา
- LaFoto ใช้ Nano Banana ไหม
- ไม่ และเราไม่มีความเกี่ยวพันกับ Google หน้านี้เป็นบทความอ้างอิงในสารบบโมเดลของเรา
เริ่มสร้างวันนี้
สร้างภาพแรกของท่านด้วยตัวสร้างภาพ AI ที่ดีที่สุด
แปลงประโยคเป็นภาพจริงสมจริงในไม่กี่วินาที — แล้วปรับรายละเอียดได้ครบ ไม่ต้องตั้งค่า ไม่ต้องใช้ Discord หรือ GPU
เข้าร่วมกับครีเอเตอร์ 4,200+ คนที่ใช้ LaFoto