ข้ามไปยังเนื้อหา
LaFoto

Google · model directory

Nano Banana คืออะไร? อธิบายโมเดลแก้ไขภาพของ Google

Nano Banana คือชื่อเล่นของโมเดลภาพ Gemini ของ Google ออกแบบมาสำหรับการแก้ไขแบบสนทนาที่รักษาตัวแบบให้คงเดิมแม้แก้หลายครั้ง

Nano Banana คือชื่อเล่นของโมเดลสร้างและแก้ไขภาพของ Gemini จาก Google จุดต่างคือการแก้ไขแบบสนทนา: คุณป้อนภาพ อธิบายการเปลี่ยนแปลงด้วยภาษาธรรมดา แล้วโมเดลจะปรับภาพตามนั้นโดยคงส่วนที่เหลือ — โดยเฉพาะใบหน้าคน — ให้ยังจำได้ว่าเป็นคนเดิม ชื่อนี้เริ่มจากชุมชน ก่อนที่ Google จะรับมาใช้ต่ออย่างเป็นทางการ

Nano Banana at a glance

ผู้พัฒนา
Google
ตระกูล
Gemini
วิธีเข้าถึง
แอป Gemini และส่วนติดต่อโปรแกรม (API)
จุดเด่น
แก้ไขได้โดยคงตัวละครให้เหมือนเดิม
น้ำหนักโมเดล
ปิด
รูปแบบการใช้งาน
เชิงสนทนา

ชื่อมาจากไหน

เดิมไม่ใช่ชื่อสินค้า โมเดลที่ไม่ติดป้ายปรากฏในสนามทดสอบแบบประจันหน้าสาธารณะ ที่ให้ผู้ใช้เปรียบเทียบผลลัพธ์โดยไม่รู้ว่าออกมาจากระบบใด ภายใต้ชื่อชั่วคราวว่า “nano banana” มันชนะบ่อย ผู้คนเริ่มจับตามอง และการคาดเดาว่าใครอยู่เบื้องหลังยืดเยื้ออยู่หลายสัปดาห์ก่อนที่ Google จะยืนยัน

จากนั้น Google ก็ทำสิ่งที่ไม่ปกติ คือคงชื่อเล่นนั้นไว้ นี่จึงเป็นเหตุที่โครงสร้างพื้นฐานจริงจังชิ้นหนึ่งถูกเรียกด้วยชื่อเล่น ส่วนตัวตนอย่างเป็นทางการคือโมเดลภาพในตระกูล Gemini แต่ชื่อที่คนค้นหาคือกล้วย

เรื่องนี้ควรรู้ไว้ เพราะอธิบายได้ว่าทำไมคำนี้ถึงมีพฤติกรรมแปลก ๆ บนการค้นหา ความสนใจเกิดก่อนงานการตลาด คำถามที่คนถามจึงเป็นสไตล์ข่าวลือ — มันคืออะไร ใครทำ มันของจริงไหม — มากกว่าคำถามเชิงสินค้า

จริง ๆ แล้วมันทำต่างจากที่อื่นอย่างไร

ส่วนใหญ่โมเดลภาพถูกออกแบบมาเพื่อสร้างภาพจากคำบรรยาย Nano Banana ถูกออกแบบมาเพื่อเปลี่ยนภาพที่มีอยู่แล้ว และส่วนที่ยากคือทุกอย่างที่ท่านไม่ได้สั่งให้เปลี่ยน

ถ้าขอให้โมเดลเอนกประสงค์เปลี่ยนให้ “คนในภาพนี้ใส่เสื้อโค้ตสีแดง” มักจะได้คนใส่เสื้อโค้ตสีแดงที่หน้าไม่ใช่คนเดิมนัก — กรามต่าง ระยะห่างตาต่าง หน้าที่เหมือนพี่น้อง เอกลักษณ์จะรอดหนึ่งครั้งและเสื่อมลงเมื่อแก้หลายครั้ง Nano Banana ถูกสร้างมาเพื่อยึดเอกลักษณ์นั้นไว้ข้ามคำสั่งต่อเนื่องหลายรอบ

แบบปฏิสัมพันธ์ก็ตามนั้น ท่านไม่ได้เขียน prompt ยาวครั้งเดียวแล้วรับผล แต่สนทนาปรับผลลัพธ์รอบต่อรอบ ขยับแสง ตอนนี้ให้เป็นเวลาเย็น ตอนนี้พาเขาออกไปข้างนอก วงจรนั้นแหละคือผลิตภัณฑ์

เหมาะกับงานอะไรในทางปฏิบัติ

งานที่ต้องให้ตัวแบบเดิมปรากฏหลายครั้ง ถ่ายภาพสินค้าในหลายฉาก ตัวละครเดียวกันตลอดลำดับช่อง ภาพพอร์ตเทรตเวอร์ชันต่าง ๆ หลายแบบ ม็อกอัปที่ต้องแสดงห้องเดียวกันในสี่โทนสี

ยังให้อภัยผู้ใช้ที่ไม่อยากเรียนไวยากรณ์ prompt เป็นพิเศษ เพราะคำสั่งเป็นการแก้ไข ไม่ใช่สเปกใหม่ ประโยคธรรมดาก็ใช้ได้ และเมื่อคำสั่งกว้างเกินไป ผลลัพธ์มักเปลี่ยนเพียงเล็กน้อย แทนที่จะกลายเป็นภาพไม่รู้เรื่อง

จุดที่ไม่ถนัดคือกรณีหน้าเปล่า เมื่อไม่มีภาพต้นทางและไม่มีตัวแบบให้รักษา กลไกรักษาความคงที่ก็ไม่มีงานทำ โมเดลที่สร้างจากข้อความล้วนมักให้การควบคุมกรอบภาพ เลนส์ และสไตล์ได้มากกว่าเมื่อเริ่มจากศูนย์

เมื่อเทียบกับตัวเลือกอื่น

เมื่อเทียบกับ Midjourney เส้นแบ่งคือการกำกับเชิงสุนทรียะ Midjourney มีสไตล์ประจำตัวชัด มักใช้เพื่อสร้างภาพโดดเด่น ส่วน Nano Banana พยายามไม่แตะส่วนที่ท่านไม่ได้สั่ง หนึ่งคือสไตลิสต์ อีกหนึ่งคือรีทัชเชอร์

เมื่อเทียบกับโมเดลเปิด — Stable Diffusion และ FLUX — เส้นแบ่งคือจุดที่การควบคุมอาศัยอยู่ น้ำหนักเปิดทำให้ผู้ใช้ต่อพ่วง ControlNet, LoRA และสายงาน inpainting เพื่อควบคุมละเอียดได้ แต่ต้องประกอบสายงานเอง Nano Banana ซ่อนส่วนควบคุมแคบกว่านั้นไว้หลังประโยคเดียว ถึงได้เร็วกว่าและยากจะผลักให้เกินกรอบ

เมื่อเทียบกับ gpt-image-1 ทั้งสองใกล้กันกว่าที่ใกล้สิ่งอื่น: ปิด, ทำตามคำสั่ง, ขับเคลื่อนด้วยบทสนทนา และผูกกับผู้ช่วยขนาดใหญ่ ความต่างเชิงปฏิบัติที่ผู้ใช้ส่วนมากพบคือใครรักษาใบหน้าได้ดีกว่าข้ามหลายรอบ ซึ่งควรทดสอบกับงานของท่านเองมากกว่าจะเชื่อกระดานจัดอันดับ

เกี่ยวอะไรกับ LaFoto

ไม่เกี่ยวเชิงพาณิชย์ — เราไม่เป็นพันธมิตรกับ Google และไม่รีเซลล์โมเดลของเขา หน้านี้มีอยู่เพราะคนถามว่าสิ่งนี้คืออะไร และคำตอบตามตรงสั้นมาก และสารบบที่อธิบายแค่โมเดลที่เราชอบย่อมไม่ใช่สารบบ

ควรอ่านควบคู่หน้าการแก้ไขบนไซต์นี้ เพราะคำศัพท์ถ่ายโอนกันได้ สิ่งที่ Nano Banana ทำแบบสนทนา ในระบบเปิดทำผ่านเทคนิคมีชื่อ: inpainting สำหรับแก้ในมาสก์, outpainting สำหรับขยายเกินกรอบ, ค่า denoise strength สำหรับกำหนดระยะที่ผลลัพธ์อนุญาตให้ไกลจากต้นฉบับ การรู้คำเหล่านี้ทำให้เข้าใจชัดขึ้นว่าเครื่องมือแก้ไขใดกำลังทำหรือไม่ทำอะไร

การแก้ไขเทียบกับการสร้างภาพ

ปัญหาที่โมเดลนี้ถูกสร้างมาแก้

ขอให้โมเดลภาพแบบครอบจักรวาลแก้รูปคนเพียงอย่างเดียว ก็มักได้คนที่ “คล้ายแต่ไม่ใช่” กรามขยับ ดวงตาวางต่างไป หน้าดูเป็นญาติมากกว่าคนเดิม แก้ครั้งเดียวพอรอด แก้สี่ครั้งติดกันมักหลุดตัวตน

การคง “ตัวตน” ไว้ขณะเปลี่ยนทุกอย่างตามที่สั่งคือโจทย์วิศวกรรมเฉพาะ และนี่คือเป้าของโมเดลนี้ จึงเรียกมันว่าเครื่องมือแก้ไขมากกว่าเครื่องมือสร้าง แม้ทำได้ทั้งคู่

ภาพพอร์ตเทรตเดียวกันพิมพ์สี่ครั้ง โดยแต่ละใบมีแสงต่างกัน

สามงานที่ใช้จริง

เมื่อ “ความคงเส้นคงวาข้ามภาพ” คือข้อกำหนด

วัตถุเดียวกันในหกโลเคชัน

ถ่ายสินค้าครั้งเดียว แล้ววางบนเคาน์เตอร์ครัว โต๊ะคาเฟ่ ม้านั่งกลางแจ้ง และฉากสตูดิโอ โดยยังคงเป็นชิ้นเดียวกันที่จำได้ตลอด

สั่งตัวสร้างภาพให้ทำสินค้าชิ้นเดิมหกครั้ง มักได้สินค้าที่ “คล้ายกันหกชิ้น” นี่แหละคือเหตุผลเชิงพาณิชย์ทั้งหมดของโมเดลแนวแก้ไข

  • ถ่ายครั้งเดียว วางได้หลายครั้ง
  • วัตถุต้องรอดจากการเปลี่ยนฉาก
  • ตรวจฉลากและโลโก้ทุกภาพผลลัพธ์
ฉากสินค้าที่แก้ไขด้วย AI โดยเปลี่ยนฉากหลัง

คำถามเกี่ยวกับ Nano Banana

สิ่งที่มักถามหลังลองรอบแรก

ประเด็นที่เริ่มโผล่มาหลังความใหม่หมดไป

ทำไมสุดท้ายหน้าถึงยังดริฟต์?

แต่ละการแก้ถูกปรับตามผลลัพธ์ครั้งก่อน ไม่ใช่ภาพต้นฉบับ จึงเกิดการสะสมความคลาดเคลื่อน การป้อนภาพต้นทางกลับเข้าไปทุก ๆ ไม่กี่รอบจะรีเซ็ตจุดอ้างอิงและหยุดการไหลเลื่อนช้า ๆ ได้

ทำผลลัพธ์ซ้ำให้เหมือนเดิมได้หรือไม่?

ไม่เสถียรพอ การแก้ไขแบบสนทนาไม่เปิดเผย seed แบบสายระบบเปิด ซึ่งเป็นข้อแลกระหว่างความเรียบง่ายของอินเทอร์เฟซกับการทำซ้ำเป๊ะ ๆ

ดีกว่า inpainting ไหม?

ง่ายกว่า Inpainting ที่มีหน้ากากระบุพิกเซลชัดเจนให้การควบคุมแบบเป๊ะ ส่วนประโยคคำสั่งปล่อยให้โมเดลตัดสินใจ งานที่ต้องความแม่นยำยังต้องการหน้ากากอยู่ดี

ใช้ภาพอ้างอิงมากกว่าหนึ่งภาพได้ไหม?

การผสมหลายอ้างอิงเป็นคำขอที่พบบ่อย และความรองรับต่างกันตามผิวงานและเวอร์ชัน ทดสอบกับวัสดุของท่านเอง อย่าพึ่งคำอธิบายจากที่อื่น

มันไม่เก่งเรื่องอะไร?

การเริ่มจากศูนย์ เมื่อไม่มีภาพต้นทาง กลไกรักษาความคงเส้นคงวาไม่มีอะไรให้ยึด และโมเดลที่ออกแบบมาเพื่อ text-to-image จะให้การควบคุมมุมมองและออปติกมากกว่า

ใช้กับวัตถุที่ไม่ใช่มนุษย์ได้ไหม?

ได้ และมักเสถียรกว่า—สินค้า หรืออาคารมีองค์ประกอบให้คนจับผิดน้อยกว่าใบหน้ามนุษย์

พอร์ตเทรตสตูดิโอที่สร้างด้วยเอไอ แสงนุ่มโอบล้อม

สำรวจต่อ

หน้าอื่น ๆ บน LaFoto

การแก้ไขคือหนึ่งงาน งานอื่นมีดังนี้

เครื่องมือสร้างภาพหลักตัวสร้างหลัก — จากข้อความสู่ภาพพร้อมใช้เปิดภาพ 120 ภาพพร้อม prompt ที่ใช้ภาพตัวอย่าง 120 ภาพ พร้อม prompt ที่ใช้จริงแบบคำต่อคำเปิดแปลงภาพที่มีอยู่เริ่มจากภาพที่ท่านมีอยู่แล้วเปิดการแก้ไขภาพด้วย AIเปลี่ยนบางส่วนของภาพ ส่วนที่เหลือคงเดิมเปิดตัวขยายความละเอียดภาพ AIขยายถึง 4K โดยไม่เละเป็นปื้นเปิดตัวปรับคุณภาพภาพถ่าย AIแก้แสง เก็บนอยซ์ และกู้ภาพเก่าเปิดลบสิ่งไม่ต้องการออกจากภาพลบแบบมาสก์ พร้อมต่อเติมฉากหลังให้ครบเปิดเบลอฉากหลังของภาพรู้เชิงระยะลึก ไม่ใช่ฟิลเตอร์ทึบเท่า ๆ กันเปิดเติมสีให้ภาพเก่าลงสีภาพขาวดำให้สมจริงน่าเชื่อเปิดสร้างตราสัญลักษณ์โลโก้ที่ยังอ่านออกแม้ 16 พิกเซลเปิดตัวสร้างรอยสัก AIลายที่ยังดูดีเมื่อลงเข็มจริงเปิดสร้างภาพประกอบงานศิลปะและภาพวาด ไม่ใช่ภาพถ่ายเปิดตัวสร้างภาพเฮดช็อต AIพอร์เทรตระดับสตูดิโอโดยไม่ต้องเข้าสตูดิโอเปิดรูปถ่ายพาสปอร์ตสเปคที่ต้องเป๊ะ และวิธีทำให้ผ่านเปิดออกแบบภายในด้วย AIปรับสไตล์ห้องจากภาพถ่ายของท่านเปิดอภิธานศัพท์seed, denoise, inpainting อธิบายให้เข้าใจเปิด

Nano Banana — questions people ask

Nano Banana คืออะไร
ชื่อเล่นที่ปัจจุบันใช้อย่างเป็นทางการของโมเดลสร้างและแก้ไขภาพ Gemini จาก Google ออกแบบมาสำหรับการแก้ไขแบบสนทนาที่รักษาตัวแบบให้คงเดิมข้ามการแก้หลายรอบ
ใครเป็นผู้พัฒนา Nano Banana
Google เป็นส่วนหนึ่งของตระกูล Gemini
ทำไมถึงชื่อ Nano Banana
มันปรากฏตัวแบบไม่เปิดเผยในสนามเปรียบเทียบโมเดลสาธารณะภายใต้ชื่อนั้น ทำผลงานโดดเด่น และชื่อติดปาก Google เลือกรับมาใช้แทนการฝืนเปลี่ยน
Nano Banana เป็นโอเพนซอร์สไหม
ไม่ใช่ น้ำหนักโมเดลเป็นแบบปิด และเข้าถึงผ่านแอปและส่วนติดต่อโปรแกรม (API) ของ Google
Nano Banana ถนัดเรื่องใดที่สุด
การแก้ไขภาพที่มีอยู่โดยคงตัวแบบให้จดจำได้ — ใบหน้าเดิมข้ามการแก้หลายรอบ ซึ่งโมเดลภาพส่วนใหญ่จะเริ่มหลุดเพียงหลังหนึ่งหรือสองครั้ง
Nano Banana ดีกว่า Midjourney ไหม
งานคนละแบบ Midjourney มีสไตล์จัด ใช้สร้างภาพเด่นจากศูนย์ ส่วน Nano Banana พยายามเปลี่ยนเฉพาะที่สั่งและปล่อยให้ส่วนที่เหลือของภาพจริงคงเดิม
Nano Banana สร้างภาพจากข้อความล้วนได้ไหม
ได้ แต่ไม่ใช่จุดแข็ง จุดต่างคือการคงตัวแบบผ่านการแก้ไข ซึ่งต้องมีภาพต้นทางให้รักษา
LaFoto ใช้ Nano Banana ไหม
ไม่ และเราไม่มีความเกี่ยวพันกับ Google หน้านี้เป็นบทความอ้างอิงในสารบบโมเดลของเรา

เริ่มสร้างวันนี้

สร้างภาพแรกของท่านด้วยตัวสร้างภาพ AI ที่ดีที่สุด

แปลงประโยคเป็นภาพจริงสมจริงในไม่กี่วินาที — แล้วปรับรายละเอียดได้ครบ ไม่ต้องตั้งค่า ไม่ต้องใช้ Discord หรือ GPU

เข้าร่วมกับครีเอเตอร์ 4,200+ คนที่ใช้ LaFoto