ข้ามไปยังเนื้อหา
LaFoto

OpenAI · model directory

gpt-image-1 คืออะไร — อธิบายโมเดลภาพของ OpenAI

gpt-image-1 คือโมเดลภาพของ OpenAI ให้ใช้ผ่าน API และอยู่เบื้องหลังการสร้างภาพใน ChatGPT จุดเด่นคือทำตาม prompt ที่ซับซ้อนได้ดี

gpt-image-1 คือโมเดลสร้างภาพของ OpenAI ให้ใช้งานผ่าน API และใช้สร้างภาพภายใน ChatGPT จุดแข็งคือการทำตามคำสั่ง เพราะมันทำงานเคียงกับโมเดลภาษาที่อ่านความต้องการของคุณจริง ๆ จึงรับมือกับ prompt ที่ยาว ซับซ้อน และมีเงื่อนไข ได้ดีกว่าโมเดลที่มอง prompt เป็นเพียงถุงคำหลักเชิงภาพ

gpt-image-1 at a glance

ผู้พัฒนา
OpenAI
วิธีเข้าถึง
API และ ChatGPT
น้ำหนักโมเดล
ปิด
จุดเด่น
การทำตามคำสั่ง
การแสดงข้อความในภาพ
ดีมาก
รุ่นก่อนหน้า
ตระกูล DALL·E

เหตุใดการวางคู่กับโมเดลภาษาจึงเปลี่ยนพฤติกรรม

สายพาน diffusion แบบดั้งเดนจะเข้ารหัส prompt เป็นเวกเตอร์แล้วใช้เป็นเงื่อนไขในการสร้างภาพ วิธีนี้ใช้ได้ผล แต่มีรูปแบบการเสื่อมเฉพาะตัว: prompt ที่ยาวจะเละ เบิ้ลปฏิเสธมักถูกเพิกเฉย และความสัมพันธ์ระหว่างวัตถุ — อยู่ด้านหลัง กำลังถือ แทนที่ — ถูกบังคับใช้อ่อนไป

เมื่อเครื่องสร้างภาพทำงานคู่กับโมเดลที่อ่านประโยคจริง ๆ เคสเหล่านี้จะดีขึ้น ขอภาพที่มีองค์ประกอบเฉพาะ 3 อย่าง โดยตั้งใจตัดสิ่งหนึ่งออก โอกาสได้ตามนั้นจะสูงขึ้น เพราะบางส่วนในสายพานเข้าใจคำว่า "without"

ความต่างเชิงปฏิบัติจะเห็นชัดกับคำขอที่ซับซ้อน prompt ง่าย ๆ ให้ผลคล้ายกันเกือบทุกโมเดลในหน้านี้ ช่องว่างจะเปิดกว้างเมื่อมีเงื่อนไขปะปนอยู่

การใส่ข้อความในภาพ และสิ่งที่มันปลดล็อก

สายโมเดลนี้ติดกลุ่มที่ใส่คำอ่านได้ชัดในภาพ จึงเกิดคลื่นของอินโฟกราฟิกที่สร้างด้วยเครื่อง โฆษณาจำลอง มีมพร้อมคำบรรยาย และภาพเชิงไดอะแกรมที่เข้าสู่การใช้งานทั่วไป ไม่ใช่เฉพาะกลุ่มผู้เชี่ยวชาญ

ควรเข้าใจเพดานให้ชัด ตัวอักษรสั้น ๆ เชื่อถือได้ ข้อความยาวจะเสื่อม และยังไม่มีโมเดลภาพใดแทนการจัดตัวอักษรจริงในเครื่องมือจริงได้ — ข้อความที่สร้างแล้วแก้ไข ตรวจตัวสะกด แปล หรือเปลี่ยนสไตล์ภายหลังไม่ได้ หากไม่สร้างภาพใหม่ทั้งใบ

เทคนิคที่ถูกต้องเหมือนกับกรณี FLUX: สร้างภาพ แล้วค่อยใส่คำให้ถูกวิธี หัวเรื่องที่สร้างด้วยเครื่องคือ mock-up ของหัวเรื่องเท่านั้น

การเข้าถึง และข้อจำกัดที่ตามมา

มีให้ใช้ผ่าน API และภายใน ChatGPT น้ำหนักโมเดลเป็นแบบปิด ไม่มีตัวเลือกใช้งานบนเครื่อง และการสร้างคิดตามปริมาณ

นโยบายเนื้อหาบังคับใช้ตั้งแต่ขั้นสร้างภาพ เข้มงวดกว่า pipeline เปิดส่วนใหญ่ และบางครั้งปฏิเสธคำขอที่เป็นกลาง ผลคือเป็นแรงเสียดทานจริงต่อบางงานที่ชอบธรรม และเป็นการป้องกันจริงในบางกรณี — จะเป็นอย่างใดขึ้นกับสิ่งที่ท่านพยายามสร้าง

สำหรับผู้พัฒนาผลิตภัณฑ์บนโมเดลนี้ ชุดเงื่อนไขที่ต้องวางแผนรับมือคือ: คิดตามปริมาณ มีตัวกรองนโยบาย แบบปิด และอาจเปลี่ยนแปลงตามตารางของผู้ให้บริการ ซึ่งเป็นข้อจำกัดเดียวกับโมเดลปิดที่โฮสต์ให้ใช้ทุกตัว

เปรียบเทียบกับโมเดลอื่นในหน้านี้

เมื่อเทียบกับ Nano Banana นับว่าใกล้เคียงที่สุดทั้งคู่เป็นแบบปิด ทำงานคู่ผู้ช่วยขนาดใหญ่ และขับเคลื่อนแบบสนทนา ความต่างที่ผู้ใช้รายงานอยู่ที่ความสม่ำเสมอของการแก้ไข และลักษณะเฉพาะของผลลัพธ์มากกว่าความต่างเชิงชนิด

เมื่อเทียบกับ Midjourney โมเดลนี้ตีความคำสั่งตามตัวอักษรมากกว่า ความงามเริ่มต้นอ่อนกว่า แต่จัดการคำสั่งเฉพาะเจาะจงได้ดีกว่า เมื่อเทียบกับ FLUX และ Stable Diffusion เส้นแบ่งอยู่ที่การควบคุมและความเป็นเจ้าของ — สองตัวนั้นโฮสต์เองได้ แต่ตัวนี้ทำไม่ได้

หมายเหตุเรื่องชื่อ DALL·E

ผู้คนยังค้นหาด้วยคำว่า DALL·E และบทความออนไลน์จำนวนมากที่พูดถึงการสร้างภาพของ OpenAI ก็อ้างถึงสายนี้ มันคือเชื้อสายเดียวกัน ไม่ใช่ผลิตภัณฑ์คนละชุด คำแนะนำเชิงปฏิบัติเรื่องการเขียน prompt ที่เคยใช้กับ DALL·E จึงยังใช้ได้มาก

เราแยกทำตารางเทียบ LaFoto กับ DALL·E ไว้ต่างหาก ซึ่งลงลึกกว่านี้ว่ากรณีใดใครเหมาะกว่า มากกว่าที่หน้ารวมจะทำได้อย่างเหมาะสม

อ่านประโยคได้

เมื่อมีภาษาอยู่ในลูป อะไรที่เปลี่ยนไป

ไปป์ไลน์ diffusion แบบคลาสสิกจะเข้ารหัส prompt ของท่านเป็นเวกเตอร์แล้วใช้เป็นเงื่อนไข ผลที่ตามมามีลักษณะเฉพาะ: prompt ยาวจะพร่า ข้อปฏิเสธถูกละเลย และความสัมพันธ์ระหว่างวัตถุถูกยึดโยงได้หลวม ๆ.

เมื่อเครื่องสร้างภาพทำงานคู่กับตัวที่ “อ่าน” ประโยคเข้าใจจริง ๆ เคสเหล่านี้ดีขึ้น ขอฉากที่ต้องไม่มีองค์ประกอบหนึ่งตั้งใจไว้ โอกาสได้ตามนั้นสูงขึ้นมาก เพราะมีบางอย่างเข้าใจคำว่า "without" อยู่จริง ๆ.

ย่อหน้าที่พิมพ์ดีดข้างภาพพิมพ์ภาพถ่ายบนโต๊ะสีอ่อน

สามแบบที่การจับคู่โผล่ออกมา

จุดต่างคือความสามารถทำตามคำสั่ง

Prompts ที่มีเงื่อนไขในตัว

มีองค์ประกอบหลายชิ้นที่กำหนดไว้ พร้อมความสัมพันธ์ที่บรรยายชัด และมีสิ่งที่ตั้งใจตัดออก เคสนี้ไปป์ไลน์ง่ายกว่าจะบีบประโยคของท่านให้เหลือคีย์เวิร์ดแล้วทำโครงสร้างหายไป.

Prompt ง่าย ๆ ให้ผลคล้ายกันแทบทุกโมเดลในไดเรกทอรีนี้ ช่องว่างจะอ้าออกในงานที่มีตรรกะอยู่ในนั้น.

  • ข้อปฏิเสธยังอยู่ในภาพ.
  • ความสัมพันธ์เชิงพื้นที่คงตัวกว่า.
  • Prompt ยาวเสื่อมน้อยลง.
คอมโพสิชันเชิงบรรณาธิการสร้างด้วย AI

คำถามเกี่ยวกับ gpt-image-1

ข้อจำกัดเชิงปฏิบัติ

สิ่งที่ควรวางแผนไว้หากท่านจะต่อยอดบนรุ่นนี้.

ทำไม prompt ของข้าพเจ้าถูกปฏิเสธ?

นโยบายเนื้อหาถูกใช้ตอนสร้างภาพและเอนเอียงไปทางระมัดระวัง จึงปฏิเสธคำขอบางอย่างที่ไม่เป็นอันตรายได้ นี่คือข้อแลกเปลี่ยนของไปป์ไลน์ที่กรองแล้ว.

นี่คืออย่างเดียวกับ DALL·E ไหม?

เป็นการสานต่อสายผลิตภัณฑ์นั้น ไม่ใช่คนละตัว จึงยังใช้คำแนะนำการเขียน prompt รุ่นเก่าได้เป็นส่วนใหญ่.

ปักหมุดเวอร์ชันได้ไหม?

ไม่ได้แบบที่ self-hosting ทำได้ เช่นเดียวกับโมเดลปิดที่โฮสต์ทั้งหมดที่นี่ กำหนดการเปลี่ยนแปลงขึ้นกับผู้ให้บริการ ไม่ใช่ของท่าน.

เทียบกับ Nano Banana อย่างไร?

เป็นคู่ที่ใกล้ที่สุดในไดเรกทอรี — ทั้งคู่ปิด ทั้งคู่พ่วงผู้ช่วย ทั้งคู่คุยโต้ตอบ ต่างรายงานกันที่ความสม่ำเสมอในการแก้ไขและคาแรกเตอร์ของเอาต์พุต มากกว่าคนละประเภท.

ทำภาพเหมือนจริงเก่งไหม?

ทำได้ดีแต่ไม่ใช่จ่าฝูง จุดเด่นคือเข้าใจสิ่งที่ท่านขอ มากกว่าความละเอียดช่วงท้าย ๆ ของคุณภาพภาพถ่าย.

ใช้เชิงพาณิชย์ได้ไหม?

โดยทั่วไปได้ภายใต้เงื่อนไขของผู้ให้บริการ ซึ่งเป็นข้อได้เปรียบจริงของโมเดลปิดแบบโฮสต์ เทียบกับใบอนุญาตน้ำหนักเปิดบางแบบ โปรดอ่านเงื่อนไขปัจจุบัน แทนการพึ่งสรุปความ.

ภาพถ่ายสินค้าที่สร้างด้วยเอไอ บนฉากโค้งขาว

สำรวจต่อ

อย่างอื่นบน LaFoto

ได้ภาพมาแล้ว จะเอาไปทำอะไรต่อ.

สร้างจากข้อความบรรยายตัวหลัก — จากข้อความสู่ภาพสำเร็จ.เปิดภาพ 120 ภาพพร้อม prompt ที่ใช้120 ภาพพร้อม prompt ที่ใช้จริงทุกคำ.เปิดเริ่มจากภาพถ่ายเริ่มจากภาพที่ท่านมีอยู่แล้ว.เปิดการแก้ไขภาพด้วย AIแก้บางส่วนของภาพ ที่เหลือคงเดิม.เปิดอัปสเกลเป็น 4Kขยายถึง 4K โดยไม่เลอะเทอะ.เปิดตัวปรับคุณภาพภาพถ่าย AIชดเชยแสง ลดนอยส์ และกู้ภาพเก่า.เปิดลบวัตถุลบด้วยมาสก์แล้วสร้างฉากหลังคืน.เปิดเบลอแบบรับรู้ความลึกรู้เชิงลึก ไม่ใช่ฟิลเตอร์เรียบ ๆ.เปิดลงสีภาพขาวดำลงสีสมจริงให้ภาพขาวดำ.เปิดสร้างโลโก้โลโก้อ่านออกแม้ที่ 16 พิกเซล.เปิดแบบรอยสักแฟลชลายที่ยังอ่านลายเมื่อกลายเป็นรอยสัก.เปิดตัวสร้างงานศิลปะ AIภาพวาดและงานเพนต์ ไม่ใช่ภาพถ่าย.เปิดตัวสร้างภาพเฮดช็อต AIภาพพอร์ตเทรตเกรดสตูดิโอโดยไม่ต้องมีสตูดิโอ.เปิดสเปกรูปถ่ายสเปกเป๊ะ และวิธีทำให้ผ่าน.เปิดภาพจำลองงานออกแบบภายในเปลี่ยนสไตล์ห้องที่ท่านถ่ายเองได้.เปิดอภิธานศัพท์อธิบาย seed, denoise, inpainting.เปิด

gpt-image-1 — questions people ask

gpt-image-1 คืออะไร
โมเดลสร้างภาพของ OpenAI ให้ใช้ผ่าน API และใช้สร้างภาพภายใน ChatGPT
gpt-image-1 คือ DALL·E ตัวเดียวกันหรือไม่
เป็นการสานต่อสายเดียวกัน ไม่ใช่ผลิตภัณฑ์คนละตัว คำแนะนำการเขียน prompt สำหรับ DALL·E ส่วนมากยังใช้ได้
ฉันรัน gpt-image-1 บนเครื่องได้ไหม
ไม่ได้ น้ำหนักโมเดลเป็นแบบปิด และเข้าถึงผ่าน API หรือผลิตภัณฑ์ของ OpenAI เท่านั้น
เหตุใดจึงเก่งกับ prompt ที่ซับซ้อนกว่า
เพราะทำงานเคียงกับโมเดลภาษาที่แยกวิเคราะห์ประโยคจริง ๆ การปฏิเสธ เงื่อนไข และความสัมพันธ์ระหว่างวัตถุจึงคงอยู่ในภาพ แทนที่จะถูกแบนเป็นเพียงคีย์เวิร์ดภาพ
gpt-image-1 ใส่ข้อความในภาพได้หรือไม่
ข้อความสั้น ๆ ทำได้เชื่อถือพอจะออกแบบรอบ ๆ ได้ ข้อความยาวจะเสื่อม และข้อความที่สร้างแล้วแก้ไขหรือตรวจตัวสะกดภายหลังไม่ได้ หากไม่สร้างภาพใหม่
gpt-image-1 ฟรีไหม
การใช้งาน API คิดตามปริมาณ การเข้าถึงผ่าน ChatGPT ขึ้นอยู่กับแพ็กเกจที่ท่านใช้อยู่
เหตุใด prompt ของฉันจึงถูกปฏิเสธ
นโยบายเนื้อหาบังคับใช้ตั้งแต่ขั้นสร้างภาพ และเข้มงวดกว่า pipeline เปิดส่วนใหญ่ จึงอาจปฏิเสธคำขอที่เป็นกลางบ้างจากการเผื่อความระมัดระวังไว้ก่อน
gpt-image-1 ดีกว่า Midjourney หรือไม่
มันทำตามคำสั่งตามตัวอักษรมากกว่า แต่ความงามเริ่มต้นอ่อนกว่า ว่าดีกว่าหรือไม่ขึ้นอยู่กับว่าท่านต้องการผลตรงตามที่ขอ หรืออยากได้ความเซอร์ไพรส์

เริ่มสร้างวันนี้

สร้างภาพแรกของท่านด้วยตัวสร้างภาพ AI ที่ดีที่สุด

แปลงประโยคเป็นภาพจริงสมจริงในไม่กี่วินาที — แล้วปรับรายละเอียดได้ครบ ไม่ต้องตั้งค่า ไม่ต้องใช้ Discord หรือ GPU

เข้าร่วมกับครีเอเตอร์ 4,200+ คนที่ใช้ LaFoto