شرکت OpenAI از ابزار تولید تصویر ChatGPT Images 2.5 رونمایی کرد؛ بررسی عملکرد و مقایسه با Google Nano Banana 2
شرکت OpenAI بهتازگی ابزار تولید تصویر ChatGPT Images 2.5 را با قابلیتهای جدید برای تمامی کاربران منتشر کرده است. در این بررسی، امکانات این نسخه و عملکرد آن در مقایسه با رقیب اصلی خود یعنی Google Gemini بررسی میشود.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- عرضه عمومی ابزار ChatGPT Images 2.5 با قابلیتهای هوشمندتر، ابزارهای ویرایش دقیقتر و امکان تبدیل طرحهای اولیه به تصاویر کامل.
- عملکرد موفقیتآمیز و واقعگرایانهتر ChatGPT Images 2.5 در تولید تصاویر نسبت به مدل Nano Banana 2 شرکت Google.
- افزوده شدن ابزار کاربردی Sketch در ChatGPT برای تبدیل طرحهای ساده به تصاویر باکیفیت و ویرایشهای دقیق و سریع.
در میان هیاهوی سایر اتفاقات مرتبط با هوش مصنوعی، OpenAI ابزار تولید تصویر ChatGPT Images 2.5 را منتشر کرده است که بنا بر اعلام این شرکت، سریعتر، واضحتر و هوشمندتر شده و «ابزارهای بهتری برای خلق هرآنچه در سر میپرورانید» ارائه میدهد. این ابزارهای جدید شامل قالبها، قابلیتهای ویرایشی دقیقتر و روشی برای تبدیل طرحهای کشیدهشده روی صفحه به تصاویر کامل و واقعگرایانه است.
این توییت در حال حاضر در دسترس نیست. ممکن است در حال بارگذاری باشد یا حذف شده باشد.
آیا این قابلیتها به این معناست که ChatGPT Images 2.5 میتواند پایانی بر تصاویر بیکیفیت تولیدشده با هوش مصنوعی برای منوها و پوسترهای تبلیغاتی باشد؟ آیا این ابزار میتواند جایگزین ویرایشگرهای سنتی عکس شود؟ و عملکرد آن در مقایسه با بهروزرسانی چشمگیر Nano Banana 2 که Google در ماه فوریه منتشر کرد، چگونه است؟
برای پاسخ به این پرسشها، ابزار جدید تولید تصویر در ChatGPT مورد بررسی قرار گرفت تا قابلیتهای آن ارزیابی شود. این نسخه در حال حاضر برای تمامی کاربران در نسخههای وب، دسکتاپ و موبایل در حال انتشار است؛ هرچند مانند همیشه، محدودیتهای استفاده مختلفی برای هر طرح اشتراکی وجود دارد (که ChatGPT تنها به صورت مبهم به آنها اشاره کرده است).
مقایسه تصاویر غذا در ChatGPT Images 2.5 و Gemini Nano Banana 2

تصاویر ChatGPT Images 2.5 در سمت چپ؛ Gemini Nano Banana 2 در سمت راست.
یکنواختی و ظاهر غیرطبیعی غذاهای تولیدشده با هوش مصنوعی روی تابلوها و منوهای رستورانها به یک مسئله جدی تبدیل شده است، بنابراین این موضوع نقطه شروع مناسبی به نظر میرسد. باید پذیرفت که تصاویر تبلیغاتی غذاها همیشه با کمی اغراق هنری همراه بودهاند، اما هوش مصنوعی این مشکل را تشدید کرده است. آیا ChatGPT Images 2.5 میتواند به بهبود این وضعیت کمک کند؟
در بررسیهای انجامشده، این پرامپت آزمایش شد: «یک تصویر با نسبت ابعاد ۱:۱ ایجاد کن که شامل چهار مربع برای نمایشگر یک رستوران فستفود باشد. این تصاویر باید (از بالا به پایین، چپ به راست) شامل یک چیزبرگر، شش قطعه ناگت، یک بسته سیبزمینی سرخکرده و یک نوشابه کوکاکولا باشند. تصاویر را تا حد امکان واقعگرایانه با نورپردازی طبیعی طراحی کن، اما تنوع و نقصهایی به آنها اضافه کن تا حس غذای واقعی را القا کنند.»
تصویر تولیدشده توسط ChatGPT در سمت چپ و تصویر Gemini در سمت راست قرار دارد. هر دو مدل در تولید اقلام منو با ظاهری واقعگرایانه و اشتهاآور عملکرد قابلقبولی داشتند، اگرچه تمایل همیشگی هوش مصنوعی به ایجاد تصاویری کلیشهای همچنان دیده میشود. بررسیها نشان میدهد تصاویر ChatGPT کمی بیشتر شبیه به غذای واقعی به نظر میرسند، در حالی که Gemini در زمینه پسزمینه و نمای کلی بهتر عمل کرده است (هرچند لوگوی برگر کینگ ممکن است مشکلساز شود).
مقایسه ابزار Sketch در ChatGPT Images 2.5 با Google Nano Banana 2

از چپ: خلاقیت انسانی، ChatGPT، Gemini.
یکی از قابلیتهای کلیدی جدید در ChatGPT Images 2.5 ابزار Sketch است که اجازه میدهد طرحهای اولیه به تصاویر کامل تبدیل شوند. با کلیک یا لمس دکمه + در کادر پرامپت میتوان به این ابزار دسترسی پیدا کرد (در نسخه موبایل باید گزینه Plugins از منوی بازشده انتخاب شود).
این ابزار امکان کار با رنگها، اشکال و متن را فراهم میکند و در نهایت میتوان یک پرامپت متنی به آن اضافه کرد. در این بررسی از این پرامپت استفاده شد: «این طرح را به تصویری شبیه به تصویرسازی کتابهای باکیفیت کودکان، همراه با ستارگان و سیارات دوردست تبدیل کن.»
اگرچه Gemini ابزار مشخصی به نام Sketch ندارد، اما افزودن یک تصویر به عنوان منبع الهام به پرامپت کار سادهای است. هوش مصنوعی Google رویکردی سنتیتر در تصویرسازی پیش گرفت و یک فضانورد بیگانه را به تصویر اضافه کرد، در حالی که ChatGPT کمی واقعگرایی بیشتری به خرج داد. هر دو ابزار عملکرد مناسبی داشتند، اما در این بخش، خروجی Gemini انتخاب بهتری به نظر میرسد.
ابزارهای ویرایشی دقیقتر در ChatGPT Image 2.5

ویرایش حرفهای تصاویر کلبه جنگلی توسط هر دو مدل (ChatGPT در سمت چپ، Gemini در سمت راست).
با توجه به تاکید OpenAI بر دقت بهبودیافته در ویرایش با ChatGPT Images 2.5، این قابلیت با پرامپت زیر آزمایش شد: «یک تصویر واقعگرایانه از یک کلبه در اعماق جنگل، در فضای باز اختصاصی خود و احاطهشده با درختان ایجاد کن. زمان تصویر اوایل صبح است و نور خورشید از میان برگها میتابد، در حالی که کلبه ظاهری مدرن و دلپذیر دارد.»
با کلیک روی تصویر تولیدشده در ChatGPT، میتوان نظراتی درباره جنبههای خاص تصویر ثبت کرد، بخشهایی را برای تغییر علامتگذاری نمود و به سرعت قسمتهایی از تصویر یا کل پسزمینه را پاک کرد. در این بررسی، درخواست حذف برخی از مبلمان کلبه و تغییر زمان از اوایل صبح به غروب ثبت شد. این هوش مصنوعی درخواست را با مهارت کامل انجام داد و تنظیم مجدد سایهها نیز یک جزئیات هوشمندانه به شمار میرود.
هنگام کلیک روی یک تصویر در Gemini، مجموعه سادهتری از ابزارهای ویرایشی ارائه میشود، اما اصول اولیه یکسان است: استفاده از نظرات متنی یا حاشیهنویسیها برای مشخص کردن تغییرات. بار دیگر درخواست حذف برخی از صندلیهای کلبه (احتمالاً دادههای آموزشی مدلهای هوش مصنوعی پر از تصویر صندلی است) و تغییر زمان به غروب ثبت شد. Gemini نیز عملکرد خوبی داشت، اما در نهایت خروجی ChatGPT ظاهر طبیعیتری داشت و کمتر مصنوعی به نظر میرسید.
عملکرد مطلوب هر دو ابزار ChatGPT Images 2.5 و Google Nano Banana 2

هر دو مدل هوش مصنوعی به خوبی از فضای بلید رانر الهام گرفتهاند (ChatGPT در سمت چپ، Gemini در سمت راست).
این دو ربات هوش مصنوعی در زمینه تولید تصویر عملکرد بسیار نزدیکی دارند. Gemini ابزار قدرتمندی است و مدل Nano Banana 2 تقریباً در هر زمینهای عالی عمل میکند، اما به نظر میرسد در حال حاضر ChatGPT Images 2.5 برتری جزئی دارد؛ بهویژه اگر ویژگیهای اضافی برای طراحی اولیه و ذخیره پرامپتها به عنوان قالب را در نظر بگیریم.
بحث درباره زمان و دلیل استفاده از این ابزارها همچنان ادامه دارد. صرفنظر از میزان پیشرفت هوش مصنوعی در تولید تصویر، هنر انسانی و عکاسی واقعی همیشه ارزش بیشتری خواهند داشت. یک جنگل واقعی همیشه زیباتر از تصویری شبیهسازیشده توسط هوش مصنوعی است. با این حال، برای ایدهپردازی و تصویرسازی در مواقعی که امکان استخدام هنرمند یا داشتن مهارتهای طراحی وجود ندارد، هم Gemini و هم ChatGPT در بالاترین سطح خود قرار دارند.
در مقطع کنونی، ابزارهای ویرایشی بیشترین کاربرد را دارند: تغییراتی در تصاویر که پیش از این برای متخصصان ساعتها زمان میبرد، اکنون توسط هر فردی در چند ثانیه قابل انجام است و این قابلیتها در آینده قطعا پیشرفت خواهند کرد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.