پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار جدید گوگل در ویرایش تصویر: نانو بنانا ۲.۱ با قیمت اقتصادی نسخه پرو را شکست داد!

انتشار:۱۵ مهر ۱۴۰۵(۲ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

گوگل از نسخه جدید مدل تولید و ویرایش تصویر خود با نام نانو بنانا ۲.۱ (Nano Banana 2.1) رونمایی کرد؛ مدلی که با وجود حفظ سرعت بالا و قیمت اقتصادی سری فلش، در آزمون‌های کلیدی نسخه گران‌قیمت پرو را پشت سر گذاشته است. این به‌روزرسانی با ارتقای چشمگیر ثبات کاراکترها و افزودن سطوح تفکر، دست توسعه‌دهندگان را برای خلق تصاویر باکیفیت و ویرایش‌های دقیق باز می‌گذارد.

شاهکار جدید گوگل در ویرایش تصویر: نانو بنانا ۲.۱ با قیمت اقتصادی نسخه پرو را شکست داد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • گوگل با معرفی نانو بنانا ۲.۱ (Nano Banana 2.1) کیفیت ویرایش تصویر را به شکل چشمگیری ارتقا داده، در حالی که قیمت و سرعت آن دقیقاً در حد مدل‌های اقتصادی سری فلش (Flash) حفظ شده است.
  • در بنچمارک‌های داخلی گوگل و رقابت‌های امتیازی Elo، این مدل جدید به‌ویژه هنگام فعال بودن قابلیت تفکر (Thinking)، در ترجیح کلی کاربران و ثبات شخصیت‌ها نسخه قدرتمند پرو را پشت سر گذاشته است.
  • این مدل تا ۱۴ تصویر رفرنس، رزولوشن‌های ۲K و ۴K و ورودی‌های چندرسانه‌ای را پشتیبانی می‌کند و دسترسی به آن از طریق API و پلتفرم‌های ابری گوگل آغاز شده است.

گوگل مدعی شد: نانو بنانا ۲.۱ در آزمون‌های کلیدی ادیت تصویر، نسخه پرو را پشت سر گذاشته است

گوگل به‌تازگی از نانو بنانا ۲.۱ (Nano Banana 2.1) رونمایی کرده است؛ یک به‌روزرسانی متمرکز برای مدل تصویرسازی این شرکت که روی سرعت بالا و هزینه اقتصادی بهینه‌سازی شده است. دسترسی به این مدل از طریق API با شناسه gemini-nano-banana-2.1 فراهم شده و انتشار گسترده‌تر آن در سراسر سرویس‌های توسعه‌دهندگان و محصولات کاربری گوگل در جریان است.

گوگل این نسخه را یک ارتقای کیفی بزرگ می‌داند که سرعت پردازش و تعرفه اقتصادی مدل‌های سری فلش (Flash) در نانو بنانا ۲ را حفظ کرده است. مدل نانو بنانا ۲ در واقع معادل مدل جمینای ۳.۱ فلش ایمیج (Gemini 3.1 Flash Image) است و طبق مستندات منتشرشده، نسخه ۲.۱ نیز به خانواده جمینای ۳ تعلق داشته و بر پایه مدل قدرتمندتر جمینای ۳.۶ فلش توسعه یافته است.

ویرایش‌های دقیق‌تر با همان سرعت سرسام‌آور سری فلش

این به‌روزرسانی چهار بخش کلیدی را هدف گرفته که تأثیر مستقیمی بر جریان کاری تولید و ویرایش تصویر می‌گذارند:

  • ترکیب‌بندی بصری (Visual composition): چیدمان تمیزتر، جزئیات صیقلی‌تر و ساختاردهی بسیار طبیعی‌تر صحنه‌ها.
  • ویرایش با ماسک (Mask-based editing): اعمال تغییرات فوق‌العاده دقیق روی بخش‌های دلخواه بدون نیاز به بازتولید کل تصویر از صفر.
  • ثبات سوژه (Subject consistency): حفظ هویت و ویژگی‌های کاراکترها و اشیا در ویرایش‌های متوالی و تصاویر پیوسته.
  • کیفیت رندرینگ (Rendering quality): خروجی‌های بسیار طبیعی‌تر با آرتیفکت‌ها و ناهنجاری‌های بصری کمتر، همراه با جهش چشمگیر در خوانایی و نمایش دقیق متن‌ها.

علاوه بر این، دست توسعه‌دهندگان با ابزار‌ها و کنترل‌های ورودی جدید بسیار بازتر شده است:

قابلیت
پشتیبانی در نانو بنانا ۲.۱
رزولوشن خروجی
کیفیت‌های ۱K، ۲K و ۴K با واقع‌گرایی بالا‌تر و کاهش شدید خطاهای تکه‌تکه شدن (تایلینگ) در ابعاد عریض ۲K و ۴K
تصاویر مرجع (Reference)
تا سقف ۱۴ تصویر، با امکان حفظ ثبات حداکثر ۴ کاراکتر و وفاداری به جزئیات تا ۱۰ شیء مجزا
اتصال به داده‌های واقعی (Grounding)
استفاده هوشمندانه از نتایج جستجوی وب و تصاویر گوگل برای افزایش دقت محتوای تولیدی
سطوح تفکر (Thinking levels)
سه حالت حداقلی (Minimal)، متوسط (Medium) و بالا (High)؛ حالت پیش‌فرض متوسط است
پنجره متنی (Context window)
۱۳۱٬۰۷۲ توکن
ورودی‌های مجاز
متن، تصویر، ویدیو و فایل‌های PDF

آزمون‌های گوگل خبر از برتری ۲.۱ می‌دهند

در ارزیابی‌های مقایسه‌ای درون‌سازمانی گوگل، از ارزیاب‌های انسانی خواسته شده تا خروجی مدل‌ها را کنار هم مقایسه کرده و گزینه بهتر را انتخاب کنند؛ سپس این ترجیحات به امتیازهای Elo تبدیل شده است. امتیاز Elo بالا‌تر نشان‌دهنده ترجیح محسوس کاربران است، هرچند تفاوت امتیازی مستقیماً به معنای درصد پیشرفت کیفی نیست.

معیار گزارش‌شده
نانو بنانا ۲
نانو بنانا ۲.۱ با قابلیت تفکر
نانو بنانا پرو
ترجیح کلی کاربران (Elo)
۹۸۱
۱۰۵۰
۹۳۵
ثبات چند کاراکتر (Elo)
گزارش نشده
۱۱۰۶
۱۰۱۱
صحت علمی و واقعی اینفوگرافیک
۰.۱۷۹
۰.۵۲۱
گزارش نشده

امتیاز صحت محتوای اینفوگرافیک در این مدل جدید نزدیک به ۲.۹ برابر نسخه قبلی یعنی نانو بنانا ۲ است. اتصال به جستجوی گوگل قطعاً نقش پررنگی در این جهش داشته، هرچند گزارش منتشرشده سهم دقیق جستجو را از بهبودهای معماری مدل، آموزش‌ها یا قابلیت تفکر تفکیک نکرده است.

این آمار‌ها نشان می‌دهند که نسخه ۲.۱ در سناریوهای آزموده‌شده برای ویرایش تصویر، به‌خصوص زمانی که حالت تفکر فعال باشد، پابه‌پای نسخه پرو رقابت می‌کند و حتی از آن جلو می‌زند. البته نباید فراموش کرد که این بنچمارک‌ها توسط خود سازنده ارائه شده و بر اساس پرامپت‌ها و معیارهای انتخابی آن‌ها سنجیده شده است؛ بنابراین ممکن است عملکرد آن روی پروژه‌ها و داده‌های اختصاصی هر تیم تفاوت‌هایی داشته باشد.

رابط برنامه‌نویسی (API) آشنا و سرراست

فراخوانی این مدل در زبان پایتون از طریق رابط برنامه‌نویسی Interactions API بسیار سرراست است و تنها به شناسه مدل و پرامپت نیاز دارد:

from google import genai
import base64

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input="A cyberpunk ramen stand at night, neon reflections on wet pavement",
)

with open("out.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))

از آنجا که در این قطعه‌کد پارامتر تفکر تعیین نشده، سیستم به‌طور خودکار روی سطح متوسط (Medium) قرار می‌گیرد. حالت حداقلی (Minimal) برای پروژه‌هایی که سرعت و تاخیر کم در اولویت اول است ایده‌آل خواهد بود؛ در حالی که سطح بالا (High) برای اینفوگرافیک‌ها، صحنه‌های پیچیده با چند سوژه و پرامپت‌هایی که نیاز به پردازش عمیق‌تر دارند طراحی شده است. گوگل اعلام کرده تعرفه و تاخیر مورد انتظار این مدل دقیقاً هم‌سطح نسخه نانو بنانا ۲ باقی مانده و نرخ‌های فعلی، سهمیه‌ها و جزئیات تنظیمات در مستندات رسمی مدل در دسترس است.

این مدل قرار است در اپلیکیشن Gemini، حالت هوش مصنوعی جستجوی گوگل (AI Mode)، محیط Google AI Studio، پلتفرم‌های Google Flow، Stitch، بخش تبلیغات گوگل (Google Ads) و پلتفرم شرکتی Gemini Enterprise عرضه شود. البته دسترسی کاربران بسته به نوع حساب، منطقه جغرافیایی و فاز انتشار ممکن است متفاوت باشد.

محدودیت‌ها و خطاهایی که حتماً باید تست کنید

گوگل به چند چالش و محدودیت فنی اشاره کرده که در پروژه‌های عملی و محیط‌های پروداکشن باید حواستان به آن‌ها باشد:

  • متن‌های ریز در رزولوشن ۱K ممکن است تار شوند و مدل همچنان در رندر دقیق پاراگراف‌های طولانی با چالش روبه‌روست.
  • ممکن است چهره و ظاهر کاراکترها بین تصویر مرجع و خروجی نهایی دچار اندکی تغییر یا انحراف شود.
  • ویرایش‌های مبتنی بر ماسک و طراحی دستی (دودل) گاهی فقط بخشی از دستور کاربر را اجرا می‌کنند.
  • اگر ویرایش نیازمند تغییر ساختاری در حالت بدن باشد، گاهی ژست و فیگور تصویر اصلی همچنان حفظ می‌شود.
  • درک جهت‌های جغرافیایی و فضایی مانند چپ و راست ممکن است دچار خطا شود.
  • استدلال سه‌بعدی و صحت کامل جزئیات واقعی هنوز به حد بی‌نقص نرسیده است.

گوگل پیشنهاد می‌کند هر زمان که نمایش متن‌های ریز در تصویر اهمیت دارد، حتماً از رزولوشن‌های ۲K یا ۴K استفاده شود. همچنین تیم‌ها در جریان‌های کاری تجاری بهتر است پیش از انتشار خروجی‌ها، مواردی مانند املای کلمات، برچسب‌ها، اطلاعات واقعی، یکدستی هویت افراد و روابط فضایی سوژه‌ها را به‌دقت بررسی و راستی‌آزمایی کنند.

راهنمای انتخاب و مسیریابی مدل در پروژه‌های واقعی

مدل نانو بنانا ۲.۱ به یک گزینه پیش‌فرض و سریع برای ویرایش، ساخت اینفوگرافیک‌های مستند، عکاسی محصول و کمپین‌های مبتنی بر کاراکتر تبدیل شده است. برای بهترین نتیجه، انتخاب سطح تفکر و کیفیت خروجی باید متناسب با نوع پروژه باشد:

نوع پروژه و بار کاری
نقطه شروع پیشنهادی
بررسی و پایش اصلی
پیش‌نویس‌ها و خروجی‌های پرحجم
مدل ۲.۱ با سطح تفکر حداقلی (Minimal)
مطمئن شوید کاهش تاخیر و سرعت بالا کیفیت لازم را فدا نکرده باشد
ویرایش عمومی تصاویر
مدل ۲.۱ با سطح تفکر متوسط (Medium)
انطباق با پرامپت و مرزبندی دقیق ماسک‌ها را چک کنید
اینفوگرافیک‌ها یا صحنه‌های پیچیده
مدل ۲.۱ با سطح تفکر بالا (High)
صحت فکت‌ها، برچسب‌های متنی و جای‌گیری سوژه‌ها را بازبینی کنید
ترکیب‌بندی با چند تصویر رفرنس
مدل ۲.۱ با تفکر متوسط یا بالا
میزان یکدستی کاراکترها و جزئیات اشیا را بسنجید
تصاویر متمرکز بر متن‌های ریز
مدل ۲.۱ در رزولوشن ۲K یا ۴K در مقایسه با نسخه Pro
کیفیت نهایی فونت‌ها را در ابعاد نمایش واقعی چک کنید

تیم‌هایی که قصد دارند زیرساخت‌های خود را به این مدل مهاجرت دهند، بهتر است هر دو مدل را با پرامپت‌های واقعی خود در مواردی مثل ابعاد نهایی، سرعت پاسخ‌دهی و هزینه تمام‌شده به چالش بکشند. گزارش‌های رسمی گوگل ثابت می‌کند که gemini-nano-banana-2.1 در حال حاضر می‌تواند انتخاب اول بسیاری از فرایندهای ویرایش تصویر باشد، هرچند تست‌های عملی هر پروژه مشخص می‌کند آیا مدل پرو همچنان جایگاهی در پایپ‌لاین کاری شما خواهد داشت یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

مدیرعامل اطلسین: «کار با هوش مصنوعی دیگر تک‌نفره نیست؛ ایجنت‌ها هم‌تیمی شما هستند، نه جایگزین‌تان!»
آخرین اخبار

مدیرعامل اطلسین: «کار با هوش مصنوعی دیگر تک‌نفره نیست؛ ایجنت‌ها هم‌تیمی شما هستند، نه جایگزین‌تان!»

مدیرعامل اطلسین در رویداد اخیر این شرکت اعلام کرد که دوران کار تک‌نفره با هوش مصنوعی به پایان رسیده و اکنون وارد عصر همکاری چندنفره انسان‌ها و ایجنت‌ها شده‌ایم. او تأکید دارد هوش مصنوعی بدون درک بستر اطلاعاتی (کانتکست) سازمان کارایی چندانی ندارد و ایجنت‌ها نه برای حذف نیروها، بلکه برای پیوستن به تیم‌ها طراحی شده‌اند.

۳ دقیقه مطالعه
۰
۱۵ مهر
شرط‌بندی پاسکال به داد مدیران رسید: چطور در قمار بزرگ AGI بازنده نباشیم؟
آخرین اخبار

شرط‌بندی پاسکال به داد مدیران رسید: چطور در قمار بزرگ AGI بازنده نباشیم؟

با پررنگ‌تر شدن زمزمه‌های ظهور هوش عمومی مصنوعی (AGI)، مدیران شرکت‌ها سر یک دوراهی بزرگ گیر افتاده‌اند: چقدر باید روی هوش مصنوعی شرط بست؟ جالب اینجاست که پاسخی دقیق و کاربردی برای این معمای مدرن، در نظریه مشهور «شرط‌بندی پاسکال» از قرن هفدهم پنهان شده است.

۳ دقیقه مطالعه
۰
۱۵ مهر
دستور توقف ساخت دو دیتاسنتر بزرگ گوگل در فنلاند؛ ترمز غول هوش مصنوعی در «تگزاس اروپا» کشیده شد!
آخرین اخبار

دستور توقف ساخت دو دیتاسنتر بزرگ گوگل در فنلاند؛ ترمز غول هوش مصنوعی در «تگزاس اروپا» کشیده شد!

سازمان‌های نظارتی فنلاند تنها یک ماه پس از اعلام طرح سرمایه‌گذاری ۱۵ میلیارد دلاری گوگل، دستور توقف ساخت دو دیتاسنتر غول‌پیکر هوش مصنوعی این شرکت را به دلیل نگرانی‌های زیست‌محیطی صادر کردند. فنلاند که به خاطر منابع انرژی پایدار به «تگزاس اروپا» برای میزبانی هوش مصنوعی شهرت پیدا کرده، حالا نشان داده که حتی برای بزرگ‌ترین غول‌های فناوری هم استانداردهای سفت‌وسختی دارد.

۳ دقیقه مطالعه
۰
۱۵ مهر