شاهکار جدید گوگل در ویرایش تصویر: نانو بنانا ۲.۱ با قیمت اقتصادی نسخه پرو را شکست داد!
گوگل از نسخه جدید مدل تولید و ویرایش تصویر خود با نام نانو بنانا ۲.۱ (Nano Banana 2.1) رونمایی کرد؛ مدلی که با وجود حفظ سرعت بالا و قیمت اقتصادی سری فلش، در آزمونهای کلیدی نسخه گرانقیمت پرو را پشت سر گذاشته است. این بهروزرسانی با ارتقای چشمگیر ثبات کاراکترها و افزودن سطوح تفکر، دست توسعهدهندگان را برای خلق تصاویر باکیفیت و ویرایشهای دقیق باز میگذارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- گوگل با معرفی نانو بنانا ۲.۱ (Nano Banana 2.1) کیفیت ویرایش تصویر را به شکل چشمگیری ارتقا داده، در حالی که قیمت و سرعت آن دقیقاً در حد مدلهای اقتصادی سری فلش (Flash) حفظ شده است.
- در بنچمارکهای داخلی گوگل و رقابتهای امتیازی Elo، این مدل جدید بهویژه هنگام فعال بودن قابلیت تفکر (Thinking)، در ترجیح کلی کاربران و ثبات شخصیتها نسخه قدرتمند پرو را پشت سر گذاشته است.
- این مدل تا ۱۴ تصویر رفرنس، رزولوشنهای ۲K و ۴K و ورودیهای چندرسانهای را پشتیبانی میکند و دسترسی به آن از طریق API و پلتفرمهای ابری گوگل آغاز شده است.
گوگل مدعی شد: نانو بنانا ۲.۱ در آزمونهای کلیدی ادیت تصویر، نسخه پرو را پشت سر گذاشته است
گوگل بهتازگی از نانو بنانا ۲.۱ (Nano Banana 2.1) رونمایی کرده است؛ یک بهروزرسانی متمرکز برای مدل تصویرسازی این شرکت که روی سرعت بالا و هزینه اقتصادی بهینهسازی شده است. دسترسی به این مدل از طریق API با شناسه gemini-nano-banana-2.1 فراهم شده و انتشار گستردهتر آن در سراسر سرویسهای توسعهدهندگان و محصولات کاربری گوگل در جریان است.
گوگل این نسخه را یک ارتقای کیفی بزرگ میداند که سرعت پردازش و تعرفه اقتصادی مدلهای سری فلش (Flash) در نانو بنانا ۲ را حفظ کرده است. مدل نانو بنانا ۲ در واقع معادل مدل جمینای ۳.۱ فلش ایمیج (Gemini 3.1 Flash Image) است و طبق مستندات منتشرشده، نسخه ۲.۱ نیز به خانواده جمینای ۳ تعلق داشته و بر پایه مدل قدرتمندتر جمینای ۳.۶ فلش توسعه یافته است.
ویرایشهای دقیقتر با همان سرعت سرسامآور سری فلش
این بهروزرسانی چهار بخش کلیدی را هدف گرفته که تأثیر مستقیمی بر جریان کاری تولید و ویرایش تصویر میگذارند:
- ترکیببندی بصری (Visual composition): چیدمان تمیزتر، جزئیات صیقلیتر و ساختاردهی بسیار طبیعیتر صحنهها.
- ویرایش با ماسک (Mask-based editing): اعمال تغییرات فوقالعاده دقیق روی بخشهای دلخواه بدون نیاز به بازتولید کل تصویر از صفر.
- ثبات سوژه (Subject consistency): حفظ هویت و ویژگیهای کاراکترها و اشیا در ویرایشهای متوالی و تصاویر پیوسته.
- کیفیت رندرینگ (Rendering quality): خروجیهای بسیار طبیعیتر با آرتیفکتها و ناهنجاریهای بصری کمتر، همراه با جهش چشمگیر در خوانایی و نمایش دقیق متنها.
علاوه بر این، دست توسعهدهندگان با ابزارها و کنترلهای ورودی جدید بسیار بازتر شده است:
قابلیت | پشتیبانی در نانو بنانا ۲.۱ |
|---|---|
رزولوشن خروجی | کیفیتهای ۱K، ۲K و ۴K با واقعگرایی بالاتر و کاهش شدید خطاهای تکهتکه شدن (تایلینگ) در ابعاد عریض ۲K و ۴K |
تصاویر مرجع (Reference) | تا سقف ۱۴ تصویر، با امکان حفظ ثبات حداکثر ۴ کاراکتر و وفاداری به جزئیات تا ۱۰ شیء مجزا |
اتصال به دادههای واقعی (Grounding) | استفاده هوشمندانه از نتایج جستجوی وب و تصاویر گوگل برای افزایش دقت محتوای تولیدی |
سطوح تفکر (Thinking levels) | سه حالت حداقلی (Minimal)، متوسط (Medium) و بالا (High)؛ حالت پیشفرض متوسط است |
پنجره متنی (Context window) | ۱۳۱٬۰۷۲ توکن |
ورودیهای مجاز | متن، تصویر، ویدیو و فایلهای PDF |
آزمونهای گوگل خبر از برتری ۲.۱ میدهند
در ارزیابیهای مقایسهای درونسازمانی گوگل، از ارزیابهای انسانی خواسته شده تا خروجی مدلها را کنار هم مقایسه کرده و گزینه بهتر را انتخاب کنند؛ سپس این ترجیحات به امتیازهای Elo تبدیل شده است. امتیاز Elo بالاتر نشاندهنده ترجیح محسوس کاربران است، هرچند تفاوت امتیازی مستقیماً به معنای درصد پیشرفت کیفی نیست.
معیار گزارششده | نانو بنانا ۲ | نانو بنانا ۲.۱ با قابلیت تفکر | نانو بنانا پرو |
|---|---|---|---|
ترجیح کلی کاربران (Elo) | ۹۸۱ | ۱۰۵۰ | ۹۳۵ |
ثبات چند کاراکتر (Elo) | گزارش نشده | ۱۱۰۶ | ۱۰۱۱ |
صحت علمی و واقعی اینفوگرافیک | ۰.۱۷۹ | ۰.۵۲۱ | گزارش نشده |
امتیاز صحت محتوای اینفوگرافیک در این مدل جدید نزدیک به ۲.۹ برابر نسخه قبلی یعنی نانو بنانا ۲ است. اتصال به جستجوی گوگل قطعاً نقش پررنگی در این جهش داشته، هرچند گزارش منتشرشده سهم دقیق جستجو را از بهبودهای معماری مدل، آموزشها یا قابلیت تفکر تفکیک نکرده است.
این آمارها نشان میدهند که نسخه ۲.۱ در سناریوهای آزمودهشده برای ویرایش تصویر، بهخصوص زمانی که حالت تفکر فعال باشد، پابهپای نسخه پرو رقابت میکند و حتی از آن جلو میزند. البته نباید فراموش کرد که این بنچمارکها توسط خود سازنده ارائه شده و بر اساس پرامپتها و معیارهای انتخابی آنها سنجیده شده است؛ بنابراین ممکن است عملکرد آن روی پروژهها و دادههای اختصاصی هر تیم تفاوتهایی داشته باشد.
رابط برنامهنویسی (API) آشنا و سرراست
فراخوانی این مدل در زبان پایتون از طریق رابط برنامهنویسی Interactions API بسیار سرراست است و تنها به شناسه مدل و پرامپت نیاز دارد:
from google import genai
import base64
client = genai.Client()
interaction = client.interactions.create(
model="gemini-nano-banana-2.1",
input="A cyberpunk ramen stand at night, neon reflections on wet pavement",
)
with open("out.png", "wb") as f:
f.write(base64.b64decode(interaction.output_image.data))از آنجا که در این قطعهکد پارامتر تفکر تعیین نشده، سیستم بهطور خودکار روی سطح متوسط (Medium) قرار میگیرد. حالت حداقلی (Minimal) برای پروژههایی که سرعت و تاخیر کم در اولویت اول است ایدهآل خواهد بود؛ در حالی که سطح بالا (High) برای اینفوگرافیکها، صحنههای پیچیده با چند سوژه و پرامپتهایی که نیاز به پردازش عمیقتر دارند طراحی شده است. گوگل اعلام کرده تعرفه و تاخیر مورد انتظار این مدل دقیقاً همسطح نسخه نانو بنانا ۲ باقی مانده و نرخهای فعلی، سهمیهها و جزئیات تنظیمات در مستندات رسمی مدل در دسترس است.
این مدل قرار است در اپلیکیشن Gemini، حالت هوش مصنوعی جستجوی گوگل (AI Mode)، محیط Google AI Studio، پلتفرمهای Google Flow، Stitch، بخش تبلیغات گوگل (Google Ads) و پلتفرم شرکتی Gemini Enterprise عرضه شود. البته دسترسی کاربران بسته به نوع حساب، منطقه جغرافیایی و فاز انتشار ممکن است متفاوت باشد.
محدودیتها و خطاهایی که حتماً باید تست کنید
گوگل به چند چالش و محدودیت فنی اشاره کرده که در پروژههای عملی و محیطهای پروداکشن باید حواستان به آنها باشد:
- متنهای ریز در رزولوشن ۱K ممکن است تار شوند و مدل همچنان در رندر دقیق پاراگرافهای طولانی با چالش روبهروست.
- ممکن است چهره و ظاهر کاراکترها بین تصویر مرجع و خروجی نهایی دچار اندکی تغییر یا انحراف شود.
- ویرایشهای مبتنی بر ماسک و طراحی دستی (دودل) گاهی فقط بخشی از دستور کاربر را اجرا میکنند.
- اگر ویرایش نیازمند تغییر ساختاری در حالت بدن باشد، گاهی ژست و فیگور تصویر اصلی همچنان حفظ میشود.
- درک جهتهای جغرافیایی و فضایی مانند چپ و راست ممکن است دچار خطا شود.
- استدلال سهبعدی و صحت کامل جزئیات واقعی هنوز به حد بینقص نرسیده است.
گوگل پیشنهاد میکند هر زمان که نمایش متنهای ریز در تصویر اهمیت دارد، حتماً از رزولوشنهای ۲K یا ۴K استفاده شود. همچنین تیمها در جریانهای کاری تجاری بهتر است پیش از انتشار خروجیها، مواردی مانند املای کلمات، برچسبها، اطلاعات واقعی، یکدستی هویت افراد و روابط فضایی سوژهها را بهدقت بررسی و راستیآزمایی کنند.
راهنمای انتخاب و مسیریابی مدل در پروژههای واقعی
مدل نانو بنانا ۲.۱ به یک گزینه پیشفرض و سریع برای ویرایش، ساخت اینفوگرافیکهای مستند، عکاسی محصول و کمپینهای مبتنی بر کاراکتر تبدیل شده است. برای بهترین نتیجه، انتخاب سطح تفکر و کیفیت خروجی باید متناسب با نوع پروژه باشد:
نوع پروژه و بار کاری | نقطه شروع پیشنهادی | بررسی و پایش اصلی |
|---|---|---|
پیشنویسها و خروجیهای پرحجم | مدل ۲.۱ با سطح تفکر حداقلی (Minimal) | مطمئن شوید کاهش تاخیر و سرعت بالا کیفیت لازم را فدا نکرده باشد |
ویرایش عمومی تصاویر | مدل ۲.۱ با سطح تفکر متوسط (Medium) | انطباق با پرامپت و مرزبندی دقیق ماسکها را چک کنید |
اینفوگرافیکها یا صحنههای پیچیده | مدل ۲.۱ با سطح تفکر بالا (High) | صحت فکتها، برچسبهای متنی و جایگیری سوژهها را بازبینی کنید |
ترکیببندی با چند تصویر رفرنس | مدل ۲.۱ با تفکر متوسط یا بالا | میزان یکدستی کاراکترها و جزئیات اشیا را بسنجید |
تصاویر متمرکز بر متنهای ریز | مدل ۲.۱ در رزولوشن ۲K یا ۴K در مقایسه با نسخه Pro | کیفیت نهایی فونتها را در ابعاد نمایش واقعی چک کنید |
تیمهایی که قصد دارند زیرساختهای خود را به این مدل مهاجرت دهند، بهتر است هر دو مدل را با پرامپتهای واقعی خود در مواردی مثل ابعاد نهایی، سرعت پاسخدهی و هزینه تمامشده به چالش بکشند. گزارشهای رسمی گوگل ثابت میکند که gemini-nano-banana-2.1 در حال حاضر میتواند انتخاب اول بسیاری از فرایندهای ویرایش تصویر باشد، هرچند تستهای عملی هر پروژه مشخص میکند آیا مدل پرو همچنان جایگاهی در پایپلاین کاری شما خواهد داشت یا خیر.
مطالب مرتبط و پیشنهادی

مدیرعامل اطلسین: «کار با هوش مصنوعی دیگر تکنفره نیست؛ ایجنتها همتیمی شما هستند، نه جایگزینتان!»
مدیرعامل اطلسین در رویداد اخیر این شرکت اعلام کرد که دوران کار تکنفره با هوش مصنوعی به پایان رسیده و اکنون وارد عصر همکاری چندنفره انسانها و ایجنتها شدهایم. او تأکید دارد هوش مصنوعی بدون درک بستر اطلاعاتی (کانتکست) سازمان کارایی چندانی ندارد و ایجنتها نه برای حذف نیروها، بلکه برای پیوستن به تیمها طراحی شدهاند.

شرطبندی پاسکال به داد مدیران رسید: چطور در قمار بزرگ AGI بازنده نباشیم؟
با پررنگتر شدن زمزمههای ظهور هوش عمومی مصنوعی (AGI)، مدیران شرکتها سر یک دوراهی بزرگ گیر افتادهاند: چقدر باید روی هوش مصنوعی شرط بست؟ جالب اینجاست که پاسخی دقیق و کاربردی برای این معمای مدرن، در نظریه مشهور «شرطبندی پاسکال» از قرن هفدهم پنهان شده است.

دستور توقف ساخت دو دیتاسنتر بزرگ گوگل در فنلاند؛ ترمز غول هوش مصنوعی در «تگزاس اروپا» کشیده شد!
سازمانهای نظارتی فنلاند تنها یک ماه پس از اعلام طرح سرمایهگذاری ۱۵ میلیارد دلاری گوگل، دستور توقف ساخت دو دیتاسنتر غولپیکر هوش مصنوعی این شرکت را به دلیل نگرانیهای زیستمحیطی صادر کردند. فنلاند که به خاطر منابع انرژی پایدار به «تگزاس اروپا» برای میزبانی هوش مصنوعی شهرت پیدا کرده، حالا نشان داده که حتی برای بزرگترین غولهای فناوری هم استانداردهای سفتوسختی دارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.