چالش ۳۰ ویرایش پیاپی روی یک عکس: مدلهای هوش مصنوعی چقدر به تصویر اصلی وفادار میمانند؟
تیم تحقیقاتی Artificial Analysis با اعمال ۳۰ ویرایش متوالی روی یک عکس دکوراسیون، مدلهای پیشروی ویرایش تصویر را به چالش کشید. این تست نشان داد در حالی که مدلهایی مثل Ideogram 4.5 و FLUX 3 تنها بخش هدف را دستکاری میکنند، مدلهایی مانند Sunburst کل تصویر را از نو میسازند و هویت اولیه عکس را به مرور تغییر میدهند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- موسسه تحقیقاتی Artificial Analysis در آزمونی کمسابقه، چهار ابزار مطرح ویرایش تصویر را با اعمال ۳۰ دستور ویرایشی پشتسرهم روی یک عکس محک زد تا میزان تغییرات ناخواسته (Drift) را بسنجد.
- مدلهای Ideogram 4.5 و FLUX 3 فوقالعاده عمل کردند و با حفظ بیش از ۹۵ درصد پیکسلهای اصلی، تنها بخش موردنظر را دستکاری کردند؛ اما مدل GPT Image 2.5 Sunburst اوپنایآی بخش اعظم کادر را از نو ساخت.
- این آزمایش ثابت میکند لیدربوردهای تکویرایشی ملاک کافی برای کارهای واقعی نیستند و در پروژههای ادیت تعاملی، پایداری و حفظ المانهای قبلی اهمیت بسیار بالاتری دارد.
۳۰ مرحله ویرایش پیاپی؛ کدام مدلهای هوش مصنوعی دچار رانش ناخواسته میشوند؟
موسسه تحقیقاتی Artificial Analysis در یک تست فشار بسیار جالب، چهار ابزار مطرح ویرایش تصویر را با اعمال ۳۰ تغییر متوالی روی یک عکس یکسان از فضای داخلی خانه محک زده است. این آزمایش بهخوبی نشان داد که هر مدل با چه سرعتی جزئیات خارج از محدوده ویرایش را دستخوش تغییر میکند؛ نقطه ضعفی اساسی که در لیدربوردها و بنچمارکهای تکویرایشی معمولاً اصلاً به چشم نمیآید.
در این فرآیند، هر چهار مدل زنجیرهای یکسان از دستورات را دریافت کردند و خروجی مرحله قبلی خودشان را ویرایش میکردند. پرامپتها شامل کارهایی مثل روشن کردن شومینه، اضافه کردن کاناپه، تغییر رنگ دیوارها، گذاشتن گلدان گل و تبدیل نور روز به غروب بود. این چیدمان دقیقاً شبیه جریان کاری واقعی کاربران در ادیتورهای تعاملی است؛ جایی که در هر گام جدید، خطاهای مراحل پیشین هم به ارث میرسند و روی هم انباشته میشوند.
۳۰ مرحله پرامپت، یک اتاق مشترک
- مدلهای بررسیشده: مدل Ideogram 4.5، مدل GPT Image 2.5 Sunburst از اوپنایآی، مدل FLUX 3 از شرکت Black Forest Labs و مدل Nano Banana 2.1 متعلق به گوگل.
- نقطه شروع: یک عکس دکوراسیون کاملاً یکسان برای هر چهار مدل.
- فرآیند آزمایش: خروجی هر نوبت ویرایش، مستقیماً به عنوان تصویر ورودی نوبت بعدی استفاده شد.
- معیار اصلی سنجش: درصدی از کادر تصویر که خارج از محدوده تغییرات درخواستی، دستنخورده و بدون تغییر ماند.
عملکرد مدلها در این چالش، طیفی از «وصلهکاری موضعی» تا «رندر دوباره کل تصویر» را به نمایش گذاشت. ابزارهای موضعی تلاش کردند پیکسلهای اصلی اطراف ناحیه هدف را دستنخورده حفظ کنند؛ در حالی که مدلهای کلینگر بخش اعظم کادر را از بیخ و بن بازتولید کردند. رویکرد دوم گرچه دست هوش مصنوعی را برای تغییر نور و استایل کلی باز میگذارد، اما ریسک رانش تدریجی و تغییرات ناخواسته را به شدت افزایش میدهد.
مدل | رفتار مشاهدهشده | ریسک در زنجیرههای ویرایش طولانی |
|---|---|---|
Ideogram 4.5 | تغییر دقیق ناحیه هدف و حفظ حداکثری پیکسلهای اولیه. در ویرایشهای کوچک مثل اضافه کردن گل لاله، حداقل ۹۵ درصد از کادر دستنخورده باقی ماند. | رانش پیکسلی بسیار کم در طول آزمایش. |
FLUX 3 | رفتار موضعی مشابه؛ حفظ حداقل ۹۵ درصد کادر در ویرایشهای کوچک. | رانش پیکسلی بسیار اندک در طول مراحل پیاپی. |
GPT Image 2.5 Sunburst | رندر مجدد بخش عمده تصویر در هر نوبت. در مقایسه انجامشده، فقط حدود یکپنجم از تصویر اولیه دستنخورده ماند. | تغییر تدریجی رنگ، بافت و ساختار در طول مراحل ویرایش. |
Nano Banana 2.1 | ویرایشهای نسبتاً موضعی، هرچند پیکسلهای اطراف اندکی تغییر کردند. | تاریک شدن تدریجی تصویر در طول زنجیره ویرایش. |
لیدربوردها خطر رانش تدریجی را نادیده میگیرند
تیم Ideogram نسخه ۴.۵ را دقیقاً با این هدف طراحی کرده که جابهجایی پیکسلها، تغییر رنگها و ایرادات بافتی ناشی از ویرایشهای مکرر را به حداقل برساند. این تست با اندازهگیری دقیق پیکسلهای باقیمانده پس از هر تغییر موضعی، ادعای سازندگان را به صورت ملموس محک زده است.
اما رتبهبندیهای تکویرایشی داستان دیگری را روایت میکنند! طبق گزارشها، مدل Ideogram 4.5 در لیدربوردهای معمولی ویرایش تصویر در رتبه ۲۳ و در تولید متن به تصویر در رتبه ۳۴ کار خود را آغاز کرد؛ در حالی که مدل GPT Image 2.5 Sunburst Max امتیاز ۱,۱۹۷، مدل Grok Imagine Image 2.0 امتیاز ۱,۱۵۵ و مدل MAI-Image-2.6 مایکروسافت امتیاز ۱,۱۵۰ را به ثبت رسانده بودند.
دلیل این تفاوت آن است که رتبهبندیهای مرسوم فقط کیفیت کار را در یک مرحله مستقل میسنجند؛ در حالی که یک زنجیره ۳۰ مرحلهای، مفهوم ماندگاری و پایداری را ارزیابی میکند: یعنی اینکه آیا مبلمان، نوشتهها، جزئیات محصولات، رنگها و ترکیببندی تصویر بعد از ویرایشهای متوالی هنوز سر جای خود میمانند یا خیر. توسعهدهندگانی که ابزارهای ویرایش تعاملی میسازند به هر دو معیار نیاز دارند؛ زیرا یک مدل ممکن است در یک ویرایش تکی عملکردی درخشان داشته باشد، اما بخشهایی را که کاربر قبلاً تأیید کرده بود ناخواسته دگرگون کند!
انتخاب مدل مناسب برای هر زنجیره ویرایشی
مدل | بهترین کاربری | قابلیتهای کلیدی |
|---|---|---|
Ideogram 4.5 | عکاسی تجاری و محصول، ویرایش پوستر، چیدمان دکوراسیون و پروژههایی با لوگو یا المانهای حساس به تغییر. | پشتیبانی از حداکثر ۴ تصویر مرجع، ماسک اختیاری، خروجی بومی 2K و ویرایش وضوح بالا به شیوه برش و اتصال (crop-and-stitch). |
GPT Image 2.5 Sunburst | تولید تکمرحلهای و زنجیرههای ویرایشی کوتاه که نیاز به نورپردازی یا تغییر استایل سراسری دارند. | خروجی حداکثر 4K، پشتیبانی از ۱۶ تصویر مرجع و سطوح کیفی xhigh و max. |
FLUX 3 | تغییرات دقیق و متمرکز، بهویژه زمانی که حفظ پیکسلهای اطراف اولویت اساسی است. | حفظ سرسختانه پیکسلهای کادر در طول ویرایشهای کوچک. |
Nano Banana 2.1 | جلسات ویرایش موضعی، به شرطی که حواستان به تغییرات تدریجی روشنایی و تراز رنگی باشد. | تغییرات نسبتاً محدود به ناحیه هدف، همراه با افت تدریجی روشنایی در مراحل طولانی. |
البته حفظ پیکسلهای موضعی به تنهایی نمیتواند ضامن کیفیت نهایی باشد. کپی کردن بدون تغییر پیکسلها میتواند نمره پایداری بالایی ایجاد کند، حتی اگر ویرایش درخواستی عملاً اعمال نشده باشد! از سوی دیگر، در دستوری مثل تبدیل نور روز به غروب، مدل ناچار است نور کل صحنه را تغییر دهد. بنابراین ارزیابی استاندارد باید میزان پایبندی به دستور و پایداری نواحی محافظتشده را به صورت مجزا بررسی کند.
آزمودن کل سناریوی کاربری، نه فقط یک فریم
این آزمایش روی یک عکس و یک زنجیره ۳۰ مرحلهای از دکوراسیون داخلی اجرا شده است؛ بنابراین نتایج آن لزوماً برای هر سوژه، پرامپت، وضوح تصویر یا تنظیمات API یکسان نخواهد بود. تیمهای توسعه باید پیش از انتخاب مدل نهایی، این آزمایش را با تصاویر و الگوهای کاری خاص خود شبیهسازی کنند.
- زنجیرههای واقعی بسازید: تعداد و الگوهای ویرایشی رایجی را که کاربران در عمل درخواست میکنند تست کنید.
- نواحی محافظتشده را تعیین کنید: تغییرات ایجادشده در لوگوها، چهرهها، هندسه محصولات، نوشتهها و چیدمانهای تأییدشده را رصد کنید.
- موفقیت در اجرای دستور را جداگانه بسنجید: بهجای تکیه بر شباهت پیکسلها، بررسی کنید که آیا دستور موردنظر واقعاً پیادهسازی شده است یا خیر.
- رانش انباشته را زیر نظر بگیرید: تغییرات روشنایی، تراز رنگی، بافت، کادربندی و جزئیات را پس از هر مرحله ثبت کنید.
- هزینه را بر اساس کل جلسه ویرایش بسنجید: تمامی مراحل ویرایش، دفعات تلاش مجدد، رزولوشن خروجی و حالتهای کیفی را در برآورد هزینه و تأخیر لحاظ نمایید.
از نظر هزینهای، مدل Ideogram 4.5 در چهار حالت کیفی مختلف با رزولوشن بومی 2K بین ۰.۰۰۸ تا ۰.۲۲ دلار به ازای هر تصویر هزینه دارد. مدل Sunburst نیز از طریق API اوپنایآی و سرویسهایی مانند Picsart و Atlas Cloud قابل دسترسی است. برای مقایسه منطقی هزینهها، باید هزینه هر تصویر را در تعداد مراحل ویرایش و دفعات تکرار ضرب کنید، نه اینکه هر تصویر را یک درخواست تکی و ایزوله به حساب آورید.
در نهایت، انتخاب مدل کاملاً به نوع پروژه شما بستگی دارد. بازتولید کلی صحنه مناسب پروژههایی است که تغییر حالوهوا و بازآفرینی پسزمینه در آنها مانعی ندارد؛ اما حفظ موضعی پیکسلها بهترین گزینه برای زنجیرههای ویرایشی طولانی است که المانهای تأییدشده آن باید کاملاً دستنخورده باقی بمانند. آزمون Artificial Analysis نشان داد که پس از ۳۰ نوبت ویرایش، تفاوت فاحشی میان عملکرد مدلها رقم میخورد و توسعهدهندگان باید این معیار عملی را در انتخابهای خود جدی بگیرند.
مطالب مرتبط و پیشنهادی

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو میسازد؛ آنهم با ۷۵ سنت!
پروژه متنباز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وبگردی شما از نو میسازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصیسازیشده و جذاب آماده میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.