پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

باگ پنهان بینایی در مدل‌های جدید GPT-6؛ اوپن‌ای‌آی بی‌سر‌و‌صدا مشکل رو رفع کرد!

انتشار:۵ مهر ۱۴۰۵(۱ روز پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه
باگ پنهان بینایی در مدل‌های جدید GPT-6؛ اوپن‌ای‌آی بی‌سر‌و‌صدا مشکل رو رفع کرد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • اوپن‌ای‌آی یه باگ پنهان در انکودر تصاویر مدل‌های جدید GPT-6 Sol و Luna رو رفع کرد که باعث افت نامحسوس درک تصاویر و اسکرین‌شات‌ها شده بود.
  • این باگ بدون نمایش هیچ خطایی پاسخ‌های به ظاهر درست تولید می‌کرد، اما جزئیات بصری ناقص باعث فریب خوردن ایجنت‌های کامپیوتر-یوز می‌شد.
  • این پچ سمت سرور اعمال شده و هزینه‌ها تغییری نکرده، اما اوپن‌ای‌آی توصیه کرده توسعه‌دهنده‌ها بنچمارک‌ها و تست‌های قبلی رو دوباره تکرار کنن.

رفع باگ انکودر تصویر در مدل‌های جدید GPT-6

شرکت اوپن‌ای‌آی (OpenAI) یه باگ پنهان مربوط به انکودینگ تصویر رو برطرف کرده؛ باگی که باعث افت کیفیت درک بصری توی مدل‌های GPT-6 Sol و GPT-6 Luna شده بود—دو مدل استدلال چندوجهی که درست چند روز قبل از این پچ نرم‌افزاری معرفی شده بودن. این آپدیت از سمت سرور اعمال شده و الان مستقیماً روی API و ابزار کدکس (Codex)، از جمله فرآیندهای استفاده از کامپیوتر (Computer Use)، فعاله.

جالبه که توی لاگ تغییرات رسمی اوپن‌ای‌آی، اندازه این افت کیفیت یا تفاوت دقیق بنچمارک‌ها اعلام نشده. نکته گمراه‌کننده ماجرا این بود که تمام درخواست‌های ارسالی بدون هیچ خطایی پردازش می‌شدن و پاسخ‌ها هم کاملاً منطقی و درست به نظر می‌رسیدن، اما امتیازهای نهایی ارزیابی مدل خیلی پایین‌تر از حد انتظار بود. به همین خاطر، تیم‌هایی که این دو مدل رو با تصاویر تست کرده بودن، بهتره ارزیابی‌هاشون رو از نو تکرار کنن.

چرا پاسخ‌های به‌ظاهر درست باعث گمراهی شدن؟

انکودر تصویر وظیفه داره پیکسل‌ها رو به داده‌های قابل‌فهم برای تحلیل مدل تبدیل کنه. اگه تو این مرحله مشکلی وجود داشته باشه، ممکنه یه سری از جزئیات بصری قبل از این‌که مدل شروع به استدلال کنه از دست برن یا تغییر شکل بدن. در نتیجه، مدل ممکنه متن‌ها، المان‌ها، چیدمان صفحه یا دکمه‌های رابط کاربری رو اشتباه متوجه بشه، اما با این حال پاسخی کاملاً روان و مسلط به کاربر تحویل بده!

البته این اولین بار نیست که اوپن‌ای‌آی چنین مشکلی رو رفع می‌کنه. توی آپدیت ماه مارس هم یه باگ انکودر کوچیک که روی ورودی‌های input_image در مدل GPT-5.4 اثر می‌ذاشت حل شد و اوپن‌ای‌آی اعلام کرد عملکرد مدل در خیلی از کاربردهای درک تصویر خودبه‌خود بهتر میشه.

یک انکودر، چند محیط مختلف

  • مدل GPT-6 Sol (یا gpt-6-sol): نسخه پرچمدار با بیشترین سطح توانایی پردازش و استدلال.
  • مدل GPT-6 Luna (یا gpt-6-luna): نسخه اقتصادی، سبک‌تر و پرسرعت برای پاسخ‌گویی به حجم بالای درخواست‌ها.
  • APIهای Responses و Chat Completions: تمام درخواست‌های تصویری ارسال‌شده به هر دو مدل.
  • کدکس و قابلیت کار با کامپیوتر (Computer Use): تمام گردش‌کارهایی که اسکرین‌شات‌ها یا تصاویر محیط رو بررسی می‌کنن.

ایجنت‌های کار با کامپیوتر برای هر اقدامی که انجام میدن شدیداً به درک بی‌نقص اسکرین‌شات‌ها وابسته‌ان. وقتی جزئیات تصویر دچار اعوجاج بشه، ممکنه ایجنت دکمه اشتباهی رو کلیک کنه، یه فیلد رو توی فرم غلط بخونه، اطلاعات رو جای نامربوط وارد کنه یا حتی به اشتباه نتیجه بگیره که کارش با موفقیت تموم شده!

پچ سمت سرور بدون تغییر در قیمت‌ها

این فیکس نرم‌افزاری هیچ نیازی به تغییر کد یا مهاجرت به نسخه جدیدی از مدل نداره. درخواست‌های جدید به شکل خودکار از مسیر اصلاح‌شده رد میشن، اما جواب‌هایی که قبل از این پچ تولید شدن تغییری نمی‌کنن. بنابراین کَش‌های سمت اپلیکیشن، پاسخ‌های آرشیوشده و سوابق ارزیابی قبلی حتماً باید جداگانه بازبینی بشن.

مدل
ورودی
ورودی کَش‌شده
خروجی
GPT-6 Sol
۲.۰۰ دلار
۰.۲۰ دلار
۱۰.۰۰ دلار
GPT-6 Luna
۰.۱۰ دلار
۰.۰۱ دلار
۰.۵۰ دلار

نتایج و شواهد رو دوباره تست کنید

الان دقیقاً همون شناسه‌های قبلی مدل دارن از مسیر اصلاح‌شده پردازش تصاویر استفاده می‌کنن، پس نتایج ارزیابی قبل و بعد از این پچ رفتارهای متفاوتی رو نشون خواهند داد. حواستون باشه موقع مقایسه نتایج، پرامپت‌ها، تصاویر، ابزارها، تنظیمات نمونه‌گیری (Sampling) و شیوه‌های امتیازدهی رو کاملاً یکسان نگه دارید و زمان اجرای تست‌ها رو هم ثبت کنید.

  1. تکرار ارزیابی‌های بینایی: تمام تست‌هایی که در بازه زمانی رونمایی این مدل‌ها تا انتشار این پچ انجام دادید رو دوباره اجرا کنید و دقت و دسته‌بندی خطاهای جدید رو مقایسه کنید.
  2. تست مجدد خطاهای ایجنت‌های بصری: سراغ اجراهای قبلی ابزار کدکس و فرآیندهای کار با کامپیوتر برید که تو خوندن دکمه‌ها، اسکرین‌شات، متن‌ها یا وضعیت صفحه با خطا روبه‌رو شده بودن.
  3. بازبینی خروجی‌های ذخیره‌شده: کَش‌های برنامه و پاسخ‌های ذخیره‌شده قبل از فیکس رو دقیق بررسی کنید، چون این پچ نمیتونه پاسخ‌های ثبت‌شده قبلی رو دستکاری کنه.
  4. تجدیدنظر در انتخاب مدل: قبل از این‌که بر اساس عملکردهای ضعیف قبلی تصمیم بگیرید مدل دیگه‌ای رو جایگزین کنید، اول خروجی‌های جدید و اصلاح‌شده چندوجهی رو بسنجید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر