باگ پنهان بینایی در مدلهای جدید GPT-6؛ اوپنایآی بیسروصدا مشکل رو رفع کرد!

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- اوپنایآی یه باگ پنهان در انکودر تصاویر مدلهای جدید GPT-6 Sol و Luna رو رفع کرد که باعث افت نامحسوس درک تصاویر و اسکرینشاتها شده بود.
- این باگ بدون نمایش هیچ خطایی پاسخهای به ظاهر درست تولید میکرد، اما جزئیات بصری ناقص باعث فریب خوردن ایجنتهای کامپیوتر-یوز میشد.
- این پچ سمت سرور اعمال شده و هزینهها تغییری نکرده، اما اوپنایآی توصیه کرده توسعهدهندهها بنچمارکها و تستهای قبلی رو دوباره تکرار کنن.
رفع باگ انکودر تصویر در مدلهای جدید GPT-6
شرکت اوپنایآی (OpenAI) یه باگ پنهان مربوط به انکودینگ تصویر رو برطرف کرده؛ باگی که باعث افت کیفیت درک بصری توی مدلهای GPT-6 Sol و GPT-6 Luna شده بود—دو مدل استدلال چندوجهی که درست چند روز قبل از این پچ نرمافزاری معرفی شده بودن. این آپدیت از سمت سرور اعمال شده و الان مستقیماً روی API و ابزار کدکس (Codex)، از جمله فرآیندهای استفاده از کامپیوتر (Computer Use)، فعاله.
جالبه که توی لاگ تغییرات رسمی اوپنایآی، اندازه این افت کیفیت یا تفاوت دقیق بنچمارکها اعلام نشده. نکته گمراهکننده ماجرا این بود که تمام درخواستهای ارسالی بدون هیچ خطایی پردازش میشدن و پاسخها هم کاملاً منطقی و درست به نظر میرسیدن، اما امتیازهای نهایی ارزیابی مدل خیلی پایینتر از حد انتظار بود. به همین خاطر، تیمهایی که این دو مدل رو با تصاویر تست کرده بودن، بهتره ارزیابیهاشون رو از نو تکرار کنن.
چرا پاسخهای بهظاهر درست باعث گمراهی شدن؟
انکودر تصویر وظیفه داره پیکسلها رو به دادههای قابلفهم برای تحلیل مدل تبدیل کنه. اگه تو این مرحله مشکلی وجود داشته باشه، ممکنه یه سری از جزئیات بصری قبل از اینکه مدل شروع به استدلال کنه از دست برن یا تغییر شکل بدن. در نتیجه، مدل ممکنه متنها، المانها، چیدمان صفحه یا دکمههای رابط کاربری رو اشتباه متوجه بشه، اما با این حال پاسخی کاملاً روان و مسلط به کاربر تحویل بده!
البته این اولین بار نیست که اوپنایآی چنین مشکلی رو رفع میکنه. توی آپدیت ماه مارس هم یه باگ انکودر کوچیک که روی ورودیهای input_image در مدل GPT-5.4 اثر میذاشت حل شد و اوپنایآی اعلام کرد عملکرد مدل در خیلی از کاربردهای درک تصویر خودبهخود بهتر میشه.
یک انکودر، چند محیط مختلف
- مدل GPT-6 Sol (یا
gpt-6-sol): نسخه پرچمدار با بیشترین سطح توانایی پردازش و استدلال. - مدل GPT-6 Luna (یا
gpt-6-luna): نسخه اقتصادی، سبکتر و پرسرعت برای پاسخگویی به حجم بالای درخواستها. - APIهای Responses و Chat Completions: تمام درخواستهای تصویری ارسالشده به هر دو مدل.
- کدکس و قابلیت کار با کامپیوتر (Computer Use): تمام گردشکارهایی که اسکرینشاتها یا تصاویر محیط رو بررسی میکنن.
ایجنتهای کار با کامپیوتر برای هر اقدامی که انجام میدن شدیداً به درک بینقص اسکرینشاتها وابستهان. وقتی جزئیات تصویر دچار اعوجاج بشه، ممکنه ایجنت دکمه اشتباهی رو کلیک کنه، یه فیلد رو توی فرم غلط بخونه، اطلاعات رو جای نامربوط وارد کنه یا حتی به اشتباه نتیجه بگیره که کارش با موفقیت تموم شده!
پچ سمت سرور بدون تغییر در قیمتها
این فیکس نرمافزاری هیچ نیازی به تغییر کد یا مهاجرت به نسخه جدیدی از مدل نداره. درخواستهای جدید به شکل خودکار از مسیر اصلاحشده رد میشن، اما جوابهایی که قبل از این پچ تولید شدن تغییری نمیکنن. بنابراین کَشهای سمت اپلیکیشن، پاسخهای آرشیوشده و سوابق ارزیابی قبلی حتماً باید جداگانه بازبینی بشن.
مدل | ورودی | ورودی کَششده | خروجی |
|---|---|---|---|
GPT-6 Sol | ۲.۰۰ دلار | ۰.۲۰ دلار | ۱۰.۰۰ دلار |
GPT-6 Luna | ۰.۱۰ دلار | ۰.۰۱ دلار | ۰.۵۰ دلار |
نتایج و شواهد رو دوباره تست کنید
الان دقیقاً همون شناسههای قبلی مدل دارن از مسیر اصلاحشده پردازش تصاویر استفاده میکنن، پس نتایج ارزیابی قبل و بعد از این پچ رفتارهای متفاوتی رو نشون خواهند داد. حواستون باشه موقع مقایسه نتایج، پرامپتها، تصاویر، ابزارها، تنظیمات نمونهگیری (Sampling) و شیوههای امتیازدهی رو کاملاً یکسان نگه دارید و زمان اجرای تستها رو هم ثبت کنید.
- تکرار ارزیابیهای بینایی: تمام تستهایی که در بازه زمانی رونمایی این مدلها تا انتشار این پچ انجام دادید رو دوباره اجرا کنید و دقت و دستهبندی خطاهای جدید رو مقایسه کنید.
- تست مجدد خطاهای ایجنتهای بصری: سراغ اجراهای قبلی ابزار کدکس و فرآیندهای کار با کامپیوتر برید که تو خوندن دکمهها، اسکرینشات، متنها یا وضعیت صفحه با خطا روبهرو شده بودن.
- بازبینی خروجیهای ذخیرهشده: کَشهای برنامه و پاسخهای ذخیرهشده قبل از فیکس رو دقیق بررسی کنید، چون این پچ نمیتونه پاسخهای ثبتشده قبلی رو دستکاری کنه.
- تجدیدنظر در انتخاب مدل: قبل از اینکه بر اساس عملکردهای ضعیف قبلی تصمیم بگیرید مدل دیگهای رو جایگزین کنید، اول خروجیهای جدید و اصلاحشده چندوجهی رو بسنجید.
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.