پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

بنچمارک‌های جدید: GPT-6 Astra با هزینه‌ای بسیار کمتر به رقابت شانه به شانه با Claude Fable 5.1 می‌پردازد

انتشار:۲۸ شهریور ۱۴۰۵(۱ هفته پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

در جدیدترین ارزیابی‌های مستقل، مدل GPT-6 Astra موفق شده است با کاهش چشمگیر هزینه‌ها، جایگاه نخست را در کنار Claude Fable 5.1 از آن خود کند. این مدل جدید در عملکردهای استدلالی و ایجنت برنامه‌نویس هم‌تراز با رقیب خود ظاهر شده است.

بنچمارک‌های جدید: GPT-6 Astra با هزینه‌ای بسیار کمتر به رقابت شانه به شانه با Claude Fable 5.1 می‌پردازد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل GPT-6 Astra در شاخص هوش و شاخص ایجنت برنامه‌نویس، به طور مشترک با Claude Fable 5.1 در رتبه نخست قرار گرفت.
  • هزینه استفاده از این مدل برای وظایف استدلالی حدود ۴۰ درصد و برای کدنویسی حدود ۶۰ درصدِ هزینه Claude Fable 5.1 است.
  • میزان توهم (Hallucination) در GPT-6 Astra نسبت به نسل قبلی (GPT-5.6 Sol) به نصف کاهش یافته و همزمان دقت آن افزایش پیدا کرده است.

مدل GPT-6 Astra در دو شاخص کلیدی ارزیابی عملکرد، با هزینه‌ای کمتر به جایگاه برابری با Claude Fable 5.1 دست یافته است. عملکرد Astra در شاخص هوش با حدود ۴۰ درصد هزینه و در شاخص ایجنت برنامه‌نویس با حدود ۶۰ درصد هزینه، کاملاً هم‌تراز با Fable 5.1 ارزیابی می‌شود.

قیمت‌گذاری این مدل در تمامی بخش‌ها ۲.۵ برابر قیمت‌های فعلی GPT-5.6 Sol است؛ به طوری که از ۴ و ۲۰ دلار به ترتیب برای هر میلیون توکن ورودی و خروجی، به ۱۰ و ۵۰ دلار افزایش یافته است. با این حال، تخفیف ۹۰ درصدی برای خوانش از کش و افزایش قیمت ۲۵ درصدی برای نوشتن در کش همچنان پابرجاست.

در شاخص جامع ارزیابی هوش، GPT-6 Astra با حدود ۴۰ درصد از هزینه هر وظیفه، با Claude Fable 5.1 برابر شده و ۶ امتیاز نسبت به GPT-5.6 Sol پیشرفت داشته است. در شاخص ایجنت برنامه‌نویس نیز، این مدل با حدود ۶۰ درصد هزینه هر وظیفه، به جایگاه مشترکی با Claude Fable 5.1 رسیده است؛ دستاوردی که به لطف کمترین میزان مصرف توکن در میان تمامی ایجنت‌های حاضر در این شاخص به دست آمده است.

نکات کلیدی در شاخص ارزیابی هوش:

➤ کسب جایگاه نخست مشترک در شاخص هوش: مدل GPT-6 Astra (در بالاترین سطح تلاش) با کسب امتیاز ۵۳ در این شاخص، هم‌تراز با Claude Fable 5.1 قرار گرفته است. این مدل توانسته ۶ امتیاز نسبت به نسل پیشین خود، یعنی GPT-5.6 Sol پیشرفت کند.

➤ پیشتازی در مرز هزینه: تمام سطوح تلاش استدلالی Astra در نمودار شاخص هوش نسبت به هزینه هر وظیفه، جایگاه ویژه‌ای دارند. در رقابت با Claude Fable 5.1، مدل Astra همان امتیاز را با حدود ۴۰ درصد هزینه (۳.۲۶ دلار در برابر ۷.۶۳ دلار) به دست می‌آورد. در بالاترین سطح تلاش، Astra حدود ۶۰ درصد گران‌تر از GPT-5.6 Sol است، اما این قیمت بالاتر تا حدی با مصرف توکن کمتر جبران می‌شود.

➤ تعریف مرز پارتو در بهره‌وری توکن: تمامی سطوح استدلالی از پایین‌ترین تا بالاترین حد، در مرز پارتو برای شاخص هوش نسبت به توکن‌های خروجی هر وظیفه قرار می‌گیرند. در بالاترین سطح، Astra برای هر وظیفه ۲۷ هزار توکن خروجی مصرف می‌کند که برای کسب امتیازی برابر، حدود یک‌سوم مصرف ۷۸ هزار توکنی Claude Fable 5.1 است.

➤ کاهش ۵۰ درصدی توهم نسبت به GPT-5.6 Sol: مدل GPT-6 Astra جهش بزرگی را در بنچمارک‌های مربوط به دانش و توهم تجربه کرده است. این موفقیت ناشی از کاهش چشمگیر نرخ توهم از ۹۲ درصد به ۵۱ درصد در بالاترین سطح تلاش است. برخلاف برخی مدل‌ها، این پیشرفت به قیمت کاهش دقت تمام نشده؛ بلکه Astra همزمان دقت خود را ۴ امتیاز افزایش داده است.

➤ افزایش ۹۰ امتیازی در ارزیابی پروژه‌های طولانی‌مدت: مدل GPT-6 Astra در بنچمارک‌های پیشرفته ارزیابی کارهای دانشی طولانی‌مدت، حدود ۹۰ امتیاز پیشرفت داشته است. در این ارزیابی‌ها، مدل‌ها روی پروژه‌های چند هفته‌ای با وظایف پیوسته و هزاران فایل منبع تست می‌شوند. مدل Astra در امتیازات کیفی و تحلیلی نسبت به نسل قبلی خود رشد چشمگیری نشان می‌دهد. با این حال، در زمینه کیفیت ارائه (Presentation Quality) افت کوچکی دیده می‌شود؛ جایی که GPT-5.6 Sol همچنان در میان تمام مدل‌ها پیشتاز است.

➤ پیشتازی در بنچمارک‌های Terminal-Bench، AutomationBench و GDP.pdf: مدل GPT-6 Astra در نسخه ۴.۰ بنچمارک Terminal-Bench با امتیاز ۵۹ درصد، بالاتر از Claude Fable 5.1 (۵۲ درصد) و با اختلاف ۱۹ امتیازی بالاتر از GPT-5.6 Sol (۴۰ درصد) قرار گرفت. این مدل در ارزیابی‌های مربوط به جریان‌های کاری تجاری (AutomationBench) با امتیاز ۶۹ درصد از Grok 4.6 (۶۷ درصد) و GPT-5.6 Sol (۶۰ درصد) پیشی گرفته است. همچنین در بنچمارک GDP.pdf که استدلال روی اسناد حرفه‌ای را می‌سنجد، در ۳۱ درصد مواقع تمام معیارها را با موفقیت پشت سر گذاشت؛ در حالی که این رقم برای GPT-5.6 Sol معادل ۲۷ درصد بود.

➤ کاهش عملکرد در ارزیابی کارهای باارزش اقتصادی (GDPval v2): در مقایسه با GPT-5.6 Sol، افت حدود ۴۵ امتیازی در بنچمارک ارزیابی وظایف باارزش اقتصادی مشاهده می‌شود. گزارش‌ها نشان می‌دهد که GPT-6 Astra در این وظایف از نوبت‌های (turns) بسیار کمتری نسبت به سایر مدل‌ها استفاده می‌کند؛ یعنی ۲۴ نوبت به ازای هر وظیفه در بالاترین سطح تلاش، در مقایسه با ۴۵ نوبت برای GPT-5.6 Sol و ۶۰ نوبت برای مدل‌های Claude Fable 5.1 و Claude Opus 5.

نکات کلیدی در شاخص ایجنت برنامه‌نویس:

➤ جایگاه نخست مشترک در شاخص ایجنت برنامه‌نویس: در محیط Codex، مدل GPT-6 Astra امتیاز ۶۲ را کسب کرده و هم‌تراز با Claude Fable 5.1 (در محیط Claude Code) و بالاتر از Claude Opus 5 (امتیاز ۶۰)، GPT-5.6 Sol (امتیاز ۵۵) و Muse Spark 1.3 در Muse Code (امتیاز ۵۴) قرار گرفته است. برتری ۷ امتیازی آن نسبت به GPT-5.6 Sol ناشی از عملکرد بهتر در Terminal-Bench v4.0 و SWE-Atlas-QnA است که البته با امتیاز کمتر در بنچمارک DeepSWE تا حدی تعدیل شده است.

➤ پیشتازی در هزینه ایجنت برنامه‌نویس: در بالاترین سطح تلاش، هزینه GPT-6 Astra برای هر وظیفه ۷.۰۹ دلار است که برای کسب ۷ امتیاز بالاتر، حدود ۱۵ درصد گران‌تر از GPT-5.6 Sol تمام می‌شود. با این حال، برای هر وظیفه، این مدل در ازای کسب امتیازی برابر یا بالاتر، حدود ۴۰ درصد ارزان‌تر از Claude Fable 5.1 و حدود ۳۰ درصد ارزان‌تر از Claude Opus 5 است. بهره‌وری هزینه‌ای Astra نتیجه مستقیم بهره‌وری در مصرف توکن است؛ به طوری که در بالاترین سطح تلاش، تنها یک‌سوم توکن‌های نسل قبلی خود را مصرف می‌کند.

تمام سطوح استدلالی GPT-6 Astra، از پایین‌ترین سطح با ۰.۸۲ دلار برای هر وظیفه تا بالاترین سطح با ۳.۲۶ دلار، در مرز بهینه شاخص هوش نسبت به هزینه قرار دارند. در مقایسه با Claude Fable 5.1، این مدل با حدود ۴۰ درصد هزینه کمتر، به امتیازی برابر دست می‌یابد.

مدل GPT-6 Astra مرز پارتو را برای شاخص هوش نسبت به توکن‌های خروجی تعریف می‌کند. این مدل در بالاترین سطح تلاش، برای کسب امتیازی مساوی، تنها یک‌سوم توکن‌های خروجی Claude Fable 5.1 را مصرف می‌کند.

این مدل در شاخص ایجنت برنامه‌نویس نیز از نظر هزینه پیشتاز است و با ۷.۰۹ دلار هزینه برای هر وظیفه (در بالاترین سطح تلاش)، حدود ۴۰ درصد ارزان‌تر از Claude Fable 5.1 عمل می‌کند.

مدل GPT-6 Astra در ارزیابی‌های مربوط به دانش جامع جهش بزرگی داشته است که دلیل اصلی آن، کاهش چشمگیر نرخ توهم از ۹۲ درصد به ۵۱ درصد و همچنین افزایش نسبی دقت آن است.

در ارزیابی پروژه‌های طولانی‌مدت، GPT-6 Astra حدود ۹۰ امتیاز بالاتر از نسل قبلی خود قرار گرفته و کیفیت تحلیلی آن به‌شدت افزایش یافته است؛ هرچند در کیفیت ارائه همچنان GPT-5.6 Sol پیشتاز است.

در بنچمارک جریان‌های کاری تجاری (AutomationBench)، مدل GPT-6 Astra با امتیاز ۶۹ درصد گوی سبقت را از مدل‌های Grok 4.6 (۶۷ درصد)، GLM-5.3 (۶۲ درصد) و GPT-5.6 Sol (۶۰ درصد) ربوده است.

جزئیات ارزیابی‌های مستقل و فردی در شاخص جامع سنجش هوش.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

کلاهبرداری ترسناک با جعل صدای پدربزرگ؛ دختر جوانی که به جنگ دیپ‌فیک‌های صوتی رفت!
آخرین اخبار

کلاهبرداری ترسناک با جعل صدای پدربزرگ؛ دختر جوانی که به جنگ دیپ‌فیک‌های صوتی رفت!

ماجرای کلاهبرداری هوشمندانه از یک پدربزرگ با صدای شبیه‌سازی‌شده برادرش، انگیزه‌ای شد تا نوه‌اش استارتاپ DetectifAI را راه‌اندازی کند. این شرکت هوش مصنوعی مدل‌های فوق‌العاده سبکی توسعه داده که مستقیماً روی سیستم‌عامل گوشی‌ها اجرا می‌شوند و صداهای جعلی را بدون ارسال به سرورهای ابری، به‌صورت آنی و زنده در حین تماس تشخیص می‌دهند.

۴ دقیقه مطالعه
۰
۶ مهر
هشدار تکان‌دهنده پدرخوانده هوش مصنوعی و نخبگان سیلیکون‌ولی: اگر هوش مصنوعی خودش را ارتقا دهد، فرصت مهارش تمام می‌شود!
آخرین اخبار

هشدار تکان‌دهنده پدرخوانده هوش مصنوعی و نخبگان سیلیکون‌ولی: اگر هوش مصنوعی خودش را ارتقا دهد، فرصت مهارش تمام می‌شود!

جمعی از برجسته‌ترین دانشمندان هوش مصنوعی از جمله جفری هینتون، هشدار داده‌اند که با خودکار شدن توسعه مدل‌ها، ممکن است با یک «انفجار هوش» مهارنشدنی روبه‌رو شویم. به گفته آن‌ها، اگر سیستم‌ها خودشان به ارتقای خود بپردازند، سرعت پیشرفت به حدی بالا می‌رود که فرصت دولت‌ها و جامعه برای واکنش و مهار آن عملاً تمام خواهد شد.

۳ دقیقه مطالعه
۰
۶ مهر
وقتی هوش مصنوعی با اعتمادبه‌نفس تمام سوتی میده؛ خطرات پنهان چت‌بات‌ها در محیط کار
آخرین اخبار

وقتی هوش مصنوعی با اعتمادبه‌نفس تمام سوتی میده؛ خطرات پنهان چت‌بات‌ها در محیط کار

استفاده بی‌ضابطه از چت‌بات‌ها و هوش مصنوعی در محیط‌های کاری به یکی از بزرگ‌ترین کابوس‌های امنیتی شرکت‌ها تبدیل شده است. اگر هوش مصنوعی با اطمینان کامل اطلاعات غلط یا توهمی تحویل دهد و داده‌های حساس سازمانی افشا شوند، خسارات سنگینی به بار می‌آید؛ ماجرایی که نشان می‌دهد کسب‌وکارها برای مهار این خطرات به قوانین شفاف و نظارت انسانی نیاز دارند.

۶ دقیقه مطالعه
۰
۶ مهر