پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی استارتاپ کره‌ای آپ‌استیج از مدل Solar Mini 4؛ سریع در خروجی، اما ۵ برابر گران‌تر در دنیای واقعی!

انتشار:۹ مهر ۱۴۰۵(۲ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ هوش مصنوعی کره‌ای آپ‌استیج (Upstage) از مدل استدلالی جدید Solar Mini 4 با ۳ میلیارد پارامتر فعال رونمایی کرد که در بنچمارک‌های هوش عملکردی فراتر از ابعاد کوچکش به نمایش گذاشته است. با این حال، مصرف سرسام‌آور توکن‌های استدلالی و بازدهی ضعیف سیستم کش باعث شده اجرای هر تسک با این مدل تا ۵ برابر گران‌تر از رقبایی مثل GPT-6 Luna تمام شود.

رونمایی استارتاپ کره‌ای آپ‌استیج از مدل Solar Mini 4؛ سریع در خروجی، اما ۵ برابر گران‌تر در دنیای واقعی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ کره‌ای Upstage مدل استدلالی اختصاصی جدید خود به نام Solar Mini 4 را با ۳ میلیارد پارامتر فعال معرفی کرد که رکورد پرچمدار نسل قبلی این شرکت را با جهشی چشمگیر شکسته است.
  • این مدل در تولید توکن بسیار پرسرعت است (۲۰۸ توکن بر ثانیه)، اما به دلیل مصرف بیش از ۸۸ هزار توکن استدلالی برای هر تسک، حل هر مسئله به طور میانگین بیش از ۷ دقیقه معطلی دارد.
  • با وجود قیمت اسمی پایین توکن‌ها، بازدهی ضعیف در کش کردن اطلاعات (فقط ۴۸ درصد) باعث شده هزینه واقعی هر تسک با این مدل حدود ۵ برابر گران‌تر از رقیبی مثل GPT-6 Luna تمام شود.

آزمایشگاه هوش مصنوعی کره‌ای 🇰🇷 استارتاپ Upstage از مدل استدلالی Solar Mini 4 رونمایی کرد؛ مدلی که در شاخص جامع هوش امتیاز ۲۴ را ثبت کرده، اما با وجود قیمت ظاهراً مشابه توکن‌ها، هزینه نهایی انجام هر تسک با آن حدود ۵ برابر بیش‌تر از GPT-6 Luna تمام می‌شود!

استارتاپ کره‌ای آپ‌استیج (Upstage) مدل استدلالی اختصاصی جدیدی به نام Solar Mini 4 را عرضه کرده است. طبق اعلام این استارتاپ، مدل مذکور از ۳۵ میلیارد پارامتر کل و ۳ میلیارد پارامتر فعال بهره می‌برد و توانسته نقطه بهینه جدیدی (Pareto optimal) را میان «شاخص هوش» و «پارامترهای فعال» برای مدل‌های زیر ۳ میلیارد پارامتر به ثبت برساند. این مدل همچنین نسبت به پرچمدار نسل قبلی همین شرکت یعنی Solar Pro 3 (با امتیاز ۸)، ۱۶ امتیاز بالا‌تر ایستاده و قیمت هر یک میلیون توکن ورودی و خروجی را هم با کاهشی یک‌سومی، به ترتیب به ۰.۱۰ و ۰.۴۰ دلار رسانده است.

مهم‌ترین نتایج و ارزیابی‌های کلیدی:

➤ عملکرد فوق‌العاده نسبت به جثه و پارامترهای فعال: مدل Solar Mini 4 موفق شده ۶ امتیاز بالا‌تر از مدل استدلالی Qwen3.6 35B A3B (که آن هم ۳ میلیارد پارامتر فعال دارد) و حتی ۱ امتیاز بالا‌تر از غول Nemotron 3 Ultra با ۵۵ میلیارد پارامتر فعال ثبت کند! البته از آنجا که این مدل اختصاصی و متن‌بسته است، امکان راستی‌آزمایی مستقل ابعاد واقعی آن وجود ندارد.

➤ استدلال در بافت‌های طولانی، برگ برنده این مدل: مدل جدید آپ‌استیج در بنچمارک استدلال در بافت طولانی (LCR v1.1) به امتیاز عالی ۸۳ درصد رسیده و با غول‌هایی مثل MiniMax-M3 و GPT-6 Luna برابری می‌کند؛ عملکردی که حتی بالا‌تر از مدل‌های نام‌آشنایی نظیر Gemini 3.8 Flash و GPT-6 Astra با امتیاز ۸۱ درصد قرار می‌گیرد. علاوه بر این، در بنچمارک برنامه‌نویسی علمی SciCode نیز امتیاز ۴۸ درصد را ثبت کرده و از MiniMax-M3 و Inkling (با امتیاز ۴۷ درصد) جلو افتاده است.

➤ خروجی برق‌آسا اما معطلی در اجرای کار‌ها: مدل Solar Mini 4 با سرعت خیره‌کننده ۲۰۸ توکن در ثانیه خروجی تولید می‌کند که حسابی از GPT-6 Luna با سرعت ۱۵۲ توکن بر ثانیه سریع‌تر است. اما داستان به این سادگی نیست؛ این مدل برای حل هر تسک در شاخص هوش، حدود ۸۸ هزار توکن خروجی تولید می‌کند و همین زیاده‌گویی باعث شده اجرای هر تسک به طور میانگین ۷.۱ دقیقه طول بکشد و کاربر را معطل کند!

➤ نقطه ضعف نسبی در کدنویسی ایجنتی: مدل جدید در کار‌های ایجنتی و برنامه‌نویسی عملکرد چندان درخشانی ندارد؛ به طوری که در بنچمارک Terminal-Bench 4.0 امتیاز ناامیدکننده ۱ درصد و در بنچمارک اتوماسیون (AutomationBench) امتیاز ۲۲ درصد را کسب کرده است. البته در کار‌های دانشی مبتنی بر ایجنت‌ها، وضعیت بهتر است و با کسب امتیاز ۱۰۷۲ Elo در بنچمارک GDPval و ۸۷۲ Elo در Briefcase، عملکردی نزدیک به مدل Inkling نشان می‌دهد.

➤ دقت پایین در دانش عمومی، اما توهم اندک: مدل Solar Mini 4 در بنچمارک ارزیابی دانش و توهم (Omniscience) امتیاز ۱۱- و دقت ۱۸ درصدی به دست آورده است. نکته جالب اینجاست که مدل به جای زدن حرف‌های نامربوط، ترجیح می‌دهد به نیمی از سؤالات پاسخ ندهد! به همین دلیل نرخ عدم توهم آن به ۶۴ درصد رسیده که بسیار بهتر از Inkling با ۳۲ درصد و GPT-6 Luna با ۲۳ درصد است.

سایر مشخصات فنی مدل:

➤ پنجره زمینه (Context Window): یک میلیون توکن

➤ حداکثر توکن‌های خروجی: ۲۶۲ هزار توکن

➤ لایسنس و دسترسی: اختصاصی و تجاری (وزن‌های مدل منتشر نشده است)

➤ تعداد پارامترها: ۳۵ میلیارد پارامتر کل و ۳ میلیارد پارامتر فعال (طبق گزارش رسمی Upstage)

➤ مودالیتی‌ها: فقط ورودی و خروجی متنی

➤ تاریخ انقضای دانش (Knowledge Cutoff): فوریه ۲۰۲۶

➤ قیمت‌گذاری: ۰.۱۰ دلار به ازای هر ۱ میلیون توکن ورودی، ۰.۴۰ دلار به ازای خروجی و ۰.۰۱ دلار برای هر بار فراخوانی کش (Cache Hit)

استارتاپ Upstage گزارش داده که Solar Mini 4 دارای ۳۵ میلیارد پارامتر در مجموع و ۳ میلیارد پارامتر فعال است و در این ابعاد، رکورد بهینه پارتو (Pareto) را در مقایسه شاخص هوش در برابر پارامترهای فعال شکسته است. از آنجا که این مدل اختصاصی است، وزن‌های آن به صورت عمومی در دسترس نیست. برای مقایسه، مدل Qwen3.6 35B A3B با همین ۳ میلیارد پارامتر فعال امتیاز ۱۸ را کسب کرده، در حالی که K2 Horizon MoVA 36B A4B با ۴ میلیارد پارامتر فعال به امتیاز ۲۵ رسیده است. جالب اینکه پرچمدار نسل پیشین آپ‌استیج یعنی Solar Pro 3 با وجود ۱۲ میلیارد پارامتر فعال، تنها امتیاز ۸ را گرفته بود.

توکن‌های ورودی بدون کش، حدود ۰.۳۰ دلار از هزینه کل ۰.۳۶ دلاری Solar Mini 4 برای هر تسک در شاخص هوش را تشکیل می‌دهند. در تسک‌های مبتنی بر ایجنت (مانند Terminal-Bench 4.0 و Briefcase) گفت‌وگو مدام در هر مرحله طولانی‌تر و دوباره ارسال می‌شود؛ بنابراین بهره‌وری کش نقشی حیاتی دارد. طبق بررسی‌ها و اندازه‌گیری‌های انجام‌شده، تنها ۴۸ درصد از محتوای تکراری Solar Mini 4 از طریق حافظه کش پردازش شده است؛ این در حالی است که این رقم برای رقیبی مانند GPT-6 Luna به ۹۹ درصد می‌رسد و همین موضوع هزینه هر تسک آن مدل را به ۰.۰۷ دلار کاهش داده است. توکن‌های استدلال و پاسخ نیز در مجموع تنها حدود ۰.۰۴ دلار به هزینه هر تسک اضافه می‌کنند.

مدل Solar Mini 4 برای انجام هر تسک در شاخص هوش، حدود ۸۸ هزار توکن خروجی مصرف می‌کند که حتی از ۷۸ هزار توکن مدل Claude Fable 5.1 هم بیش‌تر است. جالب اینجاست که ۷۲ هزار مورد از این توکن‌ها، صرفاً توکن‌های زنجیره استدلال (Reasoning Tokens) هستند. مصرف توکن خروجی این مدل تقریباً ۲.۵ برابر مدل Inkling و ۵ برابر مدل Gemini 3.5 Flash-Lite (با امتیازهای به ترتیب ۲۵ و ۲۲) است. هرچند با قیمت ۰.۴۰ دلار به ازای هر میلیون توکن خروجی، این حجم توکن تأثیر مالی وحشتناکی روی قیمت ندارد، اما زمان پردازش کار‌ها را به شدت طولانی و خسته‌کننده می‌کند.

مدل Solar Mini 4 با سرعت ۲۰۸ توکن در ثانیه خروجی تولید می‌کند، اما به دلیل حجم عظیم توکن‌های تولیدی، زمان تکمیل کار‌ها در مقایسه با GPT-6 Luna بسیار کندتر است. میانگین زمان رمزگشایی و پردازش برای هر تسک در شاخص هوش با این مدل ۷.۱ دقیقه است؛ در حالی که مدل GPT-6 Luna با سرعت ۱۵۲ توکن در ثانیه کار را ظرف ۵.۸ دقیقه و مدل Inkling با سرعت ۱۸۳ توکن در ثانیه ظرف ۲.۸ دقیقه تمام می‌کنند.

امتیاز ۱۱- مدل Solar Mini 4 در بنچمارک Omniscience، بیش از آنکه نشان‌دهنده توهم بالا باشد، بیانگر دقت پایین در ذخیره دانش است. این مدل تنها به ۱۸ درصد از سؤالات پاسخ درست داده که در میان مدل‌های مقایسه‌شده جزو ضعیف‌ترین‌هاست، و در حدود نیمی از سؤالات هم ترجیح داده به جای پاسخ اشتباه سکوت کند! با این حال، نرخ عدم توهم ۶۴ درصدی آن به طور چشمگیری از Inkling (با ۳۲ درصد) و GPT-6 Luna (با ۲۳ درصد) بالا‌تر و مطمئن‌تر است.

نتایج کامل مدل Solar Mini 4 در شاخص جامع ارزیابی هوش

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!
آخرین اخبار

خط قرمز کالیفرنیا برای کارفرماها: اخراج کارمندان با هوش مصنوعی رسماً ممنوع شد!

ایالت کالیفرنیا با تصویب یک بسته قانونی تازه، دست کارفرماها را در استفاده بی‌رویه از هوش مصنوعی بست و اخراج کارکنان صرفاً بر اساس تصمیم الگوریتم‌ها را ممنوع اعلام کرد. این قانون علاوه بر الزام به شفافیت در تعدیل‌های نیرو، استفاده از هوش مصنوعی برای نظارت تصویری در سرویس‌های بهداشتی محل کار را هم قدغن کرده است. فرماندار کالیفرنیا با دفاع از نیروی کار، ادعای امکان خودتنظیم‌گری شرکت‌های هوش مصنوعی را بی‌اساس خواند.

۲ دقیقه مطالعه
۰
۹ مهر
طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!
آخرین اخبار

طوفان هوش مصنوعی در بازار حافظه؛ رکورد تاریخی درآمد ۵۴ میلیارد دلاری میکرون در یک فصل!

عطش سیری‌ناپذیر غول‌های فناوری برای توسعه هوش مصنوعی، درآمد فصلی شرکت میکرون را با جهشی باورنکردنی به بیش از ۵۴ میلیارد دلار رساند تا وال‌استریت شگفت‌زده شود. این غول تراشه‌سازی با ثبت درآمد سالانه ۱۳۳ میلیارد دلاری رکورد تاریخ خود را شکست و حالا با تقاضای انفجاری برای حافظه‌های پیشرفته، چشم به آینده‌ای درخشان‌تر دوخته است.

۲ دقیقه مطالعه
۰
۹ مهر
خداحافظی گوگل با Opal؛ جمزها به «اسکیل‌های جمینای» برای تمام کاربران تبدیل می‌شوند!
آخرین اخبار

خداحافظی گوگل با Opal؛ جمزها به «اسکیل‌های جمینای» برای تمام کاربران تبدیل می‌شوند!

گوگل در اقدامی تازه برای یکپارچه‌سازی ابزار‌های هوش مصنوعی، سرویس Opal را بازنشسته کرده و دستیارهای اختصاصی جمز را به «اسکیل‌های جمینای» تبدیل می‌کند. این قابلیت که پیش از این در انحصار کاربران اشتراکی بود، حالا با پیروی از استاندارد مشترک ایجنت‌ها و به کمک دستورهای ساده اسلش، به رایگان در دسترس همه کاربران قرار می‌گیرد.

۴ دقیقه مطالعه
۰
۹ مهر