پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

پورتال Nous مدل قدرتمند Step 5 را یک هفته رایگان کرد؛ فرصتی عالی برای محک زدن غول ۶۰۰ میلیاردی

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

مجموعه Nous Research اعلام کرد که توسعه‌دهندگان می‌توانند به مدت یک هفته مدل پرچمدار و ۶۰۰ میلیارد پارامتری Step 5 Preview را به صورت کاملاً رایگان روی پورتال این شرکت امتحان کنند. این مدل پیشرفته با پنجره زمینه یک میلیون توکنی و پشتیبانی از ورودی‌های چندرسانه‌ای، عملکرد درخشانی در وظایف ایجنتی و کدنویسی از خود نشان داده است. این فرصت به تیم‌های فنی اجازه می‌دهد قابلیت‌های این غول پردازشی را بدون پرداخت هزینه‌های معمول API زیر ذره‌بین بگذارند.

پورتال Nous مدل قدرتمند Step 5 را یک هفته رایگان کرد؛ فرصتی عالی برای محک زدن غول ۶۰۰ میلیاردی

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پورتال Nous دسترسی به مدل جدید Step 5 Preview (ساخت استارتاپ چینی StepFun) را به مدت یک هفته رایگان کرده؛ مدلی با معماری MoE و ۶۰۰ میلیارد پارامتر کل که در هر توکن فقط ۲۷ میلیارد پارامتر آن فعال می‌شود.
  • این مدل با پنجره زمینه عظیم ۱ میلیون توکنی، ورودی متن، تصویر و ویدیو و پشتیبانی از ابزار‌های استدلال پیشرفته عرضه شده و در بنچمارک‌های ایجنتی مثل Hermes Index و کدنویسی DeepSWE حسابی درخشیده است.
  • اگرچه قیمت رسمی API این مدل بسیار اقتصادی اعلام شده، اما تولید پاسخ‌های طولانی و زنجیره استدلال مفصل می‌تواند مصرف توکن‌ها را بالا ببرد؛ بنابراین این بازه رایگان بهترین فرصت برای سنجش واقعی هزینه‌هاست.

فرصت یک‌هفته‌ای و رایگان برای تجربه Step 5 Preview در پورتال Nous

مجموعه Nous Research امکان دسترسی کاملاً رایگان به مدل Step 5 Preview (محصول استارتاپ StepFun) را به مدت یک هفته روی پورتال خود فراهم کرده است. این مدل پرچمدار، ترکیبی از یک معماری اسپارس (تنک) با ۶۰۰ میلیارد پارامتر، پشتیبانی از بینایی ماشین و پنجره زمینه غول‌پیکر ۱ میلیون توکنی است. جالب اینکه در بررسی‌های تصحیح‌شده بنچمارک Hermes Index، این مدل امتیاز ۳۲.۸۳ را به دست آورده که تنها ۱.۰۶ امتیاز با مدل GPT-6 Luna فاصله دارد.

این طرح تشویقی به توسعه‌دهندگان فرصت می‌دهد تا بدون پرداخت هزینه‌های سنگین و معمول توکن در StepFun، مدل را حسابی به چالش بکشند؛ هزینه‌هایی که بر اساس تعرفه‌های رسمی API معادل ۱ دلار به ازای هر یک میلیون توکن ورودی و ۲.۷۰ دلار برای هر یک میلیون توکن خروجی است. علاوه بر این، پورتال Nous زیرساخت ارزیابی Hermes Agent را که در لیدربوردهای عمومی استفاده می‌شود در اختیار کاربران گذاشته تا تیم‌های مهندسی بتوانند عملکرد این هوش مصنوعی را در جریان‌های کاری ایجنتی و مشابه شرایط واقعی بسنجند.

تنها ۲۷ میلیارد وزن برای هر توکن فعال می‌شود!

مدل Step 5 Preview از معماری هوشمندانه «ترکیب متخصصان تنک» (Sparse MoE) بهره می‌برد. به زبان ساده، هرچند که در مجموع حدود ۶۰۰ میلیارد پارامتر در دل این مدل ذخیره شده، اما برای پردازش هر توکن فقط نزدیک به ۲۷ میلیارد پارامتر (حدود ۴.۵ درصد از کل وزن‌ها) فعال می‌شوند. این ترفند هوشمندانه باعث می‌شود محاسبات لازم برای پاسخ به هر درخواست به شکل چشمگیری پایین بیاید؛ هرچند برای پیاده‌سازی و استقرار مدل روی سرور، همچنان به رم و حافظه ویدیویی کافی برای نگهداری یا استریم کل حجم وزن‌ها نیاز خواهید داشت.

در صفحه رسمی مدل در StepFun به قابلیت‌های کلیدی زیر اشاره شده است:

  • هسته پردازشی مدل: در مجموع ۶۰۰ میلیارد پارامتر، ۲۷ میلیارد پارامتر فعال در ازای هر توکن و معماری باریک و عمیق با ۹۲ لایه پردازشی.
  • حافظه زمینه و طول پاسخ: پنجره زمینه ۱ میلیون توکنی و توانایی تولید پاسخ تا ۶۴ هزار توکن.
  • پشتیبانی چندرسانه‌ای: دریافت ورودی به صورت متن، تصویر و ویدیو.
  • امکانات ویژه API: استریم زنده، فراخوانی ابزار‌ها (Tool Calling)، حالت‌های JSON و JSON Schema، کش کردن پرامپت‌ها (Prompt Caching) و تنظیم میزان تلاش استدلالی در سه سطح کم، متوسط یا زیاد.

پردازش پرامپت‌های ۱ میلیون توکنی در مکانیزم‌های توجه سنتی فوق‌العاده سنگین و پرهزینه تمام می‌شود، چون مدل باید ارتباط میان حجم عظیمی از توکن‌ها را بسنجد. شرکت StepFun برای حل این چالش، از تکنیک «توجه کوئری گروهی تنک» (Sparse Grouped-Query Attention) و ادغام بلوکی توکن‌ها بهره برده است. به گفته این شرکت، این رویکرد نوآورانه هزینه‌های نمایه‌سازی و انتخاب برترین گزینه‌ها (top-k) را به یک‌هشتم مدل‌های متراکم مرسوم کاهش داده و هم‌زمان اطلاعات هم‌پوشان بلوک‌های مجاور را با موفقیت ترکیب می‌کند.

فرآیند آموزش این مدل روی وظایف طولانی ایجنتی متمرکز بوده و از طریق «یادگیری تقویتی بر اساس خط‌مشی» (on-policy reinforcement learning) پیش رفته است؛ جایی که مدل مسیرهای عملیاتی را خودش تولید کرده و از نتایج سیاست‌های فعلی‌اش درس می‌گیرد. شرکت سازنده همچنین اعلام کرده که هدایت درخواست‌ها میان متخصصان (Expert Routing) در مراحل آموزش و استنتاج کاملاً بیت‌به‌بیت هماهنگ و یکپارچه است. در بخش زیرساخت سرور و سرویس‌دهی نیز از زمان‌بندی هوشمند مبتنی بر بار، محاسبات سریع FP8، رمزگشایی گمانه‌زن MTP-3 و تخلیه هوشمند حافظه KV-cache به خارج از حافظه گران‌قیمت شتاب‌دهنده‌ها استفاده شده است؛ پیشرفت‌هایی که به ادعای StepFun، سرعت کلی یادگیری تقویتی در افق‌های طولانی را بیش از ۳ برابر افزایش داده است.

یک بازبینی فنی و پیشی گرفتن Luna

شاخص معتبر Hermes Index عملکرد مدل‌ها را در چهار بنچمارک Hermes Bench، TerminalBench 4، TerminalBench Science و SkillsBench می‌سنجد. تمامی مدل‌ها در محیط تست ایجنتی یکسان یعنی Hermes Agent به رقابت می‌پردازند و سطح استدلال آن‌ها (در صورت پشتیبانی) روی بالا‌ترین حد تنظیم می‌شود. مبنای نتایج بر اساس معیار pass@1 است؛ به این معنی که مدل برای حل هر تسک تنها یک شانس دارد و میانگین عملکرد در این چهار بخش، امتیاز نهایی شاخص را تعیین می‌کند.

مجموعه Nous در گزارش اولیه خود امتیاز ۳۳.۸۹ را برای Step 5 Preview ثبت کرده بود که دقیقاً برابر با مدل قدرتمند GPT-6 Luna بود؛ اما بعد از بررسی مجدد و اصلاح داده‌ها، این امتیاز به ۳۲.۸۳ تغییر یافت. بخشی از نتایج لیدربورد در جدول زیر آمده است:

مدل
شاخص Hermes Index
میانگین هزینه هر تسک
Claude Opus 5.5
63.31
$4.99
GPT-6 Astra
56.25
$11.61
Claude Sonnet 5.5
53.14
$2.82
GLM 5.3 Flash
34.95
ذکر نشده
GPT-6 Luna
33.89
ذکر نشده
Step 5 Preview
32.83
ذکر نشده

البته باید در نظر داشت که این لیدربورد شرایط محیط تست و ابزار‌ها را به صورت ثابت و یکنواخت نگه می‌دارد و برای مقایسه ایجنت‌ها در همین چارچوب ایده‌آل است؛ اما این نتایج لزوماً به این معنا نیست که مدل در تمام مخازن کد، زنجیره‌های ابزاری یا محیط‌های واقعی تجاری نیز عملکردی مشابه داشته باشد. بنابراین تیم‌های فنی همچنان باید مدل را در محیط‌های عملیاتی اختصاصی خود تست کنند.

قدرت بالا در کدنویسی، اما با بهای پرحرفی!

شرکت StepFun مدل Step 5 Preview را برای کدنویسی ایجنتی و وظایف تخصصی سازمانی (از جمله تحلیل‌های مالی) بهینه‌سازی کرده است. ارزیابی‌های منتشرشده در بنچمارک مطرح DeepSWE v1.1 نشان می‌دهد که این مدل شانه به شانه رقبای مطرح بازار در کدنویسی حرکت می‌کند:

مدل
امتیاز DeepSWE v1.1
GPT-6 Astra Max
74.1
Claude Opus 5 Max
74.0
Step 5 Preview (سطح استدلال بالا)
67.7
Kimi K3 Max
67.5
GLM-5.3 Max
66.9

البته نباید فراموش کرد که این آمار‌ها مستقیماً توسط خود شرکت سازنده اعلام شده و نام مدل‌ها یا تنظیمات تست ممکن است با لیدربوردهای مستقلی مانند Hermes Index تفاوت داشته باشد. با اینکه این ارقام ادعای قدرت بالای مدل در برنامه‌نویسی را تأیید می‌کنند، اما نمی‌توان آنها را با بنچمارک‌های مستقل کاملاً یکسان دانست. همچنین در این آمارها، بنچمارک مجزایی برای ارزیابی قابلیت‌های مالی مدل ارائه نشده است.

نکته چالش‌برانگیز ماجرا، حجم بالای خروجی توکن‌هاست که ارزان بودن قیمت اولیه را تحت‌الشعاع قرار می‌دهد. در آزمایش‌های Hermes Index، مدل Step 5 Preview نزدیک به ۱۶۰ میلیون توکن خروجی تولید کرد؛ رقمی که در مقایسه با میانه ۹۲ میلیون توکنی سایر مدل‌ها، بسیار بالا‌تر است! ردپاهای طولانی استدلال و توضیحات مفصل می‌توانند بخشی از صرفه‌جویی ناشی از قیمت ارزان توکن را بسوزانند. به همین دلیل، تیم‌های مهندسی هنگام تست مدل برای محیط‌های واقعی باید علاوه بر قیمت هر توکن، فاکتورهایی مثل هزینه کل هر تسک موفق، نرخ تکمیل و زمان پاسخ‌دهی را نیز به دقت رصد کنند.

سه زمینه طلایی برای تست رایگان این مدل

  1. ایجنت‌های کدنویسی در سطح کل مخزن کد (Repository): بازنویسی و ریفکتور فایل‌های متعدد، بازتولید باگ‌ها، ساخت پچ‌های اصلاحی، اجرای تست‌ها و بازیابی خودکار پس از خطای ابزار‌ها را آزمایش کنید. سقف ۱ میلیون توکنی فضا را برای مخازن کد بزرگ باز می‌گذارد و این دوره آزمایشی به خوبی نشان می‌دهد مدل تا چه حد می‌تواند جزییات مرتبط را از این حجم اطلاعات بیرون بکشد.
  2. خطوط لوله اسناد چندرسانه‌ای (Multimodal): جریان‌های کاری پیچیده‌ای که گزارش‌ها، نمودارها، اسکرین‌شات‌ها و ویدیوها را با هم ترکیب می‌کنند بررسی نمایید. پشتیبانی بومی از متن، تصویر و ویدیو نیاز به سرویس‌های پردازش تصویر جداگانه را برطرف می‌کند.
  3. امکان‌سنجی میزبانی اختصاصی (Self-Hosting): شرکت StepFun اعلام کرده وزن‌های مدل در تاریخ ۱۵ اکتبر ۲۰۲۶ (۲۳ مهر ۱۴۰۵) به صورت عمومی منتشر می‌شود. با این حال، چک‌پوینت خام فرمت BF16 برای یک مدل ۶۰۰ میلیارد پارامتری به حدود ۱.۲ ترابایت حافظه (پیش از در نظر گرفتن کش KV، افزونگی و سربارهای اجرایی) نیاز دارد. اگرچه فعال‌سازی تنک (Sparse) بار محاسباتی توکن‌ها را کاهش می‌دهد، اما کوانتیزاسیون و تکنیک‌های تخلیه حافظه تعیین خواهند کرد که مدل واقعاً روی چه سخت‌افزارهایی قابل اجراست. علاوه بر این، شرایط مجوز (لایسنس) نیز پس از انتشار عمومی نیازمند بررسی خواهد بود.

سیاست قیمت‌گذاری تهاجمی StepFun و برنامه‌ریزی برای انتشار عمومی وزن‌ها، ادامه‌دهنده موج قدرتمندی از سوی آزمایشگاه‌های هوش مصنوعی چینی مثل Kimi، GLM و DeepSeek برای کاهش سرسام‌آور قیمت API و در دسترس قرار دادن مدل‌های بزرگ است. تیم‌های توسعه با بهره‌مندی از این بازه رایگان یک‌هفته‌ای می‌توانند با تعریف شرایط ثابت (شامل مخزن یکسان، پرامپت‌های مشابه، دسترسی‌های ابزاری، تنظیمات استدلال و بودجه مشخص توکن) ارزیابی منصفانه‌ای میان مدل‌ها داشته باشند. ثبت نرخ تکمیل وظایف، تأخیر زمانی، نرخ خطای ابزار‌ها و حجم کل توکن‌های مصرفی مشخص خواهد کرد که آیا تعرفه‌های جذاب Step 5 Preview در نهایت به کاهش واقعی هزینه‌ها در پروژه‌های تجاری منجر می‌شود یا خیر.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

نقشه اپل برای پادکست‌های هوش مصنوعی: جذب بی‌سروصدای تیم و فناوری استارتاپ Huxe
آخرین اخبار

نقشه اپل برای پادکست‌های هوش مصنوعی: جذب بی‌سروصدای تیم و فناوری استارتاپ Huxe

اپل با امضای قراردادی هوشمندانه، تیم و فناوری استارتاپ Huxe را جذب کرده تا احتمالاً قابلیت تولید پادکست‌های صوتی با هوش مصنوعی را به سرویس‌های خود بیاورد. بنیان‌گذاران این استارتاپ همان چهره‌هایی هستند که پیش از این پادکست‌های گفت‌وگومحور و پر سر و صدای NotebookLM را ساخته بودند.

۲ دقیقه مطالعه
۰
۱۸ مهر
رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریع‌تر با تراشه‌های Vera Rubin!
آخرین اخبار

رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریع‌تر با تراشه‌های Vera Rubin!

فریم‌ورک محبوب vLLM با انتشار بیلدهای آزمایشی، پشتیبانی از نسل آینده تراشه‌های انویدیا با معماری Vera Rubin را آغاز کرده و در بنچمارک‌های اولیه، به سرعت اعجاب‌انگیز نزدیک به ۸ برابری در اجرای مدل‌های زبانی بزرگ دست یافته است. این جهش عظیم به لطف پهنای باند خیره‌کننده حافظه‌های HBM4 و بهینه‌سازی‌های عمیق هسته‌های پردازشی رقم خورده که مسیر جدیدی را برای استنتاج ارزان‌تر و سریع‌تر هوش مصنوعی هموار می‌کند.

۵ دقیقه مطالعه
۰
۱۸ مهر
شاهکار کم‌خرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!
آخرین اخبار

شاهکار کم‌خرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!

مدل چابک و جمع‌وجور کلود هایکو ۵.۵ (Claude Haiku 5.5) موفق شد با عملکرد درخشان و هزینه باورنکردنی ۲۴.۳ دلار به ازای هر ۱۰۰۰ کوئری، در صدر جدول بهره‌وری اقتصادی بنچمارک Parallel قرار بگیرد. این مدل با اختلافی اندک نسبت به برادر بزرگ‌تر و فوق‌العاده گران‌قیمت خود یعنی کلود اوپوس، هزینه‌ها را تا یک‌سی‌ونهم کاهش داده است. این جهش خیره‌کننده نشان می‌دهد که توسعه‌دهندگان می‌توانند با بودجه‌ای بسیار اقتصادی، ایجنت‌های هوش مصنوعی فوق‌العاده قدرتمندی برای جستجو و وب‌گردی بسازند.

۴ دقیقه مطالعه
۰
۱۸ مهر