پورتال Nous مدل قدرتمند Step 5 را یک هفته رایگان کرد؛ فرصتی عالی برای محک زدن غول ۶۰۰ میلیاردی
مجموعه Nous Research اعلام کرد که توسعهدهندگان میتوانند به مدت یک هفته مدل پرچمدار و ۶۰۰ میلیارد پارامتری Step 5 Preview را به صورت کاملاً رایگان روی پورتال این شرکت امتحان کنند. این مدل پیشرفته با پنجره زمینه یک میلیون توکنی و پشتیبانی از ورودیهای چندرسانهای، عملکرد درخشانی در وظایف ایجنتی و کدنویسی از خود نشان داده است. این فرصت به تیمهای فنی اجازه میدهد قابلیتهای این غول پردازشی را بدون پرداخت هزینههای معمول API زیر ذرهبین بگذارند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- پورتال Nous دسترسی به مدل جدید Step 5 Preview (ساخت استارتاپ چینی StepFun) را به مدت یک هفته رایگان کرده؛ مدلی با معماری MoE و ۶۰۰ میلیارد پارامتر کل که در هر توکن فقط ۲۷ میلیارد پارامتر آن فعال میشود.
- این مدل با پنجره زمینه عظیم ۱ میلیون توکنی، ورودی متن، تصویر و ویدیو و پشتیبانی از ابزارهای استدلال پیشرفته عرضه شده و در بنچمارکهای ایجنتی مثل Hermes Index و کدنویسی DeepSWE حسابی درخشیده است.
- اگرچه قیمت رسمی API این مدل بسیار اقتصادی اعلام شده، اما تولید پاسخهای طولانی و زنجیره استدلال مفصل میتواند مصرف توکنها را بالا ببرد؛ بنابراین این بازه رایگان بهترین فرصت برای سنجش واقعی هزینههاست.
فرصت یکهفتهای و رایگان برای تجربه Step 5 Preview در پورتال Nous
مجموعه Nous Research امکان دسترسی کاملاً رایگان به مدل Step 5 Preview (محصول استارتاپ StepFun) را به مدت یک هفته روی پورتال خود فراهم کرده است. این مدل پرچمدار، ترکیبی از یک معماری اسپارس (تنک) با ۶۰۰ میلیارد پارامتر، پشتیبانی از بینایی ماشین و پنجره زمینه غولپیکر ۱ میلیون توکنی است. جالب اینکه در بررسیهای تصحیحشده بنچمارک Hermes Index، این مدل امتیاز ۳۲.۸۳ را به دست آورده که تنها ۱.۰۶ امتیاز با مدل GPT-6 Luna فاصله دارد.
این طرح تشویقی به توسعهدهندگان فرصت میدهد تا بدون پرداخت هزینههای سنگین و معمول توکن در StepFun، مدل را حسابی به چالش بکشند؛ هزینههایی که بر اساس تعرفههای رسمی API معادل ۱ دلار به ازای هر یک میلیون توکن ورودی و ۲.۷۰ دلار برای هر یک میلیون توکن خروجی است. علاوه بر این، پورتال Nous زیرساخت ارزیابی Hermes Agent را که در لیدربوردهای عمومی استفاده میشود در اختیار کاربران گذاشته تا تیمهای مهندسی بتوانند عملکرد این هوش مصنوعی را در جریانهای کاری ایجنتی و مشابه شرایط واقعی بسنجند.
تنها ۲۷ میلیارد وزن برای هر توکن فعال میشود!
مدل Step 5 Preview از معماری هوشمندانه «ترکیب متخصصان تنک» (Sparse MoE) بهره میبرد. به زبان ساده، هرچند که در مجموع حدود ۶۰۰ میلیارد پارامتر در دل این مدل ذخیره شده، اما برای پردازش هر توکن فقط نزدیک به ۲۷ میلیارد پارامتر (حدود ۴.۵ درصد از کل وزنها) فعال میشوند. این ترفند هوشمندانه باعث میشود محاسبات لازم برای پاسخ به هر درخواست به شکل چشمگیری پایین بیاید؛ هرچند برای پیادهسازی و استقرار مدل روی سرور، همچنان به رم و حافظه ویدیویی کافی برای نگهداری یا استریم کل حجم وزنها نیاز خواهید داشت.
در صفحه رسمی مدل در StepFun به قابلیتهای کلیدی زیر اشاره شده است:
- هسته پردازشی مدل: در مجموع ۶۰۰ میلیارد پارامتر، ۲۷ میلیارد پارامتر فعال در ازای هر توکن و معماری باریک و عمیق با ۹۲ لایه پردازشی.
- حافظه زمینه و طول پاسخ: پنجره زمینه ۱ میلیون توکنی و توانایی تولید پاسخ تا ۶۴ هزار توکن.
- پشتیبانی چندرسانهای: دریافت ورودی به صورت متن، تصویر و ویدیو.
- امکانات ویژه API: استریم زنده، فراخوانی ابزارها (Tool Calling)، حالتهای JSON و JSON Schema، کش کردن پرامپتها (Prompt Caching) و تنظیم میزان تلاش استدلالی در سه سطح کم، متوسط یا زیاد.
پردازش پرامپتهای ۱ میلیون توکنی در مکانیزمهای توجه سنتی فوقالعاده سنگین و پرهزینه تمام میشود، چون مدل باید ارتباط میان حجم عظیمی از توکنها را بسنجد. شرکت StepFun برای حل این چالش، از تکنیک «توجه کوئری گروهی تنک» (Sparse Grouped-Query Attention) و ادغام بلوکی توکنها بهره برده است. به گفته این شرکت، این رویکرد نوآورانه هزینههای نمایهسازی و انتخاب برترین گزینهها (top-k) را به یکهشتم مدلهای متراکم مرسوم کاهش داده و همزمان اطلاعات همپوشان بلوکهای مجاور را با موفقیت ترکیب میکند.
فرآیند آموزش این مدل روی وظایف طولانی ایجنتی متمرکز بوده و از طریق «یادگیری تقویتی بر اساس خطمشی» (on-policy reinforcement learning) پیش رفته است؛ جایی که مدل مسیرهای عملیاتی را خودش تولید کرده و از نتایج سیاستهای فعلیاش درس میگیرد. شرکت سازنده همچنین اعلام کرده که هدایت درخواستها میان متخصصان (Expert Routing) در مراحل آموزش و استنتاج کاملاً بیتبهبیت هماهنگ و یکپارچه است. در بخش زیرساخت سرور و سرویسدهی نیز از زمانبندی هوشمند مبتنی بر بار، محاسبات سریع FP8، رمزگشایی گمانهزن MTP-3 و تخلیه هوشمند حافظه KV-cache به خارج از حافظه گرانقیمت شتابدهندهها استفاده شده است؛ پیشرفتهایی که به ادعای StepFun، سرعت کلی یادگیری تقویتی در افقهای طولانی را بیش از ۳ برابر افزایش داده است.
یک بازبینی فنی و پیشی گرفتن Luna
شاخص معتبر Hermes Index عملکرد مدلها را در چهار بنچمارک Hermes Bench، TerminalBench 4، TerminalBench Science و SkillsBench میسنجد. تمامی مدلها در محیط تست ایجنتی یکسان یعنی Hermes Agent به رقابت میپردازند و سطح استدلال آنها (در صورت پشتیبانی) روی بالاترین حد تنظیم میشود. مبنای نتایج بر اساس معیار pass@1 است؛ به این معنی که مدل برای حل هر تسک تنها یک شانس دارد و میانگین عملکرد در این چهار بخش، امتیاز نهایی شاخص را تعیین میکند.
مجموعه Nous در گزارش اولیه خود امتیاز ۳۳.۸۹ را برای Step 5 Preview ثبت کرده بود که دقیقاً برابر با مدل قدرتمند GPT-6 Luna بود؛ اما بعد از بررسی مجدد و اصلاح دادهها، این امتیاز به ۳۲.۸۳ تغییر یافت. بخشی از نتایج لیدربورد در جدول زیر آمده است:
مدل | شاخص Hermes Index | میانگین هزینه هر تسک |
|---|---|---|
Claude Opus 5.5 | 63.31 | $4.99 |
GPT-6 Astra | 56.25 | $11.61 |
Claude Sonnet 5.5 | 53.14 | $2.82 |
GLM 5.3 Flash | 34.95 | ذکر نشده |
GPT-6 Luna | 33.89 | ذکر نشده |
Step 5 Preview | 32.83 | ذکر نشده |
البته باید در نظر داشت که این لیدربورد شرایط محیط تست و ابزارها را به صورت ثابت و یکنواخت نگه میدارد و برای مقایسه ایجنتها در همین چارچوب ایدهآل است؛ اما این نتایج لزوماً به این معنا نیست که مدل در تمام مخازن کد، زنجیرههای ابزاری یا محیطهای واقعی تجاری نیز عملکردی مشابه داشته باشد. بنابراین تیمهای فنی همچنان باید مدل را در محیطهای عملیاتی اختصاصی خود تست کنند.
قدرت بالا در کدنویسی، اما با بهای پرحرفی!
شرکت StepFun مدل Step 5 Preview را برای کدنویسی ایجنتی و وظایف تخصصی سازمانی (از جمله تحلیلهای مالی) بهینهسازی کرده است. ارزیابیهای منتشرشده در بنچمارک مطرح DeepSWE v1.1 نشان میدهد که این مدل شانه به شانه رقبای مطرح بازار در کدنویسی حرکت میکند:
مدل | امتیاز DeepSWE v1.1 |
|---|---|
GPT-6 Astra Max | 74.1 |
Claude Opus 5 Max | 74.0 |
Step 5 Preview (سطح استدلال بالا) | 67.7 |
Kimi K3 Max | 67.5 |
GLM-5.3 Max | 66.9 |
البته نباید فراموش کرد که این آمارها مستقیماً توسط خود شرکت سازنده اعلام شده و نام مدلها یا تنظیمات تست ممکن است با لیدربوردهای مستقلی مانند Hermes Index تفاوت داشته باشد. با اینکه این ارقام ادعای قدرت بالای مدل در برنامهنویسی را تأیید میکنند، اما نمیتوان آنها را با بنچمارکهای مستقل کاملاً یکسان دانست. همچنین در این آمارها، بنچمارک مجزایی برای ارزیابی قابلیتهای مالی مدل ارائه نشده است.
نکته چالشبرانگیز ماجرا، حجم بالای خروجی توکنهاست که ارزان بودن قیمت اولیه را تحتالشعاع قرار میدهد. در آزمایشهای Hermes Index، مدل Step 5 Preview نزدیک به ۱۶۰ میلیون توکن خروجی تولید کرد؛ رقمی که در مقایسه با میانه ۹۲ میلیون توکنی سایر مدلها، بسیار بالاتر است! ردپاهای طولانی استدلال و توضیحات مفصل میتوانند بخشی از صرفهجویی ناشی از قیمت ارزان توکن را بسوزانند. به همین دلیل، تیمهای مهندسی هنگام تست مدل برای محیطهای واقعی باید علاوه بر قیمت هر توکن، فاکتورهایی مثل هزینه کل هر تسک موفق، نرخ تکمیل و زمان پاسخدهی را نیز به دقت رصد کنند.
سه زمینه طلایی برای تست رایگان این مدل
- ایجنتهای کدنویسی در سطح کل مخزن کد (Repository): بازنویسی و ریفکتور فایلهای متعدد، بازتولید باگها، ساخت پچهای اصلاحی، اجرای تستها و بازیابی خودکار پس از خطای ابزارها را آزمایش کنید. سقف ۱ میلیون توکنی فضا را برای مخازن کد بزرگ باز میگذارد و این دوره آزمایشی به خوبی نشان میدهد مدل تا چه حد میتواند جزییات مرتبط را از این حجم اطلاعات بیرون بکشد.
- خطوط لوله اسناد چندرسانهای (Multimodal): جریانهای کاری پیچیدهای که گزارشها، نمودارها، اسکرینشاتها و ویدیوها را با هم ترکیب میکنند بررسی نمایید. پشتیبانی بومی از متن، تصویر و ویدیو نیاز به سرویسهای پردازش تصویر جداگانه را برطرف میکند.
- امکانسنجی میزبانی اختصاصی (Self-Hosting): شرکت StepFun اعلام کرده وزنهای مدل در تاریخ ۱۵ اکتبر ۲۰۲۶ (۲۳ مهر ۱۴۰۵) به صورت عمومی منتشر میشود. با این حال، چکپوینت خام فرمت BF16 برای یک مدل ۶۰۰ میلیارد پارامتری به حدود ۱.۲ ترابایت حافظه (پیش از در نظر گرفتن کش KV، افزونگی و سربارهای اجرایی) نیاز دارد. اگرچه فعالسازی تنک (Sparse) بار محاسباتی توکنها را کاهش میدهد، اما کوانتیزاسیون و تکنیکهای تخلیه حافظه تعیین خواهند کرد که مدل واقعاً روی چه سختافزارهایی قابل اجراست. علاوه بر این، شرایط مجوز (لایسنس) نیز پس از انتشار عمومی نیازمند بررسی خواهد بود.
سیاست قیمتگذاری تهاجمی StepFun و برنامهریزی برای انتشار عمومی وزنها، ادامهدهنده موج قدرتمندی از سوی آزمایشگاههای هوش مصنوعی چینی مثل Kimi، GLM و DeepSeek برای کاهش سرسامآور قیمت API و در دسترس قرار دادن مدلهای بزرگ است. تیمهای توسعه با بهرهمندی از این بازه رایگان یکهفتهای میتوانند با تعریف شرایط ثابت (شامل مخزن یکسان، پرامپتهای مشابه، دسترسیهای ابزاری، تنظیمات استدلال و بودجه مشخص توکن) ارزیابی منصفانهای میان مدلها داشته باشند. ثبت نرخ تکمیل وظایف، تأخیر زمانی، نرخ خطای ابزارها و حجم کل توکنهای مصرفی مشخص خواهد کرد که آیا تعرفههای جذاب Step 5 Preview در نهایت به کاهش واقعی هزینهها در پروژههای تجاری منجر میشود یا خیر.
مطالب مرتبط و پیشنهادی

نقشه اپل برای پادکستهای هوش مصنوعی: جذب بیسروصدای تیم و فناوری استارتاپ Huxe
اپل با امضای قراردادی هوشمندانه، تیم و فناوری استارتاپ Huxe را جذب کرده تا احتمالاً قابلیت تولید پادکستهای صوتی با هوش مصنوعی را به سرویسهای خود بیاورد. بنیانگذاران این استارتاپ همان چهرههایی هستند که پیش از این پادکستهای گفتوگومحور و پر سر و صدای NotebookLM را ساخته بودند.

رکوردشکنی vLLM روی معماری جدید انویدیا: اجرای مدل MiniMax تا ۸ برابر سریعتر با تراشههای Vera Rubin!
فریمورک محبوب vLLM با انتشار بیلدهای آزمایشی، پشتیبانی از نسل آینده تراشههای انویدیا با معماری Vera Rubin را آغاز کرده و در بنچمارکهای اولیه، به سرعت اعجابانگیز نزدیک به ۸ برابری در اجرای مدلهای زبانی بزرگ دست یافته است. این جهش عظیم به لطف پهنای باند خیرهکننده حافظههای HBM4 و بهینهسازیهای عمیق هستههای پردازشی رقم خورده که مسیر جدیدی را برای استنتاج ارزانتر و سریعتر هوش مصنوعی هموار میکند.

شاهکار کمخرج آنتروپیک: کلود هایکو ۵.۵ با هزینه باورنکردنی ۲۴ دلار همه رقبا را جا گذاشت!
مدل چابک و جمعوجور کلود هایکو ۵.۵ (Claude Haiku 5.5) موفق شد با عملکرد درخشان و هزینه باورنکردنی ۲۴.۳ دلار به ازای هر ۱۰۰۰ کوئری، در صدر جدول بهرهوری اقتصادی بنچمارک Parallel قرار بگیرد. این مدل با اختلافی اندک نسبت به برادر بزرگتر و فوقالعاده گرانقیمت خود یعنی کلود اوپوس، هزینهها را تا یکسیونهم کاهش داده است. این جهش خیرهکننده نشان میدهد که توسعهدهندگان میتوانند با بودجهای بسیار اقتصادی، ایجنتهای هوش مصنوعی فوقالعاده قدرتمندی برای جستجو و وبگردی بسازند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.