پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

اجرای مدل ۱۲۵ میلیاردی روی یک کامپیوتر گیمینگ معمولی؛ شاهکار جدید ابزار Strata

انتشار:۶ مهر ۱۴۰۵(۱۰ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

ابزار متن‌باز جدیدی به نام Strata اومده که غیرممکن‌ها رو ممکن کرده؛ اجرای یک مدل غول‌پیکر ۱۲۵ میلیارد پارامتری روی کامپیوترهای گیمینگ معمولی! این پروژه با ترکیب هوشمندانه حافظه کارت گرافیک، رم سیستم و حافظه SSD نشون می‌ده دیگه برای کارهای سنگین هوش مصنوعی لزوماً نیازی به سرورهای نجومی ندارید.

اجرای مدل ۱۲۵ میلیاردی روی یک کامپیوتر گیمینگ معمولی؛ شاهکار جدید ابزار Strata

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پروژه متن‌باز جدید Strata موفق شده مدل عظیم ۱۲۵ میلیارد پارامتری Qwen3.8-Flash-Next رو تنها با یک کارت گرافیک معمولی ۱۲ تا ۲۴ گیگابایتی و ۶۴ گیگابایت رم سیستم به اجرا دربیاره.
  • با تقسیم هوشمندانه وظایف میان کارت گرافیک، رم و حافظه SSD، سرعت تولید متن روی کارت گرافیک RTX 5070 به نزدیک ۹۵ توکن در ثانیه می‌رسه.
  • این سرور لوکال با فراهم کردن APIهای هماهنگ با OpenAI و Anthropic، دسترسی به مدل‌های بسیار بزرگ رو برای کاربران عادی و توسعه‌دهندگان حسابی راحت کرده.

اجرای مدل غول‌پیکر ۱۲۵ میلیاردی روی یک کامپیوتر معمولی با Strata

ابزار Strata یک سرور استنتاج (Inference) متن‌باز و تازه‌نفسه که دقیقاً برای مدل Qwen3.8-Flash-Next ساخته شده؛ مدلی با معماری مخلوطی از متخصصان (MoE) و ۱۲۵ میلیارد پارامتر که در هر مرحله فقط حدود ۶ میلیارد پارامتر فعال رو برای پردازش هر توکن به خط می‌کنه. نکته جذاب ماجرا اینجاست که این پروژه نسخه‌های کوانتیزه‌شده این غول نرم‌افزاری رو روی یک سیستم معمولی با یک کارت گرافیک انویدیا (با ۱۲ تا ۲۴ گیگابایت VRAM)، ۶۴ گیگابایت رم سیستم و پردازنده معمولی x86 اجرا می‌کنه و در محیط لوکال، رابط‌های برنامه‌نویسی استاندارد و کاملاً سازگار با OpenAI و Anthropic در اختیارتون می‌ذاره.

طبق بنچمارک‌های رسمی منتشرشده توسط سازندگان، این ابزار روی کارت گرافیک RTX 5070 با کانتکست 4K به سرعت فوق‌العاده ۹۴.۶ توکن در ثانیه می‌رسه و در کانتکست ۱۲۸ هزار توکنی با سبک‌ترین نسخه کوانتیزه، حدود ۶۵.۱ توکن در ثانیه خروجی می‌ده. یکی از اولین کاربران در شبکه اجتماعی X گزارش داده که با کارت گرافیک RTX 3090 هم در کانتکست ۱۲۸ هزار به سرعت حدود ۷۰ توکن در ثانیه دست پیدا کرده؛ البته تست‌های مستقل روی سخت‌افزارهای مختلف هنوز محدوده و خود تیم سازنده هم ارقام کارت‌های سری ۳۰۹۰ و سری ۴۰ رو تخمینی اعلام کرده.

یک مدل واحد در دل سه سطح حافظه

مدل Qwen3.8-Flash-Next از معماری MoE بهره می‌بره؛ یعنی برای پردازش هر کلمه یا توکن، کار رو فقط به بخش کوچکی از کارشناسان و لایه‌ها می‌سپاره. با وجود این‌که هر ۱۲۵ میلیارد پارامتر باید در دسترس سیستم باشن، اما در هر پردازش فقط حدود ۶ میلیارد پارامتر دست‌به‌کار می‌شن. ابزار Strata درست از همین شیوه فعال‌سازی پراکنده استفاده کرده و حافظه VRAM کارت گرافیک، رم سیستم و حافظه فوق‌سریع SSD رو مثل یک سیستم سلسله‌مراتبی یکپارچه کنار هم چیده است:

  • کارت گرافیک (GPU): حافظه VRAM بخش‌های حیاتی مثل لایه‌های Attention، میکسر DeltaNet، روترها، کارشناسان مشترک، لایه نهایی خروجی، لایه پیش‌بینی چندتوکنی، کش کلید-مقدار (KV Cache) و یک حافظه تطبیقی از پرکاربردترین کارشناسان رو تو خودش نگه می‌داره.
  • رم سیستم (System RAM): تمام ۲۴٬۵۷۶ کارشناس مدل به‌صورت ثابت روی رم سیستم بارگذاری می‌شن. وقتی کارت گرافیک مشغول پردازش بخش‌های سریع‌تره، دستورات هسته CPU (مثل AVX-512 یا AVX2) سریعاً کارشناسانی که تو کش کارت گرافیک نیستن رو ارزیابی می‌کنن.
  • حافظه اس‌اس‌دی (SSD): یک جدول ان‌گرم (n-gram) ۲۸.۸ گیگابایتی روی دیسک باقی می‌مونه و Strata از طریق کش سیستم‌عامل در هر پردازش فقط چند خط مشخص از اون رو می‌خونه.

در فرایند رمزگشایی و خروجی متن، لایه پیش‌بینی چندتوکنی این مدل همزمان تا ۳ توکن مختلف رو پیش‌نویس می‌کنه. با یک‌بار گردش داده‌ها در تمامی ۴۸ لایه، این پیش‌نویس ارزیابی و تأیید می‌شه و طبق بررسی‌های انجام‌شده، به‌طور میانگین در هر گردش بین ۲.۴ تا ۳.۲ توکن نهایی پذیرفته و تولید می‌گردد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر