اجرای مدل ۱۲۵ میلیاردی روی یک کامپیوتر گیمینگ معمولی؛ شاهکار جدید ابزار Strata
ابزار متنباز جدیدی به نام Strata اومده که غیرممکنها رو ممکن کرده؛ اجرای یک مدل غولپیکر ۱۲۵ میلیارد پارامتری روی کامپیوترهای گیمینگ معمولی! این پروژه با ترکیب هوشمندانه حافظه کارت گرافیک، رم سیستم و حافظه SSD نشون میده دیگه برای کارهای سنگین هوش مصنوعی لزوماً نیازی به سرورهای نجومی ندارید.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- پروژه متنباز جدید Strata موفق شده مدل عظیم ۱۲۵ میلیارد پارامتری Qwen3.8-Flash-Next رو تنها با یک کارت گرافیک معمولی ۱۲ تا ۲۴ گیگابایتی و ۶۴ گیگابایت رم سیستم به اجرا دربیاره.
- با تقسیم هوشمندانه وظایف میان کارت گرافیک، رم و حافظه SSD، سرعت تولید متن روی کارت گرافیک RTX 5070 به نزدیک ۹۵ توکن در ثانیه میرسه.
- این سرور لوکال با فراهم کردن APIهای هماهنگ با OpenAI و Anthropic، دسترسی به مدلهای بسیار بزرگ رو برای کاربران عادی و توسعهدهندگان حسابی راحت کرده.
اجرای مدل غولپیکر ۱۲۵ میلیاردی روی یک کامپیوتر معمولی با Strata
ابزار Strata یک سرور استنتاج (Inference) متنباز و تازهنفسه که دقیقاً برای مدل Qwen3.8-Flash-Next ساخته شده؛ مدلی با معماری مخلوطی از متخصصان (MoE) و ۱۲۵ میلیارد پارامتر که در هر مرحله فقط حدود ۶ میلیارد پارامتر فعال رو برای پردازش هر توکن به خط میکنه. نکته جذاب ماجرا اینجاست که این پروژه نسخههای کوانتیزهشده این غول نرمافزاری رو روی یک سیستم معمولی با یک کارت گرافیک انویدیا (با ۱۲ تا ۲۴ گیگابایت VRAM)، ۶۴ گیگابایت رم سیستم و پردازنده معمولی x86 اجرا میکنه و در محیط لوکال، رابطهای برنامهنویسی استاندارد و کاملاً سازگار با OpenAI و Anthropic در اختیارتون میذاره.
طبق بنچمارکهای رسمی منتشرشده توسط سازندگان، این ابزار روی کارت گرافیک RTX 5070 با کانتکست 4K به سرعت فوقالعاده ۹۴.۶ توکن در ثانیه میرسه و در کانتکست ۱۲۸ هزار توکنی با سبکترین نسخه کوانتیزه، حدود ۶۵.۱ توکن در ثانیه خروجی میده. یکی از اولین کاربران در شبکه اجتماعی X گزارش داده که با کارت گرافیک RTX 3090 هم در کانتکست ۱۲۸ هزار به سرعت حدود ۷۰ توکن در ثانیه دست پیدا کرده؛ البته تستهای مستقل روی سختافزارهای مختلف هنوز محدوده و خود تیم سازنده هم ارقام کارتهای سری ۳۰۹۰ و سری ۴۰ رو تخمینی اعلام کرده.
یک مدل واحد در دل سه سطح حافظه
مدل Qwen3.8-Flash-Next از معماری MoE بهره میبره؛ یعنی برای پردازش هر کلمه یا توکن، کار رو فقط به بخش کوچکی از کارشناسان و لایهها میسپاره. با وجود اینکه هر ۱۲۵ میلیارد پارامتر باید در دسترس سیستم باشن، اما در هر پردازش فقط حدود ۶ میلیارد پارامتر دستبهکار میشن. ابزار Strata درست از همین شیوه فعالسازی پراکنده استفاده کرده و حافظه VRAM کارت گرافیک، رم سیستم و حافظه فوقسریع SSD رو مثل یک سیستم سلسلهمراتبی یکپارچه کنار هم چیده است:
- کارت گرافیک (GPU): حافظه VRAM بخشهای حیاتی مثل لایههای Attention، میکسر DeltaNet، روترها، کارشناسان مشترک، لایه نهایی خروجی، لایه پیشبینی چندتوکنی، کش کلید-مقدار (KV Cache) و یک حافظه تطبیقی از پرکاربردترین کارشناسان رو تو خودش نگه میداره.
- رم سیستم (System RAM): تمام ۲۴٬۵۷۶ کارشناس مدل بهصورت ثابت روی رم سیستم بارگذاری میشن. وقتی کارت گرافیک مشغول پردازش بخشهای سریعتره، دستورات هسته CPU (مثل AVX-512 یا AVX2) سریعاً کارشناسانی که تو کش کارت گرافیک نیستن رو ارزیابی میکنن.
- حافظه اساسدی (SSD): یک جدول انگرم (n-gram) ۲۸.۸ گیگابایتی روی دیسک باقی میمونه و Strata از طریق کش سیستمعامل در هر پردازش فقط چند خط مشخص از اون رو میخونه.
در فرایند رمزگشایی و خروجی متن، لایه پیشبینی چندتوکنی این مدل همزمان تا ۳ توکن مختلف رو پیشنویس میکنه. با یکبار گردش دادهها در تمامی ۴۸ لایه، این پیشنویس ارزیابی و تأیید میشه و طبق بررسیهای انجامشده، بهطور میانگین در هر گردش بین ۲.۴ تا ۳.۲ توکن نهایی پذیرفته و تولید میگردد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.