اجرای محلی ایجنت کدنویسی ۲۹ میلیاردی با ۱۹ گیگابایت حافظه؛ غافلگیری چاینا تلکام با Xing4.0
تیم هوش مصنوعی چاینا تلکام با عرضه نسخه سبکسازیشده مدل Xing4.0 در قالب فرمت محبوب GGUF، اجرای محلی ایجنتهای پیشرفته کدنویسی را یک گام بزرگ به جلو برد. این مدل ۲۹ میلیاردی به لطف معماری هوشمند MoE برای هر پاسخ تنها ۴ میلیارد پارامتر را فعال میکند و در بهینهترین حالت، فقط به ۱۹ گیگابایت حافظه رم نیاز دارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم هوش مصنوعی چاینا تلکام (China Telecom) نسخه GGUF مدل جدید Xing4.0-29B-A4B را روی پلتفرم هاگینگ فیس منتشر کرد؛ مدلی ۲۹ میلیاردی که در لحظه پردازش تنها ۴ میلیارد پارامتر فعال دارد!
- بهرهگیری از معماری نوآورانه MoE در کنار تکنولوژی فشردهسازی MLA، امکان استفاده از پنجره زمینه فوقالعاده ۲۵۶ هزار توکنی (قابل ارتقا تا ۵۱۲ هزار توکن) را با مصرف بهینه حافظه فراهم کرده است.
- با بیلد بهینهشده Q4_K_M، کاربران میتوانند یک ایجنت کدنویسی و ابزار تحلیل ریپازیتوری قدرتمند را بهصورت کاملاً محلی و با تنها ۱۹ گیگابایت حافظه رم اجرا کنند.
مدل ۲۹ میلیاردی و متخصصمحور Xing4.0 در قالب GGUF عرضه شد
نسخه بهینهسازیشده و تبدیلشده به فرمت GGUF مدل Xing4.0-29B-A4B روی پلتفرم هاگینگ فیس (Hugging Face) در دسترس قرار گرفت. این مدل که دستپخت تیم هوش مصنوعی چاینا تلکام (China Telecom)—توسعهدهنده مدل شناختهشده TeleChat—است، در مجموع ۲۹ میلیارد پارامتر دارد؛ اما نکته جذاب اینجاست که در زمان پردازش هر توکن، فقط حدود ۴ میلیارد پارامتر آن فعال میشود. هدف اصلی این انتشار، قدرت بخشیدن به ایجنتهای محلی کدنویسی، تحلیل عمیق مخازن کد (ریپازیتوریها) و انجام پروژههای تحقیقاتی سنگین با پنجرههای زمینه طولانی است.
۲۹ میلیارد پارامتر در حافظه، فقط ۴ میلیارد در مسیر پردازش
مدل Xing4.0 از معماری تنک ترکیب متخصصان (Sparse Mixture-of-Experts یا MoE) با ۴۰ لایه و اندازه پنهان ۳,۵۸۴ بهره میبرد. در این ساختار هوشمند، هر توکن به جای درگیر کردن تمام شبکه، تنها از میان ۶۴ متخصص تفکیکشده به ۴ متخصص تخصصی و یک متخصص مشترک هدایت میشود. این مسیریابی هوشمندانه باعث افت چشمگیر محاسبات به ازای هر توکن و افزایش سرعت تولید پاسخ میشود؛ هرچند برای اجرای آن همچنان لازم است کل ۲۹ میلیارد پارامتر در حافظه رم سیستم، حافظه گرافیکی (VRAM) یا ترکیبی از هر دو بارگذاری شوند.
استفاده از سازوکار «توجه نهفته چندسر» (Multi-head Latent Attention یا MLA) کش مربوط به کلید-مقدار (KV Cache) را فشرده میکند که وظیفه ردیابی توکنهای قبلی را بر عهده دارد. بر اساس اطلاعات شناسنامه مدل، پنجره زمینه نیتیو آن ۲۵۶ هزار توکن است که حتی امکان گسترش تا ۵۱۲ هزار توکن را هم دارد. فناوری MLA کار با چنین حجم عظیمی از داده در حافظه کاری را بسیار کاربردیتر میکند، هرچند که با افزایش طول کانتکست، اندازه دسته (Batch Size) و دقت کش، مصرف حافظه رم سیستم همچنان افزایش خواهد یافت.
کوانتیزهسازی؛ کلید تعیین حداقل سختافزار مورد نیاز
مخزن رسمی GGUF این مدل نسخههای کوانتیزهشده متنوعی ارائه میدهد که تعادلی دقیق میان حجم فایل و دقت محاسباتی برقرار میکنند:
نسخه بیلد | حجم تقریبی | کاربرد و سناریو |
|---|---|---|
IQ2_M | ۹.۹ گیگابایت | حداکثر فشردهسازی برای سیستمهایی با حافظه محدود |
Q4_K_M | ۱۹ گیگابایت | بهترین تعادل میان سرعت و کیفیت (توصیه رسمی مخزن) |
Q6_K | ۲۵.۷ گیگابایت | افت ناچیز کیفیت ناشی از کوانتیزهسازی |
Q8_0 | ۳۳.۲ گیگابایت | کوانتیزهسازی با دقت بسیار بالا |
F16 | ۶۲.۵ گیگابایت | وزنهای اصلی با دقت نیمهاعشاری |
البته باید در نظر داشت که فایل اصلی مدل تنها بخشی از حافظه لازم در زمان اجرا را به خود اختصاص میدهد. نرمافزارها مقداری از رم را هم به کش کانتکست، بافرهای پردازشی، متادیتای مدل و سربار مربوط به بکاند موتور اجرا اختصاص میدهند. با این حال، قابلیت آفلود کردن بخشی از پردازشها روی پردازنده اصلی (CPU Offloading) میتواند نیاز به رم گرافیک (VRAM) را کاهش دهد؛ هرچند این کار معمولاً به قیمت کاهش سرعت تولید پاسخ تمام میشود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

آنتروپیک صدای شما را میخواهد؛ پای مکالمات صوتی کاربران به آموزش مدلهای کلود باز شد!
شرکت آنتروپیک گزینه جدیدی را پیش روی کاربران کلود گذاشته و از آنها میخواهد در صورت تمایل، مکالمات صوتی خود را برای آموزش و ارتقای مدلهای هوش مصنوعی به اشتراک بگذارند. این قابلیت کاملاً اختیاری است و امکان مدیریت مجزای دادههای صوتی نسبت به چتهای متنی و کدهای برنامهنویسی را در بخش حریم خصوصی فراهم میکند. خوشبختانه این گزینه بهصورت پیشفرض خاموش است و هر زمان که نظرتان تغییر کند، میتوانید این دادهها را به سادگی پاک کنید.

مدیر ارشد آمازون از بحران استخدام متخصصان هوش مصنوعی میگوید: «پیدا کردن مهندسان FDE مثل شکار اسب تکشاخ است!»
مدیر ارشد آمازون وب سرویسز (AWS) میگوید پیدا کردن مهندسان توسعه میدانی هوش مصنوعی (FDE) این روزها درست مثل پیدا کردن اسب تکشاخ، فوقالعاده نایاب و دشوار شده است. در حالی که غولهای فناوری میلیاردها دلار روی ادغام مدلهای زبانی و ایجنتها در دل کسبوکارها سرمایهگذاری کردهاند، کمبود شدید نیروهایی با مهارت فنی عمیق، درک مشتری و تجربه کار با ایجنتها به بزرگترین چالش این بازار تبدیل شده است.

قرار بود هوش مصنوعی شغلهای فناوری را نابود کند، اما آمار استخدام چیز دیگری میگوید!
در حالی که پیشبینی میشد هوش مصنوعی شغلهای حوزه فناوری را نابود کند، دادههای جدید بازار کار نشان میدهند استخدام در شرکتهای تک روندی صعودی به خود گرفته است. سرمایهگذاری سنگین در زیرساختهای سختافزاری و تراشهها تقاضا برای مهندسان را متحول کرده و همزمان بازار کار برنامهنویسان نرمافزار نیز پرقدرت باقی مانده است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.