پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

اجرای محلی ایجنت کدنویسی ۲۹ میلیاردی با ۱۹ گیگابایت حافظه؛ غافلگیری چاینا تلکام با Xing4.0

انتشار:۱۲ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

تیم هوش مصنوعی چاینا تلکام با عرضه نسخه سبک‌سازی‌شده مدل Xing4.0 در قالب فرمت محبوب GGUF، اجرای محلی ایجنت‌های پیشرفته کدنویسی را یک گام بزرگ به جلو برد. این مدل ۲۹ میلیاردی به لطف معماری هوشمند MoE برای هر پاسخ تنها ۴ میلیارد پارامتر را فعال می‌کند و در بهینه‌ترین حالت، فقط به ۱۹ گیگابایت حافظه رم نیاز دارد.

اجرای محلی ایجنت کدنویسی ۲۹ میلیاردی با ۱۹ گیگابایت حافظه؛ غافلگیری چاینا تلکام با Xing4.0

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم هوش مصنوعی چاینا تلکام (China Telecom) نسخه GGUF مدل جدید Xing4.0-29B-A4B را روی پلتفرم هاگینگ فیس منتشر کرد؛ مدلی ۲۹ میلیاردی که در لحظه پردازش تنها ۴ میلیارد پارامتر فعال دارد!
  • بهره‌گیری از معماری نوآورانه MoE در کنار تکنولوژی فشرده‌سازی MLA، امکان استفاده از پنجره زمینه فوق‌العاده ۲۵۶ هزار توکنی (قابل ارتقا تا ۵۱۲ هزار توکن) را با مصرف بهینه حافظه فراهم کرده است.
  • با بیلد بهینه‌شده Q4_K_M، کاربران می‌توانند یک ایجنت کدنویسی و ابزار تحلیل ریپازیتوری قدرتمند را به‌صورت کاملاً محلی و با تنها ۱۹ گیگابایت حافظه رم اجرا کنند.

مدل ۲۹ میلیاردی و متخصص‌محور Xing4.0 در قالب GGUF عرضه شد

نسخه بهینه‌سازی‌شده و تبدیل‌شده به فرمت GGUF مدل Xing4.0-29B-A4B روی پلتفرم هاگینگ فیس (Hugging Face) در دسترس قرار گرفت. این مدل که دستپخت تیم هوش مصنوعی چاینا تلکام (China Telecom)—توسعه‌دهنده مدل شناخته‌شده TeleChat—است، در مجموع ۲۹ میلیارد پارامتر دارد؛ اما نکته جذاب اینجاست که در زمان پردازش هر توکن، فقط حدود ۴ میلیارد پارامتر آن فعال می‌شود. هدف اصلی این انتشار، قدرت بخشیدن به ایجنت‌های محلی کدنویسی، تحلیل عمیق مخازن کد (ریپازیتوری‌ها) و انجام پروژه‌های تحقیقاتی سنگین با پنجره‌های زمینه طولانی است.

۲۹ میلیارد پارامتر در حافظه، فقط ۴ میلیارد در مسیر پردازش

مدل Xing4.0 از معماری تنک ترکیب متخصصان (Sparse Mixture-of-Experts یا MoE) با ۴۰ لایه و اندازه پنهان ۳,۵۸۴ بهره می‌برد. در این ساختار هوشمند، هر توکن به جای درگیر کردن تمام شبکه، تنها از میان ۶۴ متخصص تفکیک‌شده به ۴ متخصص تخصصی و یک متخصص مشترک هدایت می‌شود. این مسیریابی هوشمندانه باعث افت چشمگیر محاسبات به ازای هر توکن و افزایش سرعت تولید پاسخ می‌شود؛ هرچند برای اجرای آن همچنان لازم است کل ۲۹ میلیارد پارامتر در حافظه رم سیستم، حافظه گرافیکی (VRAM) یا ترکیبی از هر دو بارگذاری شوند.

استفاده از سازوکار «توجه نهفته چندسر» (Multi-head Latent Attention یا MLA) کش مربوط به کلید-مقدار (KV Cache) را فشرده می‌کند که وظیفه ردیابی توکن‌های قبلی را بر عهده دارد. بر اساس اطلاعات شناسنامه مدل، پنجره زمینه نیتیو آن ۲۵۶ هزار توکن است که حتی امکان گسترش تا ۵۱۲ هزار توکن را هم دارد. فناوری MLA کار با چنین حجم عظیمی از داده در حافظه کاری را بسیار کاربردی‌تر می‌کند، هرچند که با افزایش طول کانتکست، اندازه دسته (Batch Size) و دقت کش، مصرف حافظه رم سیستم همچنان افزایش خواهد یافت.

کوانتیزه‌سازی؛ کلید تعیین حداقل سخت‌افزار مورد نیاز

مخزن رسمی GGUF این مدل نسخه‌های کوانتیزه‌شده متنوعی ارائه می‌دهد که تعادلی دقیق میان حجم فایل و دقت محاسباتی برقرار می‌کنند:

نسخه بیلد
حجم تقریبی
کاربرد و سناریو
IQ2_M
۹.۹ گیگابایت
حداکثر فشرده‌سازی برای سیستم‌هایی با حافظه محدود
Q4_K_M
۱۹ گیگابایت
بهترین تعادل میان سرعت و کیفیت (توصیه رسمی مخزن)
Q6_K
۲۵.۷ گیگابایت
افت ناچیز کیفیت ناشی از کوانتیزه‌سازی
Q8_0
۳۳.۲ گیگابایت
کوانتیزه‌سازی با دقت بسیار بالا
F16
۶۲.۵ گیگابایت
وزن‌های اصلی با دقت نیمه‌اعشاری

البته باید در نظر داشت که فایل اصلی مدل تنها بخشی از حافظه لازم در زمان اجرا را به خود اختصاص می‌دهد. نرم‌افزارها مقداری از رم را هم به کش کانتکست، بافرهای پردازشی، متادیتای مدل و سربار مربوط به بک‌اند موتور اجرا اختصاص می‌دهند. با این حال، قابلیت آف‌لود کردن بخشی از پردازش‌ها روی پردازنده اصلی (CPU Offloading) می‌تواند نیاز به رم گرافیک (VRAM) را کاهش دهد؛ هرچند این کار معمولاً به قیمت کاهش سرعت تولید پاسخ تمام می‌شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

آنتروپیک صدای شما را می‌خواهد؛ پای مکالمات صوتی کاربران به آموزش مدل‌های کلود باز شد!
آخرین اخبار

آنتروپیک صدای شما را می‌خواهد؛ پای مکالمات صوتی کاربران به آموزش مدل‌های کلود باز شد!

شرکت آنتروپیک گزینه جدیدی را پیش روی کاربران کلود گذاشته و از آن‌ها می‌خواهد در صورت تمایل، مکالمات صوتی خود را برای آموزش و ارتقای مدل‌های هوش مصنوعی به اشتراک بگذارند. این قابلیت کاملاً اختیاری است و امکان مدیریت مجزای داده‌های صوتی نسبت به چت‌های متنی و کدهای برنامه‌نویسی را در بخش حریم خصوصی فراهم می‌کند. خوشبختانه این گزینه به‌صورت پیش‌فرض خاموش است و هر زمان که نظرتان تغییر کند، می‌توانید این داده‌ها را به سادگی پاک کنید.

۲ دقیقه مطالعه
۰
۱۲ مهر
مدیر ارشد آمازون از بحران استخدام متخصصان هوش مصنوعی می‌گوید: «پیدا کردن مهندسان FDE مثل شکار اسب تک‌شاخ است!»
آخرین اخبار

مدیر ارشد آمازون از بحران استخدام متخصصان هوش مصنوعی می‌گوید: «پیدا کردن مهندسان FDE مثل شکار اسب تک‌شاخ است!»

مدیر ارشد آمازون وب سرویسز (AWS) می‌گوید پیدا کردن مهندسان توسعه می‌دانی هوش مصنوعی (FDE) این روز‌ها درست مثل پیدا کردن اسب تک‌شاخ، فوق‌العاده نایاب و دشوار شده است. در حالی که غول‌های فناوری میلیاردها دلار روی ادغام مدل‌های زبانی و ایجنت‌ها در دل کسب‌وکارها سرمایه‌گذاری کرده‌اند، کمبود شدید نیروهایی با مهارت فنی عمیق، درک مشتری و تجربه کار با ایجنت‌ها به بزرگ‌ترین چالش این بازار تبدیل شده است.

۳ دقیقه مطالعه
۰
۱۲ مهر
قرار بود هوش مصنوعی شغل‌های فناوری را نابود کند، اما آمار استخدام چیز دیگری می‌گوید!
آخرین اخبار

قرار بود هوش مصنوعی شغل‌های فناوری را نابود کند، اما آمار استخدام چیز دیگری می‌گوید!

در حالی که پیش‌بینی می‌شد هوش مصنوعی شغل‌های حوزه فناوری را نابود کند، داده‌های جدید بازار کار نشان می‌دهند استخدام در شرکت‌های تک روندی صعودی به خود گرفته است. سرمایه‌گذاری سنگین در زیرساخت‌های سخت‌افزاری و تراشه‌ها تقاضا برای مهندسان را متحول کرده و هم‌زمان بازار کار برنامه‌نویسان نرم‌افزار نیز پرقدرت باقی مانده است.

۲ دقیقه مطالعه
۰
۱۲ مهر