پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی الف آلفا از مدل استدلال متن‌باز Kolibri-1؛ پردازش فوق‌سریع با حافظه ۱ میلیون توکنی!

انتشار:۱۲ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ آلمانی الف آلفا (Aleph Alpha) از مدل استدلال متن‌باز جدید خود به نام Kolibri-1 رونمایی کرد که با تمرکز ویژه روی زبان‌های آلمانی و انگلیسی توسعه یافته است. این مدل با معماری کارشناسان ترکیبی (MoE) و مجموعاً ۷۸ میلیارد پارامتر، تنها ۳.۵ میلیارد پارامتر فعال در هر توکن مصرف می‌کند و از پردازش متون فوق‌طولانی تا سقف ۱ میلیون توکن پشتیبانی به عمل می‌آورد.

رونمایی الف آلفا از مدل استدلال متن‌باز Kolibri-1؛ پردازش فوق‌سریع با حافظه ۱ میلیون توکنی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ آلمانی الف آلفا از مدل استدلال متن‌باز Kolibri-1 رونمایی کرد؛ مدلی با ۷۸ میلیارد پارامتر که به لطف معماری خلوت و مدرن MoE، برای هر توکن فقط ۳.۴۶ میلیارد پارامتر رو درگیر می‌کنه تا پردازش بهینه‌تری داشته باشه.
  • این مدل قدرتمند که روی آلمانی و انگلیسی تمرکز داره، حافظه و پنجره زمینه بومی ۲۶۲ هزار توکنی داره و توی تست‌ها نشون داده می‌تونه تا سقف شگفت‌انگیز ۱ میلیون توکن رو هم بدون دردسر مدیریت کنه.
  • نکته جذاب ماجرا انتشار مدل با لایسنس آزاد Apache 2.0 هست؛ یعنی شرکت‌ها و برنامه‌نویس‌ها می‌تونن با خیال راحت اون رو روی سرور‌های اختصاصی خودشون بالا بیارن و کنترل داده‌ها رو کامل دست بگیرن.

عرضه مدل استدلال Kolibri-1 توسط الف آلفا با پردازش بهینه و پنجره ۱ میلیون توکنی

استارتاپ آلمانی الف آلفا (Aleph Alpha) مستقر در هایدلبرگ، از صفحه مدل Kolibri-1 در هاگینگ‌فیس رونمایی کرد؛ یک مدل استدلال با وزن‌های باز بر پایه معماری کارشناسان ترکیبی (MoE) که برای زبان‌های آلمانی و انگلیسی بهینه‌سازی شده است. این مدل در مجموع ۷۸.۱ میلیارد پارامتر دارد، اما به لطف ساختار هوشمندانه‌اش برای پردازش هر توکن فقط حدود ۳.۴۶ میلیارد پارامتر را فعال می‌کند. همچنین این مدل از استدلال قابل‌تنظیم و فراخوانی ابزار‌ها (Tool Calling) پشتیبانی کرده و با لایسنس کاملاً آزاد Apache 2.0 برای میزبانی و استقرار روی سرور‌های اختصاصی عرضه شده است.

مدل Kolibri-1 دقیقاً برای تیم‌ها و سازمان‌هایی طراحی شده که به استدلال قوی به زبان آلمانی، بازیابی اطلاعات در متون فوق‌العاده طولانی (Long-context) و کنترل کامل روی محل ذخیره پرامپت‌ها و وزن‌های مدل نیاز دارند. معماری خلوت (Sparse) این مدل بار پردازشی هر توکن را به شکل چشمگیری کاهش می‌دهد؛ هرچند که برای نگهداری کل مجموعه وزن‌های آن، همچنان به حدود ۷۸ گیگابایت فضای ذخیره‌سازی نیاز خواهید داشت.

پردازش خلوت، حافظه فشرده

مشخصات فنی
مدل Kolibri-1
تعداد کل پارامترها
۷۸,۱۰۳,۰۷۴,۵۶۰
پارامترهای فعال در هر توکن
۳,۴۵۷,۵۷۳,۱۲۰
زبان‌های پشتیبانی‌شده
آلمانی و انگلیسی
لایه‌های ترنسفورمر
۵۰ لایه
کارشناسان (Experts)
۳۸۴ کارشناس مسیریابی‌شده در هر لایه (انتخاب ۶ کارشناس به ازای هر توکن به همراه ۱ کارشناس مشترک)
پنجره زمینه بومی
۲۶۲,۱۴۴ توکن
پنجره توسعه‌یافته و اعتبارسنجی‌شده
تا ۱,۰۴۸,۵۷۶ توکن
فرمت وزن‌ها
FP8 به همراه بخش‌های منتخب در قالب bfloat16
مجوز (License)
Apache 2.0

نسبت ۲۲.۶ به ۱ میان پارامترهای کل و پارامترهای فعال، علت رفتار سخت‌افزاری خاص این مدل را به خوبی توجیه می‌کند. هر توکن فقط کسری از وزن‌های کارشناسان را به کار می‌گیرد که این موضوع فشار محاسباتی را حسابی مهار می‌کند؛ با این حال، سرور ارائه‌دهنده در زمان استنتاج همچنان باید به کل شبکه دسترسی کامل داشته باشد.

در هر بلوک ترنسفورمر یک لایه پیش‌خوران (Feed-forward) بر پایه کارشناسان ترکیبی تعبیه شده است. سازوکار توجه (Attention) نیز از الگوی ترکیبی ۴ به ۱ بین لایه‌های پنجره متحرک (Sliding-window) و لایه‌های توجه کامل پیروی می‌کند؛ به این شکل که بیش‌تر لایه‌ها فقط ۵۱۲ توکن قبلی را بررسی می‌کنند، در حالی که لایه‌های سراسری (Global) دوره‌ای می‌توانند از کل پنجره زمینه بهره ببرند. این معماری هوشمندانه حجم عملیات توجه را در بخش اعظم مدل محدود نگه می‌دارد، اما همزمان مسیرهای انتقال اطلاعات در فواصل طولانی را دست‌نخورده حفظ می‌کند.

پردازش متون فوق‌طولانی بدون نیاز به مقیاس‌پذیری پوزیشن‌ها

تیم الف آلفا آموزش این مدل را ابتدا روی پنجره ۱۶,۳۸۴ توکنی آغاز کرد، سپس فرآیند یادگیری را در ۶۵,۵۳۶ توکن ادامه داد و نهایتاً زمینه بومی مدل را به ۲۶۲,۱۴۴ توکن رساند. این شرکت همچنین گزارش داده که تست‌های کیفیت و سرویس‌دهی مدل را در پنجره شگفت‌انگیز ۱,۰۴۸,۵۷۶ توکنی (بیش از یک میلیون توکن) با موفقیت پشت سر گذاشته است.

بر اساس مستندات رسمی مدل، کدگذاری موقعیت (Positional Encoding) صرفاً در لایه‌های توجه پنجره متحرک حضور دارد. این ساختار فنی هوشمند به الف آلفا اجازه داده تا بدون نیاز به روش‌های دستکاری یا مقیاس‌پذیری مانند YaRN یا RoPE، پنجره زمینه را به شکل خارق‌العاده‌ای گسترش دهد. البته در عمل، محدودیت‌های نهایی درخواست‌ها به پیکربندی فریم‌ورک vLLM، اندازه بچ (Batch Size) و حافظه رم موجود برای کَش کلید-مقدار (KV Cache) وابسته خواهد بود.

وزن‌های مدل در قالب بلوک‌های ۱۲۸ در ۱۲۸ از فرمت بهینه FP8 بهره می‌برند و اکتیویشن‌ها نیز به شکل پویا کوانتیزه می‌شوند. با این حال بخش‌های حساسی چون امبدینگ‌ها، لایه‌های نرمال‌سازی، هد نهایی مدل زبانی و روتر کارشناسان همچنان در فرمت bfloat16 حفظ شده‌اند تا دقت مدل افت نکند. در ارزیابی‌های فنی الف آلفا، این مدل همراه با کش کلید-مقدار تحت فرمت FP8 مورد سنجش قرار گرفته است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

پای‌تورچ و رد هت رکورد زدند: شتاب ۱۸ درصدی استنتاج در پردازنده‌های H100 با Helion
آخرین اخبار

پای‌تورچ و رد هت رکورد زدند: شتاب ۱۸ درصدی استنتاج در پردازنده‌های H100 با Helion

پای‌تورچ و رد هت با توسعه یک بک‌اند خطی مبتنی بر فریم‌ورک Helion برای موتور vLLM، جهش چشمگیری در سرعت پردازش مدل‌های هوش مصنوعی رقم زدند. این سیستم نوآورانه با تنظیم خودکار کرنل‌ها، موفق شده سرعت ضرب ماتریسی در پردازنده‌های H100 ان‌ویدیا را تا ۱۷.۸ درصد نسبت به کتابخانه‌های مطرح ارتقا دهد. این بهینه‌سازی به‌ویژه در سناریوهای تولید سریع متن در مدل‌های زبانی، بازدهی سرور‌های هوش مصنوعی را به شکل محسوسی افزایش می‌دهد.

۶ دقیقه مطالعه
۰
۱۲ مهر
ورود به عصر اسکلت‌های بیرونی روباتیک؛ گجت‌هایی که قدرت بدنی انسان را متحول می‌کنند
آخرین اخبار

ورود به عصر اسکلت‌های بیرونی روباتیک؛ گجت‌هایی که قدرت بدنی انسان را متحول می‌کنند

اسکلت‌های بیرونی روباتیک دیگر فقط به فیلم‌های علمی‌تخیلی تعلق ندارند و حالا از خط مقدم نبرد و انبارهای بزرگ تا عملیات‌های سخت امداد و نجات به کار گرفته می‌شوند. این گجت‌های پیشرفته با تقویت توان عضلانی، خستگی را به حداقل می‌رسانند و به کاربران امکان می‌دهند کار‌های سنگین فیزیکی را بسیار سریع‌تر، ایمن‌تر و با کارایی بالا‌تر انجام دهند.

۶ دقیقه مطالعه
۰
۱۲ مهر
رد هت حجم مدل ۳۰ میلیاردی نموترون انویدیا را نصف کرد: اجرای آسان‌تر ایجنت‌ها روی یک کارت گرافیک!
آخرین اخبار

رد هت حجم مدل ۳۰ میلیاردی نموترون انویدیا را نصف کرد: اجرای آسان‌تر ایجنت‌ها روی یک کارت گرافیک!

تیم هوش مصنوعی رد هت با تبدیل وزن‌های مدل ۳۰ میلیارد پارامتری Nemotron انویدیا به فرمت FP8، ردپای حافظه آن را به نصف رسانده است. این دستاورد فنی استقرار این ایجنت پیشرفته را روی یک کارت گرافیک ممکن کرده و تا الان با استقبال چشمگیر بیش از ۷۸۰ هزار دانلود در هاگینگ فیس روبه‌رو شده است.

۲ دقیقه مطالعه
۰
۱۲ مهر