پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ارتباط متنی بین مدلهای زبانی با فناوری جدید C2C منسوخ میشود

انتشار:۱ مهر ۱۴۰۵(۵ روز پیش)
۷ دقیقه زمان مطالعه
۰ دیدگاه

فناوری جدید C2C به مدلهای هوش مصنوعی اجازه میدهد تا به جای متن، از طریق حافظه کش KV با یکدیگر ارتباط برقرار کنند؛ روشی که علاوه بر کاهش تأخیر، دقت سیستمهای چندمدلی را بهطور چشمگیری افزایش میدهد.

ارتباط متنی بین مدلهای زبانی با فناوری جدید C2C منسوخ میشود

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • محققان با معرفی روش Cache-to-Cache (C2C)، امکان تبادل اطلاعات بین مدلهای زبانی را از طریق حافظه پنهان (KV Cache) به جای تولید متن فراهم کردهاند.
  • این روش در بنچمارکها توانسته دقت را ۳.۱ تا ۵.۴ درصد نسبت به ارتباط متنی افزایش دهد و سرعت پردازش را نیز به شکل قابلتوجهی بالا ببرد.
  • با حذف نیاز به تولید و پردازش توکنهای متنی میانی، تأخیر در سیستمهای شامل ایجنتهای هوشمند کاهش یافته و هزینه پردازش بهینه میشود.

هنگامی که یک سیستم متشکل از چند مدل زبانی (LLM) وظیفه‌ای را از طریق متن به مدل دیگری می‌سپارد — خواه یک مسیریاب (Router) در حال جابه‌جایی بین مدل‌ها باشد یا ایجنت‌هایی که برای انجام یک کار همکاری می‌کنند — مدل اول باید اطلاعات خود را در قالب متن فشرده کند. در مقابل، مدل بعدی باید آن متن را بخواند و اطلاعات نهفته در آن را بازسازی کند. این فرایند دست‌به‌دست شدن اطلاعات می‌تواند منجر به از دست رفتن داده‌ها و افزایش زمان استنتاج (Inference) شود.

فناوری Cache-to-Cache (C2C) که توسط پژوهشگران دانشگاه Tsinghua و سایر مؤسسات تحقیقاتی چینی پیشنهاد شده است، تلاش می‌کند تا با فراهم کردن امکان تبادل اطلاعات از طریق نمایش‌های داخلی ذخیره‌شده در حافظه پنهان کلید-مقدار (KV Cache) به جای تکیه صرف بر متن میانی، این مشکل را برطرف کند.

در بررسی‌های انجام‌شده، C2C توانست دقت را در مقایسه با ارتباط متنی حدود ۳٫۱ تا ۵٫۴ واحد درصد بهبود بخشد و تأخیر را در تمام جفت‌مدل‌های آزمایش‌شده کاهش دهد. برای تیم‌های سازمانی که در حال توسعه مسیریاب‌های مدل یا سیستم‌های چند-ایجنتی هستند، این دستاورد نشان می‌دهد که خود لایه ارتباطی می‌تواند به یک هدف مهم برای بهینه‌سازی تبدیل شود.

فناوری C2C همچنین در راستای تحقیقات گسترده‌تری در زمینه هوش مصنوعی چندمدلی قرار می‌گیرد که هدف آن، ایجاد امکان تبادل مستقیم نمایش‌های داخلی بین مدل‌هاست، تا دیگر نیازی نباشد هر تبادل اطلاعاتی به اجبار از طریق توکن‌های متنی صورت گیرد. این دستاورد در کنفرانس ICLR 2026 منتشر شد و به گفته محققان، قرار است پیاده‌سازی «KV-Cache مدیریت‌شده توسط ایجنت» به همراه یک سیستم سرویس‌دهی عرضه شود.

متن؛ یک گلوگاه پرهزینه بین مدل‌ها

سیستم‌های چند-LLM در پیکربندی‌های مختلفی عرضه می‌شوند. در سیستم‌های مشارکتی، مدل‌ها نقش‌های متفاوتی را بر عهده می‌گیرند و تحلیل‌ها، دستورالعمل‌ها یا راه‌حل‌های جزئی را تبادل می‌کنند. در سیستم‌های مسیریابی، یک هماهنگ‌کننده با پیشرفت یک گفتگو یا جریان کاری، بین مدل‌هایی با قابلیت‌ها و هزینه‌های متفاوت جابه‌جا می‌شود.

t2t communication
ارتباط کلاسیک متن‌به‌متن، بار پردازشی اضافه‌ای را به استنتاج LLM تحمیل می‌کند

این سیستم‌ها معمولاً برای انتقال اطلاعات بین مدل‌ها به توکن‌های متنی متکی هستند. بر اساس گزارش‌های منتشرشده، این رویکرد سه مشکل اساسی ایجاد می‌کند.

نخستین مشکل، از دست رفتن اطلاعات است. یک مدل، زمینه (Context) را به صورت داخلی به عنوان وضعیت‌های عددی با ابعاد بالا بازنمایی می‌کند. برای برقراری ارتباط از طریق متن، مدل باید بخشی از آن بازنمایی را در یک توالی از توکن‌های متنی فشرده کند. سپس مدل دریافت‌کننده باید آن توالی را تفسیر کرده و بازنمایی خاص خود را از آنچه مدل اول در نظر داشته است، بسازد که در این مسیر احتمال از دست رفتن اطلاعات وجود دارد.

مشکل دیگر این است که اطلاعات متنی می‌توانند مبهم باشند. پژوهشگران این موضوع را با یک مدل Coder و یک مدل Writer که در حال ویرایش یک سند HTML هستند، نشان می‌دهند. مدل Coder درک می‌کند که تگ <p> به یک موقعیت ساختاری خاص در سند اشاره دارد، اما دستورالعمل متنی آن، این اطلاعات را با دقت کافی منتقل نمی‌کند. در نتیجه، مدل Writer نمی‌تواند محتوای خواسته‌شده را در جای درست قرار دهد.

image2
ارتباط متن‌به‌متن بین مدل‌های زبانی می‌تواند باعث ابهام و سردرگمی شود

در نهایت، ارتباط مبتنی بر متن هزینه استنتاج سنگینی را بر سیستم هوش مصنوعی تحمیل می‌کند. مدل اول باید پیام خود را به صورت متوالی و توکن به توکن تولید کند. سپس این توکن‌ها به ورودی مدل دوم اضافه می‌شوند که پیش از تولید پاسخ، باید زمینه طولانی‌تری را پردازش کند. هرچه این انتقال طولانی‌تر باشد، هر دو مدل باید کار بیشتری انجام دهند. در سیستم‌هایی با زمینه‌های طولانی یا انتقال‌های مکرر بین ایجنت‌ها، این بار اضافی ارتباطی می‌تواند به سرعت افزایش یابد.

تبدیل KV Cache به یک لایه ارتباطی

فناوری C2C با برقراری ارتباط از طریق بازنمایی‌هایی که مدل‌ها از پیش ایجاد کرده‌اند (یعنی KV Cache)، سعی می‌کند از تولید متن اضافی و پردازش آن توسط دریافت‌کننده جلوگیری کند.

زمانی که یک LLM برای اولین بار یک پرامپت را پردازش می‌کند، مرحله‌ای به نام «prefill» را اجرا می‌کند که ورودی را به بازنمایی‌های داخلی کلید (Key) و مقدار (Value) تبدیل می‌کند. این موارد در KV Cache ذخیره شده و در حین تولید پاسخ توسط مدل، مجدداً استفاده می‌شوند. این وضعیت‌های ذخیره‌شده کلید و مقدار، اطلاعاتی را که مدل از زمینه استخراج کرده است، رمزگذاری می‌کنند.

image4
بررسی‌ها نشان می‌دهند که حافظه پنهان KV می‌تواند بین مدل‌های مختلف بدون نیاز به پردازش مجدد توکن‌ها تبدیل شود

در آزمایش‌های اولیه بررسی شد که آیا KV Cache می‌تواند به عنوان یک رسانه ارتباطی عمل کند یا خیر. نتایج نشان داد که اطلاعات ذخیره‌شده در یک KV Cache می‌تواند بدون طولانی‌تر کردن حافظه پنهان غنی‌سازی شود و حافظه پنهان تولیدشده توسط یک مدل می‌تواند به فضای بازنمایی یک مدل دیگر تبدیل شود.

روش C2C بر اساس همین یافته‌ها بنا شده است. هر دو مدل زمینه یکسانی را پردازش می‌کنند. یکی به عنوان «اشتراک‌گذارنده» (Sharer) و دیگری به عنوان «دریافت‌کننده» (Receiver) عمل می‌کند. یک ترکیب‌کننده حافظه پنهان آموزش‌دیده، حافظه مدل اول را به فضای بازنمایی مدل دوم نگاشت کرده و سپس آن را با حافظه پنهان خود مدل دریافت‌کننده ترکیب می‌کند. یک گیت یادگیری‌شده نیز کنترل می‌کند که کدام لایه‌های مدل دریافت‌کننده باید اطلاعات اضافی را دریافت کنند.

C2C architecture
معماری سیستم C2C

در سیستم‌های مسیریابی، این قابلیت به مدل دریافت‌کننده اجازه می‌دهد تا اطلاعات موجود در حافظه پنهان مدل اول را بدون نیاز به پیام متنی میانی، ترکیب کند. هر دو مدل همچنان زمینه مشترک را برای ساخت KV Cache اختصاصی خود پردازش می‌کنند. در سیستم‌های مشارکتی، این روش یک کانال ارتباطی دیگر در کنار متن ایجاد می‌کند.

نگاهی به عملکرد C2C

فناوری C2C روی بنچمارک‌های استدلال و دانش از جمله MMLU-Redux، OpenBookQA، ARC-Challenge و C-Eval آزمایش شد. با ثابت در نظر گرفتن Qwen3-0.6B به عنوان مدل دریافت‌کننده و سه مدل مختلف به عنوان اشتراک‌گذارنده، C2C توانست میانگین دقت مدل دریافت‌کننده را حدود ۹٫۶ تا ۱۱٫۹ واحد درصد نسبت به عملکرد انفرادی مدل افزایش دهد و در مقایسه با ارتباط متن‌به‌متن، برتری ۳٫۱ تا ۵٫۴ درصدی را ثبت کند. البته این نتایج مربوط به بنچمارک‌ها هستند و روی بارهای کاری ایجنت‌ها در محیط‌های عملیاتی آزمایش نشده‌اند. اندازه‌گیری‌های مربوط به تأخیر با اندازه دسته (Batch Size) برابر با ۱ روی یک پردازنده گرافیکی Nvidia A100 انجام شد.

بهبود تأخیر بسته به جفت‌مدل‌ها متفاوت بود. در سه پیکربندی اصلی، فناوری C2C به ترتیب ۳٫۴۶، ۱٫۵۱ و ۱۴٫۴۱ برابر سریع‌تر از ارتباط متن‌به‌متن عمل کرد. نتیجه ۱۴٫۴۱ برابری با استفاده از نسخه پایه Qwen3-4B به عنوان مدل اشتراک‌گذارنده به دست آمد؛ بر اساس گزارش‌ها، این مدل گاهی اوقات دستورالعمل‌های ارتباط متنی را نادیده گرفته و پیام‌های طولانی‌تری تولید می‌کرد که باعث کندی شدید روش متنی می‌شد.

در یکی از بررسی‌های مربوط به ارتباط متنی، مدل اول به طور میانگین ۸۰ توکن ارتباطی تولید کرد. تولید این توکن‌ها ۱۳۱۲ میلی‌ثانیه زمان برد. پیام نهایی همچنین تعداد توکن‌هایی که مدل دریافت‌کننده باید پردازش می‌کرد را افزایش داد. در مقابل، C2C تنها به حدود ۹۰ میلی‌ثانیه برای ترکیب حافظه پنهان نیاز داشت و هیچ توکن متنی تولید نکرد.

image1
نتایج عملکرد C2C

این تکنیک حتی زمانی که دو مدل دارای معماری یا تخصص‌های متفاوتی بودند نیز به خوبی کار کرد. آزمایش‌ها شامل ترکیب‌های Gemma به Qwen، نسخه Qwen Math به Qwen و Qwen Coder به Qwen بود. فناوری C2C در تمام پنج پیکربندی ناهمگن و جابه‌جاشده گزارش‌شده در این آزمایش، عملکرد بهتری نسبت به ارتباط متنی از خود نشان داد.

الزامات استقرار C2C

استفاده از C2C نیازی به تنظیم ظریف (Fine-Tuning) هیچ‌یک از LLM‌های مشارکت‌کننده ندارد. مدل‌های فرستنده و گیرنده ثابت باقی می‌مانند و تنها ماژول ترکیب حافظه پنهان با استفاده از یک هدف پیش‌بینی توکن بعدی استاندارد آموزش داده می‌شود.

با این حال، ارتباط بین‌مدلی نیازمند کارهای مهندسی است. مدل‌های مختلف می‌توانند دارای توکنایزرها، تعداد لایه‌ها و اندازه‌های بازنمایی متفاوتی باشند. روش C2C پیش از ترکیب حافظه‌های پنهان، توکن‌های تولیدشده توسط توکنایزرهای مختلف را هم‌تراز کرده و لایه‌های ترانسفورمر مربوطه را به یکدیگر نگاشت می‌کند. آموزش این پل ارتباطی نیز هزینه‌های اولیه‌ای به همراه دارد. کدهای C2C و پیکربندی‌های آن تحت مجوز Apache 2.0 در GitHub منتشر شده و چک‌پوینت‌های از پیش آموزش‌دیده ترکیب‌کننده C2C نیز در Hugging Face در دسترس قرار گرفته است.

یک نکته مهم این است که از آنجا که C2C نیاز به خواندن، تغییر و جایگزینی وضعیت‌های داخلی KV Cache دارد، نیازمند یک پشته استنتاج (Inference Stack) است که این اجزای داخلی را در دسترس قرار دهد. این موضوع باعث می‌شود در حال حاضر، این فناوری در درجه اول برای تیم‌هایی کاربرد داشته باشد که پشته استنتاج خود را کنترل می‌کنند، نه برنامه‌هایی که مدل‌ها را صرفاً از طریق API‌های بسته به یکدیگر متصل می‌سازند.

پایان وابستگی LLM‌ها به توکن‌ها برای گفتگو

فناوری C2C بخشی از یک جریان تحقیقاتی گسترده‌تر است که این سؤال را مطرح می‌کند که آیا متن باید همچنان به عنوان رابط پیش‌فرض در سیستم‌های هوش مصنوعی چندمدلی باقی بماند یا خیر.

یکی از نمونه‌های این رویکرد، تحقیقات شرکت Nvidia در زمینه انتقال درون‌مدلی KV Cache است. در حالت عادی، هنگامی که یک سیستم در طول یک جلسه طولانی مدل خود را تغییر می‌دهد، مدل جدید باید زمینه انباشته‌شده را پردازش کرده و حافظه پنهان خود را دوباره بسازد. در مقابل، رویکرد Nvidia حافظه پنهان موجود را به فرمت مدل هدف تبدیل می‌کند. پژوهشگران گزارش داده‌اند که روی جفت‌مدل‌های سازگار، این تکنیک ۲٫۷ تا ۲۵ برابر سریع‌تر از پردازش مجدد اولیه (Re-prefilling) عمل می‌کند.

در حالی که تکنیک Nvidia کل KV Cache را بین مدل مبدأ و مقصد منتقل می‌کند، C2C به هر دو مدل اجازه می‌دهد زمینه را پردازش کنند و سپس حافظه‌های پنهان آن‌ها را ترکیب می‌کند تا مدل دریافت‌کننده بتواند از بازنمایی معنایی مدل دیگر بهره‌مند شود.

نمونه دیگر در این حوزه، چارچوب چند-ایجنتی RecursiveMAS است که پیام‌های متنی را با بازنمایی‌های پنهان پیوسته که بین ایجنت‌ها جابه‌جا می‌شوند، جایگزین می‌کند. بررسی‌های این روش نشان داد که در مقایسه با همتای بازگشتی مبتنی بر متن خود، سرعت استنتاج تا ۲٫۴ برابر افزایش یافته و استفاده از توکن‌ها ۷۵٫۶ درصد کاهش یافته است.

اگرچه سازوکار این روش‌ها با یکدیگر تفاوت دارد، اما همه آن‌ها بر یک اصل مشترک استوارند: اگر مدل‌ها مجبور نباشند همه چیز را ابتدا به متن تبدیل کنند، احتمالاً می‌توانند با کارایی بسیار بالاتری با یکدیگر ارتباط برقرار کنند.

در حال حاضر، C2C یک دستاورد تحقیقاتی محسوب می‌شود و هنوز به یک معماری تجاری تبدیل نشده است؛ چرا که دسترسی به اجزای داخلی مدل را می‌طلبد و مزایای آن در بنچمارک‌ها اندازه‌گیری شده است، نه در بارهای کاری واقعی ایجنت‌های سازمانی.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر