چرا دیپسیک گاهی در متنهای طولانی گیج میزند؟ کشف غافلگیرکننده پژوهشگران بایتدنس
پژوهشگران تیم «سید» در شرکت بایتدنس پرده از راز افت دقت مدلهای دیپسیک در پردازش متنهای طولانی برداشتند. طبق این مطالعه، تکنیک فشردهسازی کَش حافظه پدیدهای به نام «حساسیت به فاز» ایجاد میکند که بسته به جایگاه کلمات، میتواند دقت بازیابی اطلاعات را تا ۴۰ درصد نوسان دهد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- پژوهشگران تیم سید (Seed) در بایتدنس متوجه شدند مدلهای دیپسیک در متنهای طولانی نوسان عجیبی دارند و بسته به محل قرارگیری کلمات، ممکن است اطلاعات مهم را جا بیندازند.
- علت اصلی ماجرا به فشردهسازی کَش حافظه (KV-Cache) مربوط میشود؛ تکنیکی برای کاهش مصرف رم که پدیدهای به اسم «حساسیت به فاز» میسازد و دقت بازیابی را تا ۴۰ درصد بالا و پایین میکند.
- این کشف ثابت میکند نمرات خیرهکننده در بنچمارکهای رایج همیشه قابل اتکا نیستند و میتوانند نقاط ضعف ساختاری و پنهان مدلها در اسناد حجیم را بپوشانند.
پژوهشگران تیم تحقیقاتی «سید» (Seed) در شرکت بایتدنس (ByteDance) موفق شدند راز یکی از عجیبترین رفتارهای مدلهای هوش مصنوعی دیپسیک (DeepSeek) را کشف کنند: چرا این مدلها در بازیابی اطلاعات از دل متنهای طولانی دچار نوسان و رفتارهای ضد و نقیض میشوند؟ بررسیهای این تیم نشان داده که ریشه ماجرا به روش فشردهسازی کَش قطعهای (Chunked KV-Cache Compression) برمیگردد؛ مکانیزمی که باعث میشود دقت مدل بسته به موقعیت کلمات درون پنجره فشردهسازی، تا ۴۰ درصد تغییر کند و نوسان داشته باشد.
مدلهای زبانی بزرگ برای مدیریت متنهای طولانی و کاهش بار پردازشی و مصرف رم، معمولاً گروهی از توکنهای متوالی را فشرده کرده و در تعداد کمتری ورودی کَش ذخیره میکنند. با این حال، پژوهشگران دریافتند که همین ترفند مهندسی پدیدهای نادیده گرفتهشده به نام «حساسیت به فاز» (Phase Sensitivity) ایجاد میکند؛ وضعیتی که در آن دسترسی مدل به یک داده مشخص، فقط به این بستگی دارد که آن کلمه کجای پنجره فشردهسازی جا خوش کرده باشد! به این ترتیب، جابهجا شدن جای کلمه حتی به اندازه چند توکن ساده میتواند تعیین کند که مدل به آن اطلاعات دسترسی پیدا میکند یا نه.
محققان با بازتولید این رفتار در مدلهایی که از صفر آموزش داده شده بودند، متوجه شدند بخشهای مختلف مکانیزم توجه (Attention) بهطور نامتقارن برای بازیابی اطلاعات از فازها و جایگاههای خاصی تخصص پیدا کردهاند. این پژوهش زنگ خطری جدی برای ارزیابی مدلها به حساب میآید، چرا که نشان میدهد نتایج درخشان در بنچمارکهای میانگین میتوانند نقاط ضعف دورهای و باگهای تکرارشونده مدلها در متنهای طولانی را بهراحتی پنهان کنند. علاقهمندان میتوانند جزئیات کامل این دستاورد فنی را در مقاله پژوهشی تیم سید در آرکایو (arXiv) مطالعه کنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

فشردهسازی شگفتانگیز غول ۷۵۳ میلیارد پارامتری GLM-5.3: کاهش حجم به ۲۷۳ گیگابایت برای اجرا روی ورکاستیشنها!
اینفاتوشی با انتشار نسخه فشردهشده EXL3 از مدل ۷۵۳ میلیارد پارامتری GLM-5.3، حجم این غول هوش مصنوعی را به ۲۷۳ گیگابایت رسانده است. این تکنیک کوانتایزیشن با میانگین ۳.۰۴ بیت به ازای هر وزن، اجرای این مدل عظیم را روی ورکاستیشنهای مجهز به چند کارت گرافیک ممکن میکند.

نقشه محرمانه OpenAI و آنتروپیک برای «روز واقعه»؛ مهار خشم عمومی پس از اولین فاجعه هوش مصنوعی
مدیران ارشد غولهای هوش مصنوعی مانند OpenAI و آنتروپیک در جلساتی محرمانه در حال سناریونویسی و برنامهریزی برای مهار خشم عمومی پس از وقوع نخستین فاجعه بزرگ هوش مصنوعی هستند. این شرکتها وقوع یک حمله سایبری فلجکننده توسط هوش مصنوعی را ظرف ۶ تا ۱۲ ماه آینده اجتنابناپذیر میدانند و برای مهار ترکشهای سیاسی آن آماده میشوند.

سپردن برنامهریزی زندگی به چتباتها؛ چرا هوش مصنوعی اصلاً نمیفهمد خوشبختی چیست؟
در یک بررسی تجربی، برنامهریزی ساعت به ساعت دو روز زندگی به چتباتهای ChatGPT، کلود و جمینای واگذار شد تا برنامهای برای رسیدن به اوج شادی بچینند. اما نتیجه نشان داد که هوش مصنوعی کار بیوقفه و بهرهوری افراطی را با خوشبختی اشتباه میگیرد و هنوز درکی از لذتهای واقعی انسان ندارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.