پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

چرا دیپ‌سیک گاهی در متن‌های طولانی گیج می‌زند؟ کشف غافلگیرکننده پژوهشگران بایت‌دنس

انتشار:۱۷ مهر ۱۴۰۵(۱ ساعت پیش)
۱ دقیقه زمان مطالعه
۰ دیدگاه

پژوهشگران تیم «سید» در شرکت بایت‌دنس پرده از راز افت دقت مدل‌های دیپ‌سیک در پردازش متن‌های طولانی برداشتند. طبق این مطالعه، تکنیک فشرده‌سازی کَش حافظه پدیده‌ای به نام «حساسیت به فاز» ایجاد می‌کند که بسته به جایگاه کلمات، می‌تواند دقت بازیابی اطلاعات را تا ۴۰ درصد نوسان دهد.

چرا دیپ‌سیک گاهی در متن‌های طولانی گیج می‌زند؟ کشف غافلگیرکننده پژوهشگران بایت‌دنس

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پژوهشگران تیم سید (Seed) در بایت‌دنس متوجه شدند مدل‌های دیپ‌سیک در متن‌های طولانی نوسان عجیبی دارند و بسته به محل قرارگیری کلمات، ممکن است اطلاعات مهم را جا بیندازند.
  • علت اصلی ماجرا به فشرده‌سازی کَش حافظه (KV-Cache) مربوط می‌شود؛ تکنیکی برای کاهش مصرف رم که پدیده‌ای به اسم «حساسیت به فاز» می‌سازد و دقت بازیابی را تا ۴۰ درصد بالا و پایین می‌کند.
  • این کشف ثابت می‌کند نمرات خیره‌کننده در بنچمارک‌های رایج همیشه قابل اتکا نیستند و می‌توانند نقاط ضعف ساختاری و پنهان مدل‌ها در اسناد حجیم را بپوشانند.

پژوهشگران تیم تحقیقاتی «سید» (Seed) در شرکت بایت‌دنس (ByteDance) موفق شدند راز یکی از عجیب‌ترین رفتارهای مدل‌های هوش مصنوعی دیپ‌سیک (DeepSeek) را کشف کنند: چرا این مدل‌ها در بازیابی اطلاعات از دل متن‌های طولانی دچار نوسان و رفتارهای ضد و نقیض می‌شوند؟ بررسی‌های این تیم نشان داده که ریشه ماجرا به روش فشرده‌سازی کَش قطعه‌ای (Chunked KV-Cache Compression) برمی‌گردد؛ مکانیزمی که باعث می‌شود دقت مدل بسته به موقعیت کلمات درون پنجره فشرده‌سازی، تا ۴۰ درصد تغییر کند و نوسان داشته باشد.

مدل‌های زبانی بزرگ برای مدیریت متن‌های طولانی و کاهش بار پردازشی و مصرف رم، معمولاً گروهی از توکن‌های متوالی را فشرده کرده و در تعداد کمتری ورودی کَش ذخیره می‌کنند. با این حال، پژوهشگران دریافتند که همین ترفند مهندسی پدیده‌ای نادیده گرفته‌شده به نام «حساسیت به فاز» (Phase Sensitivity) ایجاد می‌کند؛ وضعیتی که در آن دسترسی مدل به یک داده مشخص، فقط به این بستگی دارد که آن کلمه کجای پنجره فشرده‌سازی جا خوش کرده باشد! به این ترتیب، جابه‌جا شدن جای کلمه حتی به اندازه چند توکن ساده می‌تواند تعیین کند که مدل به آن اطلاعات دسترسی پیدا می‌کند یا نه.

محققان با بازتولید این رفتار در مدل‌هایی که از صفر آموزش داده شده بودند، متوجه شدند بخش‌های مختلف مکانیزم توجه (Attention) به‌طور نامتقارن برای بازیابی اطلاعات از فازها و جایگاه‌های خاصی تخصص پیدا کرده‌اند. این پژوهش زنگ خطری جدی برای ارزیابی مدل‌ها به حساب می‌آید، چرا که نشان می‌دهد نتایج درخشان در بنچمارک‌های میانگین می‌توانند نقاط ضعف دوره‌ای و باگ‌های تکرارشونده مدل‌ها در متن‌های طولانی را به‌راحتی پنهان کنند. علاقه‌مندان می‌توانند جزئیات کامل این دستاورد فنی را در مقاله پژوهشی تیم سید در آرکایو (arXiv) مطالعه کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

فشرده‌سازی شگفت‌انگیز غول ۷۵۳ میلیارد پارامتری GLM-5.3: کاهش حجم به ۲۷۳ گیگابایت برای اجرا روی ورک‌استیشن‌ها!
آخرین اخبار

فشرده‌سازی شگفت‌انگیز غول ۷۵۳ میلیارد پارامتری GLM-5.3: کاهش حجم به ۲۷۳ گیگابایت برای اجرا روی ورک‌استیشن‌ها!

اینفاتوشی با انتشار نسخه فشرده‌شده EXL3 از مدل ۷۵۳ میلیارد پارامتری GLM-5.3، حجم این غول هوش مصنوعی را به ۲۷۳ گیگابایت رسانده است. این تکنیک کوانتایزیشن با میانگین ۳.۰۴ بیت به ازای هر وزن، اجرای این مدل عظیم را روی ورک‌استیشن‌های مجهز به چند کارت گرافیک ممکن می‌کند.

۲ دقیقه مطالعه
۰
۱۷ مهر
نقشه محرمانه OpenAI و آنتروپیک برای «روز واقعه»؛ مهار خشم عمومی پس از اولین فاجعه هوش مصنوعی
آخرین اخبار

نقشه محرمانه OpenAI و آنتروپیک برای «روز واقعه»؛ مهار خشم عمومی پس از اولین فاجعه هوش مصنوعی

مدیران ارشد غول‌های هوش مصنوعی مانند OpenAI و آنتروپیک در جلساتی محرمانه در حال سناریونویسی و برنامه‌ریزی برای مهار خشم عمومی پس از وقوع نخستین فاجعه بزرگ هوش مصنوعی هستند. این شرکت‌ها وقوع یک حمله سایبری فلج‌کننده توسط هوش مصنوعی را ظرف ۶ تا ۱۲ ماه آینده اجتناب‌ناپذیر می‌دانند و برای مهار ترکش‌های سیاسی آن آماده می‌شوند.

۳ دقیقه مطالعه
۰
۱۷ مهر
سپردن برنامه‌ریزی زندگی به چت‌بات‌ها؛ چرا هوش مصنوعی اصلاً نمی‌فهمد خوشبختی چیست؟
آخرین اخبار

سپردن برنامه‌ریزی زندگی به چت‌بات‌ها؛ چرا هوش مصنوعی اصلاً نمی‌فهمد خوشبختی چیست؟

در یک بررسی تجربی، برنامه‌ریزی ساعت به ساعت دو روز زندگی به چت‌بات‌های ChatGPT، کلود و جمینای واگذار شد تا برنامه‌ای برای رسیدن به اوج شادی بچینند. اما نتیجه نشان داد که هوش مصنوعی کار بی‌وقفه و بهره‌وری افراطی را با خوشبختی اشتباه می‌گیرد و هنوز درکی از لذت‌های واقعی انسان ندارد.

۶ دقیقه مطالعه
۰
۱۷ مهر