پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار محققان MIT و زوریخ: پیوند بینایی و زبان در هوش مصنوعی بدون نیاز به داده‌های جفت‌شده!

انتشار:۱۸ مهر ۱۴۰۵(۲ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

پژوهشگران MIT، زوریخ و دانشگاه فنی مونیخ در دستاوردی کم‌سابقه موفق شدند مدل‌های هوش مصنوعی بینایی و زبانی را بدون نیاز به حتی یک تصویر و متن مشترک، به هم متصل کنند. این روش خلاقانه با تکیه بر ساختار هندسی بردارها، مفاهیم مشترک میان دو مدل را کشف می‌کند و می‌تواند هزینه سرسام‌آور جمع‌آوری داده‌های چندوجهی را به تاریخ پیوند بزند.

شاهکار محققان MIT و زوریخ: پیوند بینایی و زبان در هوش مصنوعی بدون نیاز به داده‌های جفت‌شده!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • محققان MIT، دانشگاه فنی مونیخ و ETH زوریخ روش نوآورانه‌ای ابداع کرده‌اند که مدل‌های هوش مصنوعی بینایی و زبان را بدون هیچ داده جفت‌شده‌ای (مثل تصویر همراه با کپشن) با یکدیگر هماهنگ می‌کند.
  • این تکنیک با مقایسه هندسه توزیع بردارها میان مدل‌هایی مثل DINOv2 و Qwen3 نشان می‌دهد مدل‌ها با بزرگ‌تر شدن، درک درونی مشابهی از جهان پیرامون پیدا می‌کنند.
  • حذف نیاز به داده‌های مشترک و برچسب‌گذاری‌شده می‌تواند هزینه‌های هنگفت آموزش مدل‌های چندوجهی را کاهش دهد و راه را برای تحلیل داده‌های پیچیده علمی و پزشکی باز کند.

همگام‌سازی مدل‌های بینایی و زبان بدون داده‌های جفت‌شده

پژوهشگران دانشگاه فنی مونیخ، MIT و ETH زوریخ خبر از دستاورد شگفت‌انگیزی داده‌اند: آن‌ها توانسته‌اند انکودرهای بینایی و زبانی را که کاملاً مستقل از هم آموزش دیده‌اند، بدون نیاز به حتی یک نمونه تصویر و کپشن جفت‌شده، در یک فضای بازنمایی مشترک کنار هم بنشانند. تیم تحقیقاتی در این مقاله علمی، با مقایسه هندسه توزیع امبدینگ‌ها (Embeddings)، مدل‌های قدرتمندی مثل DINOv2 و Qwen3 را با هم هماهنگ کرده‌اند. امبدینگ‌ها در واقع همان بردارهای عددی هستند که ویژگی‌هایی مثل اشیا، مفاهیم و روابط معنایی را در دنیای ریاضی کدگذاری می‌کنند.

این پژوهش در اصل آزمونی برای «فرضیه بازنمایی افلاطونی» (Platonic Representation Hypothesis) است؛ ایده‌ای جذاب که می‌گوید مدل‌های مختلف حتی اگر روی داده‌ها و اهداف کاملاً متفاوتی آموزش ببینند، هر چقدر مقیاسشان بزرگ‌تر شود، ساختارهای درونی مشابه‌تری از دنیای واقعی پیدا می‌کنند. یافته‌های این پژوهشگران نسخه محدودی از این فرضیه را تایید می‌کند؛ یعنی چندین جفت‌مدل آن‌قدر اشتراک هندسی دارند که بتوان پیوندهای کلی معنایی را میانشان بازسازی کرد، هرچند تطبیق دادن جزئیات ریزتر همچنان کار دشواری است.

بیش‌تر سیستم‌های چندوجهی امروزی، این پیوندها را از روی نمونه‌های جفت‌شده یاد می‌گیرند؛ مثلاً مدلی مثل CLIP مستقیماً روی تصاویر همراه با متن‌های متناظرشان آموزش می‌بیند. اما روش تازه پژوهشگران، دو دسته امبدینگ کاملاً جداگانه دریافت می‌کند و در طول فرآیند بهینه‌سازی، هیچ اطلاعاتی از نمونه‌های متناظر به آن داده نمی‌شود. در این میان، جفت‌های شناخته‌شده صرفاً برای ارزیابی و سنجش کیفیت نهایی مدل روی بنچمارک‌ها نگهداری می‌شوند.

داده‌های جفت‌شده؛ مانعی پرهزینه در مسیر هوش مصنوعی

جمع‌آوری، پالایش، دریافت حق استفاده و نگهداری مجموعه‌داده‌های عظیم حاوی تصویر و متن، هزینه فوق‌العاده سرسام‌آوری دارد. این چالش در رشته‌های علمی حتی سخت‌تر هم می‌شود؛ زیرا داده‌های ثبت‌شده توسط ابزار‌های مختلف آزمایشگاهی ممکن است بسیار کمیاب باشند، از سوژه‌های گوناگون به دست آمده باشند یا اصلاً نشود بعداً آن‌ها را به یکدیگر جفت کرد.

روش‌های قبلی که به دنبال همگام‌سازی بدون داده‌های جفت‌شده بودند، اغلب روی امبدینگ کلمات، میانگین کلاس‌ها یا مسائل ساده و مصنوعی تمرکز داشتند. اما محققان این مقاله، دستاورد خود را یک آزمایش عملی در سطح نمونه‌های واقعی می‌دانند؛ روشی قدرتمند که انکودرهای زبانی و تصویری در مقیاس صنعتی، داده‌های زیست‌شناختی و سیگنال‌های عصبی ضبط‌شده را به هم پیوند می‌دهد.

هندسه چطور جای خالی داده‌ها را پر می‌کند؟

الگوریتم پیشنهادی با در دست داشتن دو مجموعه امبدینگ بدون برچسب X و Y، یک نگاشت متعامد W را تخمین می‌زند که بدون برهم‌زدن فاصله‌ها و زاویه‌ها، یک فضا را روی فضای دیگر دوران می‌دهد یا بازتاب می‌کند. از آن‌جا که الگوریتم باید هم این تبدیل ریاضی و هم تناظرهای نامشخص میان نمونه‌ها را به صورت هم‌زمان کشف کند، بهینه‌سازی مشترک آن نامحدب است. مقداردهی اولیه تصادفی معمولاً به نتایج بسیار ضعیفی ختم می‌شود؛ به همین دلیل، روش جدید ابتدا یک تناظر تقریبی و کلی می‌سازد و سپس آن را صیقل می‌دهد.

  1. مقداردهی اولیه تقریبی: الگوریتم بارها از هر فضا نمونه‌برداری می‌کند و با بهره‌گیری از روش خوشه‌بندی k-means، آن را به ۳۰ مرکز خوشه کاهش می‌دهد. سپس به دنبال جایگشتی می‌گردد که هم‌ترازی هسته مرکزی (CKA) را میان این دو مجموعه مرکز خوشه به حداکثر برساند. این مسئله تخصیص درجه‌دو در نهایت با استفاده از ابزار MPOpt و یک روش ابتکاری بر پایه GRASP حل می‌شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
آخرین اخبار

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل

چه اتفاقی می‌افتد اگر به مدت یک ماه هر روز افکار، یادداشت‌ها و دغدغه‌های ذهنی‌تان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آن‌ها جواب دهد؟ این آزمایش تجربی نشان می‌دهد که دستیار هوش مصنوعی گوگل فراتر از پاسخ‌های اداری و کلیشه‌ای، چطور می‌تواند ابزاری غافلگیرکننده برای مرتب کردن شلوغی‌های ذهن و پیدا کردن زوایای پنهان کار‌های روزمره باشد.

۷ دقیقه مطالعه
۰
۱۸ مهر
دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر