شاهکار محققان MIT و زوریخ: پیوند بینایی و زبان در هوش مصنوعی بدون نیاز به دادههای جفتشده!
پژوهشگران MIT، زوریخ و دانشگاه فنی مونیخ در دستاوردی کمسابقه موفق شدند مدلهای هوش مصنوعی بینایی و زبانی را بدون نیاز به حتی یک تصویر و متن مشترک، به هم متصل کنند. این روش خلاقانه با تکیه بر ساختار هندسی بردارها، مفاهیم مشترک میان دو مدل را کشف میکند و میتواند هزینه سرسامآور جمعآوری دادههای چندوجهی را به تاریخ پیوند بزند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- محققان MIT، دانشگاه فنی مونیخ و ETH زوریخ روش نوآورانهای ابداع کردهاند که مدلهای هوش مصنوعی بینایی و زبان را بدون هیچ داده جفتشدهای (مثل تصویر همراه با کپشن) با یکدیگر هماهنگ میکند.
- این تکنیک با مقایسه هندسه توزیع بردارها میان مدلهایی مثل DINOv2 و Qwen3 نشان میدهد مدلها با بزرگتر شدن، درک درونی مشابهی از جهان پیرامون پیدا میکنند.
- حذف نیاز به دادههای مشترک و برچسبگذاریشده میتواند هزینههای هنگفت آموزش مدلهای چندوجهی را کاهش دهد و راه را برای تحلیل دادههای پیچیده علمی و پزشکی باز کند.
همگامسازی مدلهای بینایی و زبان بدون دادههای جفتشده
پژوهشگران دانشگاه فنی مونیخ، MIT و ETH زوریخ خبر از دستاورد شگفتانگیزی دادهاند: آنها توانستهاند انکودرهای بینایی و زبانی را که کاملاً مستقل از هم آموزش دیدهاند، بدون نیاز به حتی یک نمونه تصویر و کپشن جفتشده، در یک فضای بازنمایی مشترک کنار هم بنشانند. تیم تحقیقاتی در این مقاله علمی، با مقایسه هندسه توزیع امبدینگها (Embeddings)، مدلهای قدرتمندی مثل DINOv2 و Qwen3 را با هم هماهنگ کردهاند. امبدینگها در واقع همان بردارهای عددی هستند که ویژگیهایی مثل اشیا، مفاهیم و روابط معنایی را در دنیای ریاضی کدگذاری میکنند.
این پژوهش در اصل آزمونی برای «فرضیه بازنمایی افلاطونی» (Platonic Representation Hypothesis) است؛ ایدهای جذاب که میگوید مدلهای مختلف حتی اگر روی دادهها و اهداف کاملاً متفاوتی آموزش ببینند، هر چقدر مقیاسشان بزرگتر شود، ساختارهای درونی مشابهتری از دنیای واقعی پیدا میکنند. یافتههای این پژوهشگران نسخه محدودی از این فرضیه را تایید میکند؛ یعنی چندین جفتمدل آنقدر اشتراک هندسی دارند که بتوان پیوندهای کلی معنایی را میانشان بازسازی کرد، هرچند تطبیق دادن جزئیات ریزتر همچنان کار دشواری است.
بیشتر سیستمهای چندوجهی امروزی، این پیوندها را از روی نمونههای جفتشده یاد میگیرند؛ مثلاً مدلی مثل CLIP مستقیماً روی تصاویر همراه با متنهای متناظرشان آموزش میبیند. اما روش تازه پژوهشگران، دو دسته امبدینگ کاملاً جداگانه دریافت میکند و در طول فرآیند بهینهسازی، هیچ اطلاعاتی از نمونههای متناظر به آن داده نمیشود. در این میان، جفتهای شناختهشده صرفاً برای ارزیابی و سنجش کیفیت نهایی مدل روی بنچمارکها نگهداری میشوند.
دادههای جفتشده؛ مانعی پرهزینه در مسیر هوش مصنوعی
جمعآوری، پالایش، دریافت حق استفاده و نگهداری مجموعهدادههای عظیم حاوی تصویر و متن، هزینه فوقالعاده سرسامآوری دارد. این چالش در رشتههای علمی حتی سختتر هم میشود؛ زیرا دادههای ثبتشده توسط ابزارهای مختلف آزمایشگاهی ممکن است بسیار کمیاب باشند، از سوژههای گوناگون به دست آمده باشند یا اصلاً نشود بعداً آنها را به یکدیگر جفت کرد.
روشهای قبلی که به دنبال همگامسازی بدون دادههای جفتشده بودند، اغلب روی امبدینگ کلمات، میانگین کلاسها یا مسائل ساده و مصنوعی تمرکز داشتند. اما محققان این مقاله، دستاورد خود را یک آزمایش عملی در سطح نمونههای واقعی میدانند؛ روشی قدرتمند که انکودرهای زبانی و تصویری در مقیاس صنعتی، دادههای زیستشناختی و سیگنالهای عصبی ضبطشده را به هم پیوند میدهد.
هندسه چطور جای خالی دادهها را پر میکند؟
الگوریتم پیشنهادی با در دست داشتن دو مجموعه امبدینگ بدون برچسب X و Y، یک نگاشت متعامد W را تخمین میزند که بدون برهمزدن فاصلهها و زاویهها، یک فضا را روی فضای دیگر دوران میدهد یا بازتاب میکند. از آنجا که الگوریتم باید هم این تبدیل ریاضی و هم تناظرهای نامشخص میان نمونهها را به صورت همزمان کشف کند، بهینهسازی مشترک آن نامحدب است. مقداردهی اولیه تصادفی معمولاً به نتایج بسیار ضعیفی ختم میشود؛ به همین دلیل، روش جدید ابتدا یک تناظر تقریبی و کلی میسازد و سپس آن را صیقل میدهد.
- مقداردهی اولیه تقریبی: الگوریتم بارها از هر فضا نمونهبرداری میکند و با بهرهگیری از روش خوشهبندی k-means، آن را به ۳۰ مرکز خوشه کاهش میدهد. سپس به دنبال جایگشتی میگردد که همترازی هسته مرکزی (CKA) را میان این دو مجموعه مرکز خوشه به حداکثر برساند. این مسئله تخصیص درجهدو در نهایت با استفاده از ابزار MPOpt و یک روش ابتکاری بر پایه GRASP حل میشود.
مطالب مرتبط و پیشنهادی

یک ماه هر روز به خودم ایمیل زدم و جمینای جواب داد؛ نتیجه جالب این آزمایش با هوش مصنوعی گوگل
چه اتفاقی میافتد اگر به مدت یک ماه هر روز افکار، یادداشتها و دغدغههای ذهنیتان را برای خودتان ایمیل کنید و بگذارید هوش مصنوعی جمینای به آنها جواب دهد؟ این آزمایش تجربی نشان میدهد که دستیار هوش مصنوعی گوگل فراتر از پاسخهای اداری و کلیشهای، چطور میتواند ابزاری غافلگیرکننده برای مرتب کردن شلوغیهای ذهن و پیدا کردن زوایای پنهان کارهای روزمره باشد.

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.