پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

درخشش مدل متن‌باز Open CLIP لایون؛ ثبت دقت ۷۰ درصدی در ایمیج‌نت با تنها ۱۵۰ میلیون پارامتر

انتشار:۱۴ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

مدل متن‌باز ViT-B/16 از پروژه Open CLIP لایون توانسته با تنها ۱۵۰ میلیون پارامتر به دقت خیره‌کننده ۷۰.۲ درصدی در بنچمارک ImageNet برسد. این مدل سبک و پرسرعت که روی ۲ میلیارد جفت تصویر و متن آموزش دیده، به لطف وزن‌های عمومی و نیاز سخت‌افزاری کم، به انتخاب اول بسیاری از محققان و توسعه‌دهندگان هوش مصنوعی تبدیل شده است.

درخشش مدل متن‌باز Open CLIP لایون؛ ثبت دقت ۷۰ درصدی در ایمیج‌نت با تنها ۱۵۰ میلیون پارامتر

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • چک‌پوینت ViT-B/16 از پروژه Open CLIP لایون با ثبت دقت ۷۰.۲ درصدی در بنچمارک ImageNet (به‌صورت زیروشات)، هنوز هم یکی از محبوب‌ترین و پردانلودترین مدل‌های بینایی-زبانی در هاگینگ فیس به حساب می‌آید.
  • این مدل سبک با حدود ۱۵۰ میلیون پارامتر و حجم تقریبی ۶۰۰ مگابایت، روی ابررایانه JUWELS Booster و با پردازش ۳۴ میلیارد نمونه از پایگاه‌داده عظیم LAION آموزش دیده است.
  • ترکیب وزن‌های کاملاً متن‌باز تحت مجوز MIT، ابزار‌های آماده و نیاز سخت‌افزاری متعادل باعث شده تا این نسخه همچنان استاندارد طلایی و گزینه‌ای ایده‌آل برای توسعه‌دهندگان باشد.

چرا چک‌پوینت ViT-B/16 لایون همچنان حسابی پرطرفدار و شلوغ است؟

چک‌پوینت ViT-B/16 لایون ماهانه صدها هزار بار در پلتفرم هاگینگ فیس (Hugging Face) دانلود می‌شود و در ابزار‌ها و اسپیس‌های متعددی مورد استفاده قرار می‌گیرد. این مدل در واقع بازتولید و آموزش مستقل معماری مشهور CLIP شرکت OpenAI است که با فریم‌ورک OpenCLIP و کاملاً از صفر روی حدود ۲ میلیارد جفت تصویر و متن آموزش دیده است. ارائه وزن‌های کاملاً متن‌باز، ابزار‌های توسعه آماده و امتحان‌پس‌داده، نیاز سخت‌افزاری متعادل و عملکرد درخشان در بنچمارک‌ها دست به دست هم داده‌اند تا این مدل همچنان به‌عنوان یک استاندارد و خط مبنای ایده‌آل در حوزه بینایی-زبانی به شمار برود.

کالبدشکافی و جزئیات فنی مدل

معماری
انکودر تصویر ViT-B/16 در کنار انکودر متنی ترنسفورمر
ورودی تصویر
تصاویر ۲۲۴ در ۲۲۴ پیکسل تقسیم‌شده به پچ‌های ۱۶ در ۱۶
اندازه پروجکشن
امبدینگ‌های ۵۱۲ بعدی برای متن و تصویر
طول متن ورودی
حداکثر ۷۷ توکن با توکنایزر اختصاصی مدل
داده‌های آموزشی
مجموعه انگلیسی LAION-2B (زیرمجموعه‌ای از LAION-5B استخراج‌شده از آدرس تصاویر و متن‌های وب)
حجم داده‌های پردازش‌شده
۳۴ میلیارد نمونه پردازش‌شده با بچ‌سایز کلی حدود ۸۸٬۰۰۰
سیستم آموزشی
ابررایانه JUWELS Booster
امتیاز بنچمارک
دقت ۷۰.۲ درصدی Top-1 در حالت زیروشات (Zero-shot) روی ImageNet-1K
اندازه و حجم مدل
حدود ۱۵۰ میلیون پارامتر و تقریباً ۶۰۰ مگابایت برای وزن‌های FP32
مجوز استفاده
لایسنس MIT (همراه با راهنماهای پیاده‌سازی و توصیه‌های ایمنی در کارت مدل)

پسوند s34B-b88K در نام مدل، نشان‌دهنده تعداد نمونه‌های پردازش‌شده و اندازه بچ‌سایز در طول آموزش است. عدد ۳۴ میلیارد به کل نمونه‌های پردازش‌شده در طول مراحل مختلف آموزش (از جمله مرورهای تکراری داده‌ها) اشاره دارد، نه تعداد جفت‌های تصویر و متن منحصربه‌فرد. هدف یادگیری تقابلی (Contrastive Learning) در مدل CLIP این است که شباهت میان تصاویر و کپشن‌های متناظر را به حداکثر برساند و در عین حال موارد نامرتبط در همان بچ را از یکدیگر متمایز کند.

جایگاه نسخه B/16 در مقایسه با سایر مدل‌ها

لایون نسخه‌های مختلفی از OpenCLIP را با سطوح متفاوتی از دقت و نیاز محاسباتی عرضه کرده است. در رزولوشن ۲۲۴ پیکسلی، نسخه B/16 تصویر را به ۱۹۶ توکن یا پچ تصویری تقسیم می‌کند، در حالی که در نسخه B/32 این مقدار تنها ۴۹ پچ است. این شبکه‌بندی ریزتر و دقیق‌تر باعث ثبت جزئیات بصری بسیار بهتری می‌شود، هرچند هزینه محاسباتی مکانیسم توجه (Attention) را افزایش می‌دهد. از سوی دیگر، انکودرهای بزرگ‌تر مثل L/14 و H/14 قدرت و ظرفیت به‌مراتب بالاتری ارائه می‌دهند، اما به حافظه رم و توان پردازشی بسیار بیشتری نیاز دارند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

فرسودگی شغلی و بحران هویت برنامه‌نویس‌ها زیر بار هوش مصنوعی؛ نتایج شوکه‌کننده نظرسنجی از ۳۰ هزار متخصص
آخرین اخبار

فرسودگی شغلی و بحران هویت برنامه‌نویس‌ها زیر بار هوش مصنوعی؛ نتایج شوکه‌کننده نظرسنجی از ۳۰ هزار متخصص

نظرسنجی بزرگ استک اورفلو از بیش از ۳۰ هزار برنامه‌نویس نشان می‌دهد که موج پرشتاب ابزار‌های هوش مصنوعی و ایجنت‌های کدنویسی، مهندسان نرم‌افزار را دچار خستگی مفرط، فرسودگی شغلی و بحران هویت کرده است. با وجود استفاده روزمره بخش زیادی از توسعه‌دهندگان از این فناوری، سطح اعتماد به خروجی هوش مصنوعی بسیار پایین است و بسیاری نگران آینده شغلی و تغییر ماهیت حرفه خود هستند.

۴ دقیقه مطالعه
۰
۱۴ مهر
توصیه مدیر ارشد دیپ‌مایند به کارمندان نگران: «لازم نیست نابغه باشید، فقط کار با هوش مصنوعی را شروع کنید!»
آخرین اخبار

توصیه مدیر ارشد دیپ‌مایند به کارمندان نگران: «لازم نیست نابغه باشید، فقط کار با هوش مصنوعی را شروع کنید!»

لیلا ابراهیم، مدیر ارشد آمادگی برای هوش مصنوعی در گوگل دیپ‌مایند، معتقد است به‌جای ترسیدن از اخبار تعدیل نیرو، باید هرچه سریع‌تر کار با ابزار‌های هوش مصنوعی را یاد گرفت. او با مرور تجربه روزمره تیم‌های دیپ‌مایند، یادگیری مداوم و تقویت مهارت‌های خلاقانه انسانی را برگ برنده اصلی در رویارویی با آینده می‌داند.

۵ دقیقه مطالعه
۰
۱۴ مهر
دستمزد ۱۸ میلیون دلاری مدیرعامل آنتروپیک لو رفت؛ داریو آمودی در آستانه ورود به بورس چقدر درآمد دارد؟
آخرین اخبار

دستمزد ۱۸ میلیون دلاری مدیرعامل آنتروپیک لو رفت؛ داریو آمودی در آستانه ورود به بورس چقدر درآمد دارد؟

اسناد محرمانه عرضه اولیه سهام شرکت آنتروپیک نشان می‌دهد داریو آمودی، مدیرعامل سازنده چت‌بات کلود، در سال ۲۰۲۵ درآمدی ۱۸ میلیون دلاری داشته است. بیش‌تر این رقم به شکل سهام پرداخت شده و در مقایسه با ارزش نزدیک به ۲ تریلیون دلاری این غول هوش مصنوعی، دستمزدی متعادل در میان رهبران سیلیکون‌ولی به شمار می‌رود.

۳ دقیقه مطالعه
۰
۱۴ مهر