پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل stsb-bert-tiny در Hugging Face؛ پکیج کامل امبدینگ در حجم ۱۷٫۶ مگابایت

انتشار:۴ مهر ۱۴۰۵(۲ روز پیش)
۱ دقیقه زمان مطالعه
۰ دیدگاه

پلتفرم Hugging Face میزبان مدل زبانی فوق‌فشرده stsb-bert-tiny با ۴٫۳۹ میلیون پارامتر است که تمامی قابلیت‌های انکود و امبدینگ متنی را با حجم ناچیز ۱۷٫۶ مگابایت ارائه می‌دهد. این ابزار سبک امکان تست سریع پایپلاین‌های پردازش زبان، جستجوی معنایی و ارزیابی شباهت را بدون نیاز به منابع پردازشی سنگین فراهم می‌کند.

مدل stsb-bert-tiny در Hugging Face؛ پکیج کامل امبدینگ در حجم ۱۷٫۶ مگابایت

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • میزبانی Hugging Face از انکودر سبک stsb-bert-tiny با ۴٫۳۹ میلیون پارامتر
  • تولید امبدینگ‌های ۱۲۸ بعدی با پشتیبانی از حداکثر طول ۵۱۲ توکن
  • حجم ذخیره‌سازی تنها ۱۷٫۶ مگابایت با پشتیبانی از SafeTensors و PyTorch
  • بهینه‌سازی کامل برای تست و توسعه پایپلاین‌های جستجوی معنایی با حداقل مصرف CPU و رم

چکپوینت فوق‌العاده سبک BERT برای ارزیابی پایپلاین امبدینگ

پلتفرم Hugging Face میزبان انکودر متنی stsb-bert-tiny-safetensors با ۴٫۳۹ میلیون پارامتر است که توسط تیم sentence-transformers-testing عرضه شده است. این مدل سبک، جملات و پاراگراف‌ها را به بردارهای ۱۲۸ بعدی تبدیل می‌کند و گزینه‌ای بهینه‌ برای جستجوی معنایی، خوشه‌بندی، محاسبه میزان شباهت و تست پایپلاین‌های هوش مصنوعی به شمار می‌رود.

مخزن این پروژه شامل وزن‌های SafeTensors، چک‌پوینت PyTorch، فایل‌های توکنایزر، پیکربندی pooling و نمونه‌کدهای مرتبط برای Sentence Transformers و کتابخانه خام Transformers است. این مجموعه جامع به توسعه‌دهندگان امکان می‌دهد همان مراحل بارگذاری، توکنایز، استنتاج، pooling و سنجش شباهت مدل‌های بزرگ امبدینگ را با حداقل مصرف حافظه، حجم دانلود اندک و کمترین استفاده از CPU پیاده‌سازی و آزمایش کنند.

حجم ناچیز، ساختار کامل

مشخصه
مقدار
تعداد پارامترها
۴٫۳۹ میلیون
دقت وزن‌ها
ممیز شناور ۳۲ بیتی (32-bit floating point)
فضای ذخیره‌سازی پارامترهای خام
حدود ۱۷٫۶ مگابایت
ابعاد بردار امبدینگ
۱۲۸ بعد
حداکثر طول توالی ورودی
۵۱۲ توکن
معماری
BertModel همراه با میانگین‌گیری توکن‌ها (mean-token pooling)
فرمت وزن‌ها
SafeTensors و PyTorch

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر