پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

خط و نشان مدل متن‌باز JEV-27B-VL برای GPT-4o: ارزیابی برق‌آسای متن و تصویر فقط در یک مرحله!

انتشار:۱۳ مهر ۱۴۰۵(۱ روز پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

مدل متن‌باز JEV-27B-VL با معماری متفاوت خود توانسته سرعت تصمیم‌گیری هوش مصنوعی را متحول کند و متن و تصویر را تنها در یک مرحله بسنجد. این مدل ۲۷ میلیارد پارامتری با ترکیب سرعت خیره‌کننده و استدلال عمیق، در بسیاری از سناریوها پا‌به‌پای GPT-4o رقابت می‌کند و به گزینه‌ای ایده‌آل برای رتبه‌بندی و سیستم‌های پیشنهاددهنده تبدیل شده است.

خط و نشان مدل متن‌باز JEV-27B-VL برای GPT-4o: ارزیابی برق‌آسای متن و تصویر فقط در یک مرحله!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • تیم اتوتراست از مدل بینایی-زبانی جدید JEV-27B-VL رونمایی کرد؛ مدلی متن‌باز با ۲۷ میلیارد پارامتر بر پایه Qwen که به‌جای تولید کند و توکن‌به‌توکن کلمات، تمام گزینه‌ها یا امتیازها رو فقط توی یک دور (One Pass) و با سرعت برق حساب می‌کنه.
  • معماری دوگانه و کاربردی: «سیستم ۱» برای تصمیم‌گیری‌ها و رتبه‌بندی‌های برق‌آسا با تاخیر نزدیک به صفر طراحی شده، در حالی که «سیستم ۲» مثل یک مغز متفکر برای تحلیل‌های عمیق و استدلال گام‌به‌گام وارد گود میشه.
  • استقبال میلیونی و درخشش در دنیای واقعی: این مدل با بیش از یک میلیون بار دانلود در هاگینگ‌فیس، ثابت کرده بدون نیاز به دیتابیس‌های سنگین و فقط با نگاه کردن به کاور ویدیوها، می‌تونه رفتار کاربر رو پا‌به‌پای مدل‌هایی مثل GPT-4o پیش‌بینی کنه.

ارزیابی و امتیازدهی برق‌آسا به متن و تصویر فقط در یک مرحله

مدل JEV-27B-VL یک رابط تصمیم‌گیری ساختاریافته را به یک مدل بینایی-زبانی آورده است. چه به آن متن بدهید، چه تصویر و چه ترکیبی از هر دو، این مدل می‌تواند به سوالات بله یا خیر جواب دهد، از بین ۲ تا ۲۵۶ گزینه انتخاب کند یا امتیازی بین ۰ تا ۵ تعیین نماید. بخش هیجان‌انگیز ماجرا اینجاست که برای هر درخواست، احتمال مربوط به تک‌تک گزینه‌ها تنها در یک بار رفت محاسباتی (Forward Pass) برگردانده می‌شود.

این مدل که با مجوز کاملاً متن‌باز آپاچی ۲ (Apache-2.0) منتشر شده، ستون فقرات مدل قدرتمند Qwen3.8-27B را با یک آداپتور لورا (LoRA) و یک هد تصمیم‌گیری اختصاصی پیوند داده است. صفحه اختصاصی این مدل در هاگینگ‌فیس تا الان بیش از یک میلیون بار دانلود شده است. هد تصمیم‌گیری همه گزینه‌ها را به صورت یک‌جا و هم‌زمان امتیازدهی می‌کند؛ موضوعی که زحمت تولید کندِ توکن‌به‌توکن را حذف کرده و این ابزار را برای رتبه‌بندی، مسیریابی درخواست‌ها، داوری خودکار و حلقه‌های کنترل هوشمند فوق‌العاده کاربردی می‌کند.

مفهوم احتمال کالیبره‌شده در این مدل طوری در نظر گرفته شده که بازتاب‌دهنده واقعیت باشد؛ یعنی اگر مدل تصمیمی را با ضریب اطمینان نزدیک به ۰.۸ اعلام کند، حدود ۸۰ درصد مواقع حق با مدل خواهد بود. همین ویژگی دست توسعه‌دهندگان را برای تعیین آستانه اطمینان و ارجاع موارد مشکوک به ناظر انسانی باز می‌گذارد؛ هرچند تیم توسعه هنوز کالیبراسیون را به صورت گسترده و ساختاریافته روی وظایف تصویری نسنجیده است.

دو مسیر هوشمند در دل یک مدل واحد

حالت
عملکرد
بهترین کاربرد
سیستم ۱ (System 1)
آداپتور و هد تصمیم‌گیری را روی متن و تصاویر به کار می‌گیرد، از پرامپت‌هایی تا سقف ۲۵۶ هزار توکن پشتیبانی می‌کند و احتمال گزینه‌ها را بلافاصله تحویل می‌دهد.
دسته‌بندی، رتبه‌بندی، داوری، مسیریابی ترافیک و تصمیم‌گیری‌های پیاپی با کم‌ترین تاخیر ممکن.
سیستم ۲ (System 2)
از موتور اصلی Qwen3.8-27B برای تولید آزاد و تشریحی متن به همراه امکان استدلال گام‌به‌گام و دریافت ورودی تصویر استفاده می‌کند.
کار‌های باز و خلاقانه که به تحلیل، توضیح شفاف، جمع‌بندی داده‌ها یا استدلال بیش‌تر احتیاج دارند.

این نسخه تصویری، علاوه بر حفظ تمام مهارت‌های تصمیم‌گیری متنی نسخه قبلی، امکان دریافت اسکرین‌شات‌ها، عکس‌های واقعی و تصاویر کاور ویدیوها را هم اضافه کرده است. به لطف این معماری، برنامه‌نویسان می‌توانند تصمیم‌های روزمره و روتین را به سیستم ۱ بسپارند و تنها موارد پیچیده یا مبهم را به سیستم ۲ بفرستند.

رتبه‌بندی در حالت شروع سرد فقط با شش کاور ویدیو

در یک دمو ویدیویی کوتاه، ۵ تصویر از کاور آخرین ویدیوهایی که کاربر تماشا کرده به همراه یک تصویر کاور پیشنهادی جدید به سیستم ۱ داده شد. مدل با سرعت تخمین زد که چقدر احتمال دارد کاربر ویدیوی پیشنهادی را تماشا کند. این رویکرد خلاقانه فقط به سابقه خیلی نزدیک کاربر وابسته است و هیچ نیازی به دیتابیس‌های عظیم از رفتار جمعی کاربران، امبدینگ‌های آماده آیتم‌ها یا آموزش‌های اختصاصی مدل‌های سیستم پیشنهاددهنده (Recommender) ندارد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شاهکار جدید Manus 2.0؛ تبدیل یک خط پرامپت ساده به ویدیوی کامل با ۷۵۷ لایه قابل ادیت!
آخرین اخبار

شاهکار جدید Manus 2.0؛ تبدیل یک خط پرامپت ساده به ویدیوی کامل با ۷۵۷ لایه قابل ادیت!

ایجنت محبوب Manus در نسخه ۲.۰ یک ویرایشگر ویدیوی چندترکه به نرم‌افزار دسکتاپ استودیو اضافه کرده که تنها با یک پرامپت ساده، ویدیویی کامل و چندلایه می‌سازد. این ابزار به جای تحویل یک فایل ویدیویی قفل‌شده، تمام ترک‌های تصویر، صدا، زیرنویس و افکت‌ها را روی یک تایم‌لاین حرفه‌ای در اختیارتان می‌گذارد تا بتوانید مو به مو آن را ویرایش کنید.

۴ دقیقه مطالعه
۰
۱۴ مهر
دست رد غول فست‌فود به هوش مصنوعی؛ چرا چیک‌فیل‌ای حاضر نشد انسان‌ها را حذف کند؟
آخرین اخبار

دست رد غول فست‌فود به هوش مصنوعی؛ چرا چیک‌فیل‌ای حاضر نشد انسان‌ها را حذف کند؟

در روز‌هایی که رقبای بزرگی مثل مک‌دونالد برای کاهش هزینه‌ها به سراغ هوش مصنوعی صوتی رفته‌اند، مدیرعامل چیک‌فیل‌ای قاطعانه اعلام کرده که جایگزینی انسان‌ها با ماشین در مرام این برند نیست. این زنجیره فست‌فود ۲۴ میلیارد دلاری معتقد است لبخند و ارتباط صمیمانه پرسنل با مشتری هویت اصلی آن‌هاست و هرگز نباید قربانی اتوماسیون شود.

۳ دقیقه مطالعه
۰
۱۴ مهر
جنگ تازه در بازار تبلیغات: هوش مصنوعی چطور بازی را از «جلب توجه» به «کشف قصد مشتری» کشاند؟
آخرین اخبار

جنگ تازه در بازار تبلیغات: هوش مصنوعی چطور بازی را از «جلب توجه» به «کشف قصد مشتری» کشاند؟

با معرفی موج تازه‌ای از ابزار‌های هوش مصنوعی در جریان هفته تبلیغات، بازار تبلیغات دیجیتال دستخوش تحولی چشمگیر شده است. تمرکز این صنعت به سرعت در حال جابه‌جایی از صرفاً «جلب توجه کاربر» به سمت «درآمدزایی بر پایه قصد واقعی مشتریان» است؛ تغییری بزرگ که بودجه‌های بازاریابی را به پلتفرم‌های مدرن کشانده و ناشران سنتی را تحت فشار شدیدی گذاشته است.

۱ دقیقه مطالعه
۰
۱۴ مهر