خط و نشان مدل متنباز JEV-27B-VL برای GPT-4o: ارزیابی برقآسای متن و تصویر فقط در یک مرحله!
مدل متنباز JEV-27B-VL با معماری متفاوت خود توانسته سرعت تصمیمگیری هوش مصنوعی را متحول کند و متن و تصویر را تنها در یک مرحله بسنجد. این مدل ۲۷ میلیارد پارامتری با ترکیب سرعت خیرهکننده و استدلال عمیق، در بسیاری از سناریوها پابهپای GPT-4o رقابت میکند و به گزینهای ایدهآل برای رتبهبندی و سیستمهای پیشنهاددهنده تبدیل شده است.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- تیم اتوتراست از مدل بینایی-زبانی جدید JEV-27B-VL رونمایی کرد؛ مدلی متنباز با ۲۷ میلیارد پارامتر بر پایه Qwen که بهجای تولید کند و توکنبهتوکن کلمات، تمام گزینهها یا امتیازها رو فقط توی یک دور (One Pass) و با سرعت برق حساب میکنه.
- معماری دوگانه و کاربردی: «سیستم ۱» برای تصمیمگیریها و رتبهبندیهای برقآسا با تاخیر نزدیک به صفر طراحی شده، در حالی که «سیستم ۲» مثل یک مغز متفکر برای تحلیلهای عمیق و استدلال گامبهگام وارد گود میشه.
- استقبال میلیونی و درخشش در دنیای واقعی: این مدل با بیش از یک میلیون بار دانلود در هاگینگفیس، ثابت کرده بدون نیاز به دیتابیسهای سنگین و فقط با نگاه کردن به کاور ویدیوها، میتونه رفتار کاربر رو پابهپای مدلهایی مثل GPT-4o پیشبینی کنه.
ارزیابی و امتیازدهی برقآسا به متن و تصویر فقط در یک مرحله
مدل JEV-27B-VL یک رابط تصمیمگیری ساختاریافته را به یک مدل بینایی-زبانی آورده است. چه به آن متن بدهید، چه تصویر و چه ترکیبی از هر دو، این مدل میتواند به سوالات بله یا خیر جواب دهد، از بین ۲ تا ۲۵۶ گزینه انتخاب کند یا امتیازی بین ۰ تا ۵ تعیین نماید. بخش هیجانانگیز ماجرا اینجاست که برای هر درخواست، احتمال مربوط به تکتک گزینهها تنها در یک بار رفت محاسباتی (Forward Pass) برگردانده میشود.
این مدل که با مجوز کاملاً متنباز آپاچی ۲ (Apache-2.0) منتشر شده، ستون فقرات مدل قدرتمند Qwen3.8-27B را با یک آداپتور لورا (LoRA) و یک هد تصمیمگیری اختصاصی پیوند داده است. صفحه اختصاصی این مدل در هاگینگفیس تا الان بیش از یک میلیون بار دانلود شده است. هد تصمیمگیری همه گزینهها را به صورت یکجا و همزمان امتیازدهی میکند؛ موضوعی که زحمت تولید کندِ توکنبهتوکن را حذف کرده و این ابزار را برای رتبهبندی، مسیریابی درخواستها، داوری خودکار و حلقههای کنترل هوشمند فوقالعاده کاربردی میکند.
مفهوم احتمال کالیبرهشده در این مدل طوری در نظر گرفته شده که بازتابدهنده واقعیت باشد؛ یعنی اگر مدل تصمیمی را با ضریب اطمینان نزدیک به ۰.۸ اعلام کند، حدود ۸۰ درصد مواقع حق با مدل خواهد بود. همین ویژگی دست توسعهدهندگان را برای تعیین آستانه اطمینان و ارجاع موارد مشکوک به ناظر انسانی باز میگذارد؛ هرچند تیم توسعه هنوز کالیبراسیون را به صورت گسترده و ساختاریافته روی وظایف تصویری نسنجیده است.
دو مسیر هوشمند در دل یک مدل واحد
حالت | عملکرد | بهترین کاربرد |
|---|---|---|
سیستم ۱ (System 1) | آداپتور و هد تصمیمگیری را روی متن و تصاویر به کار میگیرد، از پرامپتهایی تا سقف ۲۵۶ هزار توکن پشتیبانی میکند و احتمال گزینهها را بلافاصله تحویل میدهد. | دستهبندی، رتبهبندی، داوری، مسیریابی ترافیک و تصمیمگیریهای پیاپی با کمترین تاخیر ممکن. |
سیستم ۲ (System 2) | از موتور اصلی Qwen3.8-27B برای تولید آزاد و تشریحی متن به همراه امکان استدلال گامبهگام و دریافت ورودی تصویر استفاده میکند. | کارهای باز و خلاقانه که به تحلیل، توضیح شفاف، جمعبندی دادهها یا استدلال بیشتر احتیاج دارند. |
این نسخه تصویری، علاوه بر حفظ تمام مهارتهای تصمیمگیری متنی نسخه قبلی، امکان دریافت اسکرینشاتها، عکسهای واقعی و تصاویر کاور ویدیوها را هم اضافه کرده است. به لطف این معماری، برنامهنویسان میتوانند تصمیمهای روزمره و روتین را به سیستم ۱ بسپارند و تنها موارد پیچیده یا مبهم را به سیستم ۲ بفرستند.
رتبهبندی در حالت شروع سرد فقط با شش کاور ویدیو
در یک دمو ویدیویی کوتاه، ۵ تصویر از کاور آخرین ویدیوهایی که کاربر تماشا کرده به همراه یک تصویر کاور پیشنهادی جدید به سیستم ۱ داده شد. مدل با سرعت تخمین زد که چقدر احتمال دارد کاربر ویدیوی پیشنهادی را تماشا کند. این رویکرد خلاقانه فقط به سابقه خیلی نزدیک کاربر وابسته است و هیچ نیازی به دیتابیسهای عظیم از رفتار جمعی کاربران، امبدینگهای آماده آیتمها یا آموزشهای اختصاصی مدلهای سیستم پیشنهاددهنده (Recommender) ندارد.
مطالب مرتبط و پیشنهادی

شاهکار جدید Manus 2.0؛ تبدیل یک خط پرامپت ساده به ویدیوی کامل با ۷۵۷ لایه قابل ادیت!
ایجنت محبوب Manus در نسخه ۲.۰ یک ویرایشگر ویدیوی چندترکه به نرمافزار دسکتاپ استودیو اضافه کرده که تنها با یک پرامپت ساده، ویدیویی کامل و چندلایه میسازد. این ابزار به جای تحویل یک فایل ویدیویی قفلشده، تمام ترکهای تصویر، صدا، زیرنویس و افکتها را روی یک تایملاین حرفهای در اختیارتان میگذارد تا بتوانید مو به مو آن را ویرایش کنید.

دست رد غول فستفود به هوش مصنوعی؛ چرا چیکفیلای حاضر نشد انسانها را حذف کند؟
در روزهایی که رقبای بزرگی مثل مکدونالد برای کاهش هزینهها به سراغ هوش مصنوعی صوتی رفتهاند، مدیرعامل چیکفیلای قاطعانه اعلام کرده که جایگزینی انسانها با ماشین در مرام این برند نیست. این زنجیره فستفود ۲۴ میلیارد دلاری معتقد است لبخند و ارتباط صمیمانه پرسنل با مشتری هویت اصلی آنهاست و هرگز نباید قربانی اتوماسیون شود.

جنگ تازه در بازار تبلیغات: هوش مصنوعی چطور بازی را از «جلب توجه» به «کشف قصد مشتری» کشاند؟
با معرفی موج تازهای از ابزارهای هوش مصنوعی در جریان هفته تبلیغات، بازار تبلیغات دیجیتال دستخوش تحولی چشمگیر شده است. تمرکز این صنعت به سرعت در حال جابهجایی از صرفاً «جلب توجه کاربر» به سمت «درآمدزایی بر پایه قصد واقعی مشتریان» است؛ تغییری بزرگ که بودجههای بازاریابی را به پلتفرمهای مدرن کشانده و ناشران سنتی را تحت فشار شدیدی گذاشته است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.