مدل تصمیمگیری d1 استارتاپ Liquid AI بینا شد؛ کاهش ۲۰۰ برابری هزینهها با پردازش مستقیم تصویر!
استارتاپ Liquid AI قابلیت درک تصویر را به مدل تصمیمگیری d1 اضافه کرد تا توسعهدهندگان بتوانند بدون نیاز به تولید پرهزینه توکنهای متنی، تصاویر و متون را مستقیماً دستهبندی کنند. این مدل با حذف خروجیهای متنی وقتگیر، هزینهها را تا ۲۰۰ برابر و زمان پاسخدهی را به کسری از ثانیه کاهش میدهد. از کنترل کیفیت خطوط تولید و بررسی بردهای الکترونیکی تا تحلیل اسکرینشات بازیها، d1 دستهبندی بصری را با سرعتی بیسابقه ممکن میسازد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل تصمیمگیری d1 حالا از ورودی تصویر هم پشتیبانی میکند و بدون تولید حتی یک توکن متنی، پاسخهای بستهای مثل بله/خیر، گزینهای و امتیازی تحویل میدهد.
- طبق گزارش Liquid AI، این مدل در وظایف دستهبندی تا ۲۰۰ برابر ارزانتر از غولهایی مثل GPT-6.1 Sol و کلود عمل کرده و پاسخها را تنها در ۲۰۰ تا ۳۰۰ میلیثانیه آماده میکند.
- این فناوری برای بازرسی خطوط تولید صنعتی، بررسی ایمنی محتوا و تحلیل تصویر برای ایجنتها طراحی شده و فعلاً از طریق API با پلن رایگان در دسترس است.
استارتاپ Liquid AI قابلیت بینایی را به مدل تصمیمگیری d1 اضافه کرد
استارتاپ Liquid AI ورودی تصویر را به مدل تصمیمگیری خود اضافه کرده است؛ مدلی که بر اساس مستندات رسمی d1، تخصص اصلیاش ارائه پاسخهای ساختاریافته و محاسبه احتمالات آماری است. حالا توسعهدهندگان میتوانند تصویر، متن یا ترکیبی از هر دو را به مدل بفرستند تا محتوای بصری را مستقیماً دستهبندی کند؛ بدون اینکه نیازی باشد یک مدل زبانی بزرگ و مولد، متنی بنویسد و آن را با زحمت زیاد در قالب فایل متنی یا فرمتهای خاص مرتب کند.
در پروژههای واقعی، خیلی وقتها از مدلهای زبانی فقط برای یک کار ساده استفاده میشود: برگرداندن یک برچسب، پاسخ بله یا خیر، انتخاب یک گزینه یا اعلام یک نمره عددی. مدل d1 دقیقاً برای همین تصمیمگیریهای مشخص و بسته طراحی شده است؛ یعنی دیگر نیازی نیست منتظر بمانید تا هوش مصنوعی کلمه به کلمه توکنها را بسازد و بعد هم کد پایتون بنویسید تا فایل خروجی JSON را تحلیل کند. طبق اعلام تیم سازنده، خروجی این مدل دقیقاً صفر توکن متنی تولید میکند؛ موضوعی که هم تأخیر در پاسخ را شدیداً کاهش میدهد، هم جلوی خطاهای مربوط به پاسخهای ناقص را میگیرد و هم هزینههای خرید توکن خروجی را صفر میکند.
چشمهای تیزبین برای هدفگیری گستردهتر
شرکت Liquid AI این مدل مجهز به بینایی ماشین را در سه حوزه کلیدی ارزیابی کرده است: بازرسی قطعات صنعتی، مسیریابی درخواستها در برنامهها، و تحلیل تصاویر صفحات بازی. نتایج منتشرشده چشمانداز این شرکت را برای کاربردهای عملی d1 نشان میدهد؛ هرچند هنوز آزمایشگاهها و متخصصان مستقل صحت این ادعاها را ارزیابی نکردهاند.
نوع آزمایش | دامنه و حوزه بررسی | نتایج گزارششده توسط Liquid AI |
|---|---|---|
بازرسی صنعتی (VisA) | بردهای الکترونیکی، شمعها، بادام هندی و آدامس | دقت بین ۸۵ تا ۹۷ درصد بدون نیاز به فاینتیونینگ و آموزش اختصاصی |
مقایسه در برنامههای کاربردی | شش وظیفه متنوع، از فیلتر کردن تیکتهای پشتیبانی تا بررسی بردهای الکترونیکی | برابری یا شکست مدل GPT-6.1 Sol در چهار وظیفه |
مقایسه هزینهها | در مقایسه با مدلهای GPT-6.1 Sol و Claude Opus 5.5 | هزینهای بین ۱۹ تا ۲۰۰ برابر پایینتر |
مقایسه زمان پاسخدهی (Latency) | در تمام شش وظیفه کاربردی | پاسخدهی سریعتر در تمام سناریوها؛ تصمیمگیریهای متنی فقط حدود ۲۰۰ تا ۳۰۰ میلیثانیه زمان برد |
در آزمایشهای بازرسی صنعتی VisA، به جای اینکه مدل را با هزاران داده خاص دوباره آموزش دهند، فقط با دستورالعملهای ساده به زبان طبیعی مشخص کردند که چه محصولی معیوب به حساب میآید. این روش به تیمها اجازه میدهد تا با یک دستور ساده (پرامپت)، معیارهای کنترل کیفیت را در لحظه تغییر دهند؛ البته نباید فراموش کرد که دقت نهایی در خط تولید همچنان به کیفیت تصویر، توازن دستهها و شباهت قطعات واقعی با نمونههای آزمایشی بستگی خواهد داشت.
علاوه بر این، دو آزمایش مبتنی بر بازی هم انجام شد تا ببینند آیا d1 میتواند اسکرینشاتها را آنقدر خوب درک کند که ایجنتها بتوانند بر اساس آن تصمیم بگیرند یا خیر:
- تتریس (Tetris): فرستادن مستقیم اسکرینشات صفحه بازی به جای توضیحات متنی، تعداد خطوط پاکشده را از ۷۰ به ۸۱ خط افزایش داد.
- وردل (Wordle): مدل d1 توانست هر ۱۲ بازی از ۱۲ مرحله را با میانگین ۳.۸ حدس و فقط با خواندن مستقیم صفحه بازی از روی اسکرینشات حل کند.
سه قالب مشخص برای خروجی تصمیمها
هر درخواستی که برای d1 ارسال میشود، شامل یک وضعیت اولیه (State) در قالب متن، JSON، تصویر یا ترکیبی از اینها است که به همراه یک یا چند پرسش فرستاده میشود. هر پرسش هم در قالب یکی از سه نوع پاسخ زیر فرمولبندی میشود:
- نوع Noul: برای سؤالات بله یا خیر یک احتمال آماری بین ۰ تا ۱ برمیگرداند. کاربردهای متداول آن شامل سیستمهای حفاظتی (گاردریلها)، تشخیص اسپم و شناسایی اطلاعات محرمانه هویتی است.
- نوع Choice: یک گزینه را از میان مجموعهای از گزینههای از پیش تعریفشده انتخاب میکند و توزیع احتمال همراه با میزان اطمینان (Confidence) را ارائه میدهد. این حالت برای تشخیص هدف پیامها و مسیریابی تیکتها عالی است.
- نوع Score: سطوح رتبهبندی مشخصشده توسط توسعهدهنده را بررسی میکند و امتیازی وزندار به آن تخصیص میدهد؛ مناسب برای سنجش درجه فوریت، شدت مشکلات یا ارزیابی کیفیت.
جالب اینجاست که در یک درخواست واحد، میتوانید هر سه نوع پرسش را ترکیب کنید. نمونه کد پایتون زیر نشان میدهد که چطور میتوان از d1 برای بازرسی یک قطعه روی برد الکترونیکی کمک گرفت:
result = client.system_one(
model="d1",
state=[
{
"type": "image",
"url": "pcb_photo.jpg",
}
],
questions={
"has_defect": Noul(
instructions=(
"Does this circuit board show a soldering defect, "
"missing component, or misalignment?"
)
),
},
)
print(result.answers["has_defect"].noul) # Example: 0.94در این سیستم، خروجی usage.output_tokens همیشه عدد 0 را نشان میدهد؛ چون مدل d1 اصلاً جوابی متنی تولید نمیکند. البته حواستان باشد که ارسال ورودیها و پردازش تصاویر همچنان هزینه دارد؛ پس برای محاسبه دقیق صرفهجویی مالی، باید حجم درخواستها و ابعاد تصاویر را در مقیاس واقعی در نظر بگیرید.
کالیبراسیون مشخص میکند که آیا احتمالات اعلامشده واقعاً به عنوان تخمینی قابلاعتماد کارایی دارند یا خیر. برای مثال، پیشبینیهایی که با احتمال نزدیک به ۰.۸ مشخص شدهاند، باید در یک نمونه آماری مناسب تقریباً در ۸۰ درصد مواقع درست از آب دربیایند. بنابراین توسعهدهندگان باید قبل از اینکه تصمیمهای کاملاً خودکار را بر اساس این احتمالات پایهریزی کنند، عملکرد مدل را روی دادههای اختصاصی خودشان بسنجند.
فعلاً روی کلود، در آینده روی سیستم محلی
در حال حاضر مدل d1 از طریق کنسول API شرکت Liquid (که پلن رایگان هم دارد) و همچنین در محیط آزمایشی (Playground) مدل d1 در دسترس قرار گرفته است. سرویسهای محبوب Vercel AI Gateway و OpenRouter فعلاً از حالت متنی این مدل پشتیبانی میکنند و پشتیبانی از ورودی تصویر نیز قرار است در بهروزرسانیهای بعدی اضافه شود.
تیم Liquid انتشار وزنهای باز (Open-weight) را در نقشه راه آینده خود قرار داده، اما مدل فعلی صرفاً از طریق API کار میکند و امکان فاینتیونینگ هم ندارد. به همین دلیل سازمانهایی که به دلایل امنیتی اجازه آپلود تصاویر به سرورهای خارجی را ندارند یا به پردازش در محل (On-premises) نیاز دارند، تا زمان انتشار مدل محلی باید به سراغ گزینههای دیگر بروند.
مدل d1 دقیقاً به چه دردی میخورد؟
مدل d1 خوراک وظایفی با حجم کاری بالا و مجموعهای از خروجیهای کاملاً مشخص و معین است؛ مخصوصاً کارهایی که در حال حاضر با فرستادن پرامپت به چتباتهای عمومی و استخراج فایل خروجی JSON انجام میشوند. چند نمونه از کاربردهای جذاب این مدل:
- بازرسی خطوط تولید برای تشخیص عیبها، قطعات ناموجود و درجهبندی کیفیت کالاها
- نظارت و بررسی ایمنی تصاویر آپلودشده توسط کاربران
- تحلیل تصویر نمایشگر برای ایجنتهای هوشمند قبل از انتخاب حرکت یا دستور بعدی
- دستهبندی و هدایت ایمیلها و تیکتهای پشتیبانی به صفهای مربوطه
- فرایندهای خودکار ارزیابی و امتیازدهی به محتوا
- رتبهبندی مجدد و هدایت درخواستها میان مدلهای زبانی بزرگتر
البته فراموش نکنید اگر پروژهتان به تولید متنهای تازه، خلاصهسازی، کدنویسی، گفتوگوهای چندمرحلهای یا نگارش آزاد نیاز دارد، حتماً باید از مدلهای مولد (Generative) استفاده کنید. مدل d1 منحصراً برای جوابهایی طراحی شده که از قبل ماهیت آنها مشخص است: بله/خیر، گزینهای یا نمره عددی.
دستهبندی دادهها دیگر نیازی به پوستین چتبات ندارد!
مدلهای تصمیمگیری دست روی یکی از نقاط ضعف و ناکارآمدیهای رایج در سیستمهای هوش مصنوعی گذاشتهاند: اینکه ما کارهای ساده دستهبندی را در قالب پرامپتهای چت میپیچیم و هزینه گزاف پردازشهای مولد را برایشان میپردازیم! یک رابط تصمیمگیری اختصاصی، نیاز به رمزگشایی اتورگرسیو توکنها و سر و کله زدن با ساختار خروجی را حذف میکند و در عین حال احتمالات ریاضی دقیقی ارائه میدهد که برای تعیین آستانهها، قوانین خودداری از تصمیم و سیاستهای هدایت هوشمند مدلها بسیار کاربردی است.
افزودن بینایی ماشین، این معماری جذاب را به دنیای پیکسلها کشانده تا در بازرسیهای صنعتی و درک رابط کاربری نرمافزارها به کار بیاید. جالب است بدانید سرویس Decisions API شرکت OpenAI هم دقیقاً همین مأموریت را در جریانهای کاری ساختاریافته دنبال میکند، و استارتاپ Fastino نیز همزمان با رونمایی اولیه d1، مدل قابلنصب روی سیستم محلی GLiNER2.5-Decide را عرضه کرد. این تنوع در حال رشد بین مدلهای کلود و مدلهای با وزن باز، دست برنامهنویسان را برای انتخاب بهترین هزینه و نحوه استقرار کاملاً باز میگذارد.
به تبلیغات دل نبندید؛ احتمالات را در عمل بسنجید!
بنچمارکها و آمارهای هیجانانگیزی که منتشر شده کار خود شرکت Liquid است و آنها خودشان مدلهای رقیب و سناریوها را دستچین کردهاند. بنابراین اگر قصد دارید از این سیستم در خطوط تولید و پروژههای واقعی استفاده کنید، حتماً باید دادههای آزمایشنشده از کار واقعی خودتان را بیاورید و این موارد را اندازه بگیرید:
- دقت کلی و دقت در تکتک کلاسها و دستهها
- نرخهای مثبت کاذب و منفی کاذب در آستانههای عملیاتی واقعی
- کالیبراسیون احتمالات با شاخصهایی مثل امتیاز Brier یا خطای کالیبراسیون مورد انتظار (ECE)
- میانگین و بیشترین زمان تأخیر در پاسخدهی، شامل زمان آپلود تصویر
- هزینه کلی ورودیها با در نظر گرفتن ابعاد واقعی تصاویر و حجم ترافیک سیستم
- عملکرد مدل در شرایط تغییر نور، فشردهسازی عکس، تاری و تغییرات تدریجی در توزیع دادهها
برای پروژههایی که خروجیشان به گزینههای مشخص و ثابتی ختم میشود، مدل d1 یک جایگزین جمعوجور، ارزان و بسیار سریع به جای خروجیهای سنتی JSON به حساب میآید. البته ارزش واقعی این ابزار زمانی مشخص میشود که ببینیم آیا این ادعاها و صرفهجوییهای اعلامشده، زیر بار تست روی تصاویر، برچسبها، آستانهها و محدودیتهای واقعی تیم شما هم دوام میآورند یا خیر.
مطالب مرتبط و پیشنهادی

شکاف دستمزد به دنیای هوش مصنوعی هم رسید؛ پرداخت ۱۰ درصد پول کمتر به ایجنتهای زن!
نتایج یک پژوهش تازه در واقعیت مجازی نشان میدهد تعصبات دنیای واقعی حتی دامن هوش مصنوعی را هم گرفته است؛ جایی که کارمندان به یک ایجنت زن با توانایی کاملاً یکسان، بیش از ۱۰ درصد کمتر از همتای مردش پاداش پرداخت کردند. این یافتهها ثابت میکند انتخاب نام، چهره و هویت ظاهری برای ایجنتهای کاری میتواند ناخودآگاه پیشداوریهای انسانی را در محیط کار فعال کند.

آزادسازی ۱۲ گیگابایت حافظه در مک؛ چطور مدلهای پنهان هوش مصنوعی اپل را با RemoveMacAI پاک کنیم؟
اگر در مکاواس نیازی به هوش مصنوعی اپل ندارید اما مدلهای سنگین آن حافظه باارزش سیستمتان را اشغال کردهاند، یک ابزار متنباز جدید به کمکتان میآید. ابزار رایگان RemoveMacAI به شما اجازه میدهد تا ۱۲ گیگابایت از مدلهای زبانی هوش مصنوعی اپل را بهطور کامل پاک کرده و جلوی دانلود خودکار آنها را بگیرید. با این ترفند کاربردی میتوانید کنترل کامل فضای ذخیرهسازی مک خود را دوباره به دست بگیرید.

پای ایجنت هوش مصنوعی اینستینکت به چتهای گروهی باز شد؛ همکاری تیمی حتی بدون نیاز به حساب کاربری!
استارتاپ ۱۰ میلیارد دلاری اینستینکت (Instinct) با آوردن ایجنت هوش مصنوعی خود به چتهای گروهی، هماهنگی کارها میان دوستان را فوقالعاده آسان کرده است. نکته جذاب این قابلیت آن است که حتی دوستان بدون حساب کاربری هم میتوانند در گروه از این دستیار هوشمند کمک بگیرند. این قابلیت تازه، رقابت اینستینکت با غولهایی مثل متا و اوپنایآی را وارد مرحله هیجانانگیزتری میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.