پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل تصمیم‌گیری d1 استارتاپ Liquid AI بینا شد؛ کاهش ۲۰۰ برابری هزینه‌ها با پردازش مستقیم تصویر!

انتشار:۱۳ مهر ۱۴۰۵(۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Liquid AI قابلیت درک تصویر را به مدل تصمیم‌گیری d1 اضافه کرد تا توسعه‌دهندگان بتوانند بدون نیاز به تولید پرهزینه توکن‌های متنی، تصاویر و متون را مستقیماً دسته‌بندی کنند. این مدل با حذف خروجی‌های متنی وقت‌گیر، هزینه‌ها را تا ۲۰۰ برابر و زمان پاسخ‌دهی را به کسری از ثانیه کاهش می‌دهد. از کنترل کیفیت خطوط تولید و بررسی بردهای الکترونیکی تا تحلیل اسکرین‌شات بازی‌ها، d1 دسته‌بندی بصری را با سرعتی بی‌سابقه ممکن می‌سازد.

مدل تصمیم‌گیری d1 استارتاپ Liquid AI بینا شد؛ کاهش ۲۰۰ برابری هزینه‌ها با پردازش مستقیم تصویر!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل تصمیم‌گیری d1 حالا از ورودی تصویر هم پشتیبانی می‌کند و بدون تولید حتی یک توکن متنی، پاسخ‌های بسته‌ای مثل بله/خیر، گزینه‌ای و امتیازی تحویل می‌دهد.
  • طبق گزارش Liquid AI، این مدل در وظایف دسته‌بندی تا ۲۰۰ برابر ارزان‌تر از غول‌هایی مثل GPT-6.1 Sol و کلود عمل کرده و پاسخ‌ها را تنها در ۲۰۰ تا ۳۰۰ میلی‌ثانیه آماده می‌کند.
  • این فناوری برای بازرسی خطوط تولید صنعتی، بررسی ایمنی محتوا و تحلیل تصویر برای ایجنت‌ها طراحی شده و فعلاً از طریق API با پلن رایگان در دسترس است.

استارتاپ Liquid AI قابلیت بینایی را به مدل تصمیم‌گیری d1 اضافه کرد

استارتاپ Liquid AI ورودی تصویر را به مدل تصمیم‌گیری خود اضافه کرده است؛ مدلی که بر اساس مستندات رسمی d1، تخصص اصلی‌اش ارائه پاسخ‌های ساختاریافته و محاسبه احتمالات آماری است. حالا توسعه‌دهندگان می‌توانند تصویر، متن یا ترکیبی از هر دو را به مدل بفرستند تا محتوای بصری را مستقیماً دسته‌بندی کند؛ بدون اینکه نیازی باشد یک مدل زبانی بزرگ و مولد، متنی بنویسد و آن را با زحمت زیاد در قالب فایل متنی یا فرمت‌های خاص مرتب کند.

در پروژه‌های واقعی، خیلی وقت‌ها از مدل‌های زبانی فقط برای یک کار ساده استفاده می‌شود: برگرداندن یک برچسب، پاسخ بله یا خیر، انتخاب یک گزینه یا اعلام یک نمره عددی. مدل d1 دقیقاً برای همین تصمیم‌گیری‌های مشخص و بسته طراحی شده است؛ یعنی دیگر نیازی نیست منتظر بمانید تا هوش مصنوعی کلمه به کلمه توکن‌ها را بسازد و بعد هم کد پایتون بنویسید تا فایل خروجی JSON را تحلیل کند. طبق اعلام تیم سازنده، خروجی این مدل دقیقاً صفر توکن متنی تولید می‌کند؛ موضوعی که هم تأخیر در پاسخ را شدیداً کاهش می‌دهد، هم جلوی خطاهای مربوط به پاسخ‌های ناقص را می‌گیرد و هم هزینه‌های خرید توکن خروجی را صفر می‌کند.

چشم‌های تیزبین برای هدف‌گیری گسترده‌تر

شرکت Liquid AI این مدل مجهز به بینایی ماشین را در سه حوزه کلیدی ارزیابی کرده است: بازرسی قطعات صنعتی، مسیریابی درخواست‌ها در برنامه‌ها، و تحلیل تصاویر صفحات بازی. نتایج منتشرشده چشم‌انداز این شرکت را برای کاربردهای عملی d1 نشان می‌دهد؛ هرچند هنوز آزمایشگاه‌ها و متخصصان مستقل صحت این ادعاها را ارزیابی نکرده‌اند.

نوع آزمایش
دامنه و حوزه بررسی
نتایج گزارش‌شده توسط Liquid AI
بازرسی صنعتی (VisA)
بردهای الکترونیکی، شمع‌ها، بادام هندی و آدامس
دقت بین ۸۵ تا ۹۷ درصد بدون نیاز به فاین‌تیونینگ و آموزش اختصاصی
مقایسه در برنامه‌های کاربردی
شش وظیفه متنوع، از فیلتر کردن تیکت‌های پشتیبانی تا بررسی بردهای الکترونیکی
برابری یا شکست مدل GPT-6.1 Sol در چهار وظیفه
مقایسه هزینه‌ها
در مقایسه با مدل‌های GPT-6.1 Sol و Claude Opus 5.5
هزینه‌ای بین ۱۹ تا ۲۰۰ برابر پایین‌تر
مقایسه زمان پاسخ‌دهی (Latency)
در تمام شش وظیفه کاربردی
پاسخ‌دهی سریع‌تر در تمام سناریوها؛ تصمیم‌گیری‌های متنی فقط حدود ۲۰۰ تا ۳۰۰ میلی‌ثانیه زمان برد

در آزمایش‌های بازرسی صنعتی VisA، به جای اینکه مدل را با هزاران داده خاص دوباره آموزش دهند، فقط با دستورالعمل‌های ساده به زبان طبیعی مشخص کردند که چه محصولی معیوب به حساب می‌آید. این روش به تیم‌ها اجازه می‌دهد تا با یک دستور ساده (پرامپت)، معیارهای کنترل کیفیت را در لحظه تغییر دهند؛ البته نباید فراموش کرد که دقت نهایی در خط تولید همچنان به کیفیت تصویر، توازن دسته‌ها و شباهت قطعات واقعی با نمونه‌های آزمایشی بستگی خواهد داشت.

علاوه بر این، دو آزمایش مبتنی بر بازی هم انجام شد تا ببینند آیا d1 می‌تواند اسکرین‌شات‌ها را آن‌قدر خوب درک کند که ایجنت‌ها بتوانند بر اساس آن تصمیم بگیرند یا خیر:

  • تتریس (Tetris): فرستادن مستقیم اسکرین‌شات صفحه بازی به جای توضیحات متنی، تعداد خطوط پاک‌شده را از ۷۰ به ۸۱ خط افزایش داد.
  • وردل (Wordle): مدل d1 توانست هر ۱۲ بازی از ۱۲ مرحله را با میانگین ۳.۸ حدس و فقط با خواندن مستقیم صفحه بازی از روی اسکرین‌شات حل کند.

سه قالب مشخص برای خروجی تصمیم‌ها

هر درخواستی که برای d1 ارسال می‌شود، شامل یک وضعیت اولیه (State) در قالب متن، JSON، تصویر یا ترکیبی از این‌ها است که به همراه یک یا چند پرسش فرستاده می‌شود. هر پرسش هم در قالب یکی از سه نوع پاسخ زیر فرمول‌بندی می‌شود:

  • نوع Noul: برای سؤالات بله یا خیر یک احتمال آماری بین ۰ تا ۱ برمی‌گرداند. کاربردهای متداول آن شامل سیستم‌های حفاظتی (گاردریل‌ها)، تشخیص اسپم و شناسایی اطلاعات محرمانه هویتی است.
  • نوع Choice: یک گزینه را از میان مجموعه‌ای از گزینه‌های از پیش تعریف‌شده انتخاب می‌کند و توزیع احتمال همراه با میزان اطمینان (Confidence) را ارائه می‌دهد. این حالت برای تشخیص هدف پیام‌ها و مسیریابی تیکت‌ها عالی است.
  • نوع Score: سطوح رتبه‌بندی مشخص‌شده توسط توسعه‌دهنده را بررسی می‌کند و امتیازی وزن‌دار به آن تخصیص می‌دهد؛ مناسب برای سنجش درجه فوریت، شدت مشکلات یا ارزیابی کیفیت.

جالب اینجاست که در یک درخواست واحد، می‌توانید هر سه نوع پرسش را ترکیب کنید. نمونه کد پایتون زیر نشان می‌دهد که چطور می‌توان از d1 برای بازرسی یک قطعه روی برد الکترونیکی کمک گرفت:

result = client.system_one(
    model="d1",
    state=[
        {
            "type": "image",
            "url": "pcb_photo.jpg",
        }
    ],
    questions={
        "has_defect": Noul(
            instructions=(
                "Does this circuit board show a soldering defect, "
                "missing component, or misalignment?"
            )
        ),
    },
)

print(result.answers["has_defect"].noul)  # Example: 0.94

در این سیستم، خروجی usage.output_tokens همیشه عدد 0 را نشان می‌دهد؛ چون مدل d1 اصلاً جوابی متنی تولید نمی‌کند. البته حواستان باشد که ارسال ورودی‌ها و پردازش تصاویر همچنان هزینه دارد؛ پس برای محاسبه دقیق صرفه‌جویی مالی، باید حجم درخواست‌ها و ابعاد تصاویر را در مقیاس واقعی در نظر بگیرید.

کالیبراسیون مشخص می‌کند که آیا احتمالات اعلام‌شده واقعاً به عنوان تخمینی قابل‌اعتماد کارایی دارند یا خیر. برای مثال، پیش‌بینی‌هایی که با احتمال نزدیک به ۰.۸ مشخص شده‌اند، باید در یک نمونه آماری مناسب تقریباً در ۸۰ درصد مواقع درست از آب دربیایند. بنابراین توسعه‌دهندگان باید قبل از اینکه تصمیم‌های کاملاً خودکار را بر اساس این احتمالات پایه‌ریزی کنند، عملکرد مدل را روی داده‌های اختصاصی خودشان بسنجند.

فعلاً روی کلود، در آینده روی سیستم محلی

در حال حاضر مدل d1 از طریق کنسول API شرکت Liquid (که پلن رایگان هم دارد) و همچنین در محیط آزمایشی (Playground) مدل d1 در دسترس قرار گرفته است. سرویس‌های محبوب Vercel AI Gateway و OpenRouter فعلاً از حالت متنی این مدل پشتیبانی می‌کنند و پشتیبانی از ورودی تصویر نیز قرار است در به‌روزرسانی‌های بعدی اضافه شود.

تیم Liquid انتشار وزن‌های باز (Open-weight) را در نقشه راه آینده خود قرار داده، اما مدل فعلی صرفاً از طریق API کار می‌کند و امکان فاین‌تیونینگ هم ندارد. به همین دلیل سازمان‌هایی که به دلایل امنیتی اجازه آپلود تصاویر به سرور‌های خارجی را ندارند یا به پردازش در محل (On-premises) نیاز دارند، تا زمان انتشار مدل محلی باید به سراغ گزینه‌های دیگر بروند.

مدل d1 دقیقاً به چه دردی می‌خورد؟

مدل d1 خوراک وظایفی با حجم کاری بالا و مجموعه‌ای از خروجی‌های کاملاً مشخص و معین است؛ مخصوصاً کار‌هایی که در حال حاضر با فرستادن پرامپت به چت‌بات‌های عمومی و استخراج فایل خروجی JSON انجام می‌شوند. چند نمونه از کاربردهای جذاب این مدل:

  • بازرسی خطوط تولید برای تشخیص عیب‌ها، قطعات ناموجود و درجه‌بندی کیفیت کالاها
  • نظارت و بررسی ایمنی تصاویر آپلودشده توسط کاربران
  • تحلیل تصویر نمایشگر برای ایجنت‌های هوشمند قبل از انتخاب حرکت یا دستور بعدی
  • دسته‌بندی و هدایت ایمیل‌ها و تیکت‌های پشتیبانی به صف‌های مربوطه
  • فرایندهای خودکار ارزیابی و امتیازدهی به محتوا
  • رتبه‌بندی مجدد و هدایت درخواست‌ها میان مدل‌های زبانی بزرگ‌تر

البته فراموش نکنید اگر پروژه‌تان به تولید متن‌های تازه، خلاصه‌سازی، کدنویسی، گفت‌وگوهای چندمرحله‌ای یا نگارش آزاد نیاز دارد، حتماً باید از مدل‌های مولد (Generative) استفاده کنید. مدل d1 منحصراً برای جواب‌هایی طراحی شده که از قبل ماهیت آن‌ها مشخص است: بله/خیر، گزینه‌ای یا نمره عددی.

دسته‌بندی داده‌ها دیگر نیازی به پوستین چت‌بات ندارد!

مدل‌های تصمیم‌گیری دست روی یکی از نقاط ضعف و ناکارآمدی‌های رایج در سیستم‌های هوش مصنوعی گذاشته‌اند: اینکه ما کار‌های ساده دسته‌بندی را در قالب پرامپت‌های چت می‌پیچیم و هزینه گزاف پردازش‌های مولد را برایشان می‌پردازیم! یک رابط تصمیم‌گیری اختصاصی، نیاز به رمزگشایی اتورگرسیو توکن‌ها و سر و کله زدن با ساختار خروجی را حذف می‌کند و در عین حال احتمالات ریاضی دقیقی ارائه می‌دهد که برای تعیین آستانه‌ها، قوانین خودداری از تصمیم و سیاست‌های هدایت هوشمند مدل‌ها بسیار کاربردی است.

افزودن بینایی ماشین، این معماری جذاب را به دنیای پیکسل‌ها کشانده تا در بازرسی‌های صنعتی و درک رابط کاربری نرم‌افزارها به کار بیاید. جالب است بدانید سرویس Decisions API شرکت OpenAI هم دقیقاً همین مأموریت را در جریان‌های کاری ساختاریافته دنبال می‌کند، و استارتاپ Fastino نیز هم‌زمان با رونمایی اولیه d1، مدل قابل‌نصب روی سیستم محلی GLiNER2.5-Decide را عرضه کرد. این تنوع در حال رشد بین مدل‌های کلود و مدل‌های با وزن باز، دست برنامه‌نویسان را برای انتخاب بهترین هزینه و نحوه استقرار کاملاً باز می‌گذارد.

به تبلیغات دل نبندید؛ احتمالات را در عمل بسنجید!

بنچمارک‌ها و آمار‌های هیجان‌انگیزی که منتشر شده کار خود شرکت Liquid است و آن‌ها خودشان مدل‌های رقیب و سناریوها را دست‌چین کرده‌اند. بنابراین اگر قصد دارید از این سیستم در خطوط تولید و پروژه‌های واقعی استفاده کنید، حتماً باید داده‌های آزمایش‌نشده از کار واقعی خودتان را بیاورید و این موارد را اندازه بگیرید:

  • دقت کلی و دقت در تک‌تک کلاس‌ها و دسته‌ها
  • نرخ‌های مثبت کاذب و منفی کاذب در آستانه‌های عملیاتی واقعی
  • کالیبراسیون احتمالات با شاخص‌هایی مثل امتیاز Brier یا خطای کالیبراسیون مورد انتظار (ECE)
  • میانگین و بیش‌ترین زمان تأخیر در پاسخ‌دهی، شامل زمان آپلود تصویر
  • هزینه کلی ورودی‌ها با در نظر گرفتن ابعاد واقعی تصاویر و حجم ترافیک سیستم
  • عملکرد مدل در شرایط تغییر نور، فشرده‌سازی عکس، تاری و تغییرات تدریجی در توزیع داده‌ها

برای پروژه‌هایی که خروجی‌شان به گزینه‌های مشخص و ثابتی ختم می‌شود، مدل d1 یک جایگزین جمع‌وجور، ارزان و بسیار سریع به جای خروجی‌های سنتی JSON به حساب می‌آید. البته ارزش واقعی این ابزار زمانی مشخص می‌شود که ببینیم آیا این ادعاها و صرفه‌جویی‌های اعلام‌شده، زیر بار تست روی تصاویر، برچسب‌ها، آستانه‌ها و محدودیت‌های واقعی تیم شما هم دوام می‌آورند یا خیر.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شکاف دستمزد به دنیای هوش مصنوعی هم رسید؛ پرداخت ۱۰ درصد پول کم‌تر به ایجنت‌های زن!
آخرین اخبار

شکاف دستمزد به دنیای هوش مصنوعی هم رسید؛ پرداخت ۱۰ درصد پول کم‌تر به ایجنت‌های زن!

نتایج یک پژوهش تازه در واقعیت مجازی نشان می‌دهد تعصبات دنیای واقعی حتی دامن هوش مصنوعی را هم گرفته است؛ جایی که کارمندان به یک ایجنت زن با توانایی کاملاً یکسان، بیش از ۱۰ درصد کم‌تر از همتای مردش پاداش پرداخت کردند. این یافته‌ها ثابت می‌کند انتخاب نام، چهره و هویت ظاهری برای ایجنت‌های کاری می‌تواند ناخودآگاه پیش‌داوری‌های انسانی را در محیط کار فعال کند.

۳ دقیقه مطالعه
۰
۱۳ مهر
آزادسازی ۱۲ گیگابایت حافظه در مک؛ چطور مدل‌های پنهان هوش مصنوعی اپل را با RemoveMacAI پاک کنیم؟
آخرین اخبار

آزادسازی ۱۲ گیگابایت حافظه در مک؛ چطور مدل‌های پنهان هوش مصنوعی اپل را با RemoveMacAI پاک کنیم؟

اگر در مک‌اواس نیازی به هوش مصنوعی اپل ندارید اما مدل‌های سنگین آن حافظه باارزش سیستم‌تان را اشغال کرده‌اند، یک ابزار متن‌باز جدید به کمکتان می‌آید. ابزار رایگان RemoveMacAI به شما اجازه می‌دهد تا ۱۲ گیگابایت از مدل‌های زبانی هوش مصنوعی اپل را به‌طور کامل پاک کرده و جلوی دانلود خودکار آن‌ها را بگیرید. با این ترفند کاربردی می‌توانید کنترل کامل فضای ذخیره‌سازی مک خود را دوباره به دست بگیرید.

۴ دقیقه مطالعه
۰
۱۳ مهر
پای ایجنت هوش مصنوعی اینستینکت به چت‌های گروهی باز شد؛ همکاری تیمی حتی بدون نیاز به حساب کاربری!
آخرین اخبار

پای ایجنت هوش مصنوعی اینستینکت به چت‌های گروهی باز شد؛ همکاری تیمی حتی بدون نیاز به حساب کاربری!

استارتاپ ۱۰ میلیارد دلاری اینستینکت (Instinct) با آوردن ایجنت هوش مصنوعی خود به چت‌های گروهی، هماهنگی کار‌ها میان دوستان را فوق‌العاده آسان کرده است. نکته جذاب این قابلیت آن است که حتی دوستان بدون حساب کاربری هم می‌توانند در گروه از این دستیار هوشمند کمک بگیرند. این قابلیت تازه، رقابت اینستینکت با غول‌هایی مثل متا و اوپن‌ای‌آی را وارد مرحله هیجان‌انگیزتری می‌کند.

۳ دقیقه مطالعه
۰
۱۳ مهر