پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل جدید d1 از لیکویید ای‌آی؛ تصمیم‌گیری هوشمند بدون تولید حتی یک توکن!

انتشار:۸ مهر ۱۴۰۵(۲ ساعت پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ لیکویید ای‌آی از مدل تخصصی d1 رونمایی کرد که بدون تولید هیچ توکن متنی، تصمیم‌گیری‌های ساختاریافته را با سرعت بالا انجام می‌دهد. این مدل با حذف مرحله رمزگشایی متنی و خطاهای ساختاری JSON، گزینه‌ای ایده‌آل برای ایجنت‌ها، روتینگ و اعتبارسنجی در نرم‌افزارهای مدرن است.

مدل جدید d1 از لیکویید ای‌آی؛ تصمیم‌گیری هوشمند بدون تولید حتی یک توکن!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ لیکویید ای‌آی (Liquid AI) از مدل جدیدی به اسم d1 رونمایی کرده که به جای تولید متن‌های طولانی، مستقیماً خروجی‌های ساختاریافته و تصمیم‌های قطعی تحویل میده.
  • این مدل بدون تولید حتی یک توکن خروجی کار می‌کنه؛ یعنی تاخیر کمتر، خطای صفر در خروجی جیسون (JSON) و هزینه‌های به مراتب پایین‌تر برای توسعه‌دهنده‌ها.
  • مدل d1 موفق شده رتبه اول بنچمارک تصمیم‌گیری Jev رو به دست بیاره و برای کارهایی مثل هدایت ایجنت‌ها، دسته‌بندی تیکت‌ها و ارزیابی ریسک فوق‌العاده کاربردیه.

مدل d1 لیکویید ای‌آی: تصمیم‌گیری ساختاریافته بدون نیاز به تولید توکن

استارتاپ لیکویید ای‌آی (Liquid AI) مستندات اولین مدل تصمیم‌گیری خودش به نام d1 رو منتشر کرد؛ مدلی تخصصی که به عنوان جایگزینی بهینه برای مدل‌های زبانی در کارهایی مثل دسته‌بندی، مسیریابی درخواست‌ها، گیت‌های تایید و امتیازدهی در نرم‌افزارهای عملیاتی طراحی شده. به گزارش لیکویید، d1 موفق شده صدرنشین شاخص تصمیم‌گیری Jev بشه؛ بنچمارکی که مدل‌های تصمیم‌گیری رو در ۳۷ آزمون مختلف و با ۱۳۲٬۴۲۲ درخواست ثابت و استاندارد ارزیابی می‌کنه.

هدف اصلی این مدل، جایگزینی درخواست‌هایی از مدل‌های زبانی بزرگه که صرفاً برای گرفتن یک برچسب، مقدار بولی (بله/خیر)، انتخاب یک گزینه یا یک امتیاز عددی، خروجی JSON تولید می‌کنن. به جای اینکه مدل متن رو کلمه به کلمه تولید کنه و بعد سیستم مجبور باشه اون رو توی یک اسکیما پارس کنه، d1 مستقیماً پاسخ‌های ساختاریافته رو همراه با میزان احتمال بازمی‌گردونه و گزارش تعداد توکن‌های خروجی تولیدشده رو صفر ثبت می‌کنه! این طراحی هوشمندانه باعث کاهش چشمگیر تاخیر (Latency)، به صفر رسیدن خطاهای پارس کردن خروجی و حذف هزینه‌های مربوط به توکن‌های خروجی میشه.

سه قالب پاسخ در قالب یک درخواست

هر فراخوانی API یک وضعیت (state) به صورت متن ساده یا JSON، و یک یا چند پرسش (questions) دریافت می‌کنه. هر پرسش از یکی از این سه نوع پاسخ پشتیبانی می‌کنه:

نوع پاسخ
خروجی
کاربرد معمول
Noul
یک احتمال از ۰ تا ۱ برای سوالات بله یا خیر
گیت‌های تایید، فلگ‌ها و متغیرهای بولی شرطی
Choice
توزیع احتمال روی گزینه‌های مشخص، همراه با میزان اطمینان
دسته‌بندی، مسیریابی و انتخاب اکشن‌ها
Score
موقعیت وزن‌دهی‌شده بر اساس احتمال روی یک سنجه و مقیاس مرتب‌شده
امتیازدهی به ارتباط، شدت موضوع، کیفیت و ریسک

خروجی نوع Score می‌تونه بین سطوح مقیاس تعریف‌شده قرار بگیره. برای مثال، یک مقیاس ۴ سطحی ممکنه به جای گرد کردن به عدد صحیح، مقدار 2.9995 رو برگردونه. برنامه‌ها می‌تونن این مقدار دقیق رو نگه دارن، به یک دسته‌بندی مپ کنن یا با یک آستانه مشخص مقایسه‌اش کنن.

جالب اینجاست که در یک درخواست واحد می‌شه هر سه نوع پاسخ رو برای یک وضعیت مشترک ترکیب کرد. مثلاً یک سیستم پشتیبانی مشتریان می‌تونه به جای ارسال سه درخواست جداگانه به مدل، در یک رفت‌وبرگشت برچسب قصد کاربر، نمره فوریت و احتمال گزارش باگ بودن پیام رو هم‌زمان دریافت کنه.

نحوه فراخوانی در پایتون

اندپوینت این API آدرس https://api.liquid.ai/decisions/v1/systemone هست. مثال زیر با استفاده از SDK تایپ‌سیف، از d1 می‌پرسه که آیا پیام مشتری یک شکایت محسوب میشه یا نه:

import os

from typesafe_sdk import Noul, TypeSafeClient

client = TypeSafeClient(
    api_key=os.environ["LIQUID_API_KEY"],
    base_url="https://api.liquid.ai",
)

result = client.system_one(
    model="d1:free",
    state="I've been waiting three weeks and nobody replies.",
    questions={
        "is_complaint": Noul(
            instructions="Is this a complaint?"
        )
    },
)

print(result.answers["is_complaint"].noul)  # 0.999

در پاسخ دریافتی، میزان توکن‌های ورودی محاسبه میشه اما مقدار usage.output_tokens دقیقاً عدد 0 گزارش میشه. یعنی سرویس داده‌های کاملاً ساختاریافته تحویل میده، اما این کار رو نه با روش تولید توکن خودبازگشتی (Autoregressive)، بلکه به شیوه‌ای کاملاً متفاوت انجام میده.

تخصصی‌سازی و حذف سربار رمزگشایی متنی

مدل‌های زبانی مرسوم حتی وقتی برنامه شما فقط یک مقدار بولی یا یک برچسب ساده می‌خواد، متن رو توکن به توکن تولید می‌کنن. مدل d1 این مرحله رمزگشایی متنی رو کاملاً دور می‌زنه؛ موضوعی که باعث پایداری و پیش‌بینی‌پذیر شدن تاخیر سرویس میشه و کابوس‌هایی مثل JSON ناقص، فیلدهای فراموش‌شده یا مقادیر نامعتبر enum رو برای همیشه حذف می‌کنه.

این API همچنین به جای اینکه از یک چت‌بات بخواد میزان اطمینانش رو توصیف کنه، احتمالات دقیق عددی ارائه میده. لیکویید این احتمالات رو «کالیبره‌شده» توصیف می‌کنه، هرچند به تیم‌های فنی توصیه میشه پیش از اعمال این مقادیر روی تصمیمات حساس، حتماً کالیبراسیون رو روی داده‌های ترافیک واقعی خودشون بسنجن.

لیکویید چهار ارتقای کلیدی در d1 نسبت به مدل‌های قبلی این خانواده گزارش کرده است:

  • کسب امتیازات بالاتر در ارزیابی‌های چندزبانه
  • مقاومت به مراتب بیشتر در برابر حملات تزریق پرامپت (Prompt Injection) در بخش وضعیت
  • عملکرد بهتر در مدیریت ورودی‌های طولانی‌تر
  • تصمیم‌گیری سریع‌تر با خروجی‌های ساختاریافته در جریان‌های کاری نرم‌افزاری

البته مقاومت در برابر پرامپت اینجکشن به این معنی نیست که ورودی‌های غیرقابل‌اعتماد ذاتاً ایمن هستن. نرم‌افزارها همچنان باید اعتبارسنجی ورودی‌ها رو انجام بدن، دسترسی عملیات بعدی رو محدود کنن، احراز هویت رو بیرون از مدل مدیریت کرده و سناریوهای حمله مرتبط با محیط خودشون رو تست کنن.

صدرنشینی در بنچمارک و ضرورت آزمایش داخلی

شاخص تصمیم‌گیری Jev شامل ۳۷ بنچمارک گوناگونه که ۱۹ مورد از اون‌ها مستقیماً روی امتیاز نهایی تاثیر دارن. این آزمون‌های نمره‌دار در پنج بخش دسته‌بندی شدن: ابزارها و اتوماسیون، بازیابی و دسته‌بندی، درک زبان، دانش و استدلال، و هنر و قضاوت انسانی. امتیاز نهایی میانگین این پنج بخش ضرب در ۱۰۰ بوده و عددی بین ۰ تا ۱۰۰ تولید می‌کنه.

طبق لیدربورد منتشرشده، پیش از این مدل Jev 1.13 با امتیاز کلی نزدیک به ۷۴.۴ صدرنشین بود که حالا d1 جایگاه اول رو از آن خودش کرده. اگرچه مجموعه داده‌های ثابت مقایسه مدل‌ها رو یکپارچه می‌کنه، اما هیچ بنچمارکی نمی‌تونه دقت عملیاتی، کالیبراسیون، تاخیر و هزینه‌های واقعی رو برای برچسب‌ها و ترافیک اختصاصی هر محصول پیش‌بینی کنه.

چه کارهایی بهترین گزینه برای این API هستند؟

مدل d1 دقیقاً برای جریان‌های کاری طراحی شده که خروجی نهایی ساختاری ثابت و مشخص داره:

  • مسیریابی تیکت‌ها، پیام‌ها و ایمیل‌ها
  • مدیریت محتوا و برچسب‌های ایمنی و اخلاقی
  • گیت‌های تایید برای صدا زدن ابزار توسط ایجنت‌ها
  • ارزیابی‌های مشخص بر اساس سنجه‌های دقیق
  • مسیریابی بین مدل‌ها و زنجیره‌های استنتاج
  • امتیازدهی به تقلب، ریسک، فوریت و اولویت
  • رتبه‌بندی مجدد (Reranking) در سیستم‌های RAG با احتمالات ارتباط

در مقابل، کارهای تولیدی (مولد) کاملاً خارج از حوزه وظایف این مدل قرار دارن. لیکویید توصیه می‌کنه برای نوشتن آزادانه متن، خلاصه‌سازی، تولید کد، گفتگوهای چندمرحله‌ای، پاسخ به پرسش‌های باز و استدلال‌های پیچیده چندمرحله‌ای همچنان از مدل‌های زبانی معمولی استفاده بشه. هر فرآیندی که باید جمله جدیدی تولید کنه، همچنان به یک مدل هوش مصنوعی مولد یا قالب‌های متنی مجزا نیاز داره.

تعیین آستانه‌های عملیاتی نیازمند داده‌های واقعی است

تیم‌هایی که قصد بررسی d1 رو دارن باید کل پایپ‌لاین تصمیم‌گیری رو تست کنن و فقط به نمرات بنچمارک بسنده نکنن:

  • تعریف دقیق برچسب‌ها: دستورالعمل‌ها و سنجه‌هایی بنویسید که کلاس‌های نزدیک به هم رو با معیارهای عینی و شفاف از هم جدا کنه.
  • سنجش روی داده‌های نمونه واقعی: حتماً نمونه‌های نادر، ورودی‌های چندزبانه، وضعیت‌های طولانی و نمونه‌های مخرب رو در ارزیابی لحاظ کنید.
  • بررسی کالیبراسیون: احتمالات پیش‌بینی‌شده رو با نتایج واقعی در بخش‌های کلیدی مقایسه کنید.
  • تنظیم آستانه‌ها بر اساس هزینه خطا: نقاط مرزی تصمیم‌گیری رو با توجه به هزینه‌ها و عواقب مثبت کاذب، منفی کاذب و تصمیم‌گیری نکردن مشخص کنید.
  • در نظر گرفتن مسیر پشتیبان (Fallback): موارد نامطمئن یا پرریسک رو به سمت قوانین سنتی، مدلی بزرگ‌تر یا نیروی انسانی هدایت کنید.
  • پایش انحراف مدل (Drift): بعد از پیاده‌سازی، فراوانی کلاس‌ها، توزیع احتمالات، نرخ خطا، تاخیر و مصرف توکن‌های ورودی رو مداوم رصد کنید.

نمایش شیوه پاسخگویی در یک بازی رانندگی

نمونه دموی Road Decider از لیکویید، از d1 به عنوان کنترلر یک بازی رانندگی پیکسلی استفاده کرده. در هر فریم بازی، این مدل یکی از سه حالت LEFT (چپ)، CENTER (وسط) یا RIGHT (راست) رو همراه با نمره اطمینان انتخاب می‌کنه.

Split-screen Road Decider game with directional choices and confidence scores
دموی بازی که پاسخ نوع Choice را مستقیماً به یکی از سه فرمان رانندگی تبدیل می‌کند.

این مثال به خوبی الگوی کنترلی مدنظر این API رو به تصویر می‌کشه: ارسال وضعیت فعلی، درخواست مجموعه‌ای مشخص از اکشن‌ها و دریافت توزیع احتمالات. الگوهای مشابهی در انتخاب اکشن توسط ایجنت‌ها، گیت‌های رباتیک، خطوط مدیریت محتوا و مسیریابی بین مدل‌ها دیده میشه؛ هرچند سیستم‌های بلادرنگ علاوه بر مدل به محدودیت‌های ایمنی قطعی بیرونی هم نیاز دارن.

دسترسی، قیمت‌گذاری و عرضه

مدل d1 هم‌اکنون از طریق کنسول API لیکویید با شناسه d1:free در دسترسه. توسعه‌دهندگان به یک کلید API اختصاصی نیاز دارن و تیم‌هایی که قصد استفاده در محیط پروداکشن رو دارن، باید پیش از پیاده‌سازی مواردی مثل محدودیت نرخ درخواست (Rate Limits)، شرایط مدیریت داده‌ها، دسترسی منطقه‌ای و تعرفه‌های پرداختی رو در کنسول بررسی کنن.

لیکویید اعلام کرده که پشتیبانی از OpenRouter هم در برنامه‌هاشون هست اما هنوز تاریخ دقیقی براش اعلام نکرده. از اونجایی که d1 هیچ توکن خروجی تولید نمی‌کنه، هزینه مصرفی اساساً بر اساس وضعیت ورودی و تعریف پرسش‌ها محاسبه میشه؛ البته هزینه نهایی و تاخیر همچنان به حجم درخواست‌ها، محدودیت‌های سرویس و ترافیک کاری وابسته است.

در مجموع، d1 رابطی اختصاصی و متمرکز برای تصمیم‌گیری‌هایی ارائه میده که خیلی از برنامه‌ها در حال حاضر با تولید پردردسر JSON از چت‌بات‌ها به دست میارن. جایگاه اول این مدل در بنچمارک‌ها نشان‌دهنده پتانسیل بالای اونه، اما آزمایش در دنیای واقعی مشخص می‌کنه که آیا دقت، کالیبراسیون، تاخیر و هزینه‌های d1 روی داده‌های واقعی سیستم شما هم به همین اندازه شگفت‌انگیز هست یا نه.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

حواشی نام‌گذاری ایجنت جدید اوپن‌ای‌آی؛ دردسرهای بی‌پایان «Dots» و موج‌سواری ایلان ماسک!
آخرین اخبار

حواشی نام‌گذاری ایجنت جدید اوپن‌ای‌آی؛ دردسرهای بی‌پایان «Dots» و موج‌سواری ایلان ماسک!

اوپن‌ای‌آی از سیستم ایجنت جدید خود به نام «Dots» رونمایی کرده، اما این نام‌گذاری حسابی در فضای مجازی جنجال به پا کرده است. از تشابه اسمی با چند شرکت چینی و هجوم کاربران به پیج اینستاگرام یک برند لباس زنانه گرفته تا ترول زیرکانه شرکت هوش مصنوعی ایلان ماسک با دامنه Dot.com، همه‌چیز دست به دست هم داده تا این رونمایی حسابی سوژه شبکه‌های اجتماعی شود.

۳ دقیقه مطالعه
۰
۸ مهر
کت‌وشلوار سازمانی بر تن OpenClaw؛ ائتلاف اوپنای‌آی و رد هت برای نجات ایجنت‌ها از تحریم اداری!
آخرین اخبار

کت‌وشلوار سازمانی بر تن OpenClaw؛ ائتلاف اوپنای‌آی و رد هت برای نجات ایجنت‌ها از تحریم اداری!

پروژه پرطرفدار OpenClaw با همراهی رد هت، ان‌ویدیا و اوپنای‌آی، در حال ساخت نسخه‌ای سازمانی موسوم به OCE است تا نگرانی‌های امنیتی شدید شرکت‌ها را رفع کند. این پروژه که لقب «کوبرنتیز برای ایجنت‌ها» را به همراه دارد، به دنبال استانداردسازی و کنترل همه‌جانبه روی دستیاران هوشمند سازمانی است.

۳ دقیقه مطالعه
۰
۸ مهر
از بیل مکانیکی تا پلتفرم هوشمند؛ باب‌کت چطور با هوش مصنوعی ماشین‌های سنگین را متحول می‌کند؟
آخرین اخبار

از بیل مکانیکی تا پلتفرم هوشمند؛ باب‌کت چطور با هوش مصنوعی ماشین‌های سنگین را متحول می‌کند؟

روی گرکو، مدیر ارشد دیجیتال شرکت باب‌کت، از استراتژی این برند پرآوازه ماشین‌آلات سنگین برای پیوند زدن لودرها و بیل‌های مکانیکی با هوش مصنوعی و نرم‌افزار پرده برداشته است؛ تحولی که ابزارهای سخت کارگاهی را به پلتفرم‌های متصل و دستیارهای هوشمند ارتقا می‌دهد.

۵ دقیقه مطالعه
۰
۸ مهر