پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

رونمایی Exa از ایجنت Agent Ultra؛ عملکرد برتر در پژوهش‌های وب با ۵۴ درصد هزینه کمتر از OpenAI

انتشار:۳ مهر ۱۴۰۵(۲ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

شرکت Exa از حالت پردازشی Agent Ultra در API ایجنت‌های خود رونمایی کرد که با تلفیق مدل‌های زبانی پیشرو و پایگاه داده‌ای شامل ۱۰۰ میلیارد سند وب، پژوهش‌های عمیق چندمرحله‌ای را با دقت بالاتر و هزینه‌ای به‌مراتب کمتر از رقبایی همچون OpenAI و Anthropic انجام می‌دهد.

رونمایی Exa از ایجنت Agent Ultra؛ عملکرد برتر در پژوهش‌های وب با ۵۴ درصد هزینه کمتر از OpenAI

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • رونمایی Exa از حالت پردازشی پیشرفته Agent Ultra در API خود با تمرکز بر پژوهش‌های عمیق و نیازمند بررسی منابع متعدد وب
  • کسب رتبه نخست در بنچمارک‌های معتبر از جمله WANDR با امتیاز ۸۱٫۴ درصد و DeepSearchQA با امتیاز ۹۳٫۹ درصد
  • کاهش هزینه‌ها تا ۵۴ درصد نسبت به رقبایی نظیر GPT-6 Astra و تا ۴۰ درصد نسبت به Opus 5.5 به لطف سیستم فشرده‌سازی و هایلایت متون
  • امکان مدیریت ناهمگام وظایف سنگین پردازشی با تعیین دقیق سقف بودجه مالی و محدودیت زمانی از ۵ دقیقه تا ۳ ساعت

تمرکز Exa Agent Ultra بر پژوهش‌های عمیق و طولانی‌مدت در وب

شرکت Exa از Agent Ultra، بالاترین سطح پردازشی در API ایجنت‌های خود، پرده برداشت. این سیستم به‌طور خاص برای وظایف پژوهشی سنگینی طراحی شده است که نیازمند پوشش گسترده وب، جمع‌آوری شواهد و اسناد از منابع متعدد و ارائه نتایج ساختاریافته هستند؛ وظایفی نظیر کشف و شناسایی شرکت‌ها، بررسی‌های موشکافانه حقوقی و مالی (Due Diligence) و غنی‌سازی داده‌های آماری درباره نهادهای مختلف.

برای توسعه‌دهندگان، حالت Ultra یک سامانه پژوهش موازی را در قالب یک تنظیم ساده در API تجمیع کرده است. طبق اعلام Exa، این سیستم مدل‌های زبانی پیشرو را با نمایه‌ای متشکل از بیش از ۱۰۰ میلیارد سند وب ترکیب می‌کند و در مقایسه با ابزارهای پژوهش عمیق شرکت‌های OpenAI، Anthropic و Perplexity، امتیازهای بالاتری در بنچمارک‌ها به دست آورده و هزینه اعلام‌شده به ازای هر وظیفه را به میزان چشمگیری کاهش داده است.

موتور جست‌وجوی موازی؛ راهکار ارتقای عمق پژوهش

حالت Ultra از یک فریم‌ورک پژوهشی اختصاصی بهره می‌برد که هر پرسش کاربر را به زیروظایف کوچک‌تر خرد کرده، آن‌ها را به چندین مدل همکار واگذار می‌کند، چندین دامنه اینترنتی را به‌طور هم‌زمان و موازی جست‌وجو می‌نماید و در نهایت یافته‌ها را ادغام می‌کند. این سامانه بر سه رکن اصلی استوار است:

  • سازمان‌دهی ساب‌ایجنت‌ها جهت جست‌وجوی هم‌زمان در منابع گوناگون و حوزه‌های موضوعی مختلف
  • اجرای کد به‌منظور پالایش داده‌ها، حذف موارد تکراری، اعتبارسنجی اطلاعات و ساخت خروجی‌های ساختاریافته
  • سیستم هایلایت محتوا (Highlights) برای استخراج بخش‌های کلیدی و مرتبط از صفحات وب، پیش از ارسال اطلاعات به مدل زبانی

به گفته Exa، بخش عمده‌ای از کارایی خیره‌کننده Ultra ناشی از سیستم هایلایت محتوا است؛ چرا که دریافت کامل صفحات وب حجم عظیمی از پنجره زمینه (Context Window) مدل را پر کرده و منجر به افزایش چشمگیر هزینه‌های استنتاج و تاخیر زمانی می‌شود. ارزیابی‌های اولیه نشان می‌دهد که مدل هایلایت این شرکت توانسته است مصرف توکن صفحات بازیابی‌شده را در آزمایش‌ها تا ۹۴ درصد کاهش دهد؛ البته این صرفه‌جویی ۹۴ درصدی به مدل هایلایت مربوط است و میزان صرفه‌جویی نهایی در کل فرایند بسته به ماهیت درخواست متغیر خواهد بود.

قابلیت دیگری موسوم به «هایلایت پویا» (Dynamic Highlights) این رویکرد را فراتر برده و گزیده‌های مهم را از میان تمام نتایج بالقوه استخراج می‌کند. این سازوکار هنگام مقایسه و اعتبارسنجی منابع متعددی که یک ادعای خاص را تایید یا رد می‌کنند، مجموعه‌ای فشرده‌تر و درعین‌حال دقیق‌تر از شواهد را در اختیار ایجنت قرار می‌دهد.

امتیازهای درخشان در بنچمارک‌ها و محدودیت‌های ارزیابی

بر اساس گزارش Exa، حالت Ultra در چهار ارزیابی شامل WANDR، WideSearch، DeepSearchQA و یک بنچمارک داخلی شناسایی جامع شرکت‌ها پیشتاز بوده است. اطلاعات منتشرشده ارقام مقایسه‌ای سه بنچمارک اول را نشان می‌دهد:

بنچمارک
Ultra
GPT-6 Astra
Opus 5.5
Perplexity Agent
WANDR
۸۱٫۴٪
۲۶٫۳٪
۷۲٫۳٪
اعلام‌نشده
WideSearch
۵۸٫۹٪
۵۴٫۷٪
۵۱٫۶٪
۵۶٫۰٪
DeepSearchQA
۹۳٫۹٪
۸۵٫۳٪
۷۷٫۶٪
اعلام‌نشده

در بنچمارک WANDR، شرکت Exa اعلام کرده است که هزینه انجام هر تسک با Ultra حدود ۴۴ درصد کمتر از Opus 5.5 و ۲۰ درصد ارزان‌تر از GPT-6 Astra تمام می‌شود. همچنین هزینه یک تسک در WideSearch با این ابزار ۳٫۸۵ دلار گزارش شده است که ۲۵ درصد ارزان‌تر از Perplexity Agent، حدود ۴۰ درصد کمتر از Opus 5.5 و ۵۴ درصد پایین‌تر از GPT-6 Astra برآورد می‌شود. در بنچمارک DeepSearchQA نیز حالت Ultra توانسته است با اختلاف ۸٫۶ واحد درصدی بالاتر از GPT-6 Astra و ۱۶٫۳ واحد درصدی بالاتر از Opus 5.5 قرار گیرد.

بنچمارک WANDR که برگرفته از عبارت Wide And Deep Research است، توانایی یک ایجنت را در یافتن جامعه آماری بزرگی از نهادهای واجد شرایط و گردآوری اسناد از حوزه‌های چندگانه ارزیابی می‌کند. وظایف این بنچمارک شباهت زیادی به پژوهش‌های شرکتی، راستی‌آزمایی موشکافانه تجاری و پرونده‌های حقوقی دارد؛ جایی که از قلم افتادن هر یک از داده‌ها یا نهادها به افت ارزش کل نتیجه منجر خواهد شد.

بااین‌حال، باید در نظر داشت که نتایج بنچمارک‌های چندشرکتی به‌شدت به ساختار چارچوب ارزیابی، ابزارهای در دسترس، محدودیت‌های پردازشی و مدل داور وابسته هستند. شرکت Exa تصریح کرده که ابزار امتیازدهی WANDR از منطق مخزن اصلی بهره برده، اما تفاوت‌هایی در ابزار استخراج محتوا، لایه انتقال و مدل امتیازدهنده وجود دارد. همچنین Parallel جدول رده‌بندی متفاوتی برای DeepSearchQA ارائه می‌دهد که نشان‌دهنده تاثیر عمیق تفاوت در پیاده‌سازی‌ها بر رتبه‌بندی‌ها است. این اعداد صرفاً عملکرد در وظایف تعریف‌شده بنچمارک را می‌سنجند و متضمن پوشش بی‌نقص در گستره وب واقعی نیستند.

پیاده‌سازی Ultra در قالب صف کاری و پردازش ناهمگام

سرویس Agent Ultra هم‌اکنون از طریق مستندات رسمی API این پلتفرم در دسترس قرار گرفته است. توسعه‌دهندگانی که پیش‌تر از API ایجنت‌های Exa استفاده می‌کردند، می‌توانند با تعیین پارامتر effort روی مقدار "ultra" و اعمال سقف بودجه مالی و زمانی اختیاری، از آن بهره‌مند شوند:

import Exa from "exa-js";

const exa = new Exa();

const run = await exa.agent.runs.create({
  query: "Find all companies building browser automation tools in the United States.",
  effort: "ultra",
  budget: {
    maxCostDollars: 10,
    maxDurationSeconds: 1800
  }
});

const finished = await exa.agent.runs.pollUntilFinished(run.id, {
  timeoutMs: 3 * 60 * 60 * 1000
});

در این سازوکار، کاربر یک درخواست اجرای ناهمگام (Asynchronous Run) ایجاد می‌کند و سپس وضعیت پایان پردازش را بررسی می‌نماید. در نمونه کد ارائه‌شده، بودجه زمانی جست‌وجو در سمت سرور ۳۰ دقیقه تعیین شده است، درحالی‌که کلاینت می‌تواند بررسی وضعیت را تا سقف ۳ ساعت ادامه دهد.

  • حالت Ultra بر اساس مدل قیمت‌گذاری کنتوری استاندارد ایجنت محاسبه می‌شود و سقف مصرف پیش‌فرض ۲۰ دلار به ازای هر اجرا دارد.
  • پارامتر budget.maxCostDollars امکان تغییر سقف هزینه مصرفی را فراهم می‌سازد.
  • پارامتر budget.maxDurationSeconds بازه زمانی میان ۵ دقیقه تا ۳ ساعت را می‌پذیرد.
  • با اتمام مهلت زمانی، نتایج گردآوری‌شده تا همان لحظه بازگردانده می‌شوند.
  • به گفته Exa، وظایف معمول Ultra عموماً ظرف حدود ۳۰ دقیقه تکمیل می‌شوند، اما فرآیندهای دشوار ممکن است تا ۳ ساعت به طول بینجامند.
  • ارسال یک درخواست HTTP POST به مسیر /agent/runs/{id}/stop فرایند اجرا را متوقف کرده و اطلاعات جمع‌آوری‌شده را حفظ می‌کند.
  • تعیین محدودیت‌های زمانی و توقف پیش از موعد نیازمند تنظیم effort: "ultra" است؛ هرچند محدودیت‌های مالی در حالت effort: "auto" نیز اعمال‌پذیر خواهند بود.

کاربرد ایده‌آل: پژوهش‌های گروهی و عمیق

حالت Ultra مناسب فعالیت‌هایی است که در آن‌ها ضرورت پوشش همه‌جانبه وب، زمان پردازش طولانی‌تر و هزینه‌های بالاتر را توجیه می‌کند. از جمله کاربردهای متداول آن می‌توان به موارد زیر اشاره کرد:

  • گردآوری فهرستی از شرکت‌ها یا اشخاصی که معیارهای ارزیابی پیچیده و دشواری دارند
  • اجرای پژوهش‌های جامع رقابتی در بازار، تامین منابع و بازاریابی هدفمند
  • پشتیبانی از تحلیل‌های حقوقی، سرمایه‌گذاری و موشکافی موشکافانه تجاری که حذف هر نهاد باعث ایجاد شکاف جدی در داده‌ها می‌شود
  • غنی‌سازی فهرست‌های اولیه با فیلدهای ساختاریافته جمع‌آوری‌شده از منابع پراکنده وب
  • پاسخ به سوالات چندمرحله‌ای (Multi-hop) که نیازمند پیوند دادن شواهد از چندین دامنه مختلف هستند

در نقطه مقابل، حلقه‌های تعاملی ایجنت‌ها با حساسیت به تاخیر، سناریوهای سبک RAG و چت‌بات‌های زنده تطابق بهتری با حالت‌های خودکار یا کم‌هزینه دارند. فرآیندی پژوهشی که ۳۰ دقیقه طول می‌کشد و بودجه مشخصی مصرف می‌کند، ذاتاً باید در بستر یک گردش کار ناهمگام با رهگیری وضعیت، قابلیت لغو و ذخیره‌سازی نتایج مدیریت شود.

راهبرد Exa؛ کاهش بار زمینه برای بهره‌وری حداکثری

محصولات پژوهش عمیق که توسط Exa، Parallel، Perplexity، OpenAI، Anthropic و Google توسعه یافته‌اند، ساختار بنیادین مشترکی دارند: مدلی مجهز به ابزارهای جست‌وجو، همراه با بودجه مشخص و زمانی کافی برای کاوش و تحقیق. بااین‌حال، تمایز عملکرد آن‌ها به نحوه انتخاب پرسمان‌ها، تقسیم وظایف، استخراج منابع، مدیریت کانتکست، راستی‌آزمایی شواهد و تصمیم‌گیری درباره زمان توقف بازمی‌گردد.

راهبرد Exa بر استفاده از نمایه جست‌وجوی تخصصی و استخراج فشرده بخش‌های منتخب صفحات متمرکز شده تا حجم داده ارسالی به مدل‌های زبانی را به حداقل برساند. داده‌های منتشرشده نشان می‌دهد که این رویکرد در جست‌وجوی گسترده نهادها و تحقیقات چندمرحله‌ای کارایی بالایی دارد، هرچند باید محدودیت‌های بنچمارک‌های شرکتی را نیز مد نظر داشت.

تیم‌هایی که قصد ارزیابی و استقرار Ultra را دارند، بهتر است آن را با پرسش‌های واقعی حوزه کاری خود محک بزنند و معیارهایی نظیر بازخوانی نهادها (Recall)، دقت داده‌ها، کیفیت ارجاعات، زمان صرف‌شده و هزینه نهایی را بسنجند؛ چرا که ارزیابی متناسب با حجم کاری واقعی، معیار بسیار مطمئن‌تری نسبت به رتبه‌بندی‌های بنچمارک‌های آزمایشگاهی خواهد بود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر