رونمایی Exa از ایجنت Agent Ultra؛ عملکرد برتر در پژوهشهای وب با ۵۴ درصد هزینه کمتر از OpenAI
شرکت Exa از حالت پردازشی Agent Ultra در API ایجنتهای خود رونمایی کرد که با تلفیق مدلهای زبانی پیشرو و پایگاه دادهای شامل ۱۰۰ میلیارد سند وب، پژوهشهای عمیق چندمرحلهای را با دقت بالاتر و هزینهای بهمراتب کمتر از رقبایی همچون OpenAI و Anthropic انجام میدهد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- رونمایی Exa از حالت پردازشی پیشرفته Agent Ultra در API خود با تمرکز بر پژوهشهای عمیق و نیازمند بررسی منابع متعدد وب
- کسب رتبه نخست در بنچمارکهای معتبر از جمله WANDR با امتیاز ۸۱٫۴ درصد و DeepSearchQA با امتیاز ۹۳٫۹ درصد
- کاهش هزینهها تا ۵۴ درصد نسبت به رقبایی نظیر GPT-6 Astra و تا ۴۰ درصد نسبت به Opus 5.5 به لطف سیستم فشردهسازی و هایلایت متون
- امکان مدیریت ناهمگام وظایف سنگین پردازشی با تعیین دقیق سقف بودجه مالی و محدودیت زمانی از ۵ دقیقه تا ۳ ساعت
تمرکز Exa Agent Ultra بر پژوهشهای عمیق و طولانیمدت در وب
شرکت Exa از Agent Ultra، بالاترین سطح پردازشی در API ایجنتهای خود، پرده برداشت. این سیستم بهطور خاص برای وظایف پژوهشی سنگینی طراحی شده است که نیازمند پوشش گسترده وب، جمعآوری شواهد و اسناد از منابع متعدد و ارائه نتایج ساختاریافته هستند؛ وظایفی نظیر کشف و شناسایی شرکتها، بررسیهای موشکافانه حقوقی و مالی (Due Diligence) و غنیسازی دادههای آماری درباره نهادهای مختلف.
برای توسعهدهندگان، حالت Ultra یک سامانه پژوهش موازی را در قالب یک تنظیم ساده در API تجمیع کرده است. طبق اعلام Exa، این سیستم مدلهای زبانی پیشرو را با نمایهای متشکل از بیش از ۱۰۰ میلیارد سند وب ترکیب میکند و در مقایسه با ابزارهای پژوهش عمیق شرکتهای OpenAI، Anthropic و Perplexity، امتیازهای بالاتری در بنچمارکها به دست آورده و هزینه اعلامشده به ازای هر وظیفه را به میزان چشمگیری کاهش داده است.
موتور جستوجوی موازی؛ راهکار ارتقای عمق پژوهش
حالت Ultra از یک فریمورک پژوهشی اختصاصی بهره میبرد که هر پرسش کاربر را به زیروظایف کوچکتر خرد کرده، آنها را به چندین مدل همکار واگذار میکند، چندین دامنه اینترنتی را بهطور همزمان و موازی جستوجو مینماید و در نهایت یافتهها را ادغام میکند. این سامانه بر سه رکن اصلی استوار است:
- سازماندهی سابایجنتها جهت جستوجوی همزمان در منابع گوناگون و حوزههای موضوعی مختلف
- اجرای کد بهمنظور پالایش دادهها، حذف موارد تکراری، اعتبارسنجی اطلاعات و ساخت خروجیهای ساختاریافته
- سیستم هایلایت محتوا (Highlights) برای استخراج بخشهای کلیدی و مرتبط از صفحات وب، پیش از ارسال اطلاعات به مدل زبانی
به گفته Exa، بخش عمدهای از کارایی خیرهکننده Ultra ناشی از سیستم هایلایت محتوا است؛ چرا که دریافت کامل صفحات وب حجم عظیمی از پنجره زمینه (Context Window) مدل را پر کرده و منجر به افزایش چشمگیر هزینههای استنتاج و تاخیر زمانی میشود. ارزیابیهای اولیه نشان میدهد که مدل هایلایت این شرکت توانسته است مصرف توکن صفحات بازیابیشده را در آزمایشها تا ۹۴ درصد کاهش دهد؛ البته این صرفهجویی ۹۴ درصدی به مدل هایلایت مربوط است و میزان صرفهجویی نهایی در کل فرایند بسته به ماهیت درخواست متغیر خواهد بود.
قابلیت دیگری موسوم به «هایلایت پویا» (Dynamic Highlights) این رویکرد را فراتر برده و گزیدههای مهم را از میان تمام نتایج بالقوه استخراج میکند. این سازوکار هنگام مقایسه و اعتبارسنجی منابع متعددی که یک ادعای خاص را تایید یا رد میکنند، مجموعهای فشردهتر و درعینحال دقیقتر از شواهد را در اختیار ایجنت قرار میدهد.
امتیازهای درخشان در بنچمارکها و محدودیتهای ارزیابی
بر اساس گزارش Exa، حالت Ultra در چهار ارزیابی شامل WANDR، WideSearch، DeepSearchQA و یک بنچمارک داخلی شناسایی جامع شرکتها پیشتاز بوده است. اطلاعات منتشرشده ارقام مقایسهای سه بنچمارک اول را نشان میدهد:
بنچمارک | Ultra | GPT-6 Astra | Opus 5.5 | Perplexity Agent |
|---|---|---|---|---|
WANDR | ۸۱٫۴٪ | ۲۶٫۳٪ | ۷۲٫۳٪ | اعلامنشده |
WideSearch | ۵۸٫۹٪ | ۵۴٫۷٪ | ۵۱٫۶٪ | ۵۶٫۰٪ |
DeepSearchQA | ۹۳٫۹٪ | ۸۵٫۳٪ | ۷۷٫۶٪ | اعلامنشده |
در بنچمارک WANDR، شرکت Exa اعلام کرده است که هزینه انجام هر تسک با Ultra حدود ۴۴ درصد کمتر از Opus 5.5 و ۲۰ درصد ارزانتر از GPT-6 Astra تمام میشود. همچنین هزینه یک تسک در WideSearch با این ابزار ۳٫۸۵ دلار گزارش شده است که ۲۵ درصد ارزانتر از Perplexity Agent، حدود ۴۰ درصد کمتر از Opus 5.5 و ۵۴ درصد پایینتر از GPT-6 Astra برآورد میشود. در بنچمارک DeepSearchQA نیز حالت Ultra توانسته است با اختلاف ۸٫۶ واحد درصدی بالاتر از GPT-6 Astra و ۱۶٫۳ واحد درصدی بالاتر از Opus 5.5 قرار گیرد.
بنچمارک WANDR که برگرفته از عبارت Wide And Deep Research است، توانایی یک ایجنت را در یافتن جامعه آماری بزرگی از نهادهای واجد شرایط و گردآوری اسناد از حوزههای چندگانه ارزیابی میکند. وظایف این بنچمارک شباهت زیادی به پژوهشهای شرکتی، راستیآزمایی موشکافانه تجاری و پروندههای حقوقی دارد؛ جایی که از قلم افتادن هر یک از دادهها یا نهادها به افت ارزش کل نتیجه منجر خواهد شد.
بااینحال، باید در نظر داشت که نتایج بنچمارکهای چندشرکتی بهشدت به ساختار چارچوب ارزیابی، ابزارهای در دسترس، محدودیتهای پردازشی و مدل داور وابسته هستند. شرکت Exa تصریح کرده که ابزار امتیازدهی WANDR از منطق مخزن اصلی بهره برده، اما تفاوتهایی در ابزار استخراج محتوا، لایه انتقال و مدل امتیازدهنده وجود دارد. همچنین Parallel جدول ردهبندی متفاوتی برای DeepSearchQA ارائه میدهد که نشاندهنده تاثیر عمیق تفاوت در پیادهسازیها بر رتبهبندیها است. این اعداد صرفاً عملکرد در وظایف تعریفشده بنچمارک را میسنجند و متضمن پوشش بینقص در گستره وب واقعی نیستند.
پیادهسازی Ultra در قالب صف کاری و پردازش ناهمگام
سرویس Agent Ultra هماکنون از طریق مستندات رسمی API این پلتفرم در دسترس قرار گرفته است. توسعهدهندگانی که پیشتر از API ایجنتهای Exa استفاده میکردند، میتوانند با تعیین پارامتر effort روی مقدار "ultra" و اعمال سقف بودجه مالی و زمانی اختیاری، از آن بهرهمند شوند:
import Exa from "exa-js";
const exa = new Exa();
const run = await exa.agent.runs.create({
query: "Find all companies building browser automation tools in the United States.",
effort: "ultra",
budget: {
maxCostDollars: 10,
maxDurationSeconds: 1800
}
});
const finished = await exa.agent.runs.pollUntilFinished(run.id, {
timeoutMs: 3 * 60 * 60 * 1000
});در این سازوکار، کاربر یک درخواست اجرای ناهمگام (Asynchronous Run) ایجاد میکند و سپس وضعیت پایان پردازش را بررسی مینماید. در نمونه کد ارائهشده، بودجه زمانی جستوجو در سمت سرور ۳۰ دقیقه تعیین شده است، درحالیکه کلاینت میتواند بررسی وضعیت را تا سقف ۳ ساعت ادامه دهد.
- حالت Ultra بر اساس مدل قیمتگذاری کنتوری استاندارد ایجنت محاسبه میشود و سقف مصرف پیشفرض ۲۰ دلار به ازای هر اجرا دارد.
- پارامتر
budget.maxCostDollarsامکان تغییر سقف هزینه مصرفی را فراهم میسازد. - پارامتر
budget.maxDurationSecondsبازه زمانی میان ۵ دقیقه تا ۳ ساعت را میپذیرد. - با اتمام مهلت زمانی، نتایج گردآوریشده تا همان لحظه بازگردانده میشوند.
- به گفته Exa، وظایف معمول Ultra عموماً ظرف حدود ۳۰ دقیقه تکمیل میشوند، اما فرآیندهای دشوار ممکن است تا ۳ ساعت به طول بینجامند.
- ارسال یک درخواست HTTP
POSTبه مسیر/agent/runs/{id}/stopفرایند اجرا را متوقف کرده و اطلاعات جمعآوریشده را حفظ میکند. - تعیین محدودیتهای زمانی و توقف پیش از موعد نیازمند تنظیم
effort: "ultra"است؛ هرچند محدودیتهای مالی در حالتeffort: "auto"نیز اعمالپذیر خواهند بود.
کاربرد ایدهآل: پژوهشهای گروهی و عمیق
حالت Ultra مناسب فعالیتهایی است که در آنها ضرورت پوشش همهجانبه وب، زمان پردازش طولانیتر و هزینههای بالاتر را توجیه میکند. از جمله کاربردهای متداول آن میتوان به موارد زیر اشاره کرد:
- گردآوری فهرستی از شرکتها یا اشخاصی که معیارهای ارزیابی پیچیده و دشواری دارند
- اجرای پژوهشهای جامع رقابتی در بازار، تامین منابع و بازاریابی هدفمند
- پشتیبانی از تحلیلهای حقوقی، سرمایهگذاری و موشکافی موشکافانه تجاری که حذف هر نهاد باعث ایجاد شکاف جدی در دادهها میشود
- غنیسازی فهرستهای اولیه با فیلدهای ساختاریافته جمعآوریشده از منابع پراکنده وب
- پاسخ به سوالات چندمرحلهای (Multi-hop) که نیازمند پیوند دادن شواهد از چندین دامنه مختلف هستند
در نقطه مقابل، حلقههای تعاملی ایجنتها با حساسیت به تاخیر، سناریوهای سبک RAG و چتباتهای زنده تطابق بهتری با حالتهای خودکار یا کمهزینه دارند. فرآیندی پژوهشی که ۳۰ دقیقه طول میکشد و بودجه مشخصی مصرف میکند، ذاتاً باید در بستر یک گردش کار ناهمگام با رهگیری وضعیت، قابلیت لغو و ذخیرهسازی نتایج مدیریت شود.
راهبرد Exa؛ کاهش بار زمینه برای بهرهوری حداکثری
محصولات پژوهش عمیق که توسط Exa، Parallel، Perplexity، OpenAI، Anthropic و Google توسعه یافتهاند، ساختار بنیادین مشترکی دارند: مدلی مجهز به ابزارهای جستوجو، همراه با بودجه مشخص و زمانی کافی برای کاوش و تحقیق. بااینحال، تمایز عملکرد آنها به نحوه انتخاب پرسمانها، تقسیم وظایف، استخراج منابع، مدیریت کانتکست، راستیآزمایی شواهد و تصمیمگیری درباره زمان توقف بازمیگردد.
راهبرد Exa بر استفاده از نمایه جستوجوی تخصصی و استخراج فشرده بخشهای منتخب صفحات متمرکز شده تا حجم داده ارسالی به مدلهای زبانی را به حداقل برساند. دادههای منتشرشده نشان میدهد که این رویکرد در جستوجوی گسترده نهادها و تحقیقات چندمرحلهای کارایی بالایی دارد، هرچند باید محدودیتهای بنچمارکهای شرکتی را نیز مد نظر داشت.
تیمهایی که قصد ارزیابی و استقرار Ultra را دارند، بهتر است آن را با پرسشهای واقعی حوزه کاری خود محک بزنند و معیارهایی نظیر بازخوانی نهادها (Recall)، دقت دادهها، کیفیت ارجاعات، زمان صرفشده و هزینه نهایی را بسنجند؛ چرا که ارزیابی متناسب با حجم کاری واقعی، معیار بسیار مطمئنتری نسبت به رتبهبندیهای بنچمارکهای آزمایشگاهی خواهد بود.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.