پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ایجنت‌های هوش مصنوعی روی سیستم شما چقدر سریع اجرا میشن؟ بنچمارک جذاب RTX 5090، مک‌بوک و رقبا

انتشار:۸ مهر ۱۴۰۵(۲ ساعت پیش)
۷ دقیقه زمان مطالعه
۰ دیدگاه

با انتشار ابزار متن‌باز AgentPerf-Local، حالا می‌توانید سرعت اجرای ایجنت‌های هوش مصنوعی را روی لپ‌تاپ و سیستم شخصی خود به چالش بکشید. اولین بنچمارک‌ها روی غول‌هایی مثل RTX 5090، مک‌بوک پرو M5 Pro و تراشه‌های هوش مصنوعی نشان می‌دهد پهنای باند حافظه و بهینه‌سازی نرم‌افزاری چقدر در زنده نگه‌داشتن سرعت ایجنت‌ها حیاتی است.

ایجنت‌های هوش مصنوعی روی سیستم شما چقدر سریع اجرا میشن؟ بنچمارک جذاب RTX 5090، مک‌بوک و رقبا

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • ابزار متن‌باز AgentPerf-Local منتشر شد تا کاربران بتونن سرعت واقعی اجرای ایجنت‌های هوش مصنوعی رو مستقیماً روی لپ‌تاپ و ورک‌استیشن شخصی خودشون تست کنن.
  • کارت گرافیک غول‌پیکر RTX 5090 به لطف پهنای باند حافظه ۱۷۹۲ گیگابایتی، مدل‌هایی که تو حافظه‌ش جا شدن رو بیش از ۳.۵ برابر سریع‌تر از رقبا اجرا کرد.
  • مک‌بوک پرو M5 Pro ارزون‌ترین گزینه این تست بود و رقابت پایاپایی نشون داد، اما سیستم DGX Spark انویدیا به خاطر برتری در پردازش ورودی و بلوغ درایورهای CUDA، در اکثر مدل‌ها سریع‌تر از تراشه Ryzen AI عمل کرد.

معرفی AgentPerf-Local؛ ابزار متن‌باز تست عملکرد اینفرنس مدل‌های محلی هوش مصنوعی – بررسی کنید ایجنت‌های هوش مصنوعی با چه سرعتی روی لپ‌تاپ یا ورک‌استیشن شما اجرا می‌شوند و با ارزیابی کانفیگ‌های گوناگون، سیستم ایده‌آل خود را برای اجرای محلی ایجنت‌ها آماده کنید.

نکات کلیدی:

➤ ابزار متن‌باز AgentPerf-Local با بازپخش تعاملات واقعی ایجنت‌ها روی سخت‌افزارهای دسکتاپ و لپ‌تاپ، عملکرد واقعی اینفرنس را اندازه‌گیری می‌کند.

➤ نتایج اولیه برای سیستم‌های NVIDIA DGX Spark، کارت گرافیک NVIDIA GeForce RTX 5090، پلتفرم AMD Ryzen AI Halo و لپ‌تاپ مک‌بوک پرو M5 Pro منتشر شده است.

➤ این ابزار و جدول رده‌بندی آن به‌مرور برای پوشش سخت‌افزارها، فریم‌ورک‌ها و مدل‌های بیشتر توسعه خواهد یافت و با عرضه‌های جدید آپدیت می‌شود.

پس از بررسی عملکرد اینفرنس روی گوشی‌های هوشمند و سرورهای دیتاسنتری، اکنون پوشش تست‌ها به لپ‌تاپ‌ها و ورک‌استیشن‌ها گسترش یافته است. در کنار جدول رده‌بندی نتایج ترکیب سخت‌افزارها و مدل‌های پرطرفدار، تمامی کدها و داده‌های لازم برای اجرای AgentPerf-Local به‌صورت متن‌باز در دسترس قرار گرفته تا تیم‌ها و توسعه‌دهندگان بتوانند سیستم‌های خود را ارزیابی کرده و بهترین تصمیم را برای راه‌اندازی هوش مصنوعی محلی بگیرند.

ابزار AgentPerf-Local جلسات واقعی تعامل ایجنت‌ها را مجدداً اجرا می‌کند. سناریوی آزمایشی پیش‌فرض شامل ۸ تسک ضبط‌شده از ایجنت‌هاست که در ۱۶۸ نوبت رفت‌وبرگشت مدل انجام می‌شوند. درست مانند یک ایجنت در دنیای واقعی، هر درخواست شامل کل تاریخچه گفت‌وگو تا آن لحظه است؛ در نتیجه طول کانتکست تا حدود ۵۶ هزار توکن افزایش می‌یابد. در هر نوبت، سیستم دقیقاً همان تعداد توکن ثبت‌شده را تولید می‌کند تا بار پردازشی تمامی سیستم‌ها کاملاً یکسان باشد. اجرای ابزارها (Tools) به‌طور پیش‌فرض نادیده گرفته می‌شود تا سرعت خالص پردازش هوش مصنوعی تفکیک شود؛ با این حال، کاربران می‌توانند تأخیرهای واقعی ثبت‌شده ابزارها را بازپخش کنند یا فراخوانی ابزارها را به‌صورت زنده روی پردازنده اصلی (CPU) به اجرا درآورند.

در فاز نخست، تمرکز بر عملکردی است که یک تک‌ایجنت می‌تواند با استفاده از تمام توان سیستم به دست آورد. در ادامه این سناریوها برای سیستم‌های چندایجنت و شرایطی که ایجنت در کنار سایر برنامه‌های روزمره اجرا می‌شود نیز گسترش خواهد یافت.

سخت‌افزارهای اولیه آزمایش‌شده عبارتند از: سیستم NVIDIA DGX Spark با ۱۲۸ گیگابایت حافظه، پلتفرم AMD Ryzen AI Halo با ۱۲۸ گیگابایت حافظه، مک‌بوک پرو M5 Pro با ۶۴ گیگابایت حافظه، و کارت گرافیک NVIDIA GeForce RTX 5090 با ۳۲ گیگابایت VRAM. این سخت‌افزارها برای پوشش تنوعی از پلتفرم‌ها (CUDA، ROCm، Vulkan و Metal)، ظرفیت‌های رم و پهنای باندهای مختلف انتخاب شده‌اند. در آینده لپ‌تاپ‌های بیشتری بر پایه x86 و پردازنده‌های گرافیکی ورک‌استیشن نظیر RTX PRO 6000 بلک‌ول اضافه می‌شوند تا مقایسه دقیق‌تری از انواع سخت‌افزارها ارائه شود.

مدل‌های اولیه بررسی‌شده شامل Qwen3.5-9B، مدل متراکم Qwen3.8-27B، مدل Qwen3.6-35B-A3B و Ling 3.0 Flash (با ۱۲۴ میلیارد پارامتر کل و ۵ میلیارد پارامتر فعال) هستند. این مدل‌ها نیازمندی‌های حافظه‌ای متنوع و معماری‌های Dense و MoE را پوشش می‌دهند و برای شبیه‌سازی شرایط واقعی در کوانتیزاسیون ۴ بیتی بنچمارک شده‌اند. علاوه بر این، این ابزار امکان تست عملکرد هر سرور اینفرنس سازگار با OpenAI را دارد، به این معنی که کاربران می‌توانند هر مدل و کانفیگی را به‌راحتی به‌صورت محلی بسنجند.

انتخاب کانفیگ اجرای مدل نقش سرنوشت‌سازی در نتایج دارد؛ چرا که ران‌تایم، نوع کوانتیزاسیون و روش دی‌کدینگ حدسی (Speculative Decoding) خروجی را دگرگون می‌کنند. در تمامی ۱۴ کانفیگ رسمی بررسی‌شده از روش‌های دی‌کدینگ حدسی (مانند MTP، DFlash یا DSpark) استفاده شده است.

نتایج اولیه آزمایش‌ها:

➤ زمان تکمیل فرایند بیش از هر چیز به تعداد پارامترهای فعال مدل بستگی دارد: مدل Qwen3.6-35B-A3B (با ۳ میلیارد پارامتر فعال) سریع‌ترین مدل در تمامی سیستم‌ها بود و بین ۲.۵ تا ۳.۳ برابر سریع‌تر از مدل متراکم Qwen3.8-27B عمل کرد. با این وجود، پارامترهای فعال تمام ماجرا نیستند؛ چرا که مدل Ling 3.0 Flash با ۵ میلیارد پارامتر فعال همچنان در تمام سخت‌افزارها کندتر از مدل ۹ میلیارد پارامتری Qwen3.5 ظاهر شد.

➤ کارت گرافیک GeForce RTX 5090 سریع‌ترین سیستم برای مدل‌هایی بود که در حافظه ۳۲ گیگابایتی آن جا شدند: این کارت گرافیک زمان اتصالی بیش از ۳.۵ برابر سریع‌تر از رقبا را به ثبت رساند. سرعت دی‌کود تک‌کاربره وابستگی بالایی به پهنای باند حافظه دارد و RTX 5090 با پهنای باند فوق‌العاده ۱۷۹۲ گیگابایت بر ثانیه، فرسنگ‌ها جلوتر از سیستم‌های حافظه یکپارچه (با پهنای باند ۲۵۶ تا ۳۰۷ گیگابایت بر ثانیه) قرار گرفته است.

➤ دو سیستم DGX Spark و Ryzen AI Halo در مجموع پلتفرم‌های مشابه‌ای هستند: هر دو دارای ظرفیت یکسان حافظه یکپارچه، پهنای باند نزدیک و قیمت اولیه ۴۰۰۰ دلاری هستند. با این وجود، سیستم DGX Spark در ۳ مدل از ۴ مدل تست‌شده، ۱.۴ تا ۱.۷ برابر سریع‌تر ظاهر شد. این اختلاف فراتر از تفاوت ۷ درصدی پهنای باند آن‌هاست؛ سیستم انویدیا از توان محاسباتی بهتری در دقت پایین برخوردار است که فاز پردازش ورودی (Prefill) را سرعت می‌بخشد و بلوغ بیشتر نرم‌افزار CUDA نیز عملکرد بهتری در معماری MoE و دی‌کدینگ حدسی فراهم کرده است.

➤ مک‌بوک پرو (M5 Pro با ۶۴ گیگابایت رم و ۲۰ هسته گرافیکی) تنها لپ‌تاپ تست‌شده تا این مرحله بود: این لپ‌تاپ نتایج بسیار رقابتی ثبت کرد و اختلافی بین ۲ تا ۹ درصد با سیستم Ryzen AI Halo در دو مدل کوئن بر جای گذاشت. مک‌بوک پرو با بالاترین پهنای باند بین سیستم‌های حافظه یکپارچه (۳۰۷ گیگابایت بر ثانیه) و قیمت ۳۷۰۰ دلاری، ارزان‌ترین دستگاه تست‌شده است؛ هرچند بلوغ نرم‌افزاری و توان خام پردازشی برای فاز Prefill از عوامل محدودکننده آن به شمار می‌روند.

➤ با وجود اینکه ۷۳ تا ۹۳ درصد توکن‌های پرامپت از کَش KV فراخوانی شدند: صرف خواندن ورودی‌های جدید در هر مرحله (فاز Prefill) بخش چشمگیری از زمان کل (۲۲ تا ۴۱ درصد در مدل Qwen3.8-27B) را مصرف کرد. این موضوع به‌ویژه بر سیستم‌هایی که نسبت توان محاسباتی به پهنای باند کمتری دارند اثر گذاشته است.

➤ تکنیک دی‌کدینگ حدسی در تمامی کانفیگ‌های برتر پیاده‌سازی شد: این راهکار توانست سرعت تولید توکن را در مدل Qwen3.8-27B بین ۳۰ تا ۱۲۰ درصد فراتر از سقف توان پهنای باند افزایش دهد.

قیمت بازار آزاد اغلب سخت‌افزارها نسبت به قیمت مصوب اولیه افزایش داشته است. با در نظر گرفتن نرخ‌های فعلی بازار، با کاهش زمان تکمیل کار، قیمت سیستم‌ها صعودی می‌شود؛ مک‌بوک پرو M5 Pro ارزان‌ترین گزینه و سیستم مجهز به کارت GeForce RTX 5090 با اختلاف گران‌ترین سیستم است.

سرعت تولید توکن (Decode) در مدل Qwen3.8-27B روی هر سه دستگاه مجهز به حافظه یکپارچه به‌دلیل پهنای باند مشابه (۲۵۶ تا ۳۰۷ گیگابایت بر ثانیه) تقریباً یکسان بود. اما کارت RTX 5090 به یمن پهنای باند ۱۷۹۲ گیگابایت بر ثانیه‌ای خود، بیش از ۵ برابر سرعت دی‌کود بالاتری ثبت کرد.

سرعت پردازش اولیه ورودی‌ها (Prefill) نیز الگویی مشابه فاز تولید نشان داد، اما توان پردازشی بالای DGX Spark خود را در خواندن سریع‌تر کانتکست نمایان کرد. در تعاملات ایجنتی، حتی با وجود کَش شدن ۹۳ درصد ورودی‌ها، هر نشست همچنان حاوی حدود ۱۹۶ هزار توکن ورودی جدید است. هنگام بازگرداندن یک فایل حجیم توسط ابزار، ایجنت ممکن است روی سیستم Halo تا ۲۴ ثانیه و روی مک‌بوک تا ۳۹ ثانیه معطل شود، در حالی که کارت RTX 5090 این کار را در حدود ۲ ثانیه انجام می‌دهد.

این بنچمارک به‌طور مداوم با ورود قطعات و ابزارهای جدید به‌روزرسانی می‌شود و پشتیبانی از سناریوهای چندایجنت و فریم‌ورک‌های جدید اینفرنس در برنامه‌های آتی آن قرار دارد.

برای دسترسی به سورس‌کد و اجرای این بنچمارک روی سیستم خود می‌توانید به مخزن متن‌باز پروژه مراجعه کنید.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

حواشی نام‌گذاری ایجنت جدید اوپن‌ای‌آی؛ دردسرهای بی‌پایان «Dots» و موج‌سواری ایلان ماسک!
آخرین اخبار

حواشی نام‌گذاری ایجنت جدید اوپن‌ای‌آی؛ دردسرهای بی‌پایان «Dots» و موج‌سواری ایلان ماسک!

اوپن‌ای‌آی از سیستم ایجنت جدید خود به نام «Dots» رونمایی کرده، اما این نام‌گذاری حسابی در فضای مجازی جنجال به پا کرده است. از تشابه اسمی با چند شرکت چینی و هجوم کاربران به پیج اینستاگرام یک برند لباس زنانه گرفته تا ترول زیرکانه شرکت هوش مصنوعی ایلان ماسک با دامنه Dot.com، همه‌چیز دست به دست هم داده تا این رونمایی حسابی سوژه شبکه‌های اجتماعی شود.

۳ دقیقه مطالعه
۰
۸ مهر
کت‌وشلوار سازمانی بر تن OpenClaw؛ ائتلاف اوپنای‌آی و رد هت برای نجات ایجنت‌ها از تحریم اداری!
آخرین اخبار

کت‌وشلوار سازمانی بر تن OpenClaw؛ ائتلاف اوپنای‌آی و رد هت برای نجات ایجنت‌ها از تحریم اداری!

پروژه پرطرفدار OpenClaw با همراهی رد هت، ان‌ویدیا و اوپنای‌آی، در حال ساخت نسخه‌ای سازمانی موسوم به OCE است تا نگرانی‌های امنیتی شدید شرکت‌ها را رفع کند. این پروژه که لقب «کوبرنتیز برای ایجنت‌ها» را به همراه دارد، به دنبال استانداردسازی و کنترل همه‌جانبه روی دستیاران هوشمند سازمانی است.

۳ دقیقه مطالعه
۰
۸ مهر
از بیل مکانیکی تا پلتفرم هوشمند؛ باب‌کت چطور با هوش مصنوعی ماشین‌های سنگین را متحول می‌کند؟
آخرین اخبار

از بیل مکانیکی تا پلتفرم هوشمند؛ باب‌کت چطور با هوش مصنوعی ماشین‌های سنگین را متحول می‌کند؟

روی گرکو، مدیر ارشد دیجیتال شرکت باب‌کت، از استراتژی این برند پرآوازه ماشین‌آلات سنگین برای پیوند زدن لودرها و بیل‌های مکانیکی با هوش مصنوعی و نرم‌افزار پرده برداشته است؛ تحولی که ابزارهای سخت کارگاهی را به پلتفرم‌های متصل و دستیارهای هوشمند ارتقا می‌دهد.

۵ دقیقه مطالعه
۰
۸ مهر