پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ارزش لیدربورد محبوب Arena به ۳.۱ میلیارد دلار رسید؛ پلتفرمی که مچ هوش مصنوعی را هنگام دروغ گفتن می‌گیرد!

انتشار:۱۷ مهر ۱۴۰۵(۵۹ دقیقه پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

پلتفرم محبوب ارزیابی مدل‌های هوش مصنوعی، Arena، با جذب سرمایه ۲۰۰ میلیون دلاری ارزش خود را ظرف ۱۰ ماه به ۳.۱ میلیارد دلار رساند. این استارتاپ اکنون با افزودن شاخص هم‌راستایی، رفتارهای پرخطر هوش مصنوعی مثل دروغگویی و تصمیمات خودسرانه را مورد ارزیابی قرار می‌دهد.

ارزش لیدربورد محبوب Arena به ۳.۱ میلیارد دلار رسید؛ پلتفرمی که مچ هوش مصنوعی را هنگام دروغ گفتن می‌گیرد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • پلتفرم ارزیابی هوش مصنوعی Arena با هدایت لایت‌اسپید و خوسلا ونچرز ۲۰۰ میلیون دلار سرمایه جدید جذب کرد و ارزش آن به ۳.۱ میلیارد دلار رسید.
  • ارزش‌گذاری این استارتاپ ظرف ۱۰ ماه دو برابر شده و درآمد سالانه آن نیز از مرز ۱۰۰ میلیون دلار عبور کرده است.
  • آرنا بخش جدیدی برای سنجش «هم‌راستایی» ایجاد کرده که مدل‌ها را از نظر رفتارهای پرخطری مثل اقدامات خودسرانه و دروغگویی درباره انجام تسک‌ها رتبه‌بندی می‌کند.

پلتفرم Arena (همان لیدربورد نام‌آشنای LMArena) که سال ۲۰۲۳ کار خود را به عنوان یک پروژه تحقیقاتی و جمع‌سپاری در دانشگاه برکلی کالیفرنیا برای رتبه‌بندی مدل‌های هوش مصنوعی آغاز کرد، روز پنج‌شنبه اعلام کرد که در دور سرمایه‌گذاری سری B موفق به جذب ۲۰۰ میلیون دلار با ارزش‌گذاری خیره‌کننده ۳.۱ میلیارد دلاری شده است.

این جهش مالی چشمگیر پس از آن اتفاق می‌افتد که این شرکت در ماه ژوئن اعلام کرد به درآمد سالانه (Run-rate) ۱۰۰ میلیون دلاری دست یافته است.

رهبری این دور سرمایه‌گذاری را شرکت‌های نام‌آشنای «لایت‌اسپید» (Lightspeed Venture Partners) و «خوسلا ونچرز» (Khosla Ventures) بر عهده داشتند و غول‌هایی مانند سیلزفورس ونچرز، اندریسن هوروویتز (a16z)، دل تکنالوجیز کپیتال، 01 Advisors و فلیسیس هم در آن مشارکت کردند. آرنا پیش از این در ماه ژانویه از جذب سرمایه ۱۵۰ میلیون دلاری در دور سری A با ارزش‌گذاری ۱.۷ میلیارد دلاری خبر داده بود؛ زمانی که درآمد سالانه‌اش تنها ۳۰ میلیون دلار اعلام شد. این یعنی ارزش‌گذاری این استارتاپ تنها ظرف حدود ۱۰ ماه تقریباً دو برابر شده است!

پلتفرم Arena بستری رایگان و جمع‌سپاری‌شده را در اختیار کاربران می‌گذارد؛ محیطی که در آن افراد پرامپت‌های مختلف را ثبت می‌کنند یا عملکرد پروژه‌های vibe coding را به بوته آزمایش می‌گذارند و سپس تعیین می‌کنند کدام مدل هوش مصنوعی خروجی بهتری ارائه داده است. آرنا مدعی است ماهانه ده‌ها میلیون بازدیدکننده دارد.

سپتامبر سال گذشته بود که این شرکت محصول تجاری خود یعنی AI Evaluations را معرفی کرد؛ سرویسی که بر اساس بازخورد جامعه کاربران، تحلیل‌های دقیق و موشکافانه‌ای از عملکرد مدل‌ها را در اختیار آزمایشگاه‌های هوش مصنوعی و کسب‌وکارهای بزرگ قرار می‌دهد. زمان‌بندی عرضه این محصول بی‌نظیر بود؛ زیرا در سال جاری آزمایشگاه‌های هوش مصنوعی پی بردند که مدل‌هایشان بنچمارک‌ها را دور می‌زنند و یاد گرفته‌اند چطور بدون پیشرفت واقعی، نمرات بالایی ثبت کنند. هم‌زمان، سازمان‌ها نیز به دنبال راهکاری مطمئن بودند تا بفهمند کدام مدل دقیقاً به کار نیازهای اختصاصی‌شان می‌آید، نه اینکه فقط به بنچمارک‌های استاندارد و خشک متکی باشند.

این شرکت در بیانیه جذب سرمایه خود اعلام کرد: «هوش مصنوعی با سرعتی بالا‌تر از توانایی ما برای ارزیابی آن به جلو می‌تازد و بنچمارک‌های ایستا به محض اینکه مدل‌ها حس کنند مورد سنجش قرار گرفته‌اند، از کار می‌افتند. دنیا به یک داور بی‌طرف نیاز دارد تا عیار واقعی امنیت و هم‌راستایی هوش مصنوعی را در دست کاربران واقعی بسنجد؛ و آرنا امروز دقیقاً همین مسئولیت را پذیرفته است.»

در راستای همین هدف، آرنا شاخه جدیدی را به جدول رده‌بندی خود افزوده است: هم‌راستایی (Alignment). در این بخش، مدل‌ها بر پایه رفتارهای خطرسازی رتبه‌بندی می‌شوند؛ چالش‌هایی چون اقدام خودسرانه (انجام کار‌هایی بدون درخواست کاربر)، استناد نادرست (انتساب اشتباه اظهارات یا فکت‌ها به منابع دیگر)، و رفتاری که آن را «تکمیل فریبکارانه» نامیده‌اند (دروغ گفتن هوش مصنوعی درباره پایان رساندن وظایفی که اصلاً انجام نداده است!).

در حال حاضر، مجموعه‌ای از مدل‌های شرکت OpenAI در رتبه‌های نخست جدول اولیه هم‌راستایی جای گرفته‌اند و مدل‌های کلود اوپوس ۵.۵ (Claude Opus 5.5) و کلود فیبل (Claude Fable) از شرکت آنتروپیک نیز به ترتیب در جایگاه‌های ششم و نهم دیده می‌شوند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد
آخرین اخبار

شکار بخش گمشده کیهان با هوش مصنوعی آنتروپیک؛ کلود نقشه فرابنفش آسمان را کامل کرد

یک اخترفیزیک‌دان در دانشگاه جانز هاپکینز با استفاده از پلتفرم Claude Science موفق شد یک‌سوم گمشده از نقشه فرابنفش کیهان را بازسازی و کامل کند. این پروژه عظیم که در گذشته به ماه‌ها کار طاقت‌فرسا نیاز داشت، حالا به لطف ایجنت‌های هوشمند کلود و در عرض چند روز به سرانجام رسیده است.

۵ دقیقه مطالعه
۰
۱۷ مهر
سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!
آخرین اخبار

سرمایه‌گذاری ۱ میلیارد دلاری انویدیا برای سلطه علمی آمریکا؛ پول خردی که خرج ابررایانه‌های هوش مصنوعی شد!

انویدیا از اختصاص یک میلیارد دلار برای توسعه پژوهش‌های علمی و ابررایانه‌های هوش مصنوعی در آمریکا خبر داد؛ بودجه‌ای که برای این غول تراشه‌ساز حکم پول خرد را دارد اما ارتش پردازشی این کشور را در رقابت با چین تقویت می‌کند. این طرح بلندپروازانه با تجهیز آزمایشگاه‌های ملی به تراشه‌های بلک‌ول، پیشتازی هوش مصنوعی و محاسبات کوانتومی را هدف گرفته است.

۳ دقیقه مطالعه
۰
۱۷ مهر
تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی
آخرین اخبار

تاکسی خودران اختصاصی ایکس‌پنگ به خیابان‌ها آمد؛ رونمایی از سرویس XPENG YOYO و آغاز تست‌های عمومی

شرکت چینی ایکس‌پنگ (XPENG) با معرفی برند جهانی «XPENG YOYO» رسماً وارد فاز آزمایش عمومی تاکسی‌های خودران خود شد. این روبوتاکسی تمام‌عیار با تکیه بر ۴ تراشه هوش مصنوعی تورینگ و مدل پیشرفته بینایی-زبانی VLA 2.0، بدون نیاز به لیدار در خیابان‌ها مسافرگیری می‌کند. کاربران منتخب در چین از همین حالا می‌توانند با کدهای دعوت اختصاصی، سفر در کابین لوکس و هوشمند این تاکسی را تجربه کنند.

۱ دقیقه مطالعه
۰
۱۷ مهر