پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

استارتاپ Vals با حمایت Andreessen Horowitz به دنبال تبدیل شدن به استاندارد طلایی بنچمارک هوش مصنوعی است

انتشار:۲۸ شهریور ۱۴۰۵(۱ هفته پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Vals قصد دارد در دنیایی که روزبه‌روز با مدل‌های هوش مصنوعی اشباع می‌شود، ارزیابی و بنچمارک این فناوری را به منبعی بی‌طرف‌تر و قابل‌اعتمادتر تبدیل کند.

استارتاپ Vals با حمایت Andreessen Horowitz به دنبال تبدیل شدن به استاندارد طلایی بنچمارک هوش مصنوعی است

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ Vals با جذب سرمایه ۴۰ میلیون دلاری در تلاش است تا سیستم‌های ناکارآمد فعلی برای بنچمارک مدل‌های هوش مصنوعی را اصلاح کند.
  • این شرکت برخلاف روش‌های سنتی، از آزمون‌های غیرعلنی برای ارزیابی عملکرد مدل‌ها در صنایع خاص مانند حقوق، مالی و برنامه‌نویسی استفاده می‌کند.
  • هدف نهایی این پلتفرم، بررسی دقیق پیامدهای مثبت و منفی هوش مصنوعی در دنیای واقعی و کمک به جلب اعتماد عمومی برای شرکت‌های این حوزه است.

بنچمارک به استاندارد اصلی صنعت برای اعتبارسنجی قابلیت‌های مدل‌های هوش مصنوعی تبدیل شده است و زمانی که آمار و ارقام به نفع شرکت‌ها باشد، آن‌ها می‌توانند از رقبا پیشی بگیرند و برتری خود را تبلیغ کنند. به عبارت دیگر، کسب نتایج خوب در بنچمارک تقریباً همیشه به معنای روابط عمومی موفق است.

با این حال، شرکت‌ها راه‌هایی برای دور زدن سیستم‌های قدیمی بنچمارک پیدا کرده‌اند؛ سیستم‌هایی که بسیاری از آن‌ها منسوخ شده‌اند و برای سنجش توانایی‌های مدل‌های پیشرفته امروزی ساخته نشده‌اند.

استارتاپ Vals که در سال ۲۰۲۴ تأسیس شده، اعلام کرده است که مأموریت دارد این سیستم بسیار ناکارآمد را اصلاح کند. این شرکت در کمتر از دو سال توانسته است جایگاه قابل‌توجهی در صنعت فناوری به دست آورد و سال گذشته، موفق به جذب سرمایه اولیه با هدایت 8VC و Bloomberg Beta شد. ماه گذشته نیز پس از یک دوره رشد سریع، در دور اول جذب سرمایه (Series A) با رهبری Andreessen Horowitz، موفق به دریافت ۴۰ میلیون دلار شد.

رایان کریشنان (Rayan Krishnan)، هم‌بنیان‌گذار ۲۵ ساله این شرکت، سابقه کارآموزی در Palantir را دارد و در دوران کارشناسی در دانشگاه استنفورد، با Microsoft و آزمایشگاه تحسین‌شده هوش مصنوعی این دانشگاه همکاری کرده است. به گفته کریشنان، ایده شکل‌گیری Vals از مشاهدات شخصی او درباره عقب‌ماندگی سیستم‌های بنچمارک نسبت به پیشرفت‌های صنعتی نشأت گرفته است.

کریشنان توضیح می‌دهد: «ما شاهد ورود سریع مجموعه‌ای از مدل‌های جدید و بسیار توانمند به بازار بودیم، اما بنچمارک‌های دانشگاهی همپای این پیشرفت‌های مرزی حرکت نمی‌کردند.» او معتقد است با ادغام هوش مصنوعی در تمام بخش‌های جامعه، بنچمارک‌ها باید واقعاً تأیید کنند که مدل‌ها می‌توانند ادعاهای تبلیغاتی شرکت‌های سازنده خود را برآورده کنند.

دفتر دو طبقه این شرکت در خیابان فولسوم سان‌فرانسیسکو واقع شده است؛ یک ساختمان آجری قدیمی که یک قرن پیش به‌عنوان کارخانه آبجوسازی فعالیت می‌کرد. اکنون این سازه تاریخی به جای تولیدات صنعتی، به خانه استارتاپ‌های متعددی تبدیل شده است که به دنبال ساختن آینده صنعت فناوری هستند.

کریشنان در ادامه می‌گوید: «از نظر تاریخی، فکر می‌کنم ارزیابی هوش همیشه به شکلی بسیار انتزاعی انجام شده است. برای مثال، آیا مدل‌ها اطلاعات کافی برای شرکت در آزمونی شبیه به آزمون وکالت را دارند؟»

اینجا همان نقطه‌ای است که Vals می‌خواهد تفاوت ایجاد کند. در حالی که بسیاری از سیستم‌های بنچمارک، آزمون‌های خود را به‌صورت عمومی در دسترس قرار می‌دهند (که می‌تواند به شرکت‌ها اجازه دهد مدل‌های خود را دقیقاً با همان آزمون‌ها آموزش دهند و در واقع تقلب کنند)، Vals مواد آزمون‌های اختصاصی خود را فاش نمی‌کند. این شرکت به جای سنجش دانش عمومی یک مدل هوش مصنوعی، مدل‌ها را بر اساس توانایی آن‌ها در انجام وظایف پیچیده و مرتبط با صنایع خاص مانند حقوق، امور مالی و کدنویسی ارزیابی می‌کند.

کریشنان تأکید می‌کند: «کاری که ما انجام می‌دهیم، بررسی دقیق تأثیرات واقعی مدل‌ها است. آیا آن‌ها می‌توانند در هر حوزه‌ای کاری انجام دهند که خروجی آن کیفیتی برابر با کار انسان داشته باشد؟»

به گفته او، ایده اصلی این است که نه تنها پیامدهای مثبت، بلکه نتایج منفی نیز بررسی شوند. هدف آن‌ها تحلیل این موضوع است که «اگر این مدل‌ها در دنیای واقعی بدون کنترل رها شوند، چه پیامدهای منفی به همراه خواهند داشت.»

قابلیت‌هایی که Vals می‌سنجد در حال گسترش است. این استارتاپ علاوه بر صنایع سنتی‌تر، همچنان به حوزه‌های منحصربه‌فردتری نفوذ می‌کند. کریشنان توضیح می‌دهد: «ما یک بنچمارک برای خودبهبودی بازگشتی داریم. همچنین در حال انجام کارهایی در زمینه‌های سلامت روان، امنیت سایبری، امنیت زیستی و حتی حقوق مخاصمات مسلحانه هستیم تا بفهمیم مدل‌ها چگونه کنوانسیون ژنو را اعمال می‌کنند.»

شرکت‌ها برای آزمایش مدل‌های خود به Vals پول پرداخت می‌کنند؛ مفهومی که شاید در نگاه اول عجیب به نظر برسد که چرا یک شرکت باید برای فهمیدن عملکرد ضعیف مدل خود هزینه کند. اما داشتن یک معیار مؤثر به شرکت‌ها کمک می‌کند تا مشکلات را عیب‌یابی کرده و در طول زمان پیشرفت کنند. کریشنان مدل درآمدی شرکتش را به هزینه‌ای تشبیه می‌کند که یک دانش‌آموز برای شرکت در آزمون‌های استانداردی مانند SAT پرداخت می‌کند.

در نتیجه، این ارزیابی‌ها به عوامل کلیدی تصمیم‌گیری برای شرکت‌هایی تبدیل می‌شوند که به دنبال استفاده از مدل‌های هوش مصنوعی جدید هستند.

این استارتاپ اخیراً فاش کرده است که درآمد فعلی آن هشت برابر سال گذشته است و تعداد کارمندان آن نیز در حال افزایش است. Vals که سال را با تنها هشت نفر آغاز کرد، اکنون تیم خود را با رسیدن به ۲۵ نفر، سه برابر کرده است. کریشنان اشاره می‌کند که با رشد استارتاپ، برنامه آن‌ها انتقال به یک دفتر بسیار بزرگ‌تر و همچنین استخدام ۱۰ تا ۱۵ نفر دیگر است. این شرکت به‌تازگی برنامه‌ای را نیز برای ارائه ارزیابی‌های مدل به نهادهای دولتی فدرال راه‌اندازی کرده است.

کریشنان سیستم بنچمارک شرکت خود را به‌عنوان آینده‌ای می‌بیند که شرکت‌های هوش مصنوعی برای رشد کسب‌وکار خود و جلب اعتماد عمومی به آن متکی خواهند بود.

او خاطرنشان می‌کند: «شرکت‌های فعال در حوزه هوش مصنوعی در حال ورود به بازار سهام و عرضه عمومی هستند. Anthropic برای اواخر امسال برنامه‌ریزی کرده است و گمان می‌کنم OpenAI نیز به‌زودی عرضه عمومی شود. به باور من، با تبدیل شدن مدل‌های هوش مصنوعی به بخش اصلی اقتصاد و گسترش هرچه بیشتر آن‌ها، انواع بنچمارک‌ها و ارزیابی‌هایی که ما انجام می‌دهیم، میزان استفاده از این مدل‌ها را هدایت کرده و به بخش مرکزی نحوه گزارش‌دهی عمومی این شرکت‌ها یا صحبت درباره سرمایه‌گذاری‌های آینده آن‌ها در هوش مصنوعی تبدیل خواهد شد.»

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر