استارتاپ Vals با حمایت Andreessen Horowitz به دنبال تبدیل شدن به استاندارد طلایی بنچمارک هوش مصنوعی است
استارتاپ Vals قصد دارد در دنیایی که روزبهروز با مدلهای هوش مصنوعی اشباع میشود، ارزیابی و بنچمارک این فناوری را به منبعی بیطرفتر و قابلاعتمادتر تبدیل کند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ Vals با جذب سرمایه ۴۰ میلیون دلاری در تلاش است تا سیستمهای ناکارآمد فعلی برای بنچمارک مدلهای هوش مصنوعی را اصلاح کند.
- این شرکت برخلاف روشهای سنتی، از آزمونهای غیرعلنی برای ارزیابی عملکرد مدلها در صنایع خاص مانند حقوق، مالی و برنامهنویسی استفاده میکند.
- هدف نهایی این پلتفرم، بررسی دقیق پیامدهای مثبت و منفی هوش مصنوعی در دنیای واقعی و کمک به جلب اعتماد عمومی برای شرکتهای این حوزه است.
بنچمارک به استاندارد اصلی صنعت برای اعتبارسنجی قابلیتهای مدلهای هوش مصنوعی تبدیل شده است و زمانی که آمار و ارقام به نفع شرکتها باشد، آنها میتوانند از رقبا پیشی بگیرند و برتری خود را تبلیغ کنند. به عبارت دیگر، کسب نتایج خوب در بنچمارک تقریباً همیشه به معنای روابط عمومی موفق است.
با این حال، شرکتها راههایی برای دور زدن سیستمهای قدیمی بنچمارک پیدا کردهاند؛ سیستمهایی که بسیاری از آنها منسوخ شدهاند و برای سنجش تواناییهای مدلهای پیشرفته امروزی ساخته نشدهاند.
استارتاپ Vals که در سال ۲۰۲۴ تأسیس شده، اعلام کرده است که مأموریت دارد این سیستم بسیار ناکارآمد را اصلاح کند. این شرکت در کمتر از دو سال توانسته است جایگاه قابلتوجهی در صنعت فناوری به دست آورد و سال گذشته، موفق به جذب سرمایه اولیه با هدایت 8VC و Bloomberg Beta شد. ماه گذشته نیز پس از یک دوره رشد سریع، در دور اول جذب سرمایه (Series A) با رهبری Andreessen Horowitz، موفق به دریافت ۴۰ میلیون دلار شد.
رایان کریشنان (Rayan Krishnan)، همبنیانگذار ۲۵ ساله این شرکت، سابقه کارآموزی در Palantir را دارد و در دوران کارشناسی در دانشگاه استنفورد، با Microsoft و آزمایشگاه تحسینشده هوش مصنوعی این دانشگاه همکاری کرده است. به گفته کریشنان، ایده شکلگیری Vals از مشاهدات شخصی او درباره عقبماندگی سیستمهای بنچمارک نسبت به پیشرفتهای صنعتی نشأت گرفته است.
کریشنان توضیح میدهد: «ما شاهد ورود سریع مجموعهای از مدلهای جدید و بسیار توانمند به بازار بودیم، اما بنچمارکهای دانشگاهی همپای این پیشرفتهای مرزی حرکت نمیکردند.» او معتقد است با ادغام هوش مصنوعی در تمام بخشهای جامعه، بنچمارکها باید واقعاً تأیید کنند که مدلها میتوانند ادعاهای تبلیغاتی شرکتهای سازنده خود را برآورده کنند.
دفتر دو طبقه این شرکت در خیابان فولسوم سانفرانسیسکو واقع شده است؛ یک ساختمان آجری قدیمی که یک قرن پیش بهعنوان کارخانه آبجوسازی فعالیت میکرد. اکنون این سازه تاریخی به جای تولیدات صنعتی، به خانه استارتاپهای متعددی تبدیل شده است که به دنبال ساختن آینده صنعت فناوری هستند.
کریشنان در ادامه میگوید: «از نظر تاریخی، فکر میکنم ارزیابی هوش همیشه به شکلی بسیار انتزاعی انجام شده است. برای مثال، آیا مدلها اطلاعات کافی برای شرکت در آزمونی شبیه به آزمون وکالت را دارند؟»
اینجا همان نقطهای است که Vals میخواهد تفاوت ایجاد کند. در حالی که بسیاری از سیستمهای بنچمارک، آزمونهای خود را بهصورت عمومی در دسترس قرار میدهند (که میتواند به شرکتها اجازه دهد مدلهای خود را دقیقاً با همان آزمونها آموزش دهند و در واقع تقلب کنند)، Vals مواد آزمونهای اختصاصی خود را فاش نمیکند. این شرکت به جای سنجش دانش عمومی یک مدل هوش مصنوعی، مدلها را بر اساس توانایی آنها در انجام وظایف پیچیده و مرتبط با صنایع خاص مانند حقوق، امور مالی و کدنویسی ارزیابی میکند.
کریشنان تأکید میکند: «کاری که ما انجام میدهیم، بررسی دقیق تأثیرات واقعی مدلها است. آیا آنها میتوانند در هر حوزهای کاری انجام دهند که خروجی آن کیفیتی برابر با کار انسان داشته باشد؟»
به گفته او، ایده اصلی این است که نه تنها پیامدهای مثبت، بلکه نتایج منفی نیز بررسی شوند. هدف آنها تحلیل این موضوع است که «اگر این مدلها در دنیای واقعی بدون کنترل رها شوند، چه پیامدهای منفی به همراه خواهند داشت.»
قابلیتهایی که Vals میسنجد در حال گسترش است. این استارتاپ علاوه بر صنایع سنتیتر، همچنان به حوزههای منحصربهفردتری نفوذ میکند. کریشنان توضیح میدهد: «ما یک بنچمارک برای خودبهبودی بازگشتی داریم. همچنین در حال انجام کارهایی در زمینههای سلامت روان، امنیت سایبری، امنیت زیستی و حتی حقوق مخاصمات مسلحانه هستیم تا بفهمیم مدلها چگونه کنوانسیون ژنو را اعمال میکنند.»
شرکتها برای آزمایش مدلهای خود به Vals پول پرداخت میکنند؛ مفهومی که شاید در نگاه اول عجیب به نظر برسد که چرا یک شرکت باید برای فهمیدن عملکرد ضعیف مدل خود هزینه کند. اما داشتن یک معیار مؤثر به شرکتها کمک میکند تا مشکلات را عیبیابی کرده و در طول زمان پیشرفت کنند. کریشنان مدل درآمدی شرکتش را به هزینهای تشبیه میکند که یک دانشآموز برای شرکت در آزمونهای استانداردی مانند SAT پرداخت میکند.
در نتیجه، این ارزیابیها به عوامل کلیدی تصمیمگیری برای شرکتهایی تبدیل میشوند که به دنبال استفاده از مدلهای هوش مصنوعی جدید هستند.
این استارتاپ اخیراً فاش کرده است که درآمد فعلی آن هشت برابر سال گذشته است و تعداد کارمندان آن نیز در حال افزایش است. Vals که سال را با تنها هشت نفر آغاز کرد، اکنون تیم خود را با رسیدن به ۲۵ نفر، سه برابر کرده است. کریشنان اشاره میکند که با رشد استارتاپ، برنامه آنها انتقال به یک دفتر بسیار بزرگتر و همچنین استخدام ۱۰ تا ۱۵ نفر دیگر است. این شرکت بهتازگی برنامهای را نیز برای ارائه ارزیابیهای مدل به نهادهای دولتی فدرال راهاندازی کرده است.
کریشنان سیستم بنچمارک شرکت خود را بهعنوان آیندهای میبیند که شرکتهای هوش مصنوعی برای رشد کسبوکار خود و جلب اعتماد عمومی به آن متکی خواهند بود.
او خاطرنشان میکند: «شرکتهای فعال در حوزه هوش مصنوعی در حال ورود به بازار سهام و عرضه عمومی هستند. Anthropic برای اواخر امسال برنامهریزی کرده است و گمان میکنم OpenAI نیز بهزودی عرضه عمومی شود. به باور من، با تبدیل شدن مدلهای هوش مصنوعی به بخش اصلی اقتصاد و گسترش هرچه بیشتر آنها، انواع بنچمارکها و ارزیابیهایی که ما انجام میدهیم، میزان استفاده از این مدلها را هدایت کرده و به بخش مرکزی نحوه گزارشدهی عمومی این شرکتها یا صحبت درباره سرمایهگذاریهای آینده آنها در هوش مصنوعی تبدیل خواهد شد.»
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.