پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

آموزش ربات‌ها با چشم‌های انسان؛ رونمایی TwelveLabs از مدل ویدیویی Pegasus 1.6

انتشار:۱۴ مهر ۱۴۰۵(۲ ساعت پیش)
۹ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ هوش مصنوعی TwelveLabs با معرفی مدل Pegasus 1.6 گام بلندی برای حل یکی از بزرگ‌ترین چالش‌های رباتیک برداشته است. این مدل ویدیویی پیشرفته می‌تواند با تحلیل ویدیوهای ضبط‌شده از زاویه دید اول‌شخص انسان‌ها، تک‌تک مراحل کار‌های فیزیکی مثل سرهم کردن قطعات را به داده‌های آماده برای یادگیری ماشین‌ها و ربات‌ها تبدیل کند.

آموزش ربات‌ها با چشم‌های انسان؛ رونمایی TwelveLabs از مدل ویدیویی Pegasus 1.6

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ TwelveLabs از مدل جدید Pegasus 1.6 رونمایی کرد؛ مدلی که کارش تبدیل ویدیوهای زاویه دید اول‌شخص (دیدگاه فرد حین انجام کار) به داده‌های آماده برای آموزش ربات‌هاست.
  • این مدل برخلاف هوش مصنوعی‌های چندوجهی معمولی، متوالی بودن حرکات در طول زمان رو می‌فهمه و تک‌تک جزئیات مثل این‌که کدوم دست چه ابزاری رو برمی‌داره یا اگه قطعه سر بخوره چی می‌شه رو ثبت می‌کنه.
  • با نرخ ۱.۷۵ دلار برای هر ساعت ویدیو، پگاسوس ۱.۶ وارد رقابت با غول‌هایی مثل انویدیا Cosmos و جمینای گوگل شده تا کابوس پرهزینه و طاقت‌فرسای برچسب‌گذاری داده‌های رباتیک رو حل کنه.

وقتی یک کارگر در حال سرهم کردن قطعه‌ای است، چیزی به مراتب فراتر از نتیجه نهایی کار را نشان می‌دهد: این‌که کدام دست قطعه را نگه می‌دارد، دست دیگر چه زمانی به سمت ابزار می‌رود و وقتی قطعه‌ای لیز می‌خورد یا از دست می‌افتد چطور باید وضعیت را جمع‌وجور کرد. استارتاپ TwelveLabs قصد دارد دقیقاً همین جزئیات ریز و حیاتی را برای شرکت‌هایی که به ربات‌ها کار‌های فیزیکی یاد می‌دهند، کاربردی و قابل استفاده کند.

این شرکت فعال در حوزه هوش مصنوعی ویدیویی، امروز با انتشار مدل Pegasus 1.6، پشتیبانی تخصصی از ویدیوهایی را اضافه کرده که دقیقاً از زاویه دید فرد یا ماشینی که کار را انجام می‌دهد (دیدگاه اول‌شخص یا Egocentric) ضبط شده‌اند.

استارتاپ TwelveLabs توسعه‌دهندگان رباتیک و ارائه‌دهندگان داده‌های آموزشی را هدف گرفته؛ یعنی کسانی که نیاز دارند این ویدیوهای خام را به داده‌هایی برچسب‌گذاری‌شده و با نشانه‌گذاری دقیق زمانی (Timestamp) برای آموزش مدل‌ها تبدیل کنند. این قابلیت‌ها بر پایه امکانات توصیف و بخش‌بندی ویدیویی نسل قبلی، یعنی مدل Pegasus 1.5 توسعه یافته‌اند.

هر دو مدل در واقع سیستم‌های تبدیل ویدیو به متن و بخش‌بندی ویدیو هستند که به‌طور اختصاصی برای تبدیل ویدیوهای خام به فراداده‌های ساختاریافته و زمان‌بندی‌شده طراحی شده‌اند.

برخلاف مدل‌های زبانی بزرگ چندوجهیِ همه‌منظوره که صرفاً فریم‌های تصاویر ثابت را کنار هم می‌گذارند یا پرسش‌وپاسخ‌های ساده‌ای روی کلیپ‌ها انجام می‌دهند، سری مدل‌های Pegasus برای «استدلال زمانی نیتیو» (Native Temporal Reasoning) مهندسی شده‌اند؛ یعنی درک متوالی علت و معلول همراه با رصد تغییرات در گذر زمان، و درک سرتاسری و عمیق ویدیو.

این ایده برای شرکت‌ها و سازمان‌ها، راه‌حلی برای یکی از موانع پنهان و بی‌سر‌وصدا اما طاقت‌فرسای خودکارسازی است: تبدیل ویدیوهای ضبط‌شده از کار‌های فیزیکی به داده‌هایی که تیم‌های توسعه واقعاً بتوانند از آن‌ها استفاده کنند. شرکت‌هایی که به تازگی وارد دنیای رباتیک می‌شوند می‌توانند مستندسازی و سامان‌دهی فرآیندهای کاری منتخب خود را آغاز کنند؛ تیم‌هایی هم که هم‌اکنون مشغول آموزش ربات‌ها هستند می‌توانند بخش‌هایی از فرآیند برچسب‌گذاری و بررسی کیفیت داده‌های خود را خودکار کنند.

البته این تفاوت بسیار کلیدی است: پگاسوس صرفاً توصیفات و ساختار داده‌ها را فراهم می‌کند. در نهایت توسعه‌دهندگان رباتیک همچنان باید این مشاهدات را به حرکات، حسگر‌ها و سیستم‌های کنترلی وصل کنند تا دستگاه بتواند کار را به شکلی مطمئن و بی‌نقص اجرا کند.

جه لی (Jae Lee)، هم‌بنیان‌گذار و مدیرعامل TwelveLabs، در گفت‌وگویی پیش از این رونمایی اشاره کرد: «این مدل‌ها در حال حاضر به شدت تشنه داده هستند.»

از بایگانی‌های ویدیویی تا نمونه‌های عملی کار انسان

لی توضیح داد که TwelveLabs در ابتدا روی صنایع رسانه، سرگرمی، ورزش و تبلیغات متمرکز بود؛ جایی که مشتریان نیاز داشتند در آرشیوهای بزرگ ویدیویی جستجو کنند و محتوای آن‌ها را شرح دهند. اما ورود این استارتاپ به دنیای رباتیک، این توانمندی‌ها را به سمت حل مسأله متفاوتی هدایت می‌کند: شناسایی الگوهای کاربردی از رفتارهای فیزیکی انسان.

روش کنترل از راه دور ربات توسط انسان (Teleoperation) نمونه‌های بسیار ارزشمندی از انجام کار‌ها تولید می‌کند، اما به تجهیزات گران‌قیمت و اپراتورهای آموزش‌دیده نیاز دارد. به گفته لی، بزرگ‌تر کردن مقیاس این فرآیند جمع‌آوری داده، هزینه و زمان زیادی را می‌بلعد.

او در این باره می‌گوید: «مثل این است که یک نفر آدم همیشه باید پای یک ربات بایستد.»

در این میان، ویدیوهای ضبط‌شده از زاویه دید اول‌شخص منبع دیگری برای ارائه نمونه‌های آموزشی هستند. دوربینی که روی بدن یک کارگر نصب می‌شود می‌تواند تک‌تک وظایف را ثبت کند، بدون این‌که نیازی باشد حتماً در زمان ضبط یک ربات پای کار حاضر باشد. با این حال، این ویدیوها همچنان به تفسیر و تحلیل نیاز دارند: چه عملی در حال وقوع است، چه ابزار یا جسمی درگیر است، کدام دست کار را انجام می‌دهد و این حرکت دقیقاً از چه زمانی شروع شده و کِی به پایان می‌رسد؟

مدل Pegasus 1.5 از قبل می‌توانست ویدیوها را به بخش‌های زمان‌بندی‌شده تقسیم کند و توصیفاتی ساختاریافته ارائه دهد. خود شرکت TwelveLabs هم پیش از این انتشار، این توانمندی‌ها را به عنوان پایه‌ای برای برچسب‌گذاری داده‌های رباتیک معرفی کرده بود. حالا Pegasus 1.6 آموزش و پشتیبانی اختصاصی برای ویدیوهای اول‌شخص یا اگوسنتریک (Egocentric) را اضافه کرده است؛ چرا که به گفته این استارتاپ، نسخه‌های قبلی در تحلیل این نوع ویدیوها عملکرد چندان خوبی نداشتند. نوآوری اصلی در واقع همین تخصصی‌سازی و بهبود عملکرد است، نه صرفاً قابلیت ابتدایی تبدیل ویدیو به متن. بر اساس توضیحات لی و گزارش فنی شرکت، مشتریان دسته‌ها و فیلدهای مورد نظر خود را تعریف می‌کنند و مدل بر اساس همین نیازمندی‌ها ویدیو را دسته‌بندی و سامان‌دهی می‌کند.

به عنوان مثال، یک تیم مونتاژ می‌تواند بخش‌های جداگانه‌ای برای برداشتن قطعه، قرار دادن آن در جای مناسب و بستن پیچ‌ها درخواست کند؛ آن هم همراه با توصیف دقیق نقش هر دست. البته این مورد صرفاً یک سناریوی نمونه برای درک فرآیند کار است، نه گزارشی از پیاده‌سازی واقعی نزد یک مشتری خاص.

استارتاپ TwelveLabs برای این فناوری پنج جریان کاری اصلی برمی‌شمارد: تجزیه ویدیوها به حرکات برچسب‌گذاری‌شده، تولید زیرنویس‌ها و توضیحات دقیق، غربالگری ویدیوها از نظر کیفیت، شناسایی رویدادهای غیرمعمول و تکراری، و نشانه‌گذاری محتواهای حساس پیش از استفاده در فرآیندهای بعدی. بررسی کیفیت مواردی چون زاویه دید مسدودشده، لرزش دوربین یا حرکات نامشخص را در بر می‌گیرد.

این نسخه همچنین تحلیل تصاویر ثابت و شناسایی بهتر افراد و اشیا را به شکل نیتیو اضافه کرده است که به مشتریان امکان می‌دهد تصاویر را از طریق همان API یکسان با ویدیو پردازش کنند. این قابلیت‌ها کارایی مدل را فراتر از رباتیک برده و به کاربردهای رایج تحلیل ویدیو نیز بسط می‌دهد.

فهمیدن یک حرکت فقط نیمی از آموزش دادن آن است

لی فرصت تجاری فعلی در حوزه رباتیک را در قالب زیرساخت آموزش مدل‌ها توصیف می‌کند.

او می‌گوید: «فکر می‌کنم در مقطع فعلی همه در حالت شتابان و بی‌وقفه برای آموزش دادن مدل‌ها هستند.»

به گفته او، پیاده‌سازی‌های فعلی معمولاً وظایف محدودی را انجام می‌دهند یا داده‌های می‌دانی جمع‌آوری می‌کنند تا به توسعه‌دهندگان در بهبود مدل‌ها کمک کنند. فرضیه بلندمدت او این است که ویدیوهای رفتار انسان می‌توانند پایگاه وسیعی از دانش رفتاری ایجاد کنند و در ادامه، نمایش‌های کنترل از راه دور به پیاده‌سازی این دانش روی ربات‌های واقعی کمک نمایند.

البته این دیدگاه فعلاً یک استراتژی توسعه است و هنوز تضمین اثبات‌شده‌ای وجود ندارد که ویدیوی بیش‌تر لزوماً به ساخت رباتی همه‌فن‌حریف و توانمند منجر شود.

لی خاطرنشان می‌کند که پگاسوس می‌تواند حرکات دست و پا را شرح دهد و درکی کلی از مسیر حرکت ارائه دهد، اما تمام اطلاعات لازم برای اجرای فیزیکی آن‌ها را فراهم نمی‌کند. مسائلی چون میزان فشار، حس لامسه و کنترل بسیار دقیق، چالش‌های مجزایی هستند. تیم‌های رباتیک باید اطلاعات به‌دست‌آمده از ویدیو را با سایر داده‌ها ترکیب کنند و سیستم‌هایی بسازند که این داده‌ها را به عمل واقعی ترجمه کنند.

ضمیمه فنی این شرکت ارزیابی‌های داخلی شامل شناسایی حرکات، تشخیص دست انجام‌دهنده کار و درک حرکات در گذر زمان را شرح داده است. با این حال، هیچ امتیاز عددی یا مقایسه تجدیدپذیری در برابر رقبا ارائه نشده است. همچنین در این اطلاعات اولیه مشتری رباتیکی که نتایج عملیاتی‌اش به شکل مستقل قابل راستی‌آزمایی باشد معرفی نشده است.

لی برای نشان دادن مقیاس پردازش به اجرای تستی اشاره کرد که در آن حدود ۱۷ سال ویدیوی اول‌شخص ظرف تقریباً ۱۸ ساعت بدون حتی یک خطای پردازشی تحلیل شد. البته او منابع محاسباتی یا شرایط دقیق این ارزیابی را مشخص نکرده است؛ بنابراین این ادعا بیش‌تر شبیه یک نمونه سرانگشتی از توان پردازش است تا یک بنچمارک رسمی یا نتیجه اثبات‌شده در زمینه دقت.

میدان رقابت TwelveLabs کجاست و چه کمکی به دیگر توسعه‌دهندگان می‌کند؟

موضوع رقابت بخش‌های مختلفی از فرآیند توسعه رباتیک را در بر می‌گیرد؛ برخی شرکت‌ها روی سامان‌دهی داده‌های آموزشی تمرکز دارند، در حالی که برخی دیگر به دنبال تحلیل محیط اطراف ربات یا تولید دستورات حرکتی هستند.

ابزار Cosmos Curator شرکت انویدیا از طریق فیلتر کردن، برچسب‌گذاری و حذف موارد تکراری، هم‌پوشانی مستقیمی با حل چالش آماده‌سازی داده‌ها دارد. ابزار‌های متن‌باز انویدیا جایگزینی مناسب برای خرید سرویس‌های مدیریت‌شده تحلیل ویدیو به تیم‌های مهندسی ارائه می‌دهند، هرچند که تیم‌ها خودشان باید پایپ‌لاین مورد نیاز را سرهم کرده و راه‌اندازی کنند.

یکپارچه‌سازی پلتفرم Encord با Cosmos Reason 2 و Embed انویدیا مقایسه نزدیک دیگری است. پلتفرم Encord مدل‌ها را میزبانی می‌کند، برچسب‌های اولیه ویدیو را برای بازبینی انسانی می‌سازد و از جستجو بر اساس حرکات پشتیبانی می‌کند؛ قابلیتی که آن را مستقیماً در حوزه برچسب‌گذاری و پالایش داده‌ها در رقابت با TwelveLabs قرار می‌دهد.

مدل Gemini Robotics ER 2 گوگل نیز در تفسیر ویدیو و رصد پیشرفت کار‌ها هم‌پوشانی دارد، اما تمرکز اصلی آن روی برنامه‌ریزی و هماهنگی اجراست؛ سپس وظیفه اجرای حرکات موتورها را به مدل‌های حرکتی سطح پایین‌تر یا رابط‌های رباتیک می‌سپارد.

از طرفی، مدل FLUX-mimic متعلق به شرکت‌های Black Forest Labs و mimic از یک مدل ویدیویی پایه‌ای برای تولید حرکات ربات بهره می‌برد. این شرکت‌ها از آزمایش و پیاده‌سازی این مدل در کارخانه‌های آئودی برای انجام کار‌های صنعتی خبر داده‌اند. این سیستم نمونه‌ای از فرآیندهای پایین‌دستی است که می‌توانند از داده‌های آموزشی بهتر تغذیه کنند، هرچند فعلاً ارتباط و یکپارچگی مشخصی بین آن و TwelveLabs وجود ندارد.

سرویس / محصول

نقش اصلی

قابلیت‌های کلیدی

تفاوت ساختاری برای سازمان‌ها

قیمت‌های اعلام‌شده / مبنای هزینه (دلار آمریکا)

TwelveLabs Pegasus 1.6

آماده‌سازی و توصیف ویدیو برای آموزش

بخش‌بندی حرکات اول‌شخص، توضیحات متنی دقیق و خروجی‌های قابل تنظیم

سرویس API؛ مسئولیت آموزش و کنترل ربات با خود مشتری است

تعرفه‌های رسمی: ۱.۷۵ دلار به ازای هر ساعت ویدیو؛ ۳ دلار به ازای هر میلیون توکن ورودی تصویر؛ ۷.۵۰ دلار به ازای هر میلیون توکن خروجی. نسخه سازمانی: قیمت‌گذاری توافقی.

Nvidia Cosmos Curator

ساخت پایپ‌لاین‌های پردازش داده

فیلتر کردن، برچسب‌گذاری و حذف موارد تکراری

ابزار متن‌باز برای تیم‌هایی که زیرساخت اختصاصی خود را می‌سازند

نرم‌افزار متن‌باز بدون هزینه لایسنس؛ هزینه‌های پردازش ابری/GPU، ذخیره‌سازی و مهندسی پابرجاست. لایسنس مدل‌ها متفاوت است.

Encord با Cosmos Reason 2 و Embed

مدیریت برچسب‌گذاری و پالایش داده‌ها

برچسب‌گذاری خودکار اولیه، گردش کار بازبینی انسانی و جستجو بر اساس رفتار

پلتفرم میزبانی‌شده ترکیب‌کننده مدل‌ها با بازبینی انسانی

بدون نرخ دلاری عمومی؛ برای دریافت قیمت پلتفرم و استفاده از مدل‌ها باید با شرکت تماس گرفت.

Google Gemini Robotics ER 2

استدلال و هماهنگی وظایف ربات

ارزیابی پیشرفت ویدیو، برنامه‌ریزی و استفاده از ابزار‌ها

استدلال در دسترس از طریق API؛ سیستم‌های مجزا حرکات را اجرا می‌کنند

تعرفه‌های استاندارد API: ۱ دلار به ازای هر میلیون توکن ورودی و ۵ دلار برای خروجی (شامل توکن‌های تفکر) تا پایان ۲۰۲۶؛ از ۲۰۲۷ معادل ۲ و ۱۰ دلار. دارای پلن رایگان.

BFL/mimic FLUX-mimic

تولید حرکات برای کار‌های فیزیکی

ترجمه اطلاعات استخراج‌شده از ویدیو به رفتار حرکتی ربات

سیستم عملیاتی رباتیک، با تمرکز بر اجرا فراتر از آماده‌سازی داده‌ها

قیمت عمومی در اطلاعیه محصول اعلام نشده است؛ شرایط استفاده نیازمند استعلام بوده و به عنوان مدل رایگان تبلیغ نشده است.

قیمت‌ها بر اساس بررسی‌های انجام‌شده در ۶ اکتبر ۲۰۲۶ ثبت شده‌اند. واحدهای صدور صورت‌حساب و گستره کاربرد این محصولات با یکدیگر تفاوت دارند؛ بنابراین این ارقام لزوماً ارزان‌ترین گزینه را برای یک حجم کاری مشخص تعیین نمی‌کنند. پگاسوس هزینه ویدیو را بر اساس مدت‌زمان و هزینه خروجی متن را بر حسب توکن محاسبه می‌کند؛ در حالی که گوگل هم ورودی و هم خروجی را بر اساس توکن دریافت می‌کند. استارتاپ TwelveLabs همچنین مدت‌زمان محاسبه‌شده ویدیو را در تعداد تعاریف بخش‌بندی (Segment) ضرب می‌کند. نرم‌افزارهای متن‌باز نیز همچنان به زیرساخت‌های پردازشی پولی نیاز دارند.

این مقایسه‌ها عملکردی و صرفاً بر اساس توضیحات خود ارائه‌دهندگان بوده و به معنای رتبه‌بندی عملکرد در شرایط مساوی نیست. در بررسی‌های انجام‌شده هنوز شواهدی وجود ندارد که نشان دهد Pegasus 1.6 در کیفیت برچسب‌گذاری، هزینه‌ها یا در نهایت موفقیت عملیاتی ربات از تمام این رویکردها بهتر عمل می‌کند.

با این وجود، لی توسعه‌دهندگان مدل‌های تولیدکننده حرکات فیزیکی را مشتریان و ذی‌نفعان احتمالی خود می‌داند و می‌گوید: «ما به خوبی در لایه‌های مختلف این زنجیره جا می‌گیریم.»

آزمون تجاری اصلی این است که آیا TwelveLabs می‌تواند فرآیند آماده‌سازی ویدیو را آن‌قدر دقیق، مقرون‌به‌صرفه و با ادغام آسان ارائه دهد که این تیم‌ها به جای ساخت ابزار اختصاصی یا رفتن به سراغ جایگزین‌ها، خرید این سرویس را ترجیح دهند یا خیر.

تعرفه‌ها و آن‌چه سازمان‌ها باید قبل از هر چیز آزمایش کنند

استارتاپ TwelveLabs تقریباً همان قیمت توکن‌های خروجی در نسخه قبلی را برای Pegasus 1.6 حفظ کرده است: ۱.۷۵ دلار به ازای هر ساعت ویدیوی ورودی، ۳ دلار به ازای هر میلیون توکن تصویر ورودی، و ۷.۵۰ دلار برای هر میلیون توکن خروجی.

قراردادهای سازمانی از قیمت‌گذاری اختصاصی استفاده می‌کنند و مشتریانی که به دنبال استقرار اختصاصی یا مدیریت‌شده روی سرور‌های خود هستند باید با بخش فروش تماس بگیرند.

با نرخ‌های اعلام‌شده، یک بار پردازش ۱,۰۰۰ ساعت ویدیو پیش از محاسبه هزینه‌های خروجی و سایر موارد، ۱,۷۵۰ دلار آب می‌خورد. برچسب‌گذاری‌های متراکم و پرجزئیات نیز هزینه‌های خروجی را افزایش می‌دهند. استارتاپ TwelveLabs بعد از آن‌که در ابتدا ارقام را روی وب‌سایت عمومی خود دو برابر درج کرده بود، این تعرفه‌های به‌روز و واقعی را تأیید و اصلاح کرد.

در بخش سوالات متداول تعرفه‌ها همچنین آمده است که هر تعریف بخش‌بندی در درخواست‌ها به شکل جداگانه محاسبه می‌شود که در واقع مدت‌زمان ویدیوی ارسال‌شده را در ضرایب چندگانه ضرب می‌کند؛ نکته‌ای بسیار حیاتی و تعیین‌کننده برای تیم‌هایی که چند دسته برچسب‌گذاری هم‌زمان می‌خواهند.

به گفته لی، این شرکت همچنین ممکن است قراردادهای بلندمدت لایسنس و پژوهش‌های سفارشی محدودی با شرکای بزرگ‌تر منعقد کند.

برای سازمان‌هایی که در ابتدای راه ورود به رباتیک هستند، بهترین نقطه شروع می‌تواند یک فرآیند کاری مشخص و محدود باشد؛ مثلاً بسته‌بندی یک کالای خاص یا مونتاژ قطعه‌ای مشخص. اجرای یک پروژه آزمایشی کوچک مشخص می‌کند که آیا ویدیوهای ضبط‌شده جزئیات کافی را دارند، آیا برچسب‌های تولیدشده با نظر متخصصان همخوانی دارند و پیش از آن‌که در سیستم رباتیک استفاده شوند چقدر به اصلاح دستی نیاز خواهند داشت.

این موضوع همچنین به معنای تعیین تکلیف مسائل حقوقی، کسب مجوز برای فیلم‌برداری از کارگران و مراقبت از فرآیندهای انحصاری و محرمانه است. قابلیت تشخیص خودکار تصاویر حساس هرچند به بازبینی کمک می‌کند، اما به خودی خود مجوزی برای ضبط یا آموزش مدل روی این ویدیوها به حساب نمی‌آید.

برای تیم‌هایی که هم‌اکنون با ربات‌ها کار می‌کنند، عیار واقعی در مراحل بعدی مشخص می‌شود: آیا افزودن ویدیوهای برچسب‌خورده توسط Pegasus درصد موفقیت انجام کار را در نمونه‌های جدید ارتقا می‌دهد؟ آیا نیاز به جمع‌آوری داده‌های بیش‌تر را کم‌تر می‌کند یا چرخه‌های توسعه را کوتاه‌تر می‌سازد؟ در کنار سرعت پردازش، باید دقت برچسب‌گذاری، تشخیص دقیق مرز شروع و پایان حرکات و میزان زمانی که انسان‌ها باید صرف اصلاح خطاها کنند نیز بادقت سنجیده شود.

شاخص اقتصادی کلیدی در این میان، هزینه تمام‌شده برای هر نمونه آموزشیِ پذیرفته‌شده و کاربردی است، و در ادامه، سهم آن در بهبود رفتار واقعی ربات. استارتاپ TwelveLabs راهکاری برای سرعت بخشیدن به فاصله میان فیلم‌برداری از یک کار فیزیکی تا یادگیری ربات از آن ارائه داده است؛ اما در نهایت، هر سازمانی باید شخصاً بررسی کند که آیا این داده‌ها واقعاً فرآیندی را که قصد خودکارسازی‌اش را دارد ارتقا می‌دهند یا نه.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!
آخرین اخبار

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!

ابزار امنیتی محبوب VulnHunter که توسط شرکت Capital One توسعه یافته بود، با یک فورک جامعه‌محور تازه از انحصار محیط Claude Code رها شد. این ابزار متن‌باز با رویکرد هکرهای واقعی کدهای پروژه را اسکن می‌کند و حالا توسعه‌دهندگان می‌توانند ایجنت‌ها و اسکیل‌های آن را در هر محیط کدنویسی دلخواهی برای کشف و رفع تضمینی آسیب‌پذیری‌ها به کار بگیرند.

۲ دقیقه مطالعه
۰
۱۴ مهر
متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها
آخرین اخبار

متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها

متا پس از ۹ سال استفاده داخلی، کتابخانه اختصاصی Rebalancer را به‌صورت متن‌باز در اختیار عموم توسعه‌دهندگان قرار داد. این ابزار قدرتمند روزانه بیش از ۴۰ میلیون مسئله پیچیده تخصیص منابع و چیدمان سخت‌افزار را در زیرساخت‌های عظیم این شرکت حل‌وفصل می‌کند. انتشار این پروژه همراه با ابزار بصری Explorer، مدیریت دیتاسنترها و سرور‌های توزیع‌شده را برای تیم‌های فنی متحول خواهد کرد.

۶ دقیقه مطالعه
۰
۱۴ مهر
کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!
آخرین اخبار

کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!

شرکت آنتروپیک نسخه بتای عمومی Claude for Workspace را عرضه کرد تا کاربران بتوانند چت‌بات کلود را مستقیماً داخل گوگل داکس، شیتس و اسلایدز به کار بگیرند. با این قابلیت، بدون نیاز به کپی‌پیست مداوم میان تب‌های مختلف مرورگر، می‌توانید متن‌ها را در لحظه اصلاح کنید، در شیتس فرمول بسازید و اسلایدهای حرفه‌ای طراحی کنید.

۴ دقیقه مطالعه
۰
۱۴ مهر