پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

دست‌فرمان مدل GPT-6 Astra پشت تویوتای واقعی؛ وقتی گراک بعد از دو فرمان تصادف کرد!

انتشار:۱۴ مهر ۱۴۰۵(۲ ساعت پیش)
۳ دقیقه زمان مطالعه
۰ دیدگاه

پژوهشگران در آزمایشی جذاب و کم‌سابقه، کنترل یک تویوتای واقعی را به مدل‌های زبانی سپردند تا دست‌فرمان آن‌ها را در یک مسیر پر از مانع محک بزنند. در این چالش، مدل GPT-6 Astra موفق شد مسیر ۱۳۴ متری را تا انتها طی کند، اما مدل‌هایی مثل گراک و کلود خیلی زود با موانع برخورد کردند یا از مسیر خارج شدند. این بررسی نشان داد که میان پاسخگویی متنی بی‌نقص و هدایت ایمن یک وسیله در دنیای فیزیکی، هنوز فاصله‌ای طولانی وجود دارد.

دست‌فرمان مدل GPT-6 Astra پشت تویوتای واقعی؛ وقتی گراک بعد از دو فرمان تصادف کرد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • در بنچمارک جدید DrivingBench، برای اولین بار چهار مدل هوش مصنوعی پیشگام کنترل مستقیم یک خودروی تویوتا کرولا واقعی را در پیست موانع به دست گرفتند.
  • تنها مدلی که موفق شد کل مسیر ۱۳۴ متری را پشت سر بگذارد GPT-6 Astra بود؛ در حالی که مدل Grok 4.6 تنها پس از دو فرمان مسیر را اشتباه گرفت و تصادف کرد و کلود هم نتوانست نیمی از مسیر را برود.
  • این آزمایش نشان داد درک زبانی فوق‌العاده لزوماً به مهارت فیزیکی ختم نمی‌شود؛ به ویژه که تأخیر ارسال اینترنتی داده‌ها و ضعف در استدلال فضایی، رانندگی را برای این ایجنت‌ها بسیار دشوار کرده است.

مدل GPT-6 Astra موفق شد یک مسیر ۱۳۴.۷ متری چیده‌شده با موانع مخروطی را پشت فرمان تویوتا کرولا طی کند، در حالی که مدل Grok 4.6 تنها پس از دو فرمان از ادامه کار بازماند.

مدل GPT-6 Astra توانست یک خودروی واقعی را در محوطه پارکینگ هدایت کرده و مسیر ۱۳۴.۷ متری پر از مانع را در ۵ دقیقه و ۲۲ ثانیه به پایان برساند؛ آن هم در شرایطی که سه مدل رقیب حتی پیش از رسیدن به پیچ اول شکست خوردند. اما این اتفاق در عمل چه پیامی دارد؟

بنچمارک DrivingBench که توسط جمعی از پژوهشگران به نام‌های آدیتیا رامابادران، سایمون مانس و توبیاس گسلر طراحی شده، یکی از اولین تلاش‌های ساختاریافته برای سنجش این است که آیا ایجنت‌های هوش مصنوعی همه‌منظوره به جز پاسخگویی روان، توانایی کنترل فیزیکی در دنیای واقعی را هم دارند یا خیر.

در این آزمایش دقیقاً چه چیزی سنجیده شد؟

چهار مدل پیشگام هوش مصنوعی به یک تویوتای واقعی متصل شدند، کنترل خودرو به آن‌ها واگذار شد و مأموریت یافتند یک مسیر ساده مشخص‌شده با مخروط‌های ترافیکی را طی کنند.

محققان مدل‌های GPT-6 Astra، GPT-5.6 Sol، Claude Fable 5.1 و Grok 4.6 را به یک خودروی تویوتا کرولا ۲۰۲۲ متصل کردند. این خودرو به سخت‌افزار Comma Four و نرم‌افزار کنترلی openpilot مجهز شده بود.

هر مدل تصاویر زنده دوربین و داده‌های تله‌متری خودرو را دریافت می‌کرد و سپس فرمان‌های چرخش فرمان، شتاب‌گیری و ترمز را از طریق اتصال بی‌سیم به دیتاسنترهای راه دور می‌فرستاد. مدل در هر مرحله مشاهدات و تصمیمات خود را نیز به صورت متنی روایت می‌کرد.

این اتصال بی‌سیم نقش بسیار مهمی داشت؛ از آنجا که تک‌تک فرمان‌ها باید تا دیتاسنتر می‌رفتند و برمی‌گشتند، خودرو وسط مانورها مدام متوقف می‌شد تا دستور بعدی برسد؛ رفتاری که کاملاً برخلاف طراحی سیستم‌های اختصاصی خودروهای خودران است.

تصویری از روند اجرای آزمایش DrivingBench در کنار مکالمات مدل GPT-6 Astra که نحوه پردازش و تصمیم‌گیری هوش مصنوعی برای مسیریابی را نشان می‌دهد.

چه مدلی به خط پایان رسید و چه مدل‌هایی ناکام ماندند؟

از مجموع ۱۱ بار آزمایش روی این چهار مدل، فقط یک بار خودرو موفق شد مسیر را به پایان برساند.

مدل Astra تنها مدلی بود که توانست به خط پایان برسد، آن هم در دومین تلاش خود. مسیر حرکت آن در یک پیچ طولانی راست‌گرد بیش از حد به کناره چسبید و نزدیک خط پایان هم چیزی نمانده بود از مسیر خارج شود، اما در نهایت کار را تمام کرد.

مدل Claude Fable 5.1 در بهترین حالت به حدود ۴۵ درصد از مسیر رسید. مدل Grok 4.6 فقط به حدود ۱۱ درصد مسیر دست یافت؛ به طوری که در تلاش اول تنها پس از دو فرمان متوقف شد، چون فاصله خالی میان دو مخروط را به اشتباه دروازه ورود دید و مستقیم به سمت آن گاز داد! مدل GPT-5.6 Sol هم تنها توانست حدود ۶ درصد مسیر را پیش برود.

بررسی ارقام و هزینه‌ها ماجرا را ملموس‌تر می‌کند؛ دور موفق Astra حدود ۶.۶ میلیون توکن مصرف کرد و ۷.۷۴ دلار هزینه داشت؛ یعنی تقریباً چهار برابر هزینه تلاش قبلی‌اش که نیمی از مسافت را طی کرده بود.

کنترل یک وسیله فیزیکی به کمک یک مدل زبانی، اصلاً شبیه مسیریابی ساده نیست؛ بیش‌تر شبیه این است که روی صندلی عقب ماشین بنشینید و قدم‌به‌قدم برای دوست‌تان پیامک بفرستید که کجا بپیچد، آن هم در حالی که بین هر پیامک تأخیری کلافه‌کننده وجود دارد!

ناکامی‌ها چه رازهایی را برملا کردند؟

استدلال کلامی روان و کنترل مطمئن یک وسیله فیزیکی، دو مهارت کاملاً متفاوت از آب درآمدند.

خطاهای مدل‌ها فراتر از کج‌فهمی ساده دستورالعمل‌ها بود. مدل‌ها در استدلال فضایی دست‌وپا می‌زدند؛ به خصوص در تبدیل تصمیمِ پیچیدن به زاویه دقیق گردش فرمان. حتی یکی از مدل‌های GPT برای خودش یک قانون من‌درآوردی درباره رنگ مخروط‌ها ساخت؛ قانونی که دقیقاً خلاف دستورات اولیه بود!

کنترل حلقه بسته (Closed-loop) عمیق‌ترین چالش را نشان داد: چرخه مداومِ دیدن وضعیت خودرو، واکنش نشان دادن و تصحیح مسیر بر اساس خروجی قبلی، نشان داد که تولید روان کلمات چقدر بد به حرکات پیوسته فیزیکی تبدیل می‌شود.

صحنه جالبی که در این آزمایش دیده می‌شود این است: مدل به طور دقیق و شمرده هرچه را می‌بیند شرح می‌دهد، در حالی که خودرو دقیقاً در جهتی اشتباه دارد منحرف می‌شود!

پروژه DrivingBench مدل‌ها را در برابر سیستم‌های تجاری خودران نسنجیده است؛ سیستم‌هایی که ادراکات تخصصی، موقعیت‌یابی دقیق، پیش‌بینی رفتار، برنامه‌ریزی و معماری چندلایه ایمنی را در هم می‌آمیزند. این پژوهش ایجنت‌های هوش مصنوعی همه‌منظوره را با یک سازوکار آزمایشی به خودرو متصل کرده بود و درک این تمایز برای تفسیر درست نتایج ضروری است.

نتیجه‌گیری پایانی

یک دور رانندگی در پارکینگ آزمون جاده‌ای نیست، اما روش‌شناسی پشت آن ارزش پیگیری دارد.

یک دور حرکت موفق با سرعت پایین هرگز مهارت کامل در رانندگی، تکرارپذیری یا آمادگی برای حضور در جاده‌های عمومی را ثابت نمی‌کند. اما این آزمایش نشان داد که در ارزیابی‌های آینده، احتمالاً کم‌تر از مدل‌ها سوالات متنی پرسیده می‌شود و بیش‌تر توانایی آن‌ها در حل چالش‌های دنیای فیزیکی به آزمون گذاشته خواهد شد. شکاف عمیق میان «توضیح دادن آنچه می‌بینید» و «کنترل ایمن آنچه لمس می‌کنید» هنوز به قوت خود باقی است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!
آخرین اخبار

ابزار امنیتی VulnHunter از انحصار کلود آزاد شد: شکار هوشمند باگ‌ها در هر محیط کدنویسی!

ابزار امنیتی محبوب VulnHunter که توسط شرکت Capital One توسعه یافته بود، با یک فورک جامعه‌محور تازه از انحصار محیط Claude Code رها شد. این ابزار متن‌باز با رویکرد هکرهای واقعی کدهای پروژه را اسکن می‌کند و حالا توسعه‌دهندگان می‌توانند ایجنت‌ها و اسکیل‌های آن را در هر محیط کدنویسی دلخواهی برای کشف و رفع تضمینی آسیب‌پذیری‌ها به کار بگیرند.

۲ دقیقه مطالعه
۰
۱۴ مهر
متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها
آخرین اخبار

متا ابزار Rebalancer را متن‌باز کرد؛ حل روزانه ۴۰ میلیون معمای زیرساختی در دیتاسنترها

متا پس از ۹ سال استفاده داخلی، کتابخانه اختصاصی Rebalancer را به‌صورت متن‌باز در اختیار عموم توسعه‌دهندگان قرار داد. این ابزار قدرتمند روزانه بیش از ۴۰ میلیون مسئله پیچیده تخصیص منابع و چیدمان سخت‌افزار را در زیرساخت‌های عظیم این شرکت حل‌وفصل می‌کند. انتشار این پروژه همراه با ابزار بصری Explorer، مدیریت دیتاسنترها و سرور‌های توزیع‌شده را برای تیم‌های فنی متحول خواهد کرد.

۶ دقیقه مطالعه
۰
۱۴ مهر
کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!
آخرین اخبار

کلود آنتروپیک وارد گوگل داکس و شیتس شد؛ ویرایش مستقیم اسناد بدون نیاز به کپی‌پیست!

شرکت آنتروپیک نسخه بتای عمومی Claude for Workspace را عرضه کرد تا کاربران بتوانند چت‌بات کلود را مستقیماً داخل گوگل داکس، شیتس و اسلایدز به کار بگیرند. با این قابلیت، بدون نیاز به کپی‌پیست مداوم میان تب‌های مختلف مرورگر، می‌توانید متن‌ها را در لحظه اصلاح کنید، در شیتس فرمول بسازید و اسلایدهای حرفه‌ای طراحی کنید.

۴ دقیقه مطالعه
۰
۱۴ مهر