مدل GPT-6 Astra شرکت OpenAI رانندگی کرد؛ موفقیت شگفتانگیز در اولین آزمایشهای فیزیکی
محققان با استفاده از مدل زبانی GPT-6 Astra شرکت OpenAI موفق به هدایت یک خودروی واقعی در یک پارکینگ شدند. در حالی که سایر مدلهای تجاری در این مسیر شکست خوردند، نماینده OpenAI با سرعت پایین و هزینه پردازشی بالا این آزمایش را به پایان رساند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل GPT-6 Astra از OpenAI توانست یک خودروی واقعی را در یک مسیر آزمایشی با موفقیت هدایت کند، در حالی که مدلهای رقیب در این تست شکست خوردند.
- این آزمایش با مصرف ۶.۶ میلیون توکن و هزینه حدود ۷.۷۴ دلار انجام شد که نشاندهنده هزینه بالای استفاده از مدلهای زبانی عمومی برای رانندگی است.
- برای جلوگیری از امتناع مدلها به دلایل ایمنی، محققان مجبور شدند به آنها بگویند که این تمرین تنها یک «شبیهسازی» است.
- اگرچه سیستمهای تخصصی خودران همچنان برتری دارند، اما مدلهای زبانی عمومی پتانسیل بالایی در درک محیط و استدلال نشان دادهاند.
اگر تاکنون فکر میکردید که آیا یک مدل هوش مصنوعی مولد میتواند با موفقیت یک خودرو را هدایت کند، دیگر نیازی به حدس و گمان نیست: این کار امکانپذیر است، هرچند با هزینهای بالا و سرعتی بسیار پایین، و البته تا زمانی که اتصال اینترنت برقرار باشد.
گروهی از دانشمندان علوم کامپیوتر در حال آزمایش مدلهای تجاری مختلف هوش مصنوعی در جاده بودهاند تا ببینند این سیستمها چقدر در هدایت یک تویوتا کرولا در میان مخروطهای ترافیکی در یک پارکینگ موفق عمل میکنند.
تلاشهای آنها تاکنون، که بخشی از پروژهای به نام DrivingBench است، عملکردهای ضعیفی از مدلهای GPT-5.6 Sol، Grok 4.6 و Claude Fable 5.1 را ثبت کرده است که هیچکدام نتوانستند مسیر را به پایان برسانند.
اکنون بر اساس گزارشهای منتشرشده، مدل GPT-6 Astra شرکت OpenAI موفق شده است در جایی که سایر مدلهای تجاری هوش مصنوعی شکست خوردهاند، پیروز شود. در دومین تلاش، مدل پرچمدار OpenAI توانست یک خودرو را در مسیری به طول ۱۳۴.۷ متر با موفقیت در ۵ دقیقه و ۲۲ ثانیه هدایت کند.
بر اساس گزارش DrivingBench: «مدل GPT-6 Astra تنها مدلی بود که مسیر را به طور کامل (در تلاش دوم، در حدود ۵ دقیقه) به پایان رساند. سومین تلاش Claude Fable 5.1 توانست تقریباً نیمی از مسیر را طی کند، و اولین تلاش Astra نیز به همین میزان پیش رفت. تمام تلاشهای دیگر نتوانستند از اولین پیچ عبور کنند. به طور کلی، دلیل شکست در آن نقطه، مشکل در درک محیط بود: تشخیص اینکه لاین رانندگی در کدام سمت اولین خط قطری از مخروطها قرار دارد.»
برای تکمیل این سفر با سرعت متوسط ۰.۹۴ مایل بر ساعت، محققان برای پردازش ۶.۶ میلیون توکن استنتاجی، مبلغ ۷.۷۴ دلار هزینه کردند.
با احتساب حدود ۱.۱۷ دلار به ازای هر میلیون توکن، این مبلغ نسبت به نرخ رسمی OpenAI که ۱۰ دلار برای ورودی و ۵۰ دلار برای خروجی به ازای هر میلیون توکن است، تخفیف قابل توجهی داشته است.
یکی از محققان این پروژه در توضیح این موضوع گفت: «بخش عمده این کاهش هزینه به دلیل کش (caching) است. از آنجا که در هر پیچ، برنامه چت کل مکالمه (از جمله تصاویر) را دوباره برای مدل ارسال میکند، تقریباً تمام توکنها به عنوان زمینه تکراری محسوب شده و با نرخ ورودی کش شده (۱ دلار به ازای هر میلیون به جای ۱۰ دلار) محاسبه میشوند. مدل در این مکالمات بسیار کم مینوشت (تنها فراخوانی ابزارهای کوچک و چند جمله خروجی/استدلال).»
به این صورتحساب ۷.۷۴ دلاری توکنها، باید ۹۹۹ دلار برای یک دستگاه دستیار راننده متصل به خودرو و لپتاپ که نرمافزار openpilot را اجرا میکند، و همچنین یک گوشی موبایل برای ارتباط با سرورهای میزبان GPT-6 Astra را اضافه کرد.
حتی بدون در نظر گرفتن هزینه سختافزار، استفاده از Astra برای رانندگی، روشی بسیار گرانقیمت خواهد بود؛ حتی اگر بتوان بر خطرات تأخیر شبکه غلبه کرد. طی کردن ۱۳۴.۷ متر با استفاده از ۶.۶ میلیون توکن به قیمت ۷.۷۴ دلار، معادل هزینهای حدود ۹۲.۴۷ دلار به ازای هر مایل است.
برای خودرویی که با هر گالن بنزین ۴.۶۰ دلاری میتواند ۲۵ مایل مسافت را طی کند، هزینه هر مایل حدود ۰.۱۸۴ دلار است. بنابراین هزینه توکنها حدود ۵۰۰ برابر گرانتر از سوخت است (و البته در حالی که با سرعت کمتر از یک مایل بر ساعت حرکت میکنید، باید هزینه بنزین را نیز علاوه بر هزینه پردازش بپردازید).
سپس مسئله هزینه بیمه مطرح میشود که ممکن است راننده هوش مصنوعی شما را تحت پوشش قرار ندهد. و زمانی که خود مدلهای هوش مصنوعی از ایده رانندگی یک خودرو طفره میروند، ممکن است نشانهای برای تجدید نظر در این کار باشد.
در این گزارش آمده است: «برخی از مدلها (بهویژه GPT-6 Astra) گاهی اوقات از رانندگی خودروی فیزیکی به دلایل ایمنی امتناع میکردند (حتی در یک پارکینگ کاملاً خالی، و پس از ارائه تمام تدابیر ایمنی از جمله محدودیتهای سرعت بسیار پایین).»
محققان در واقع مجبور بودند به مدلها دروغ بگویند تا از امتناع آنها به دلایل ایمنی جلوگیری کنند. به عنوان مثال، آنها به مدلها میگفتند که این تمرین یک «شبیهسازی» است، اگرچه به گفته آنها: «در برخی آزمایشها، مدلها تصاویر واقعی را میدیدند و متوجه میشدند که همهچیز واقعی است و شروع به وحشتزدگی میکردند.» محققان دریافتند که بهترین راهحل، تغییر نام سرور به «DrivingBench Sandbox» است که ثابت کرد برای متقاعد کردن مدلها مبنی بر اینکه در جادههای واقعی رانندگی نمیکنند، کافی است.
یکی از محققان اشاره کرد: «استفاده از یک مدل زبانی بزرگ یا مدل پرچمدار به صورت مستقیم برای رانندگی واقعی در حال حاضر قطعاً کاربردی نیست. در بنچمارک ما، سرعت خودرو به شدت محدود شده بود و یک انسان دائماً آماده ترمز گرفتن بود. تأخیر مدل قطعاً یک گلوگاه بود و بیشتر زمان انتظار ناشی از زمان تفکر مدل بود.»
او افزود: «مدل GPT-6 Astra (که بهترین عملکرد را داشت)، هر ۵ تا ۶ ثانیه از ابزار \"مشاهده\" ما (که به نماهای دوربین نگاه میکند) استفاده میکرد. Fable 5.1 در یکی از تلاشهای خود، از ۱۹۰ ثانیه تنها ۳۱ ثانیه رانندگی کرد و بقیه زمان را در حالی که خودرو متوقف بود، صرف تفکر کرد. اما برای ما شگفتانگیز بود که یک مدل همهمنظوره در این شرایط محدود میتواند به هیچ وجه در یک مسیر واقعی رانندگی کند.»
به گفته این محقق، در حال حاضر و در آینده نزدیک، مدلهای تخصصی رانندگی که هماکنون در خودروهای خودران استفاده میشوند، همچنان در اولویت خواهند بود. او تأکید کرد که مدلهای پرچمدار بزرگ مانند GPT-6 Astra همچنان برای پردازش به پردازندههای گرافیکی دیتاسنترها نیاز خواهند داشت، اگرچه فناوری به سرعت در حال تغییر است و مدلهای کوچکتر نیز در حال قدرتمندتر شدن هستند.
او توضیح داد: «یک مسیر احتمالی در درازمدت میتواند آموزش یک مدل پرچمدار عمومی بسیار توانمند و سپس تقطیر آن به یک مدل تخصصی کوچکتر باشد که روی سختافزار خودرو جا بگیرد و به اندازه کافی برای اجرا در یک خودرو کارآمد باشد. این روش میتواند بهتر از ساخت یک مدل تخصصی از ابتدا باشد و بیشتر با مفهوم \"درس تلخ\" در هوش مصنوعی همخوانی دارد.»
\"درس تلخ\" یک مقاله تأثیرگذار در حوزه هوش مصنوعی است که استدلال میکند روشهای تحقیقاتی عمومی در این زمینه که به کاهش هزینه توان محاسباتی متکی هستند، معمولاً مؤثرترین روشها به شمار میروند.
این محقق افزود: «نتایج ما نیز به همین جهت اشاره دارد (مدلهایی که آزمایش کردیم احتمالاً برای رانندگی خودروهای واقعی آموزش ندیده بودند و برخی از آنها همچنان توانستند در مسیر و شرایط ما عملکرد بسیار خوبی داشته باشند، که این امر ناشی از تواناییهای عمومی آنها در درک، استدلال، برنامهریزی و کنترل به دلیل مقیاسپذیری و آموزش در وظایف دیگر است). با این حال، در آینده نزدیک، سیستمهای تخصصی به دلیل سرعت بیشتر، هزینه کمتر و آزمایشهای گستردهتر در دنیای واقعی، احتمالاً همچنان پیروز میدان خواهند بود.»
شرکتهایی مانند Google که سرمایهگذاریهای عظیمی در پروژههای خودروهای خودران انجام دادهاند، احتمالاً تا چند سال آینده به تجهیز وسایل نقلیه خود با فناوریهای سفارشی ادامه خواهند داد.
اما سپردن رانندگی به Claude، ChatGPT یا Copilot با استفاده از برخی سختافزارهای نسبتاً ساده در داخل خودرو، ممکن است در آیندهای نه چندان دور به واقعیت بپیوندد. فقط کافی است به مدل بگویید که همهچیز یک شبیهسازی است.
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.