پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار هوش مصنوعی ERA گوگل؛ شکست ۳۹ تیم در چالش پیش‌بینی آنفلوآنزا برای CDC

انتشار:۹ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

سیستم هوش مصنوعی ERA گوگل با تکیه بر تولید و آزمایش خودکار کدهای علمی، موفق شد در ارزیابی فصلی سازمان CDC آمریکا رتبه نخست پیش‌بینی بستری‌های آنفلوآنزا را میان ۳۹ تیم مدعی کسب کند. این مدل که صفر تا صد الگوریتم‌هایش با جست‌وجوی درختی توسط هوش مصنوعی بهینه‌سازی شده، قدرت خیره‌کننده کدنویسی هوشمند در حل مسائل پیچیده همه‌گیرشناسی را به نمایش می‌گذارد.

شاهکار هوش مصنوعی ERA گوگل؛ شکست ۳۹ تیم در چالش پیش‌بینی آنفلوآنزا برای CDC

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل Google_SAI-FluEns که با سیستم تحقیقاتی ERA گوگل توسعه یافته، موفق شد میان ۳۹ تیم مطرح دانشگاهی و دولتی، رتبه اول پیش‌بینی هفتگی آنفلوآنزا در ارزیابی معتبر سازمان CDC آمریکا را از آن خود کند.
  • نکته شگفت‌انگیز ماجرا اینجاست که پژوهشگران فقط صورت مسئله و داده‌ها را مشخص کردند و هوش مصنوعی با ترکیب مدل‌های زبانی و جست‌وجوی درختی، کد الگوریتم‌ها را خودکار نوشته، تست کرده و ارتقا داده است.
  • با وجود این پیروزی چشمگیر، مدل‌های پیش‌بینی درست در روز‌های اوج شیوع و چرخش‌های ناگهانی بیماری با افت شدید دقت روبه‌رو شدند و گوگل نیز دسترسی به ERA را همچنان محدود نگه داشته است.

صدرنشینی مدل پیش‌بینی آنفلوآنزای گوگل در ارزیابی معتبر CDC

بر اساس گزارش منتشرشده از سوی گوگل و گزارش‌های تحلیلی مستقل، مدل هوش مصنوعی Google_SAI-FluEns توانست در ارزیابی گذشته‌نگر FluSight سازمان CDC برای فصل ۲۰۲۵-۲۰۲۶، میان ۳۹ تیم مدعی و واجد شرایط، جایگاه اول را فتح کند. این مدل پیشرفته، آمار بستری‌های هفتگی ناشی از آنفلوآنزا را برای تک‌تک ایالت‌های آمریکا، هم برای هفته جاری و هم تا سه هفته بعد پیش‌بینی می‌کرد.

جالب اینجاست که نرم‌افزار پشت این مدل، حاصل دسترنج ابزاری به نام «دستیار پژوهش‌های تجربی» یا ERA (مخفف Empirical Research Assistance) است که کدها را به شکل خودکار تولید کرده و قدم‌به‌قدم صیقل داده است. ماجرا از این قرار بود که پژوهشگران گوگل فقط صورت مسئله، داده‌ها و معیار ارزیابی دقت را مشخص کردند؛ سپس سیستم ERA با تکیه بر یک مدل زبانی بزرگ و روش جست‌وجوی درختی (Tree Search)، برنامه‌های کاندید را یکی پس از دیگری نوشت و آزمود. این دستاورد یک آزمون عمومی واقعی برای سنجش عیار کدهای علمی تولیدشده توسط هوش مصنوعی بود؛ آن هم درست زیر ذره‌بین همان قوانینی که برای ارزیابی تیم‌های دولتی، دانشگاهی و شرکت‌های بزرگ تجاری اعمال می‌شود.

نتیجه
کسب رتبه نخست میان ۳۹ تیم واجد شرایط
فصل ارزیابی
فصل ۲۰۲۵-۲۰۲۶ چالش FluSight
هدف پیش‌بینی
آمار هفتگی بستری‌های بیمارستانی آنفلوآنزا در سطح ایالتی
افق زمانی
هفته جاری تا سه هفته آینده
معیار امتیازدهی
امتیاز بازه‌ای وزنی (WIS) روی داده‌های لگاریتمی
دسترسی به ERA
تنها برای تسترها و پژوهشگران معتمد (فاقد API عمومی)

راز امتیازدهی و نحوه تعیین رتبه‌ها

چالش FluSight که سابقه طولانی در سازمان کنترل و پیشگیری از بیماری‌های آمریکا (CDC) دارد، هر سال از ماه اکتبر تا مه، پیش‌بینی‌های هفتگی تیم‌های مختلف را درباره بیماری‌های تنفسی جمع‌آوری می‌کند. هدف این است که تخمین درستی از بار مراجعات و بستری‌های بیمارستانی در بازه‌های زمانی مختلف به دست آید و در نهایت، مرکز CDC با ترکیب تمام این پیش‌بینی‌ها در قالب یک «مدل گروهی» (Ensemble)، به بیمارستان‌های ایالتی برای برنامه‌ریزی تخت‌ها و تجهیزات کمک کند.

سازمان CDC بعد از ثبت آمار‌های واقعی بستری، پیش‌بینی‌ها را با معیاری به نام «امتیاز بازه‌ای وزنی» یا WIS (روی مقادیر با تبدیل لگاریتمی) نمره‌دهی می‌کند. فرمول این معیار هوشمندانه است: اگر بازه احتمالی پیش‌بینی‌شده باریک و دقیق باشد و عدد واقعی در آن بیفتد، مدل بالا‌ترین پاداش را می‌گیرد؛ اما اگر بازه‌ها بی‌دلیل خیلی عریض باشند یا عدد واقعی کاملاً خارج از بازه بیفتد، مدل حسابی جریمه می‌شود. به زبان ساده، این سیستم هم‌زمان دقت و میزان قطعیت پیش‌بینی را می‌سنجد و مقیاس لگاریتمی هم باعث می‌شود مقایسه خطاها میان ایالت‌های پرجمعیت و کم‌جمعیت کاملاً منصفانه باشد.

سیستم ERA چطور کد می‌زند و آن را می‌آزماید؟

ابزار ERA به فرآیند مدل‌سازی علمی به چشم یک مسئله «جست‌وجوی برنامه» نگاه می‌کند. داستان به این شکل پیش می‌رود که یک مدل زبانی، الگوریتم‌های کاندید را پیشنهاد می‌دهد، هر الگوریتم با داده‌های ایزوله‌شده‌ای که در آموزش نقشی نداشته‌اند تست می‌شود و یک معیار مشخص، کیفیت کارش را می‌سنجد. به جای اینکه فقط به یک تک‌کد جنریت‌شده اکتفا شود، الگوریتم جست‌وجوی درختی (Tree Search) مسیرهای امیدوارکننده را نگه می‌دارد، آنها را دستکاری و اصلاح می‌کند و شاخه‌های جدیدشان را در چند راند پیاپی گسترش می‌دهد تا به بهترین نتیجه برسد.

گوگل ارسال پیش‌بینی‌های خلق‌شده توسط ERA به چالش FluSight را درست از آغاز مسابقات در نوامبر ۲۰۲۵ کلید زد. البته بلندپروازی اهالی مانتین‌ویو به همین‌جا ختم نمی‌شود؛ آنها از این سیستم برای پیش‌بینی مداوم بستری‌های کووید-۱۹ و پایش ویروس سین‌سیشیال تنفسی (RSV) نیز بهره می‌برند. گوگل در مقاله مفصلی که در نشریه معتبر نیچر (Nature) چاپ کرده، توضیح داده که این فناوری پتانسیل‌های شگفت‌انگیزی در همه‌گیرشناسی و تحلیل‌های داده‌های مکانی دارد.

روز‌های اوج بحران؛ پاشنه آشیل سیستم پیش‌بینی

سازمان CDC در ارزیابی‌های اولیه، فصل آنفلوآنزای ۲۰۲۵-۲۰۲۶ را یک دوره معتدل طبقه‌بندی کرده بود. با این حال، ورودی هفتگی بیماران به بیمارستان‌ها در نقطه اوج خود از مرز ۴۰ هزار نفر عبور کرد؛ روندی که از اواسط نوامبر اوج گرفت و درست در هفته منتهی به ۲۷ دسامبر به بیش‌ترین میزان خود رسید.

اما جالب اینجاست که مدل گروهی تجمیعی CDC درست در مواجهه با تندترین پیچ‌ها و چرخش‌های ناگهانی فصل به تپ‌تپ افتاد! بازه‌های پیش‌بینی ۵۰ و ۹۵ درصدی این مدل اصلاً نتوانستند جهش ناگهانی اواخر دسامبر و سقوط سریع آمار‌ها در اواسط ژانویه را حدس بزنند. در روز‌های اوج شیوع، کم‌تر از ۲۵ درصد پیش‌بینی‌های مربوط به دو هفته آینده با واقعیت همخوانی داشت؛ وضعیتی که البته از ابتدای فوریه ۲۰۲۶ فروکش کرد و دقت مدل دوباره به مرز ۹۵ درصد برگشت.

البته این آمار کلی مدل تجمیعی است و نمی‌توان عملکرد اختصاصی مدل Google_SAI-FluEns را به شکل مجزا در نقطه پیک تفکیک کرد؛ اما این ماجرا نشان داد که آسیب‌پذیرترین نقطه سیستم‌های پیش‌بینی درست در لحظات چرخش ناگهانی رخ می‌دهد؛ یعنی درست همان زمانی که بیمارستان‌ها برای شیفت‌بندی پرسنل و ظرفیت تخت‌ها، بیش‌ترین نیاز را به پیش‌بینی‌های دقیق دارند.

یک فصل موفق چه چیزی را ثابت می‌کند؟

کسب مدال طلای این رقابت در چارچوب یک سیستم داوری عمومی و شفاف ثابت کرد که روش جست‌وجوی خودکار برنامه می‌تواند کدهایی فوق‌العاده رقابتی برای مدل‌سازی بیماری‌ها خلق کند. با این حال، هنوز پرسش‌های بی‌پاسخ زیادی روی میز باقی مانده است:

  • فاصله امتیازی برنده: گوگل هنوز اختلاف امتیاز میان مدل خود و تیم دوم را اعلام نکرده است؛ بنابراین مشخص نیست پیروزی با فاصله‌ای شکننده به دست آمده یا برتری کاملاً قاطع بوده است.
  • تعمیم‌پذیری به شرایط جدید: درخشش در یک فصل و برای یک بیماری خاص، مدرک کافی برای عملکرد بی‌نقص مدل روی سایر پاتوژن‌ها، مناطق جغرافیایی و فصل‌های آینده به حساب نمی‌آید.
  • لحظات حساس و نقاط عطف: هرچند آمار‌های کلی ارائه‌شده از ضعف مدل‌ها در روز‌های پیک خبر می‌دهند، اما هنوز پوشش بازه‌ای اختصاصی مدل برنده گوگل در این بازه‌های بحرانی منتشر نشده است.
  • امکان بازتولید نتایج (Reproducibility): سیستم ERA هیچ رابط برنامه‌نویسی کاربردی (API) عمومی ندارد و همین مسئله مانع از آن می‌شود که محققان مستقل بتوانند فرآیند جست‌وجوی برنامه آن را بازتولید یا راستی‌آزمایی کنند.
  • استفاده مجدد در سناریوهای دیگر: به‌کارگیری این سیستم در رصد کووید-۱۹ و ویروس RSV این فرصت را به دانشمندان می‌دهد تا این متدولوژی هوش مصنوعی را در محیط‌های متنوع‌تری بسنجند.

دسترسی همچنان پشت درهای بسته

توسعه‌دهندگان در حال حاضر برای دسترسی به فناوری ERA به تأییدیه مستقیم نیاز دارند، چرا که گوگل این سرویس را صرفاً به عنوان یک طرح آزمایشی برای تسترها و محققان منتخب از طریق Google Labs ارائه می‌دهد. هدف فعلی گوگل همکاری‌های دانشگاهی و پژوهشی است نه عرضه تجاری به توسعه‌دهندگان عمومی. با این همه، مقاله پژوهشگران گوگل در نشریه نیچر کامل‌ترین جزئیات فنی را درباره چرخه ترکیب مدل‌های زبانی و جست‌وجوی درختی تشریح کرده است.

الگوی پیشنهادی برای یک پکیج ارزیابی استاندارد

  • تعریف دقیق هدف: مشخص کردن یک سنجه عددی شفاف که بتواند برنامه‌های جنریت‌شده را به صورت یکپارچه و عادلانه رتبه‌بندی کند.
  • جداسازی داده‌ها: کنار گذاشتن بخشی از مشاهدات تاریخی برای فاز سنجش نهایی، تا برنامه‌های کاندید روی داده‌های کاملاً جدید و دست‌نخورده ارزیابی شوند.
  • تعیین مدل‌های پایه (Baselines): تعریف متدهای موجود و نمرات آنها به عنوان خط مبنا، تا امکان مقایسه‌ای معنادار و ملموس فراهم شود.
  • مشخص‌سازی محدودیت‌ها: تعیین پیش‌شرط‌هایی مثل مدت‌زمان اجرا، نحوه دسترسی به دیتا، شفافیت و تفسیرپذیری کد و الزامات استقرار، پیش از شروع فرآیند جست‌وجوی هوشمند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دردسر تازه در اوپن‌ای‌آی؛ اخراج جنجالی سه پژوهشگر ایمنی به اتهام درز اطلاعات محرمانه
آخرین اخبار

دردسر تازه در اوپن‌ای‌آی؛ اخراج جنجالی سه پژوهشگر ایمنی به اتهام درز اطلاعات محرمانه

اوپن‌ای‌آی در پی یک تحقیق داخلی، سه پژوهشگر تیم ایمنی خود را به اتهام افشای اطلاعات محرمانه شرکت اخراج کرد. این تصمیم در حالی گرفته شده که انتقادها از کم‌توجهی این غول فناوری به مسائل امنیتی بالا گرفته و اخیراً حتی عرضه مدل GPT-6.1 Astra نیز به دلیل ریسک‌های ایمنی متوقف شده است.

۲ دقیقه مطالعه
۰
۹ مهر
تکیه‌کلام‌هایی که دست هوش مصنوعی را رو می‌کنند؛ افشای تیک‌های نگارشی Opus 5.5 و مدل‌های پیشرو
آخرین اخبار

تکیه‌کلام‌هایی که دست هوش مصنوعی را رو می‌کنند؛ افشای تیک‌های نگارشی Opus 5.5 و مدل‌های پیشرو

پژوهش جدید شرکت گرافیت نشان می‌دهد مدل‌های هوش مصنوعی با وجود پیشرفت چشمگیر، هنوز تکیه‌کلام‌ها و ساختارهای نگارشی تکراری دارند که دستشان را رو می‌کند. از علاقه افراطی مدل Opus 5.5 به تکرار عبارت «این موضوع اهمیت دارد» تا ترفندهای مدل‌های OpenAI، هر نسخه با الگوهای منحصربه‌فردی نوشته‌های ماشینی را لو می‌دهد.

۴ دقیقه مطالعه
۰
۹ مهر
بی‌خیال آخرالزمان هوش مصنوعی؛ خطر واقعی تنبلی ما در رعایت امنیت پایه است!
آخرین اخبار

بی‌خیال آخرالزمان هوش مصنوعی؛ خطر واقعی تنبلی ما در رعایت امنیت پایه است!

در حالی که خبرهای هولناک از نفوذ خودسرانه ایجنت‌های هوش مصنوعی سرتیتر رسانه‌ها شده، متخصصان ارشد امنیت سایبری در کنفرانس HumanX یادآور می‌شوند که بزرگ‌ترین تهدید نه هوش ماشین‌ها، بلکه تنبلی خودمان در رعایت اصول پایه امنیت است. به گفته این کارشناسان، شرکت‌ها به جای وحشت از سناریوهای تخیلی آخرالزمانی، باید روی بستن رخنه‌های پیش‌پاافتاده، فعال‌سازی احراز هویت چندمرحله‌ای و کنترل دسترسی ایجنت‌ها تمرکز کنند.

۵ دقیقه مطالعه
۰
۹ مهر