شاهکار هوش مصنوعی ERA گوگل؛ شکست ۳۹ تیم در چالش پیشبینی آنفلوآنزا برای CDC
سیستم هوش مصنوعی ERA گوگل با تکیه بر تولید و آزمایش خودکار کدهای علمی، موفق شد در ارزیابی فصلی سازمان CDC آمریکا رتبه نخست پیشبینی بستریهای آنفلوآنزا را میان ۳۹ تیم مدعی کسب کند. این مدل که صفر تا صد الگوریتمهایش با جستوجوی درختی توسط هوش مصنوعی بهینهسازی شده، قدرت خیرهکننده کدنویسی هوشمند در حل مسائل پیچیده همهگیرشناسی را به نمایش میگذارد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل Google_SAI-FluEns که با سیستم تحقیقاتی ERA گوگل توسعه یافته، موفق شد میان ۳۹ تیم مطرح دانشگاهی و دولتی، رتبه اول پیشبینی هفتگی آنفلوآنزا در ارزیابی معتبر سازمان CDC آمریکا را از آن خود کند.
- نکته شگفتانگیز ماجرا اینجاست که پژوهشگران فقط صورت مسئله و دادهها را مشخص کردند و هوش مصنوعی با ترکیب مدلهای زبانی و جستوجوی درختی، کد الگوریتمها را خودکار نوشته، تست کرده و ارتقا داده است.
- با وجود این پیروزی چشمگیر، مدلهای پیشبینی درست در روزهای اوج شیوع و چرخشهای ناگهانی بیماری با افت شدید دقت روبهرو شدند و گوگل نیز دسترسی به ERA را همچنان محدود نگه داشته است.
صدرنشینی مدل پیشبینی آنفلوآنزای گوگل در ارزیابی معتبر CDC
بر اساس گزارش منتشرشده از سوی گوگل و گزارشهای تحلیلی مستقل، مدل هوش مصنوعی Google_SAI-FluEns توانست در ارزیابی گذشتهنگر FluSight سازمان CDC برای فصل ۲۰۲۵-۲۰۲۶، میان ۳۹ تیم مدعی و واجد شرایط، جایگاه اول را فتح کند. این مدل پیشرفته، آمار بستریهای هفتگی ناشی از آنفلوآنزا را برای تکتک ایالتهای آمریکا، هم برای هفته جاری و هم تا سه هفته بعد پیشبینی میکرد.
جالب اینجاست که نرمافزار پشت این مدل، حاصل دسترنج ابزاری به نام «دستیار پژوهشهای تجربی» یا ERA (مخفف Empirical Research Assistance) است که کدها را به شکل خودکار تولید کرده و قدمبهقدم صیقل داده است. ماجرا از این قرار بود که پژوهشگران گوگل فقط صورت مسئله، دادهها و معیار ارزیابی دقت را مشخص کردند؛ سپس سیستم ERA با تکیه بر یک مدل زبانی بزرگ و روش جستوجوی درختی (Tree Search)، برنامههای کاندید را یکی پس از دیگری نوشت و آزمود. این دستاورد یک آزمون عمومی واقعی برای سنجش عیار کدهای علمی تولیدشده توسط هوش مصنوعی بود؛ آن هم درست زیر ذرهبین همان قوانینی که برای ارزیابی تیمهای دولتی، دانشگاهی و شرکتهای بزرگ تجاری اعمال میشود.
نتیجه | کسب رتبه نخست میان ۳۹ تیم واجد شرایط |
|---|---|
فصل ارزیابی | فصل ۲۰۲۵-۲۰۲۶ چالش FluSight |
هدف پیشبینی | آمار هفتگی بستریهای بیمارستانی آنفلوآنزا در سطح ایالتی |
افق زمانی | هفته جاری تا سه هفته آینده |
معیار امتیازدهی | امتیاز بازهای وزنی (WIS) روی دادههای لگاریتمی |
دسترسی به ERA | تنها برای تسترها و پژوهشگران معتمد (فاقد API عمومی) |
راز امتیازدهی و نحوه تعیین رتبهها
چالش FluSight که سابقه طولانی در سازمان کنترل و پیشگیری از بیماریهای آمریکا (CDC) دارد، هر سال از ماه اکتبر تا مه، پیشبینیهای هفتگی تیمهای مختلف را درباره بیماریهای تنفسی جمعآوری میکند. هدف این است که تخمین درستی از بار مراجعات و بستریهای بیمارستانی در بازههای زمانی مختلف به دست آید و در نهایت، مرکز CDC با ترکیب تمام این پیشبینیها در قالب یک «مدل گروهی» (Ensemble)، به بیمارستانهای ایالتی برای برنامهریزی تختها و تجهیزات کمک کند.
سازمان CDC بعد از ثبت آمارهای واقعی بستری، پیشبینیها را با معیاری به نام «امتیاز بازهای وزنی» یا WIS (روی مقادیر با تبدیل لگاریتمی) نمرهدهی میکند. فرمول این معیار هوشمندانه است: اگر بازه احتمالی پیشبینیشده باریک و دقیق باشد و عدد واقعی در آن بیفتد، مدل بالاترین پاداش را میگیرد؛ اما اگر بازهها بیدلیل خیلی عریض باشند یا عدد واقعی کاملاً خارج از بازه بیفتد، مدل حسابی جریمه میشود. به زبان ساده، این سیستم همزمان دقت و میزان قطعیت پیشبینی را میسنجد و مقیاس لگاریتمی هم باعث میشود مقایسه خطاها میان ایالتهای پرجمعیت و کمجمعیت کاملاً منصفانه باشد.
سیستم ERA چطور کد میزند و آن را میآزماید؟
ابزار ERA به فرآیند مدلسازی علمی به چشم یک مسئله «جستوجوی برنامه» نگاه میکند. داستان به این شکل پیش میرود که یک مدل زبانی، الگوریتمهای کاندید را پیشنهاد میدهد، هر الگوریتم با دادههای ایزولهشدهای که در آموزش نقشی نداشتهاند تست میشود و یک معیار مشخص، کیفیت کارش را میسنجد. به جای اینکه فقط به یک تککد جنریتشده اکتفا شود، الگوریتم جستوجوی درختی (Tree Search) مسیرهای امیدوارکننده را نگه میدارد، آنها را دستکاری و اصلاح میکند و شاخههای جدیدشان را در چند راند پیاپی گسترش میدهد تا به بهترین نتیجه برسد.
گوگل ارسال پیشبینیهای خلقشده توسط ERA به چالش FluSight را درست از آغاز مسابقات در نوامبر ۲۰۲۵ کلید زد. البته بلندپروازی اهالی مانتینویو به همینجا ختم نمیشود؛ آنها از این سیستم برای پیشبینی مداوم بستریهای کووید-۱۹ و پایش ویروس سینسیشیال تنفسی (RSV) نیز بهره میبرند. گوگل در مقاله مفصلی که در نشریه معتبر نیچر (Nature) چاپ کرده، توضیح داده که این فناوری پتانسیلهای شگفتانگیزی در همهگیرشناسی و تحلیلهای دادههای مکانی دارد.
روزهای اوج بحران؛ پاشنه آشیل سیستم پیشبینی
سازمان CDC در ارزیابیهای اولیه، فصل آنفلوآنزای ۲۰۲۵-۲۰۲۶ را یک دوره معتدل طبقهبندی کرده بود. با این حال، ورودی هفتگی بیماران به بیمارستانها در نقطه اوج خود از مرز ۴۰ هزار نفر عبور کرد؛ روندی که از اواسط نوامبر اوج گرفت و درست در هفته منتهی به ۲۷ دسامبر به بیشترین میزان خود رسید.
اما جالب اینجاست که مدل گروهی تجمیعی CDC درست در مواجهه با تندترین پیچها و چرخشهای ناگهانی فصل به تپتپ افتاد! بازههای پیشبینی ۵۰ و ۹۵ درصدی این مدل اصلاً نتوانستند جهش ناگهانی اواخر دسامبر و سقوط سریع آمارها در اواسط ژانویه را حدس بزنند. در روزهای اوج شیوع، کمتر از ۲۵ درصد پیشبینیهای مربوط به دو هفته آینده با واقعیت همخوانی داشت؛ وضعیتی که البته از ابتدای فوریه ۲۰۲۶ فروکش کرد و دقت مدل دوباره به مرز ۹۵ درصد برگشت.
البته این آمار کلی مدل تجمیعی است و نمیتوان عملکرد اختصاصی مدل Google_SAI-FluEns را به شکل مجزا در نقطه پیک تفکیک کرد؛ اما این ماجرا نشان داد که آسیبپذیرترین نقطه سیستمهای پیشبینی درست در لحظات چرخش ناگهانی رخ میدهد؛ یعنی درست همان زمانی که بیمارستانها برای شیفتبندی پرسنل و ظرفیت تختها، بیشترین نیاز را به پیشبینیهای دقیق دارند.
یک فصل موفق چه چیزی را ثابت میکند؟
کسب مدال طلای این رقابت در چارچوب یک سیستم داوری عمومی و شفاف ثابت کرد که روش جستوجوی خودکار برنامه میتواند کدهایی فوقالعاده رقابتی برای مدلسازی بیماریها خلق کند. با این حال، هنوز پرسشهای بیپاسخ زیادی روی میز باقی مانده است:
- فاصله امتیازی برنده: گوگل هنوز اختلاف امتیاز میان مدل خود و تیم دوم را اعلام نکرده است؛ بنابراین مشخص نیست پیروزی با فاصلهای شکننده به دست آمده یا برتری کاملاً قاطع بوده است.
- تعمیمپذیری به شرایط جدید: درخشش در یک فصل و برای یک بیماری خاص، مدرک کافی برای عملکرد بینقص مدل روی سایر پاتوژنها، مناطق جغرافیایی و فصلهای آینده به حساب نمیآید.
- لحظات حساس و نقاط عطف: هرچند آمارهای کلی ارائهشده از ضعف مدلها در روزهای پیک خبر میدهند، اما هنوز پوشش بازهای اختصاصی مدل برنده گوگل در این بازههای بحرانی منتشر نشده است.
- امکان بازتولید نتایج (Reproducibility): سیستم ERA هیچ رابط برنامهنویسی کاربردی (API) عمومی ندارد و همین مسئله مانع از آن میشود که محققان مستقل بتوانند فرآیند جستوجوی برنامه آن را بازتولید یا راستیآزمایی کنند.
- استفاده مجدد در سناریوهای دیگر: بهکارگیری این سیستم در رصد کووید-۱۹ و ویروس RSV این فرصت را به دانشمندان میدهد تا این متدولوژی هوش مصنوعی را در محیطهای متنوعتری بسنجند.
دسترسی همچنان پشت درهای بسته
توسعهدهندگان در حال حاضر برای دسترسی به فناوری ERA به تأییدیه مستقیم نیاز دارند، چرا که گوگل این سرویس را صرفاً به عنوان یک طرح آزمایشی برای تسترها و محققان منتخب از طریق Google Labs ارائه میدهد. هدف فعلی گوگل همکاریهای دانشگاهی و پژوهشی است نه عرضه تجاری به توسعهدهندگان عمومی. با این همه، مقاله پژوهشگران گوگل در نشریه نیچر کاملترین جزئیات فنی را درباره چرخه ترکیب مدلهای زبانی و جستوجوی درختی تشریح کرده است.
الگوی پیشنهادی برای یک پکیج ارزیابی استاندارد
- تعریف دقیق هدف: مشخص کردن یک سنجه عددی شفاف که بتواند برنامههای جنریتشده را به صورت یکپارچه و عادلانه رتبهبندی کند.
- جداسازی دادهها: کنار گذاشتن بخشی از مشاهدات تاریخی برای فاز سنجش نهایی، تا برنامههای کاندید روی دادههای کاملاً جدید و دستنخورده ارزیابی شوند.
- تعیین مدلهای پایه (Baselines): تعریف متدهای موجود و نمرات آنها به عنوان خط مبنا، تا امکان مقایسهای معنادار و ملموس فراهم شود.
- مشخصسازی محدودیتها: تعیین پیششرطهایی مثل مدتزمان اجرا، نحوه دسترسی به دیتا، شفافیت و تفسیرپذیری کد و الزامات استقرار، پیش از شروع فرآیند جستوجوی هوشمند.
مطالب مرتبط و پیشنهادی

دردسر تازه در اوپنایآی؛ اخراج جنجالی سه پژوهشگر ایمنی به اتهام درز اطلاعات محرمانه
اوپنایآی در پی یک تحقیق داخلی، سه پژوهشگر تیم ایمنی خود را به اتهام افشای اطلاعات محرمانه شرکت اخراج کرد. این تصمیم در حالی گرفته شده که انتقادها از کمتوجهی این غول فناوری به مسائل امنیتی بالا گرفته و اخیراً حتی عرضه مدل GPT-6.1 Astra نیز به دلیل ریسکهای ایمنی متوقف شده است.

تکیهکلامهایی که دست هوش مصنوعی را رو میکنند؛ افشای تیکهای نگارشی Opus 5.5 و مدلهای پیشرو
پژوهش جدید شرکت گرافیت نشان میدهد مدلهای هوش مصنوعی با وجود پیشرفت چشمگیر، هنوز تکیهکلامها و ساختارهای نگارشی تکراری دارند که دستشان را رو میکند. از علاقه افراطی مدل Opus 5.5 به تکرار عبارت «این موضوع اهمیت دارد» تا ترفندهای مدلهای OpenAI، هر نسخه با الگوهای منحصربهفردی نوشتههای ماشینی را لو میدهد.

بیخیال آخرالزمان هوش مصنوعی؛ خطر واقعی تنبلی ما در رعایت امنیت پایه است!
در حالی که خبرهای هولناک از نفوذ خودسرانه ایجنتهای هوش مصنوعی سرتیتر رسانهها شده، متخصصان ارشد امنیت سایبری در کنفرانس HumanX یادآور میشوند که بزرگترین تهدید نه هوش ماشینها، بلکه تنبلی خودمان در رعایت اصول پایه امنیت است. به گفته این کارشناسان، شرکتها به جای وحشت از سناریوهای تخیلی آخرالزمانی، باید روی بستن رخنههای پیشپاافتاده، فعالسازی احراز هویت چندمرحلهای و کنترل دسترسی ایجنتها تمرکز کنند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.