شاهکار مدل استدلالی متا؛ حل ۵ مسئله باز و حلنشده ریاضی با کمک هوش مصنوعی Muse Spark
شرکت متا از دستاورد جدیدی پرده برداشت که نشان میدهد نسخههای ۱.۱ و ۱.۲ مدل استدلالی Muse Spark توانستهاند در نگارش ۶ مقاله علمی به پژوهشگران کمک کنند و ۵ مسئله باز و پیچیده ریاضی را به سرانجام برسانند. این پژوهشها بدون نیاز به هیچ ابزار کمکی اختصاصی و تنها از دل محیط گفتوگوی ساده Meta.ai متولد شدهاند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- متا با انتشار ۶ مقاله پژوهشی اعلام کرد مدل استدلالی Muse Spark به ریاضیدانها کمک کرده ۵ مسئله باز و بیپاسخ مانده دنیای ریاضی را با موفقیت حل کنند.
- نکته جالب اینجاست که دانشمندان هیچ ابزار یا ایجنت پیچیدهای نساختند و تمام این فرآیند فقط از طریق چتباکس معمولی Meta.ai و حالت Thinking Mode پیش رفته است.
- البته متا تأکید کرده هنوز کار هوش مصنوعی بینقص نیست؛ مدل فقط در نقش یک دستیار باهوش عمل کرده و هدایت اصلی، رفع خطاها و اثبات نهایی کاملاً بر دوش ریاضیدانها بوده است.
شرکت متا اعلام کرده که جمعی از ریاضیدانها با استفاده از نسخههای ۱.۱ و ۱.۲ مدل استدلالی Muse Spark موفق به نگارش ۶ مقاله پژوهشی شدهاند؛ آن هم تنها از طریق همان محیط گفتوگوی ساده و همیشگی Meta.ai! این شرکت به تازگی ۶ مقاله علمی را منتشر کرده و میگوید ۵ مورد از این مقالهها مسائلی را حل کردهاند که تا پیش از شروع این همکاری، هیچ پاسخ مشخصی در دنیای ریاضیات برایشان وجود نداشت. البته نتایج برخی از این پژوهشها با کارهای مستقلی که همزمان توسط سایر تیمها پیش رفته بود، همپوشانی دارد.
متا پیش از این هم نشان داده بود مدلهایش میتوانند در پنج المپیاد دانشآموزی ریاضی، فیزیک و شیمی به سطحی معادل مدال طلا برسند. با این حال، مسابقات المپیاد شامل مسائل از پیش تعریفشده با پاسخهای مشخص هستند؛ در حالی که مقالههای جدید به سراغ «پژوهشهای زنده و واقعی» رفتهاند؛ جایی که ریاضیدان باید خودش مسیر حل مسئله را ترسیم کند، به نتیجه برسد و درستی تکتک مراحل را بسنجد. این دستاوردها نشاندهنده یک فرآیند پژوهشی کارآمد هستند، هرچند همکاری روی ۶ مسئله خاص نمیتواند نرخ موفقیت کلی مدل را اثبات کند.
پژوهش علمی فقط از طریق یک چتباکس ساده
ریاضیدانها برای ارتباط با مدل Muse Spark فقط از رابط کاربری عمومی Meta.ai و قابلیت تفکر عمیق (Thinking Mode) آن استفاده کردند. جالب است بدانید طبق گفته متا، در این فرآیند از هیچ فریمورک اختصاصی ایجنتها، سیستمهای فراخوانی ابزار متصل به Lean یا Mathematica و حتی سامانه بازیابی مقالات از arXiv استفاده نشده است.
پروتکل این همکاری کاملاً شفاف بود و مرز بین کار انسان و هوش مصنوعی را مشخص میکرد: ریاضیدانها صورتمسئله را انتخاب کرده و مسیر پیشبرد کار را مدیریت میکردند، در حالی که گروه دیگری خروجیهای مدل را به دقت ارزیابی میکردند. در هر مقاله نیز بخشهایی که توسط انسان یا خودِ Muse Spark نوشته شده کاملاً نشانهگذاری شده، به کارهای پژوهشی قبلی ارجاع داده شده و از تیمهایی که به صورت مستقل به نتایج مشابهی رسیدهاند نیز تقدیر شده است.
شش هدف تخصصی و چالشبرانگیز ریاضی
- احتمالات: این مقاله یک آستانه دقیق برای برازش نقاط تصادفی گاوسی روی یک بیضیگون در ابعاد بالا تعیین کرده است؛ به طوری که پایینتر از این حد آستانه، احتمال برازش بسیار بالاست و بالاتر از آن تقریباً غیرممکن میشود. جالب اینکه سه گروه مستقل دیگر نیز همزمان و با روشهای متفاوتی به همین اثبات رسیدهاند.
- معادلات دیفرانسیل: در این پژوهش برای جوابهای متقارن شعاعی با انرژی منفی، پدیده انفجار در زمان متناهی (Finite-time blow-up) در معادله غیرخطی شرودینگر دوهارمونیک با جرم بحرانی در دو یا چند بعد اثبات شده است. این معادله موج مرتبه چهارم میتواند به تکینگی برسد؛ نقطهای که در آن جواب هموار دیگر وجود ندارد. این نتیجه به پرسشی که از سال ۲۰۱۵ در این ساختار متقارن بیپاسخ مانده بود پایان داد.
- نظریه گروهها: این مقاله یک مثال نقض برای حدس سال ۲۰۲۴ کیدا ارائه کرده که دو رده فنی از گروههای متناهی (گروههای نیمهجابهجاییپذیر و تکجملهای) را به هم پیوند میداد. مدل Muse Spark کدی به زبان GAP (سیستم جبر محاسباتی در نظریه گروهها) نوشت که موفق شد یک مثال نقض ۳۸۴ عنصری پیدا کند. در نهایت پژوهشگران با بررسی این مثال نقض، اثبات قضیه را کامل کردند.
- بهینهسازی: در این پروژه، معیاری برای دقیق بودن آزادسازی مبتنی بر دور در مسائل چندجملهای دودویی استخراج شد. این روشهای آزادسازی، بهینهسازی دشوار روی متغیرهای صفر و یک را با محدودیتهایی جایگزین میکنند که حل آنها بسیار سادهتر است. این نتیجه پاسخی به پرسش مطرحشده توسط دلپیا و خجاویراد است.
- فیزیک حسابی (Arithmetic Physics): نویسندگان اثبات کردند که یک تابع دونقطهای (Two-point function) در نظریه ریسمان با یک تابع ارتفاع حسابی روی رده گستردهای از منحنیهای p-adic برابری میکند. توابع دونقطهای همبستگیها را اندازه میگیرند و هندسه p-adic بر پایه سیستمهای عددی بنا شده که مفهوم فاصله در آنها به بخشپذیری وابسته است. این مقاله مسیری را گسترش میدهد که یوری مانین در دهه ۱۹۸۰ پیشنهاد داده بود.
- جبر غیرشرکتپذیر (Non-associative algebra): این پژوهش یک مثال نقض سهبعدی برای آزمون پیشنهادی جبرهای تحولی حلپذیر ساخت؛ فضایی که در آن عمل ضرب لزوماً از قانون شرکتپذیری
(ab)c = a(bc)پیروی نمیکند. علاوه بر این، مقاله توصیف جایگزینی را نیز در سطح زیرفضاها ارائه داده است.
از طرح کلی اثبات تا نوشتن کدهای جستوجو
در طول نگارش این مقالهها، مدل Muse Spark در چند نقش کلیدی به پیشبرد مراحل میانی پژوهش کمک کرد:
- توسعه استدلال و اثبات: استدلالهای اولیه و استراتژیهای گوناگونی برای اثبات پیشنهاد داد تا متخصصان آنها را بررسی و اصلاح کنند.
- بازتعریف مسئله: در پروژه بهینهسازی، مدل یک فرمولبندی احتمالات جدید پیشنهاد کرد که جرقه اصلی را برای رسیدن به راهحل نهایی زد.
- جستوجوی محاسباتی: کدهایی به زبان GAP نوشت که در میان گروههای متناهی به جستوجو پرداخت و مثال نقض ۳۸۴ عنصری را کشف کرد.
- پیشنویس متون تخصصی: بخشهایی از متن مقالهها را بازنویسی و تنظیم کرد؛ از جمله سه بخش محوری از مقاله مربوط به فیزیک حسابی.
- تولید مثالهای نقض: ساختارها و موجودیتهای ریاضی گوناگونی پیشنهاد داد تا پژوهشگران درستی فرضیات و حدسها را در برابر آنها محک بزنند.
با همه اینها، اعتبارسنجی نهایی تمام این مراحل کاملاً بر عهده ریاضیدانها بود. پژوهشگران بودند که اهداف تحقیق را معین کردند، رویکردهای پیشنهادی مدل را فیلتر نمودند، شکافهای استدلالی را برطرف کردند، محاسبات را سنجیدند و درستی هر ادعا را تأیید کردند. برای مثال در پروژه نظریه گروهها، مدل با نوشتن کد یک گزینه مناسب پیدا کرد، اما این محققان بودند که ویژگیهای آن را دقیقاً راستیآزمایی کرده و اثبات نهایی را تکمیل کردند.
شواهدی امیدبخش از یک جامعه آماری محدود
بنچمارکهایی مانند FrontierMath توانایی مدلها را روی مجموعهای ثابت از مسائل دشوار میسنجند که پاسخ آنها از قبل مشخص است و معمولاً دقت مدلها در سطوح دانشگاهی و پیشرفته بین ۱۰ تا ۳۰ درصد گزارش میشود. مقالههای جدید متا، نمونههایی عملی و واقعی از پروژههای زنده را به این شواهد اضافه میکنند. اگر هوش مصنوعی بتواند به طور پیوسته طرحهای اثبات کاربردی تولید کند یا کدهای محاسباتی دقیقی بنویسد، دانشمندان میتوانند در وقت خود صرفهجویی کرده و ساعتهای کمتری را در بنبستهای پژوهشی یا کدنویسیهای روزمره سپری کنند.
با این حال، نتیجهگیری قطعی درباره توانایی کلی این مدل با محدودیتهایی روبهرو است:
- انتخاب گزینشی (Selection): گزارش متا فقط همکاریهای موفقیتآمیز را منعکس کرده و آماری از مسائل ناکاممانده، مسیرهای به بنبست رسیده، تعداد پرامپتها یا ساعتهای صرفشده توسط محققان ارائه نداده است.
- کشف همزمان: سه مورد از این نتایج همزمان توسط گروههای تحقیقاتی دیگری نیز به شکل مستقل اثبات شده بودند که نشان میدهد برخی مسائل از قبل در آستانه حل شدن قرار داشتند.
- نقش اساسی نیروی انسانی: انتخاب مسائل، ارائه زمینههای تخصصی، هدایت گفتوگوها، اصلاح اثباتها و راستیآزمایی تمامی نتایج توسط متخصصان انسانی انجام شده است.
- محدودیت دامنه مسائل: پاسخ به ۶ پرسش تخصصی تنها توسط یک خانواده از مدلها، مدرک کافی برای تعمیم توانایی هوش مصنوعی به تمام شاخههای گسترده ریاضیات به حساب نمیآید.
- سنجش سرعت: هیچ مقایسه مشخصی وجود ندارد که نشان دهد اگر همین تیمها از Muse Spark استفاده نمیکردند، رسیدن به پاسخ چقدر بیشتر طول میکشید.
- تکرارپذیری آزمایشها: بازتولید دقیق این دستاوردها به پرامپتهای استفادهشده، تنظیمات نمونهبرداری، تاریخچه کامل مکالمات، نسخه مدل و دسترسی مداوم به همان اسنپشات انحصاری مدل وابسته است.
یک الگوی کاری تکرارپذیر برای پژوهشگران
این تجربه موفق یک چرخه کاری انسانمحور را تعریف میکند که محققان میتوانند بدون نیاز به راهاندازی زیرساختهای پیچیده ایجنتی، از آن بهره ببرند:
- ادعای علمی، فرضیات و نتایج پیشین مرتبط با مسئله را به صورت دقیق و محدود مشخص کنید.
- از مدل بخواهید چندین سناریوی اثبات، مثال نقض، بازتعریف مسئله یا اسکریپت جستوجو ارائه کند.
- کدهای تولیدشده توسط مدل را در یک محیط کنترلشده اجرا کرده و پیشفرضها، نتایج و خطاهای احتمالی آن را بررسی کنید.
- هر گام از اثبات ریاضی را به شکل دستی، یا در صورت لزوم به کمک نرمافزارهای اثبات قضیه، سامانههای جبر محاسباتی یا محاسبات مستقل راستیآزمایی کنید.
- نسخه مدل، پرامپتها، پاسخها، ویرایشهای انسانی و مسیرهای ناموفق را برای مستندسازی دقیق فرآیند ثبت کنید.
- سهم متنها و ایدههای تولیدشده توسط هوش مصنوعی را بر اساس قوانین افشای مشارکت و اخلاق نشر مجلات علمی شفافسازی کنید.
در مجموع این پروژهها نشان دادند مدل Muse Spark توانسته درون یک چتباکس ساده برای کاربران عمومی، پیشنویس استدلالها، کدها، مثالهای نقض و متون علمی قابلتوجهی خلق کند. با این حال، مسئولیت گزینش مسئله، بازبینی خطاها و اثبات نهایی کماکان بر دوش ریاضیدانها باقی مانده است. این مقالهها از یک همراهی ارزشمند هوش مصنوعی زیر ذرهبین دقیق متخصصان خبر میدهند؛ هرچند میزان افزایش سرعت و درصد موفقیت کلی مدل در مقیاس وسیع هنوز نیازمند سنجشهای دقیقتری است.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

شتاب خیرهکننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکنها
تیم OpenBMB با انتشار مدل کمحجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانهزنانه، توکنها را به صورت دستهای حدس میزند تا فرایند پردازش با کمترین مصرف محاسباتی و بیشترین سرعت ممکن اجرا شود.

پیودیپای: موقع ساخت هوش مصنوعی اختصاصیام، OpenAI دو بار اکانتم را بست!
فلیکس شلبرگ یا همان پیودیپای معروف، بهتازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

طعنه سنگین سم آلتمن به آنتروپیک: نسبت دادن روح و دین به هوش مصنوعی خطرناکه!
سم آلتمن، مدیرعامل اوپنایآی، در اظهارنظری جنجالی به رویکرد شرکت رقیب یعنی آنتروپیک تاخت و نسبت دادن مفاهیم مذهبی و خودآگاهی به مدلهای هوش مصنوعی را یک تهدید امنیتی واقعی دانست. این اختلافنظر تازه پس از آن بالا گرفت که گزارشهایی از گفتوگوهای آنتروپیک با رهبران دینی برای تزریق اخلاق به مدلها منتشر شد. حالا دانشمندان ارشد هوش مصنوعی و حتی واتیکان هم به این مناقشه فلسفی کشیده شدهاند و درباره خطرات چنین رویکردی هشدار میدهند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.