پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل متن‌باز AstaBrief 8B معرفی شد؛ نگارش ۳.۵ برابر سریع‌تر گزارش‌های علمی مستند تنها در یک مرحله!

انتشار:۱۱ مهر ۱۴۰۵(۱۱ ساعت پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

مؤسسه تحقیقاتی Ai2 با معرفی مدل متن‌باز AstaBrief 8B، تحولی جدی در تولید سریع گزارش‌های پژوهشی ایجاد کرده است. این مدل با حذف مراحل وقت‌گیر و واسطه‌ای، به محققان اجازه می‌دهد تا گزارش‌های علمی منسجم و همراه با منابع مستند را تا ۳.۵ برابر سریع‌تر و تنها در یک مرحله تولید کنند. وزن‌های این مدل سبک روی هاگینگ‌فیس منتشر شده و امکان اجرای کاملاً امن و محلی روی سیستم‌های سازمانی را فراهم می‌کند.

مدل متن‌باز AstaBrief 8B معرفی شد؛ نگارش ۳.۵ برابر سریع‌تر گزارش‌های علمی مستند تنها در یک مرحله!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مؤسسه هوش مصنوعی آلن (Ai2) مدل متن‌باز AstaBrief 8B را بر پایه Qwen3 معرفی کرد؛ ابزاری تخصصی که گزارش‌های علمی مستند را به جای چند مرحله طولانی، فقط در یک گام می‌نویسد.
  • این مدل با حذف مراحل وقت‌گیر خلاصه‌سازی و بخش‌بندی مجزا، سرعت تولید گزارش را ۳.۵ برابر کرده و زمان پردازش را از ۱۷۸ ثانیه به حدود ۵۱ ثانیه رسانده است.
  • با اتکا به آموزش‌های هدفمند SFT و DPO و فیلتر ویژه تراکم ارجاع‌دهی، دقت استنادها رشد چشمگیری داشته و وزن‌های آن برای استقرار محلی روی سرور‌های داخلی سازمان‌ها در دسترس است.

نگارش گزارش‌های علمی مستند در یک مرحله با AstaBrief 8B

مؤسسه هوش مصنوعی آلن (Ai2) به‌تازگی از مدل متن‌باز AstaBrief 8B رونمایی کرده است؛ مدلی که بر پایه Qwen3-8B فاین‌تیون شده تا یک پرسش پژوهشی و بخش‌های استخراج‌شده از مقالات علمی را تحویل بگیرد و در قالب یک گزارش ساختاریافته و دارای منابع دقیق تحویل دهد. این انتشار تحت مجوز Apache 2.0 شامل کل مجموعه داده‌های آموزشی نیز می‌شود؛ بنابراین توسعه‌دهندگان می‌توانند فرایند پس‌آموزش (Post-training) را به‌طور کامل بررسی، بازتولید یا شخصی‌سازی کنند.

طبق گزارش Ai2، میانگین تأخیر انتها‌به‌انتها در پایپ‌لاین سریع Asta تنها ۵۱.۱ ثانیه است؛ در حالی که این زمان برای حالت تحلیلی و متفکر (Thinking mode) به ۱۷۸.۵ ثانیه می‌رسد. این یعنی سرعت نگارش حدود ۳.۵ برابر بیش‌تر شده است! این مقایسه کل مسیر تولید را در بر می‌گیرد و شامل زمان صرفه‌جویی‌شده ناشی از حذف مراحل واسطه‌ای مانند خلاصه‌سازی، خوشه‌بندی موضوعی و پیش‌نویس جداگانه هر بخش است.

یک مرحله تولید به‌جای چهار مرحله وقت‌گیر

سیستم‌های ایجنتی سنتز مقالات پژوهشی — مثل سرویس Asta متعلق به Ai2 که از مدل‌های کلود (Claude) قدرت می‌گیرد — معمولاً ابتدا متن‌ها را جستجو و استخراج می‌کنند، سپس آن‌ها را خلاصه می‌سازند، در بخش‌های جداگانه دسته‌بندی می‌کنند و در نهایت هر بخش را جداگانه می‌نویسند. اما AstaBrief پرسش علمی و چکیده‌های استخراج‌شده را یک‌جا دریافت می‌کند و کل گزارش نهایی را تنها در یک مرحله (One pass) تحویل می‌دهد. بر اساس ارزیابی‌های اصلی Ai2، این ساده‌سازی چشمگیر توانسته کیفیتی هم‌سطح با سیستم‌های چندمرحله‌ای ارائه دهد.

البته این مدل همچنان برای پیدا کردن مقالات و انتخاب قطعات متنی مرتبط به یک سیستم بازیابی خارجی (Retrieval) وابسته است. برنامه‌های کاربردی باید این قطعات را آماده کنند، شناسه‌های منابع را برای ارجاع‌دهی در اختیار مدل بگذارند و شواهد را طوری تنظیم کنند که در پنجره متنی (Context Window) مدل بگنجد. مؤسسه Ai2 یک نمونه محلی PDF در گیت‌هاب ارائه کرده که جریان کاری این فرایند را به‌خوبی نشان می‌دهد.

شکل‌دهی مدل با ترجیحات هوشمندانه و داده‌های پالایش‌شده

تیم Ai2 برای آموزش AstaBrief ابتدا از یادگیری نظارت‌شده (SFT) و سپس از بهینه‌سازی مستقیم ترجیحات (DPO) استفاده کرده است. در مرحله SFT، مدل با بررسی نمونه‌های کامل گزارش‌ها آموزش می‌بیند و سپس در مرحله DPO، جفت‌های ثابتی از گزارش‌های برتر و ضعیف به مدل نشان داده می‌شود تا الگوهای خروجی مطلوب تقویت شوند. Ai2 این فرایند کم‌دردسرتر را انتخاب کرد، چرا که روش‌های یادگیری تقویتی مبتنی بر مدل داور (Judge-driven RL) می‌توانند بسیار پرهزینه، ناپایدار و از نظر خطایابی دشوار باشند.

  1. جمع‌آوری پرسش‌ها: محققان Ai2 کار را با پرامپت‌های واقعی ارسال‌شده به سیستم‌های ScholarQA و نسخه‌های اولیه Asta آغاز کردند. در مرحله فیلترسازی، ترافیک ربات‌ها، پرامپت‌های بیش از حد کوتاه، درخواست‌های غیرانگلیسی، سؤالات غیرعلمی و درخواست‌های حاوی اطلاعات هویتی افراد حذف شدند تا در نهایت حدود ۹۰ هزار پرسش پژوهشی تمیز باقی بماند.
  2. اهداف آموزشی SFT: پایپ‌لاین چندمرحله‌ای ScholarQA با استفاده از مدل‌های پرچمداری مثل Claude 3.5 Sonnet، Claude 3.7 Sonnet، o3، o4-mini و GPT-4.1 گزارش‌هایی تولید کرد. پس از فیلتر کیفی، حدود ۴۷ هزار نمونه آموزشی برای فاین‌تیون نظارت‌شده آماده شد.
  3. جفت‌های مقایسه‌ای DPO: برای زیرمجموعه دیگری از پرسش‌ها، یک گزارش از پایپ‌لاین ScholarQA و گزارش دیگر از مدل‌هایی مثل o3، o4-mini، DeepSeek-V3 یا DeepSeek-R1 گرفته شد. دو مدل GPT-4.1 و DeepSeek-R1 وظیفه داوری هر جفت گزارش را بر عهده داشتند. Ai2 گزارش کرده که ۹۵ درصد از داوری‌های خودکار کاملاً با ترجیحات انسانی همخوانی داشته است. در نهایت با نگه‌داشتن جفت‌هایی که هر دو داور بر سر برتری آن‌ها توافق داشتند، حدود ۶ هزار نمونه ترجیحی ارزشمند استخراج شد.

یک فیلتر هوشمند که کیفیت ارجاعات را متحول کرد

چک‌پوینت‌های اولیه SFT گزارش‌هایی بسیار روان تولید می‌کردند، اما گاهی اوقات منابع ساختگی به متن اضافه می‌کردند یا ارجاع‌دهی را جا می‌انداختند! تیم Ai2 چهار معیار فیلتر را برای گزارش‌های مصنوعی بررسی کرد: نسبت توکن‌های خروجی به ورودی، ارتباط ارجاعات، تراکم ارجاع‌دهی (Citation Density) و تنوع ارجاعات. در این میان، تراکم ارجاع‌دهی مشخص می‌کند که گزارش تا چه حد به‌طور پیوسته برای ادعاهایی که نیاز به مدرک دارند، منبع معتبر ارائه می‌دهد.

حذف نمونه‌هایی با تراکم ارجاع پایین، بزرگ‌ترین جهش کیفی را ایجاد کرد. جالب اینکه اعمال فیلترهای سخت‌گیرانه‌تر، ترکیب چند فیلتر مختلف یا آزمایش نرخ‌های یادگیری گوناگون تأثیر چندانی نداشت. در آزمایش‌های Ai2 مشخص شد که انتخاب نمونه‌های دارای پوشش ارجاع قوی، بسیار مطمئن‌تر از پیچیده‌تر کردن فیلترها می‌تواند استناد و واقع‌گرایی مدل را ارتقا دهد.

جهش چشمگیر بازیابی ارجاعات به لطف DPO

مجموعه ارزیابی ScholarQA-CS2 شامل پرسش‌های واقعی در حوزه علوم کامپیوتر است که کاربران مطرح کرده‌اند. معیارهای این ارزیابی به‌طور مستقل کیفیت پاسخ، پشتیبانی ارجاعات از ادعاهای مطرح‌شده و همچنین ارجاع‌دهی به ادعاهایی که نیازمند مدرک هستند را می‌سنجند (امتیاز بالا‌تر به معنای عملکرد بهتر است):

مدل
میانگین امتیاز
دقت پاسخ
دقت استناد
بازیابی استناد
Qwen3-8B
77.3
90.6
76.2
64.6
AstaBrief-8B-SFT
83.7
90.4
87.7
71.3
AstaBrief-8B
87.0
89.0
90.5
78.2

در مقایسه با نسخه اولیه SFT، اعمال DPO میانگین امتیاز مدل را از ۸۳.۷ به ۸۷.۰ ارتقا داده است. در این میان، دقت استناد ۲.۸ امتیاز و بازیابی استناد ۶.۹ امتیاز رشد داشته که البته با افت اندک ۱.۴ امتیازی در دقت پاسخ همراه بوده است.

روی همین مجموعه آزمایشی، مدل AstaBrief به امتیاز ۸۷.۰ دست یافت که از امتیاز ۸۶.۲ متعلق به Asta ScholarQA بالا‌تر بوده و به امتیاز ۸۸.۸ مدل DR-Tulu-8B بسیار نزدیک است. همچنین در رقابت‌های رو‌در‌رو، AstaBrief در ۷۲ درصد موارد توانست بر Asta ScholarQA غلبه کند. البته عملکرد مدل در بنچمارک DeepScholarBench کمی پایین‌تر است؛ AstaBrief امتیاز ۵۳.۵ را در برابر ۶۰.۲۵ سیستم Asta ScholarQA کسب کرده و گزارش‌ها نشان می‌دهد DR-Tulu نیز در آنجا نمره بالاتری ثبت کرده است.

سرعت بالا با مرزها و محدودیت‌های مشخص

  • بهترین کاربرد: مدل AstaBrief برای ابزار‌ها و برنامه‌هایی ایده‌آل است که خودشان بخش‌های متنی مرتبط از مقالات علمی را بازیابی کرده‌اند و حالا به یک سنتز سریع، ساختاریافته و دارای استنادهای پرتراکم نیاز دارند.
  • خارج از حیطه توانایی: این مدل به جستجوی آزاد در وب، خرد کردن پرسش‌های پیچیده (Query decomposition)، جستجوی بازگشتی یا استفاده چندمرحله‌ای از ابزار‌ها نمی‌پردازد. اجرای چنین قابلیت‌هایی نیازمند یک ایجنت یا معماری نرم‌افزاری پیرامونی است.
  • ترجیح ارزیابان انسانی: در یک بررسی محدود با حضور سه داور، مدل DR-Tulu ترجیح کلی بالاتری دریافت کرد؛ هرچند دو نفر از سه داور، دقت ارجاعات AstaBrief را برتر دانستند.
  • ریسک وفاداری به منابع: گاهی ممکن است یک ارجاع به مقاله‌ای کاملاً مرتبط اشاره کند، اما ادعای مطرح‌شده توسط مدل نتایج آن تحقیق را اغراق‌آمیز جلوه دهد؛ مثلاً نتیجه یک مطالعه کوچک به کل جامعه آماری تعمیم داده شود. مدل AstaBrief به‌طور خاص برای مقابله با این سناریوی خطا آموزش ندیده است.

اجرای محلی گزارش‌ها با دسترسی به وزن‌های متن‌باز

یک مدل ۸ میلیاردی پارامتری (8B) می‌تواند با تنظیمات مناسب دقت محاسباتی و پنجره متنی، روی یک کارت گرافیک رده‌بالای مصرفی اجرا شود. استقرار محلی این امکان را به مراکز تحقیقاتی می‌دهد تا مقالات منتشرنشده، پرسش‌های حساس و گزارش‌های تولیدشده را در بستر شبکه داخلی سازمان خود نگه دارند و نیازی به ارسال اسناد محرمانه به سرویس‌های ابری مدل‌های هوش مصنوعی اختصاصی نداشته باشند.

مؤسسه Ai2 در پست معرفی رسمی این پروژه بر اهمیت ترکیب داده‌های پس‌آموزش تأکید کرده است. موفقیت AstaBrief حاصل نمونه‌هایی بود که سنتز مستند و انتساب دقیق را به نمایش گذاشتند و سپس آموزش مبتنی بر ترجیحات این رفتارها را تثبیت کرد. برای تیم‌هایی که قصد دارند سیستم‌های نگارش متون تخصصی را بر پایه مدل‌های متن‌باز بسازند، ترکیب SFT، DPO و فیلترگذاری بر اساس تراکم ارجاعات، یک رویکرد اثبات‌شده و قابل تکرار پیش از ورود به پایپ‌لاین‌های پیچیده‌تر یادگیری تقویتی محسوب می‌شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟
آخرین اخبار

دوپامین مصنوعی و مغزهای هک‌شده؛ هوش مصنوعی مولد چطور سیم‌کشی تمرکز ما را به هم می‌ریزد؟

رگبار نوتیفیکیشن‌ها و سیستم‌های هوش مصنوعی مولد با تولید مداوم «دوپامین مصنوعی»، ساختار شیمیایی و مدارهای تمرکز مغز انسان را دستخوش تغییر اساسی کرده‌اند. این سقوط دامنه توجه صرفاً یک مسئله شخصی نیست، بلکه با از بین بردن فرصت‌های استراحت مغزی، امنیت شناختی و تفکر عمیق جامعه را در معرض تهدیدی جدی قرار داده است.

۶ دقیقه مطالعه
۰
۱۱ مهر
شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها
آخرین اخبار

شتاب خیره‌کننده مدل زبانی MiniCPM5 با دستیار ۳۲۴ میلیونی DSpark؛ جهش چشمگیر در تولید موازی توکن‌ها

تیم OpenBMB با انتشار مدل کم‌حجم ۳۲۴ میلیون پارامتری DSpark، جهش بزرگی در سرعت استنتاج مدل زبانی MiniCPM5-2B ایجاد کرده است. این مدل با تکیه بر تکنیک هوشمندانه رمزگشایی گمانه‌زنانه، توکن‌ها را به صورت دسته‌ای حدس می‌زند تا فرایند پردازش با کم‌ترین مصرف محاسباتی و بیش‌ترین سرعت ممکن اجرا شود.

۲ دقیقه مطالعه
۰
۱۱ مهر
پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!
آخرین اخبار

پیودی‌پای: موقع ساخت هوش مصنوعی اختصاصی‌ام، OpenAI دو بار اکانتم را بست!

فلیکس شلبرگ یا همان پیودی‌پای معروف، به‌تازگی مدل هوش مصنوعی محلی خود به نام Ajax را معرفی کرده، اما فاش ساخته که در مسیر توسعه آن، شرکت OpenAI دو بار حسابش را مسدود کرده است. او برای ساخت این مدل ۹ میلیارد پارامتری از تکنیک تقطیر استفاده کرده؛ موضوعی که زنگ خطر نقض قوانین سازنده ChatGPT را به صدا درآورده است.

۳ دقیقه مطالعه
۰
۱۱ مهر