پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل جذاب Noct-Q-Anime برای عاشقان انیمه؛ اجرای هوش مصنوعی علی‌بابا روی گرافیک‌های ۸ گیگابایتی!

انتشار:۸ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

توسعه‌دهنده‌ای به نام Noctaluna با بهینه‌سازی مدل قدرتمند Qwen-Image-2.1 علی‌بابا، مدلی ویژه خلق تصاویر انیمه به نام Noct-Q-Anime عرضه کرده که روی کارت‌های گرافیک ۸ گیگابایتی هم به‌راحتی اجرا می‌شود. این نسخه سفارشی بدون محدودیت‌های محتوایی اولیه منتشر شده و در روز‌های نخست با استقبال چشمگیر کاربران مواجه شده است.

مدل جذاب Noct-Q-Anime برای عاشقان انیمه؛ اجرای هوش مصنوعی علی‌بابا روی گرافیک‌های ۸ گیگابایتی!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • توسعه‌دهنده‌ای با نام مستعار Noctaluna مدلی اختصاصی برای نقاشی‌های انیمه به اسم Noct-Q-Anime منتشر کرده که نسخه دستکاری‌شده و بدون سانسور مدل Qwen-Image-2.1 علی‌باباست و فقط تو چند روز اول بیش از ۶ هزار بار دانلود شده.
  • این مدل با کوانتیزاسیون INT8 وزن‌ها و کاهش حجم به ۷.۳ گیگابایت، طوری بهینه‌سازی شده که حتی روی سیستم‌های خانگی با کارت گرافیک‌های میان‌رده ۸ تا ۱۲ گیگابایتی (به‌ویژه توی ComfyUI) هم روان کار می‌کنه.
  • علی‌بابا در نسل جدید مدل تصویری خودش تعداد پارامترها رو از ۲۰ میلیارد به ۷ میلیارد رسونده تا هنرمندان دیجیتال بتونن بدون نیاز به سرور‌های فوق‌العاده گرون‌قیمت، تصاویر باکیفیت و ترنسپرنت خلق کنن.

بسته‌بندی Noct-Q-Anime برای کارت‌های گرافیک ۸ تا ۱۲ گیگابایتی

توسعه‌دهنده‌ای به نام Noctaluna نسخه جدیدی به اسم Noct-Q-Anime منتشر کرده است؛ یک مدل تغییریافته توسط جامعه کاربری که بر پایه مدل Qwen-Image-2.1 علی‌بابا و مشخصاً برای خلق تصویرسازی‌های انیمه طراحی شده است. در این چک‌پوینت، وزن‌های بخش تولید تصویر (Visual Generator) با دقت عددی INT8 ذخیره شده‌اند، لایه‌های ترنسفورمر متمرکز بر سبک انیمه با آن ادغام گشته و محدودیت‌های محتوایی مدل اصلی نیز کاملاً برداشته شده است. صفحه این مدل در پلتفرم هاگینگ فیس (Hugging Face) تنها در چند روز نخست توانست به رکورد بیش از ۶ هزار بار دانلود دست پیدا کند.

هدف اصلی سازنده، کاربرانی هستند که از ابزار محبوب ComfyUI با کارت‌های گرافیک دارای ۸ تا ۱۲ گیگابایت حافظه ویدئویی (VRAM) استفاده می‌کنند. حجم فایل اصلی چک‌پوینت دیفیوژن حدود ۷.۳ گیگابایت فضا می‌گیرد؛ هرچند میزان اوج حافظه مصرفی به عواملی مانند رزولوشن خروجی، اندازه بچ (Batch Size)، سیستم جابه‌جایی لایه‌ها (Model Offloading) و انکودر متنی و VAE مجزا نیز بستگی دارد.

کاهش ردپای سخت‌افزاری با معماری ۷ میلیارد پارامتری

این نسخه سفارشی بر پایه Qwen-Image-2.1 ساخته شده که جدید‌ترین مدل تصویری قابل دانلود شرکت علی‌بابا به شمار می‌رود. علی‌بابا در این نسخه تعداد پارامترهای تولیدکننده بصری را از حدود ۲۰ میلیارد پارامتر در نسل قبلی به ۷ میلیارد کاهش داد و در نتیجه حجم وزن‌های با دقت BF16 از ۴۰.۹ گیگابایت به ۱۴.۲ گیگابایت تقلیل یافت.

بخش‌های مدل Qwen-Image-2.1
مشخصات فنی
تولیدکننده بصری (Visual Generator)
۷ میلیارد پارامتر
معماری
۳۲ لایه ترنسفورمر دیفیوژن تک‌جریانی (Single-stream DiT)
حجم با دقت BF16
۱۴.۲ گیگابایت
حجم با دقت INT8
۷.۲۶ گیگابایت
قابلیت‌های پشتیبانی‌شده
تولید تصویر، ویرایش و خروجی با پس‌زمینه شفاف (Transparent)

یک ترنسفورمر دیفیوژن یا همان DiT، نویزهای تصادفی را گام‌به‌گام به یک تصویر مفهومی تبدیل می‌کند. در فرمت BF16 هر وزن در ۱۶ بیت ذخیره می‌شود، در حالی که در فرمت فشرده INT8 از اعداد صحیح ۸ بیتی استفاده می‌شود تا فضای ذخیره‌سازی و مصرف رم به حداقل برسد. هرچند کوانتیزاسیون ممکن است اندکی بر ظرافت‌های خروجی تأثیر بگذارد، اما در عمل باعث می‌شود اجرای چنین مدلی روی طیف گسترده‌ای از کارت‌های گرافیک خانگی و مقرون‌به‌صرفه امکان‌پذیر شود.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رونمایی شرکت میتوان از مدل هوش مصنوعی LongCat-2.5؛ جهش بزرگ غول چینی با قابلیت درک تصویر
آخرین اخبار

رونمایی شرکت میتوان از مدل هوش مصنوعی LongCat-2.5؛ جهش بزرگ غول چینی با قابلیت درک تصویر

شرکت چینی میتوان (Meituan) با عرضه نسخه پیش‌نمایش LongCat-2.5 در پلتفرم API خود، قابلیت درک و تحلیل تصاویر را به این خانواده هوش مصنوعی اضافه کرد. این مدل چندوجهی تازه به برنامه‌نویسان و توسعه‌دهندگان اجازه می‌دهد تا استدلال بصری و پردازش تصویر را به ایجنت‌ها و برنامه‌های کاربردی خود بیاورند.

۱ دقیقه مطالعه
۰
۸ مهر
شگفتی تازه در اکوسیستم OpenAI؛ پای مدل چینی Kimi K3 به سیستم سازمانی کدکس باز شد
آخرین اخبار

شگفتی تازه در اکوسیستم OpenAI؛ پای مدل چینی Kimi K3 به سیستم سازمانی کدکس باز شد

مدل هوش مصنوعی چینی Kimi K3 در رویدادی کم‌سابقه به کانال سازمانی ابزار کدنویسی Codex در پلتفرم OpenAI پیوست. بر اساس این سازوکار، مشتریان تجاری می‌توانند هزینه‌های استفاده از این مدل توانمند را مستقیماً از اعتبارات مالی قراردادهای موجود خود با OpenAI پرداخت کنند؛ حرکتی که دسترسی به مدل‌های پیشروی چینی را برای سازمان‌ها بسیار ساده‌تر و بی‌دردسر می‌کند.

۱ دقیقه مطالعه
۰
۸ مهر
رقابت داغ فناوری و معمای مهار ایجنت‌ها؛ آیا واقعاً می‌توانیم هوش مصنوعی را کنترل کنیم؟
آخرین اخبار

رقابت داغ فناوری و معمای مهار ایجنت‌ها؛ آیا واقعاً می‌توانیم هوش مصنوعی را کنترل کنیم؟

با ورود ایجنت‌های خودمختار به میدان، ترس از دست رفتن کنترل بر هوش مصنوعی بیش‌تر از همیشه در میان پژوهشگران و سرمایه‌گذاران رخنه کرده است. در این میان، کارشناسان برجسته فناوری در یک گفت‌وگوی جذاب، راهکارهای متفاوتی از تدوین مرام‌نامه‌های سازمانی تا استفاده از ابرهوش مصنوعی به‌عنوان ناظر را برای مهار و همگام‌سازی این فناوری بررسی کردند.

۸ دقیقه مطالعه
۰
۸ مهر