پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

تولید موزیک با هوش مصنوعی بدون دردسر پایتورچ؛ انتشار نسخه سبک و محلی ACE-Step 1.5

انتشار:۱۸ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

توسعه‌دهندگان حالا می‌توانند با نسخه سبک و فشرده مدل ACE-Step 1.5، بدون نیاز به نصب محیط‌های پیچیده پایتورچ، مستقیماً روی سیستم شخصی خود آهنگ بسازند. این انتشار جامعه‌محور با فرمت GGUF و یک موتور سبک ++C عرضه شده و امکان تولید فایل‌های صوتی استریو با کیفیت ۴۸ کیلوهرتز را روی پردازنده‌ها و کارت‌های گرافیک مختلف فراهم می‌کند.

تولید موزیک با هوش مصنوعی بدون دردسر پایتورچ؛ انتشار نسخه سبک و محلی ACE-Step 1.5

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل تولید موسیقی ACE-Step 1.5 حالا با فرمت فشرده GGUF و موتور سبک ++C منتشر شده و بدون نیاز به پایتورچ یا پیش‌نیازهای سنگین، روی سیستم‌های شخصی اجرا می‌شود.
  • این ابزار به جای نیاز به سیستم‌های سنگین، روی پردازنده اصلی (CPU)، کارت‌های انویدیا (CUDA)، مک‌های اپل (Metal) و حتی Vulkan اجرا می‌شود و خروجی صوتی ۴۸ کیلوهرتز استریو تحویل می‌دهد.
  • معماری مدولار مدل به شما اجازه می‌دهد مدل زبانی و ترنسفورمر دیفیوژن را مستقل از هم انتخاب کنید و با دانلود حدود ۷.۷ گیگابایت، یک استودیوی کامل تولید صدا داشته باشید.

عرضه وزن‌های فشرده GGUF و موتور ++C برای مدل ACE-Step 1.5

در یک انتشار جامعه‌محور GGUF، مؤلفه‌های مختلف مدل تولید موسیقی ACE-Step 1.5 در قالب فایل‌های کوانتیزه‌شده و بهینه بسته‌بندی شده‌اند و در کنار acestep.cpp قرار گرفته‌اند؛ یک موتور اجرای پرتابل بر پایه استاندارد C++17 که با کتابخانه GGML ساخته شده است. به لطف این انتشار، توسعه‌دهندگان حالا می‌توانند بدون نیاز به راه‌اندازی محیط‌های سنگین پایتورچ (PyTorch)، درایورهای اختصاصی CUDA و فایل‌های چک‌پوینت پرحجم با دقت کامل، موسیقی استریو با کیفیت ۴۸ کیلوهرتز را مستقیماً روی سیستم شخصی‌شان بسازند.

فرمت محبوب GGUF تانسورها و متادیتای مدل را طوری ذخیره می‌کند که بارگذاری و کوانتیزه‌سازی با کم‌ترین مصرف حافظه و بالا‌ترین کارایی انجام شود. این نسخه جدید، همان شیوه استقرار سبک و بهینه‌ای را که پیش‌تر در مدل‌های زبانی محلی دیده بودیم، به خط لوله ساخت موسیقی از متن (Text-to-Music) آورده است. این موتور پرتابل یک توضیح متنی (پرامپت) و در صورت تمایل شعر ترانه را دریافت کرده و سپس روی پردازنده اصلی (CPU)، کارت‌های گرافیک انویدیا (CUDA)، اپل سیلیکون (Metal) یا رابط Vulkan اجرا می‌شود. البته سطح کارایی و پشتیبانی از شتاب‌دهنده‌ها به فلگ‌های بیلد، سخت‌افزار سیستم و دقت کوانتیزه‌سازی انتخابی بستگی دارد.

این نسخه جدید شامل چه مواردی است؟

بخش
جزئیات
نحوه انتشار
تبدیل‌های جامعه‌محور GGUF همراه با موتور اجرای اختصاصی ++C
ورودی
توضیح متنی (پرامپت)، متن ترانه اختیاری و تنظیمات تولید
خروجی
فایل صوتی استریو با کیفیت ۴۸ کیلوهرتز
رابط‌های کاربری
سرور تحت وب به همراه ابزار‌های مستقل خط فرمان برای مدل زبانی و سنتز صدا
پلتفرم‌های پردازشی
پردازنده (CPU)، انویدیا (CUDA)، اپل (Metal) و ولکان (Vulkan)
حجم پیش‌فرض دانلود
حدود ۷.۷ گیگابایت برای مجموعه مدل‌های Q8_0 Turbo

چهار فایل و دو مرحله مجزا برای ساخت صدا

معماری مدل ACE-Step فرآیند برنامه‌ریزی، تولید کدهای صوتی و سنتز نهایی شکل‌موج صدا را میان چند مدل تفکیک کرده است. این طراحی مدولار و منعطف به توسعه‌دهندگان اجازه می‌دهد مدل زبانی و ترنسفورمر دیفیوژن (Diffusion Transformer) را مستقل از یکدیگر انتخاب کنند؛ در حالی که انکودر متنی و بخش VAE همچنان به معماری پایه آموزش مدل متصل می‌مانند.

مؤلفه
نقش
نسخه‌های موجود
اینکودر متنی (Text encoder)
توضیحات و متن ترانه را به بردارهای شرطی تبدیل می‌کند که توسط ترنسفورمر دیفیوژن به کار گرفته می‌شوند. جایگزین کردن این بخش با مدل امبدینگ دیگر، بازنمایی‌های یادگرفته‌شده در زمان آموزش را مختل خواهد کرد.
مدل Qwen3-Embedding-0.6B با فرمت‌های BF16 یا Q8_0
مدل زبانی (Language model)
درخواست اولیه را به متادیتای آهنگ، شعر ترانه و دنباله‌ای از کدهای صوتی ۵ هرتزی بسط می‌دهد. در نرخ ۵ هرتز، هر کد ۲۰۰ میلی‌ثانیه را پوشش می‌دهد و دایره لغات کدهای صوتی شامل ۶۴٬۰۰۰ ورودی است.
مدل‌های مبتنی بر Qwen3 در ابعاد ۰.۶B، ۱.۷B و ۴B
ترنسفورمر دیفیوژن (Diffusion transformer)
با بهره‌گیری از تکنیک Flow Matching نقشه اولیه را به متغیرهای پنهان صوتی ۲۵ هرتزی تبدیل می‌کند و طنین، جزئیات ظریف صدا و ساختار استریو را شکل می‌دهد.
—

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

آیا VPN واقعاً حریم خصوصی شما را در ChatGPT و Claude حفظ می‌کند؟ پشت پرده ذخیره چت‌ها در هوش مصنوعی
آخرین اخبار

آیا VPN واقعاً حریم خصوصی شما را در ChatGPT و Claude حفظ می‌کند؟ پشت پرده ذخیره چت‌ها در هوش مصنوعی

شاید تصور کنید روشن کردن VPN ردپای شما را در ابزار‌های هوش مصنوعی پاک می‌کند، اما واقعیت ماجرا کاملاً متفاوت است. فیلترشکن فقط آی‌پی و موقعیت مکانی شما را می‌پوشاند، در حالی که تک‌تک پیام‌ها، فایل‌ها و پرامپت‌های ارسالی‌تان روی سرور‌های هوش مصنوعی ذخیره و تحلیل می‌شوند.

۴ دقیقه مطالعه
۰
۱۸ مهر
بهترین ایجنت‌های هوش مصنوعی در پیامک و چت؛ دستیارهای هوشمندی که بدون اپلیکیشن همه‌کار می‌کنند
آخرین اخبار

بهترین ایجنت‌های هوش مصنوعی در پیامک و چت؛ دستیارهای هوشمندی که بدون اپلیکیشن همه‌کار می‌کنند

به جای نصب ده‌ها اپلیکیشن جداگانه، حالا می‌توانید با ارسال یک پیامک ساده کارهایتان را به باهوش‌ترین ایجنت‌های هوش مصنوعی بسپارید. از برنامه‌ریزی سفر و خرید آنلاین گرفته تا مدیریت امور اداری و هماهنگی برنامه‌های خانه، این دستیارهای پیامکی همیشه در دسترس شما هستند تا زحمت کار‌های تکراری را کم کنند. در این مقاله جذاب، با بهترین ایجنت‌های فعال در پیام‌رسان‌ها و قابلیت‌های کاربردی آن‌ها آشنا می‌شوید.

۱۲ دقیقه مطالعه
۰
۱۸ مهر
اورکات دوباره زنده می‌شود؟ خالق این شبکه محبوب به جنگ محتوای هوش مصنوعی و الگوریتم‌ها می‌رود
آخرین اخبار

اورکات دوباره زنده می‌شود؟ خالق این شبکه محبوب به جنگ محتوای هوش مصنوعی و الگوریتم‌ها می‌رود

اورکات، یکی از محبوب‌ترین شبکه‌های اجتماعی اوایل دهه ۲۰۰۰، شاید به‌زودی دوباره زنده شود. اورکات بویوک‌کوکتن، خالق این پلتفرم نوستالژیک، از کاربران خواسته برای احیای آن همراهی کنند تا اینترنت را از تسلط الگوریتم‌های سرد و محتوای تولیدشده با هوش مصنوعی نجات دهند. او معتقد است ارتباط اصیل انسانی در هیاهوی فناوری محو شده و وقت بازسازی دوباره وبِ دوست‌داشتنی فرا رسیده است.

۲ دقیقه مطالعه
۰
۱۸ مهر