تولید موزیک با هوش مصنوعی بدون دردسر پایتورچ؛ انتشار نسخه سبک و محلی ACE-Step 1.5
توسعهدهندگان حالا میتوانند با نسخه سبک و فشرده مدل ACE-Step 1.5، بدون نیاز به نصب محیطهای پیچیده پایتورچ، مستقیماً روی سیستم شخصی خود آهنگ بسازند. این انتشار جامعهمحور با فرمت GGUF و یک موتور سبک ++C عرضه شده و امکان تولید فایلهای صوتی استریو با کیفیت ۴۸ کیلوهرتز را روی پردازندهها و کارتهای گرافیک مختلف فراهم میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- مدل تولید موسیقی ACE-Step 1.5 حالا با فرمت فشرده GGUF و موتور سبک ++C منتشر شده و بدون نیاز به پایتورچ یا پیشنیازهای سنگین، روی سیستمهای شخصی اجرا میشود.
- این ابزار به جای نیاز به سیستمهای سنگین، روی پردازنده اصلی (CPU)، کارتهای انویدیا (CUDA)، مکهای اپل (Metal) و حتی Vulkan اجرا میشود و خروجی صوتی ۴۸ کیلوهرتز استریو تحویل میدهد.
- معماری مدولار مدل به شما اجازه میدهد مدل زبانی و ترنسفورمر دیفیوژن را مستقل از هم انتخاب کنید و با دانلود حدود ۷.۷ گیگابایت، یک استودیوی کامل تولید صدا داشته باشید.
عرضه وزنهای فشرده GGUF و موتور ++C برای مدل ACE-Step 1.5
در یک انتشار جامعهمحور GGUF، مؤلفههای مختلف مدل تولید موسیقی ACE-Step 1.5 در قالب فایلهای کوانتیزهشده و بهینه بستهبندی شدهاند و در کنار acestep.cpp قرار گرفتهاند؛ یک موتور اجرای پرتابل بر پایه استاندارد C++17 که با کتابخانه GGML ساخته شده است. به لطف این انتشار، توسعهدهندگان حالا میتوانند بدون نیاز به راهاندازی محیطهای سنگین پایتورچ (PyTorch)، درایورهای اختصاصی CUDA و فایلهای چکپوینت پرحجم با دقت کامل، موسیقی استریو با کیفیت ۴۸ کیلوهرتز را مستقیماً روی سیستم شخصیشان بسازند.
فرمت محبوب GGUF تانسورها و متادیتای مدل را طوری ذخیره میکند که بارگذاری و کوانتیزهسازی با کمترین مصرف حافظه و بالاترین کارایی انجام شود. این نسخه جدید، همان شیوه استقرار سبک و بهینهای را که پیشتر در مدلهای زبانی محلی دیده بودیم، به خط لوله ساخت موسیقی از متن (Text-to-Music) آورده است. این موتور پرتابل یک توضیح متنی (پرامپت) و در صورت تمایل شعر ترانه را دریافت کرده و سپس روی پردازنده اصلی (CPU)، کارتهای گرافیک انویدیا (CUDA)، اپل سیلیکون (Metal) یا رابط Vulkan اجرا میشود. البته سطح کارایی و پشتیبانی از شتابدهندهها به فلگهای بیلد، سختافزار سیستم و دقت کوانتیزهسازی انتخابی بستگی دارد.
این نسخه جدید شامل چه مواردی است؟
بخش | جزئیات |
|---|---|
نحوه انتشار | تبدیلهای جامعهمحور GGUF همراه با موتور اجرای اختصاصی ++C |
ورودی | توضیح متنی (پرامپت)، متن ترانه اختیاری و تنظیمات تولید |
خروجی | فایل صوتی استریو با کیفیت ۴۸ کیلوهرتز |
رابطهای کاربری | سرور تحت وب به همراه ابزارهای مستقل خط فرمان برای مدل زبانی و سنتز صدا |
پلتفرمهای پردازشی | پردازنده (CPU)، انویدیا (CUDA)، اپل (Metal) و ولکان (Vulkan) |
حجم پیشفرض دانلود | حدود ۷.۷ گیگابایت برای مجموعه مدلهای Q8_0 Turbo |
چهار فایل و دو مرحله مجزا برای ساخت صدا
معماری مدل ACE-Step فرآیند برنامهریزی، تولید کدهای صوتی و سنتز نهایی شکلموج صدا را میان چند مدل تفکیک کرده است. این طراحی مدولار و منعطف به توسعهدهندگان اجازه میدهد مدل زبانی و ترنسفورمر دیفیوژن (Diffusion Transformer) را مستقل از یکدیگر انتخاب کنند؛ در حالی که انکودر متنی و بخش VAE همچنان به معماری پایه آموزش مدل متصل میمانند.
مؤلفه | نقش | نسخههای موجود |
|---|---|---|
اینکودر متنی (Text encoder) | توضیحات و متن ترانه را به بردارهای شرطی تبدیل میکند که توسط ترنسفورمر دیفیوژن به کار گرفته میشوند. جایگزین کردن این بخش با مدل امبدینگ دیگر، بازنماییهای یادگرفتهشده در زمان آموزش را مختل خواهد کرد. | مدل Qwen3-Embedding-0.6B با فرمتهای BF16 یا Q8_0 |
مدل زبانی (Language model) | درخواست اولیه را به متادیتای آهنگ، شعر ترانه و دنبالهای از کدهای صوتی ۵ هرتزی بسط میدهد. در نرخ ۵ هرتز، هر کد ۲۰۰ میلیثانیه را پوشش میدهد و دایره لغات کدهای صوتی شامل ۶۴٬۰۰۰ ورودی است. | مدلهای مبتنی بر Qwen3 در ابعاد ۰.۶B، ۱.۷B و ۴B |
ترنسفورمر دیفیوژن (Diffusion transformer) | با بهرهگیری از تکنیک Flow Matching نقشه اولیه را به متغیرهای پنهان صوتی ۲۵ هرتزی تبدیل میکند و طنین، جزئیات ظریف صدا و ساختار استریو را شکل میدهد. | — |
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

آیا VPN واقعاً حریم خصوصی شما را در ChatGPT و Claude حفظ میکند؟ پشت پرده ذخیره چتها در هوش مصنوعی
شاید تصور کنید روشن کردن VPN ردپای شما را در ابزارهای هوش مصنوعی پاک میکند، اما واقعیت ماجرا کاملاً متفاوت است. فیلترشکن فقط آیپی و موقعیت مکانی شما را میپوشاند، در حالی که تکتک پیامها، فایلها و پرامپتهای ارسالیتان روی سرورهای هوش مصنوعی ذخیره و تحلیل میشوند.

بهترین ایجنتهای هوش مصنوعی در پیامک و چت؛ دستیارهای هوشمندی که بدون اپلیکیشن همهکار میکنند
به جای نصب دهها اپلیکیشن جداگانه، حالا میتوانید با ارسال یک پیامک ساده کارهایتان را به باهوشترین ایجنتهای هوش مصنوعی بسپارید. از برنامهریزی سفر و خرید آنلاین گرفته تا مدیریت امور اداری و هماهنگی برنامههای خانه، این دستیارهای پیامکی همیشه در دسترس شما هستند تا زحمت کارهای تکراری را کم کنند. در این مقاله جذاب، با بهترین ایجنتهای فعال در پیامرسانها و قابلیتهای کاربردی آنها آشنا میشوید.

اورکات دوباره زنده میشود؟ خالق این شبکه محبوب به جنگ محتوای هوش مصنوعی و الگوریتمها میرود
اورکات، یکی از محبوبترین شبکههای اجتماعی اوایل دهه ۲۰۰۰، شاید بهزودی دوباره زنده شود. اورکات بویوککوکتن، خالق این پلتفرم نوستالژیک، از کاربران خواسته برای احیای آن همراهی کنند تا اینترنت را از تسلط الگوریتمهای سرد و محتوای تولیدشده با هوش مصنوعی نجات دهند. او معتقد است ارتباط اصیل انسانی در هیاهوی فناوری محو شده و وقت بازسازی دوباره وبِ دوستداشتنی فرا رسیده است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.