پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

کلون کردن هر صدایی فقط با یک کلیپ ۳ ثانیه‌ای؛ قابلیت جذاب شبیه‌سازی آنی به مدل محبوب Kokoro-82M آمد

انتشار:۱۵ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه

مدل سبک و سریع تبدیل متن به گفتار Kokoro-82M با دریافت یک آداپتور متن‌باز جدید، حالا می‌تواند تنها با یک کلیپ صوتی ۳ ثانیه‌ای، هر صدایی را با بالا‌ترین کیفیت کلون کند. این به‌روزرسانی بدون دستکاری مدل اصلی کار می‌کند و توسعه‌دهندگان می‌توانند خیلی راحت بسته‌های صوتی اختصاصی را مستقیماً در خطوط لوله فعلی خود به کار بگیرند.

کلون کردن هر صدایی فقط با یک کلیپ ۳ ثانیه‌ای؛ قابلیت جذاب شبیه‌سازی آنی به مدل محبوب Kokoro-82M آمد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • آداپتور جدید kokoro-inno-clone-tuner قابلیت شبیه‌سازی آنی صدا (Zero-Shot) را به مدل محبوب و متن‌باز Kokoro-82M اضافه کرده که بدون نیاز به آموزش مجدد، از روی صدای مرجع خروجی تولید می‌کند.
  • تنها با یک کلیپ صوتی ۳ تا ۳۰ ثانیه‌ای تمیز از یک گوینده، یک بسته صوتی کامل سازگار با Kokoro تولید می‌شود که مستقیماً در پایپ‌لاین صوتی قابل استفاده و ذخیره‌سازی است.
  • این ابزار به صورت پیش‌فرض در پروژه محبوب Kokoro-FastAPI (از نسخه ۰.۹.۰ به بعد) ادغام شده و امکان راه‌اندازی آسان سلف‌هاست را بدون نیاز به دانلود جداگانه انکودر صدا فراهم می‌کند.

قابلیت جذاب شبیه‌سازی آنی صدا به مدل Kokoro-82M اضافه شد

مدل Kokoro-82M یکی از آن گزینه‌های جذاب حوزه تبدیل متن به گفتار است که سرعت بسیار بالا، خروجی‌های پایدار و مجموعه‌ای از بسته‌های صوتی آماده را در کنار هم ارائه می‌دهد. حالا با انتشار آداپتور جدید kokoro-inno-clone-tuner، قابلیت تطبیق آنی صدا (Zero-Shot) هم به آن اضافه شده است؛ یعنی شما می‌توانید تنها با داشتن یک کلیپ صوتی کوتاه از فردی که مدل تا حالا صدایش را نشنیده، بدون نیاز به هیچ آموزش مجدد یا فاین‌تیونینگی، صدای او را بازتولید کنید. نکته جذاب‌تر اینکه مدل پایه کاملاً دست‌نخورده (Frozen) باقی می‌ماند و آداپتور بسته‌های صوتی بومی خودِ Kokoro را تحویل می‌دهد، بنابراین پایپ‌لاین‌ها و پروژه‌های فعلی بدون نیاز به تغییر مدل سنتز صوت، می‌توانند بلافاصله از نتیجه استفاده کنند.

تولید بسته صوتی بومی تنها با یک نمونه صدا

این آداپتور دور مدل Kokoro-82M قرار می‌گیرد و فایل صوتی مرجع را به یک تانسور استاندارد با ابعاد مشخص [510, 1, 256] در Kokoro تبدیل می‌کند. برنامه‌ها می‌توانند این تانسور را مستقیماً به KPipeline ارسال کنند یا اینکه آن را با دستور torch.save به عنوان یک فایل صوتی اختصاصی و قابل استفاده مجدد ذخیره نمایند.

ثبت نمونه صدا و تولید گفتار

# Shell
pip install inno-kokoro
import torch

from inno_kokoro.enroll import Tuner, enroll, read
from kokoro import KPipeline

tuner = Tuner()
pack, _ = enroll(*read("my_ref.wav"), tuner)

torch.save(pack, "my_voice.pt")

pipeline = KPipeline(lang_code="a")
result = next(
    pipeline("Hello from a tuned voice.", voice=pack)
)
audio = result.audio

تنها شرط کار این است که کلیپ صوتی مرجع بین ۳ تا ۳۰ ثانیه زمان داشته باشد، فقط شامل صدای یک گوینده باشد و کیفیت صوتی آن به اندازه کافی شفاف و تمیز باشد. در نسخه فعلی، این قابلیت از زبان انگلیسی پشتیبانی می‌کند.

استقرار سریع و بدون دردسر همراه با تفکیک مجوزها

پروژه Kokoro-FastAPI از نسخه ۰.۹.۰ به بعد این تیونر را درون خود جای داده است؛ قابلیتی که به سرویس‌های سلف‌هاست (Self-Hosted) اجازه می‌دهد بدون بازنویسی لایه سرویس‌دهی خود، ثبت و کلونینگ صدا را پیاده‌سازی کنند. علاوه بر این، انکودر صدای ادغام‌شده باعث شده تا دیگر نیازی به دانلود جداگانه مدل ثانویه نباشد.

  • کدها و وزن‌های آداپتور: مجوز Apache-2.0
  • انکودر صدای ادغام‌شده: مجوز CC BY-SA 3.0

بنابراین اگر قصد دارید کل این پکیج را در پروژه‌های خود بازتوزیع یا منتشر کنید، حتماً باید تعهدات هر دو مجوز را به دقت بررسی کنید؛ به خصوص شرایط مربوط به ذکر منبع (Attribution) و اشتراک‌گذاری مشابه (Share-Alike) که برای انکودر صدا در نظر گرفته شده است.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

چرا غول‌های هوش مصنوعی چیزی ساختن که خودشون هم ازش وحشت دارن؟ ناگفته‌های شنیدنی کوین روز
آخرین اخبار

چرا غول‌های هوش مصنوعی چیزی ساختن که خودشون هم ازش وحشت دارن؟ ناگفته‌های شنیدنی کوین روز

چرا چهره‌هایی مثل داریو آمودی و سم آلتمن با وجود هشدارهای ترسناک درباره خطرات هوش مصنوعی، همچنان دیوانه‌وار برای توسعه آن با هم مسابقه می‌دهند؟ کوین روز، روزنامه‌نگار باسابقه فناوری، در کتاب تازه و گفت‌وگوی جذاب خود پرده از اضطراب‌های آخرالزمانی و پشت‌پرده رقابت جنون‌آمیز هوش مصنوعی در سان‌فرانسیسکو برمی‌دارد.

۹ دقیقه مطالعه
۰
۱۵ مهر
ابزار‌های جدید هوش مصنوعی متا؛ ردگیری تبلیغات فریبنده‌ای که به آزار کودکان ختم می‌شوند
آخرین اخبار

ابزار‌های جدید هوش مصنوعی متا؛ ردگیری تبلیغات فریبنده‌ای که به آزار کودکان ختم می‌شوند

متا ابزار‌های جدیدی مبتنی بر هوش مصنوعی و مدل‌های زبانی معرفی کرده تا تبلیغات به ظاهر سالمی را که کاربران را مخفیانه به سمت محتوای مجرمانه و آزار کودکان هدایت می‌کنند، ردگیری و مسدود کند. این شرکت با بررسی مقصد لینک‌ها و به‌کارگیری ایجنت‌های هوش مصنوعی، درصدد بستن راه‌های فرار متخلفان برآمده است.

۳ دقیقه مطالعه
۰
۱۵ مهر
وقتی هوش مصنوعی ردپایش را پاک می‌کند: سوءاستفاده از باگ MathJax برای جعل لاگ‌های ایمنی در Inspect
آخرین اخبار

وقتی هوش مصنوعی ردپایش را پاک می‌کند: سوءاستفاده از باگ MathJax برای جعل لاگ‌های ایمنی در Inspect

پژوهشگران سازمان METR با کشف یک آسیب‌پذیری در فریم‌ورک ایمنی Inspect نشان دادند که ایجنت‌های هوش مصنوعی می‌توانند با سوءاستفاده از کتابخانه MathJax، لاگ‌های عملکرد خود را دستکاری کنند و خطاهایشان را بپوشانند. هرچند این باگ تنها ظرف یک روز با یک پچ امنیتی برطرف شد، اما زنگ خطری جدی درباره نفوذپذیری ابزار‌های نظارت بر هوش مصنوعی به صدا درآورد.

۵ دقیقه مطالعه
۰
۱۵ مهر