کلون کردن هر صدایی فقط با یک کلیپ ۳ ثانیهای؛ قابلیت جذاب شبیهسازی آنی به مدل محبوب Kokoro-82M آمد
مدل سبک و سریع تبدیل متن به گفتار Kokoro-82M با دریافت یک آداپتور متنباز جدید، حالا میتواند تنها با یک کلیپ صوتی ۳ ثانیهای، هر صدایی را با بالاترین کیفیت کلون کند. این بهروزرسانی بدون دستکاری مدل اصلی کار میکند و توسعهدهندگان میتوانند خیلی راحت بستههای صوتی اختصاصی را مستقیماً در خطوط لوله فعلی خود به کار بگیرند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- آداپتور جدید kokoro-inno-clone-tuner قابلیت شبیهسازی آنی صدا (Zero-Shot) را به مدل محبوب و متنباز Kokoro-82M اضافه کرده که بدون نیاز به آموزش مجدد، از روی صدای مرجع خروجی تولید میکند.
- تنها با یک کلیپ صوتی ۳ تا ۳۰ ثانیهای تمیز از یک گوینده، یک بسته صوتی کامل سازگار با Kokoro تولید میشود که مستقیماً در پایپلاین صوتی قابل استفاده و ذخیرهسازی است.
- این ابزار به صورت پیشفرض در پروژه محبوب Kokoro-FastAPI (از نسخه ۰.۹.۰ به بعد) ادغام شده و امکان راهاندازی آسان سلفهاست را بدون نیاز به دانلود جداگانه انکودر صدا فراهم میکند.
قابلیت جذاب شبیهسازی آنی صدا به مدل Kokoro-82M اضافه شد
مدل Kokoro-82M یکی از آن گزینههای جذاب حوزه تبدیل متن به گفتار است که سرعت بسیار بالا، خروجیهای پایدار و مجموعهای از بستههای صوتی آماده را در کنار هم ارائه میدهد. حالا با انتشار آداپتور جدید kokoro-inno-clone-tuner، قابلیت تطبیق آنی صدا (Zero-Shot) هم به آن اضافه شده است؛ یعنی شما میتوانید تنها با داشتن یک کلیپ صوتی کوتاه از فردی که مدل تا حالا صدایش را نشنیده، بدون نیاز به هیچ آموزش مجدد یا فاینتیونینگی، صدای او را بازتولید کنید. نکته جذابتر اینکه مدل پایه کاملاً دستنخورده (Frozen) باقی میماند و آداپتور بستههای صوتی بومی خودِ Kokoro را تحویل میدهد، بنابراین پایپلاینها و پروژههای فعلی بدون نیاز به تغییر مدل سنتز صوت، میتوانند بلافاصله از نتیجه استفاده کنند.
تولید بسته صوتی بومی تنها با یک نمونه صدا
این آداپتور دور مدل Kokoro-82M قرار میگیرد و فایل صوتی مرجع را به یک تانسور استاندارد با ابعاد مشخص [510, 1, 256] در Kokoro تبدیل میکند. برنامهها میتوانند این تانسور را مستقیماً به KPipeline ارسال کنند یا اینکه آن را با دستور torch.save به عنوان یک فایل صوتی اختصاصی و قابل استفاده مجدد ذخیره نمایند.
ثبت نمونه صدا و تولید گفتار
# Shell
pip install inno-kokoroimport torch
from inno_kokoro.enroll import Tuner, enroll, read
from kokoro import KPipeline
tuner = Tuner()
pack, _ = enroll(*read("my_ref.wav"), tuner)
torch.save(pack, "my_voice.pt")
pipeline = KPipeline(lang_code="a")
result = next(
pipeline("Hello from a tuned voice.", voice=pack)
)
audio = result.audioتنها شرط کار این است که کلیپ صوتی مرجع بین ۳ تا ۳۰ ثانیه زمان داشته باشد، فقط شامل صدای یک گوینده باشد و کیفیت صوتی آن به اندازه کافی شفاف و تمیز باشد. در نسخه فعلی، این قابلیت از زبان انگلیسی پشتیبانی میکند.
استقرار سریع و بدون دردسر همراه با تفکیک مجوزها
پروژه Kokoro-FastAPI از نسخه ۰.۹.۰ به بعد این تیونر را درون خود جای داده است؛ قابلیتی که به سرویسهای سلفهاست (Self-Hosted) اجازه میدهد بدون بازنویسی لایه سرویسدهی خود، ثبت و کلونینگ صدا را پیادهسازی کنند. علاوه بر این، انکودر صدای ادغامشده باعث شده تا دیگر نیازی به دانلود جداگانه مدل ثانویه نباشد.
- کدها و وزنهای آداپتور: مجوز Apache-2.0
- انکودر صدای ادغامشده: مجوز CC BY-SA 3.0
بنابراین اگر قصد دارید کل این پکیج را در پروژههای خود بازتوزیع یا منتشر کنید، حتماً باید تعهدات هر دو مجوز را به دقت بررسی کنید؛ به خصوص شرایط مربوط به ذکر منبع (Attribution) و اشتراکگذاری مشابه (Share-Alike) که برای انکودر صدا در نظر گرفته شده است.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

چرا غولهای هوش مصنوعی چیزی ساختن که خودشون هم ازش وحشت دارن؟ ناگفتههای شنیدنی کوین روز
چرا چهرههایی مثل داریو آمودی و سم آلتمن با وجود هشدارهای ترسناک درباره خطرات هوش مصنوعی، همچنان دیوانهوار برای توسعه آن با هم مسابقه میدهند؟ کوین روز، روزنامهنگار باسابقه فناوری، در کتاب تازه و گفتوگوی جذاب خود پرده از اضطرابهای آخرالزمانی و پشتپرده رقابت جنونآمیز هوش مصنوعی در سانفرانسیسکو برمیدارد.

ابزارهای جدید هوش مصنوعی متا؛ ردگیری تبلیغات فریبندهای که به آزار کودکان ختم میشوند
متا ابزارهای جدیدی مبتنی بر هوش مصنوعی و مدلهای زبانی معرفی کرده تا تبلیغات به ظاهر سالمی را که کاربران را مخفیانه به سمت محتوای مجرمانه و آزار کودکان هدایت میکنند، ردگیری و مسدود کند. این شرکت با بررسی مقصد لینکها و بهکارگیری ایجنتهای هوش مصنوعی، درصدد بستن راههای فرار متخلفان برآمده است.

وقتی هوش مصنوعی ردپایش را پاک میکند: سوءاستفاده از باگ MathJax برای جعل لاگهای ایمنی در Inspect
پژوهشگران سازمان METR با کشف یک آسیبپذیری در فریمورک ایمنی Inspect نشان دادند که ایجنتهای هوش مصنوعی میتوانند با سوءاستفاده از کتابخانه MathJax، لاگهای عملکرد خود را دستکاری کنند و خطاهایشان را بپوشانند. هرچند این باگ تنها ظرف یک روز با یک پچ امنیتی برطرف شد، اما زنگ خطری جدی درباره نفوذپذیری ابزارهای نظارت بر هوش مصنوعی به صدا درآورد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.