پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

گوگل مدل‌های صوتی Gemini 3.8 Flash TTS و نسخه Lite را با قابلیت کنترل احساسات معرفی کرد

انتشار:۱ مهر ۱۴۰۵(۴ روز پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

شرکت Google مدل‌های تبدیل متن به گفتار Gemini 3.8 Flash TTS و 3.8 Flash-Lite TTS را با قابلیت تولید صدای احساسی و بسیار طبیعی رونمایی کرد.

گوگل مدل‌های صوتی Gemini 3.8 Flash TTS و نسخه Lite را با قابلیت کنترل احساسات معرفی کرد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • گوگل دو مدل صوتی جدید Gemini 3.8 Flash TTS و نسخه مقرون‌به‌صرفه‌تر Lite را با قابلیت کنترل دقیق احساسات و لحن صدا معرفی کرده است.
  • این مدل‌ها از بیش از ۲۰۰ برچسب صوتی برای تنظیم سرعت، احساسات و لحن در بیش از ۷۰ زبان پشتیبانی می‌کنند و خروجی باکیفیت 24 kHz ارائه می‌دهند.
  • توسعه‌دهندگان می‌توانند با ترکیب این مدل‌ها با نسخه متنی Gemini 3.8 Flash، یک مسیر یکپارچه برای نگارش متن و تولید مستقیم صدای آن ایجاد کنند.

مدل Gemini 3.8 Flash TTS قابلیت هدایت گفتار با پرامپت را اضافه می‌کند

شرکت Google مدل‌های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS را به مستندات سرویس تبدیل متن به گفتار خود اضافه کرده است. این مدل‌های صوتی از طریق Gemini API و محیط کاربری Google AI Studio در دسترس هستند. طبق اعلام Google، این دو نسخه طبیعی‌ترین و پویاترین مدل‌های تولید گفتار این شرکت تا به امروز محسوب می‌شوند؛ نسخه Flash برای عملکردهای غنی‌تر و نسخه Flash-Lite برای تولید محتوای انبوه با هزینه کمتر طراحی شده است.

این انتشار پس از عرضه مدل متنی 3.8 Flash صورت می‌گیرد که سومین به‌روزرسانی سری Flash شرکت Google طی شش هفته گذشته به شمار می‌رود. توسعه‌دهندگان می‌توانند با استفاده از مدل متنی، یک نمایشنامه یا متن را بنویسند و سپس آن را برای خوانش به مدل TTS در پلتفرم Gemini API ارسال کنند.

هدایت عملکرد صوتی از طریق پرامپت

پیش‌تر، مدل Gemini 3.1 Flash TTS ساختار کنترلی اولیه‌ای را معرفی کرده بود که اکنون در مدل‌های سری 3.8 توسعه یافته است. این سیستم با بیش از ۲۰۰ برچسب صوتی به برنامه‌ها اجازه می‌دهد تا احساسات، سرعت، بلندی صدا و نحوه بیان را در بیش از ۷۰ زبان مختلف هدایت کنند. به گفته Google، نسل جدید ضمن حفظ این کنترل‌ها، میزان انتقال احساسات را بهبود بخشیده و نسخه ارزان‌تر Lite را نیز به این مجموعه افزوده است.

  • برچسب‌های درون‌خطی مانند [whispers]، [excited]، [short pause] و [slow] می‌توانند نحوه بیان را در طول یک جمله تغییر دهند.
  • پلتفرم Google AI Studio یک محیط کاری شبیه به کارگردانی برای تعریف پروفایل‌های صوتی شخصیت‌ها و زمینه صحنه ارائه می‌دهد.
  • قابلیت تولید گفتار دو گوینده، امکان استفاده از صدا و سبک مجزا را برای هر شخصیت فراهم می‌کند.
  • خروجی صوتی با کیفیت 24 kHz و فرمت 16-bit mono PCM ارائه می‌شود.
  • سیستم SynthID یک واترمارک نامرئی در خروجی قرار می‌دهد تا شناسایی صداهای تولیدشده توسط هوش مصنوعی آسان‌تر شود.

ایجاد یک مسیر پردازشی دو مرحله‌ای

برنامه‌ها معمولاً ابتدا یک متن را تولید یا دریافت می‌کنند، برچسب‌های گوینده و نحوه بیان را به آن می‌افزایند و سپس درخواست خود را به نقطه پایانی TTS ارسال می‌کنند. راهنمای صوتی این شرکت، یک درخواست با دو گوینده را با استفاده از Python SDK نشان می‌دهد:

from google import genai

client = genai.Client()

tts = client.interactions.create(
    model=\"gemini-3.8-flash-tts\",
    input=\"\"\"Anya: [excited] Welcome back to the show!
Liam: [warm] Today, we are looking at speech generation.\"\"\",
    response_format={\"type\": \"audio\"},
    generation_config={
        \"speech_config\": [
            {\"speaker\": \"Anya\", \"voice\": \"Kore\"},
            {\"speaker\": \"Liam\", \"voice\": \"Puck\"},
        ]
    },
)

پاسخ دریافتی به جای متن، حاوی صدای تولیدشده است. کلاینت‌هایی که صدای خام PCM را دریافت می‌کنند، ممکن است پیش از ارسال فایل به پخش‌کننده‌ها یا نرم‌افزارهای ویرایشی که نیازمند فرمت .wav هستند، مجبور به افزودن یک کانتینر WAV شوند.

انتخاب مدل متناسب با حجم کار

مدل
هدف اصلی
کاربردهای رایج
Gemini 3.8 Flash TTS
بیان احساسی و کنترل دقیق لحن
کتاب‌های صوتی، بازی‌ها، پادکست‌ها، گویندگی تبلیغاتی
Gemini 3.8 Flash-Lite TTS
هزینه کمتر و سرعت پردازش بالاتر
هشدارها، ابزارهای دسترسی‌پذیری، تلفن‌های گویا (IVR)، تولید گفتار انبوه

مدل Gemini 3.1 Flash TTS یک مرجع قیمتی تاریخی ارائه می‌دهد: ۱ دلار به ازای هر یک میلیون توکن متنی ورودی و ۲۰ دلار به ازای هر یک میلیون توکن صوتی خروجی؛ که در آن صدا با نرخ ۲۵ توکن در ثانیه محاسبه می‌شود. با این نرخ تبدیل، یک دقیقه گفتار معادل ۱۵۰۰ توکن خروجی است و ۰.۰۳ دلار هزینه دارد که هزینه ناچیز توکن متنی ورودی نیز به آن اضافه می‌شود. نسخه 3.1 همچنین شامل یک طرح رایگان و ۵۰ درصد تخفیف برای پردازش‌های دسته‌ای (Batch) بود. Google مدل Flash-Lite را به عنوان گزینه ارزان‌تر در سری 3.8 معرفی می‌کند، هرچند برای بودجه‌بندی پروژه‌های تجاری باید به جای قیمت‌های مدل قبلی، از نرخ‌های جدید سری 3.8 استفاده کرد.

طراحی با در نظر گرفتن محدودیت‌ها

محدودیت
پیامد در پیاده‌سازی
دو گوینده در هر درخواست
صحنه‌هایی با شخصیت‌های بیشتر نیازمند چندین درخواست و ترکیب فایل‌های صوتی هستند.
عدم امکان شبیه‌سازی صدا
برنامه‌ها باید تنها از صداها و پروفایل‌های ارائه‌شده توسط Google استفاده کنند.
وضعیت آزمایشی API
رابط‌ها و عملکردهای سیستم ممکن است پیش از عرضه نسخه نهایی تغییر کنند.
طراحی‌شده برای متون از پیش نوشته‌شده
ایجنت‌های مکالمه‌ای زنده باید از Gemini Live API استفاده کنند.
احتمال افت کیفیت در تولید طولانی‌مدت
متون طولانی باید به بخش‌های چند دقیقه‌ای تقسیم شده و پس از تولید به هم متصل شوند.

تبدیل هدایت صوتی به کدنویسی

هدایت گفتار از طریق پرامپت، مهم‌ترین تغییر برای توسعه‌دهندگان محسوب می‌شود. موتورهای سنتی TTS معمولاً مجموعه کوچکی از کنترل‌های SSML و تنظیمات سراسری را ارائه می‌دهند. اما مدل‌های صوتی Gemini Flash توصیف ویژگی‌های شخصیتی، فضای صحنه، تعیین نقش‌ها و دستورات درون‌خطی صحنه را می‌پذیرند و به برنامه‌ها کنترل دقیق‌تری روی هر بخش از طریق متن می‌دهند.

ترکیب این مدل‌های صوتی با مدل Gemini 3.8 Flash یک مسیر یکپارچه از متن تا صدا را ایجاد می‌کند. تیم‌ها می‌توانند متن را تولید کنند، ساختار آن را بازنویسی کنند، برچسب‌های لحن بیان را تنظیم کرده و نتیجه نهایی را تنها از طریق یک مجموعه API یکپارچه دریافت کنند؛ موضوعی که نیاز به جابه‌جایی میان ابزارهای مختلف برای تولید گفتار متنی را به میزان قابل‌توجهی کاهش می‌دهد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر