گوگل مدلهای صوتی Gemini 3.8 Flash TTS و نسخه Lite را با قابلیت کنترل احساسات معرفی کرد
شرکت Google مدلهای تبدیل متن به گفتار Gemini 3.8 Flash TTS و 3.8 Flash-Lite TTS را با قابلیت تولید صدای احساسی و بسیار طبیعی رونمایی کرد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- گوگل دو مدل صوتی جدید Gemini 3.8 Flash TTS و نسخه مقرونبهصرفهتر Lite را با قابلیت کنترل دقیق احساسات و لحن صدا معرفی کرده است.
- این مدلها از بیش از ۲۰۰ برچسب صوتی برای تنظیم سرعت، احساسات و لحن در بیش از ۷۰ زبان پشتیبانی میکنند و خروجی باکیفیت 24 kHz ارائه میدهند.
- توسعهدهندگان میتوانند با ترکیب این مدلها با نسخه متنی Gemini 3.8 Flash، یک مسیر یکپارچه برای نگارش متن و تولید مستقیم صدای آن ایجاد کنند.
مدل Gemini 3.8 Flash TTS قابلیت هدایت گفتار با پرامپت را اضافه میکند
شرکت Google مدلهای Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS را به مستندات سرویس تبدیل متن به گفتار خود اضافه کرده است. این مدلهای صوتی از طریق Gemini API و محیط کاربری Google AI Studio در دسترس هستند. طبق اعلام Google، این دو نسخه طبیعیترین و پویاترین مدلهای تولید گفتار این شرکت تا به امروز محسوب میشوند؛ نسخه Flash برای عملکردهای غنیتر و نسخه Flash-Lite برای تولید محتوای انبوه با هزینه کمتر طراحی شده است.
این انتشار پس از عرضه مدل متنی 3.8 Flash صورت میگیرد که سومین بهروزرسانی سری Flash شرکت Google طی شش هفته گذشته به شمار میرود. توسعهدهندگان میتوانند با استفاده از مدل متنی، یک نمایشنامه یا متن را بنویسند و سپس آن را برای خوانش به مدل TTS در پلتفرم Gemini API ارسال کنند.
هدایت عملکرد صوتی از طریق پرامپت
پیشتر، مدل Gemini 3.1 Flash TTS ساختار کنترلی اولیهای را معرفی کرده بود که اکنون در مدلهای سری 3.8 توسعه یافته است. این سیستم با بیش از ۲۰۰ برچسب صوتی به برنامهها اجازه میدهد تا احساسات، سرعت، بلندی صدا و نحوه بیان را در بیش از ۷۰ زبان مختلف هدایت کنند. به گفته Google، نسل جدید ضمن حفظ این کنترلها، میزان انتقال احساسات را بهبود بخشیده و نسخه ارزانتر Lite را نیز به این مجموعه افزوده است.
- برچسبهای درونخطی مانند
[whispers]،[excited]،[short pause]و[slow]میتوانند نحوه بیان را در طول یک جمله تغییر دهند. - پلتفرم Google AI Studio یک محیط کاری شبیه به کارگردانی برای تعریف پروفایلهای صوتی شخصیتها و زمینه صحنه ارائه میدهد.
- قابلیت تولید گفتار دو گوینده، امکان استفاده از صدا و سبک مجزا را برای هر شخصیت فراهم میکند.
- خروجی صوتی با کیفیت 24 kHz و فرمت 16-bit mono PCM ارائه میشود.
- سیستم SynthID یک واترمارک نامرئی در خروجی قرار میدهد تا شناسایی صداهای تولیدشده توسط هوش مصنوعی آسانتر شود.
ایجاد یک مسیر پردازشی دو مرحلهای
برنامهها معمولاً ابتدا یک متن را تولید یا دریافت میکنند، برچسبهای گوینده و نحوه بیان را به آن میافزایند و سپس درخواست خود را به نقطه پایانی TTS ارسال میکنند. راهنمای صوتی این شرکت، یک درخواست با دو گوینده را با استفاده از Python SDK نشان میدهد:
from google import genai
client = genai.Client()
tts = client.interactions.create(
model=\"gemini-3.8-flash-tts\",
input=\"\"\"Anya: [excited] Welcome back to the show!
Liam: [warm] Today, we are looking at speech generation.\"\"\",
response_format={\"type\": \"audio\"},
generation_config={
\"speech_config\": [
{\"speaker\": \"Anya\", \"voice\": \"Kore\"},
{\"speaker\": \"Liam\", \"voice\": \"Puck\"},
]
},
)پاسخ دریافتی به جای متن، حاوی صدای تولیدشده است. کلاینتهایی که صدای خام PCM را دریافت میکنند، ممکن است پیش از ارسال فایل به پخشکنندهها یا نرمافزارهای ویرایشی که نیازمند فرمت .wav هستند، مجبور به افزودن یک کانتینر WAV شوند.
انتخاب مدل متناسب با حجم کار
مدل | هدف اصلی | کاربردهای رایج |
|---|---|---|
Gemini 3.8 Flash TTS | بیان احساسی و کنترل دقیق لحن | کتابهای صوتی، بازیها، پادکستها، گویندگی تبلیغاتی |
Gemini 3.8 Flash-Lite TTS | هزینه کمتر و سرعت پردازش بالاتر | هشدارها، ابزارهای دسترسیپذیری، تلفنهای گویا (IVR)، تولید گفتار انبوه |
مدل Gemini 3.1 Flash TTS یک مرجع قیمتی تاریخی ارائه میدهد: ۱ دلار به ازای هر یک میلیون توکن متنی ورودی و ۲۰ دلار به ازای هر یک میلیون توکن صوتی خروجی؛ که در آن صدا با نرخ ۲۵ توکن در ثانیه محاسبه میشود. با این نرخ تبدیل، یک دقیقه گفتار معادل ۱۵۰۰ توکن خروجی است و ۰.۰۳ دلار هزینه دارد که هزینه ناچیز توکن متنی ورودی نیز به آن اضافه میشود. نسخه 3.1 همچنین شامل یک طرح رایگان و ۵۰ درصد تخفیف برای پردازشهای دستهای (Batch) بود. Google مدل Flash-Lite را به عنوان گزینه ارزانتر در سری 3.8 معرفی میکند، هرچند برای بودجهبندی پروژههای تجاری باید به جای قیمتهای مدل قبلی، از نرخهای جدید سری 3.8 استفاده کرد.
طراحی با در نظر گرفتن محدودیتها
محدودیت | پیامد در پیادهسازی |
|---|---|
دو گوینده در هر درخواست | صحنههایی با شخصیتهای بیشتر نیازمند چندین درخواست و ترکیب فایلهای صوتی هستند. |
عدم امکان شبیهسازی صدا | برنامهها باید تنها از صداها و پروفایلهای ارائهشده توسط Google استفاده کنند. |
وضعیت آزمایشی API | رابطها و عملکردهای سیستم ممکن است پیش از عرضه نسخه نهایی تغییر کنند. |
طراحیشده برای متون از پیش نوشتهشده | ایجنتهای مکالمهای زنده باید از Gemini Live API استفاده کنند. |
احتمال افت کیفیت در تولید طولانیمدت | متون طولانی باید به بخشهای چند دقیقهای تقسیم شده و پس از تولید به هم متصل شوند. |
تبدیل هدایت صوتی به کدنویسی
هدایت گفتار از طریق پرامپت، مهمترین تغییر برای توسعهدهندگان محسوب میشود. موتورهای سنتی TTS معمولاً مجموعه کوچکی از کنترلهای SSML و تنظیمات سراسری را ارائه میدهند. اما مدلهای صوتی Gemini Flash توصیف ویژگیهای شخصیتی، فضای صحنه، تعیین نقشها و دستورات درونخطی صحنه را میپذیرند و به برنامهها کنترل دقیقتری روی هر بخش از طریق متن میدهند.
ترکیب این مدلهای صوتی با مدل Gemini 3.8 Flash یک مسیر یکپارچه از متن تا صدا را ایجاد میکند. تیمها میتوانند متن را تولید کنند، ساختار آن را بازنویسی کنند، برچسبهای لحن بیان را تنظیم کرده و نتیجه نهایی را تنها از طریق یک مجموعه API یکپارچه دریافت کنند؛ موضوعی که نیاز به جابهجایی میان ابزارهای مختلف برای تولید گفتار متنی را به میزان قابلتوجهی کاهش میدهد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.