شاهکار جدید Fish Audio در تبدیل صوت به متن: تشخیص گوینده و احساسات فقط با ساعتی ۳۶ سنت!
استارتاپ Fish Audio با رونمایی از مدل transcribe-1-pro، قابلیت جذاب تفکیک گویندگان و برچسبگذاری احساسات مختلف را در کنار تبدیل گفتار به متن با هزینه استثنایی ساعتی ۳۶ سنت در دسترس توسعهدهندگان قرار داد. این نوآوری با یکدست کردن تمام خروجیهای صوتی در یک فراخوانی ساده، کار ایجنتهای هوشمند، پردازش پادکستها و خلاصهسازی جلسات را فوقالعاده راحت و کمهزینه میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ Fish Audio از مدل جدید transcribe-1-pro رونمایی کرد که علاوه بر تبدیل گفتار به متن، به صورت همزمان گویندهها و حتی حسوحال صدا مثل خنده و هیجان را تشخیص میدهد.
- هزینه استفاده از این نسخه حرفهای فوقالعاده اقتصادی است و درست مثل مدل استاندارد قبلی، به ازای هر ساعت فایل صوتی تنها ۰.۳۶ دلار (۳۶ سنت) محاسبه میشود.
- این مدل از ۸۳ زبان مختلف پشتیبانی میکند و با ارسال دادههای متن، گویندگان و برچسبهای احساسی در یک پاسخ یکپارچه، کار ایجنتهای صوتی و تحلیل جلسات را به مراتب سادهتر کرده است.
قابلیتهای جدید در نسخه Pro تبدیل صوت به متن Fish Audio؛ تشخیص گوینده و ریزهکاریهای لحن
استارتاپ صوتی Fish Audio با معرفی مدل transcribe-1-pro دو قابلیت فوقالعاده کاربردی را به API تبدیل گفتار به متن (STT) خود اضافه کرده است: تفکیک گویندگان (Speaker Diarization) که مشخص میکند چه کسی در چه زمانی صحبت کرده، و برچسبگذاری رویدادهای صوتی لحن. این مدل هوش مصنوعی در کنار تشخیص خودکار زبان و ثبت دقیق زمانبندی (تایماستمپ) در سطح هر کلمه، تغییر گویندگان، احساسات کلامی و صداهایی مثل خندیدن را مستقیماً داخل متن پیاده میکند. به لطف این ویژگی، سیستمهای مدیریت جلسه، سامانههای پشتیبانی مشتریان، پادکستها و ایجنتهای صوتی میتوانند تمام این سیگنالها را تنها در یک مرحله پردازش صوتی دریافت کنند.
نکته جالب اینجاست که هر دو مدل transcribe-1-pro و مدل استاندارد transcribe-1 از اندپوینت POST /v1/asr استفاده میکنند؛ بنابراین کاربرانی که از قبل از این سرویس استفاده میکردند، تنها با تغییر یک هدر ساده در درخواست HTTP میتوانند نسخه Pro را فعال کنند، بدون اینکه نیاز باشد ساختار اندپوینت یا فرمت درخواستشان را دستکاری کنند.
همه مکالمات در قالب یک خروجی یکپارچه
در فیلد text پاسخ دریافتی، از نشانگرهای درونمتنی به فرمت <|speaker:N|> استفاده شده که در آن N یک شناسه عددی برای هر گوینده است. هر نشانگر تا زمان رسیدن به گوینده بعدی معتبر میماند و اگر همان فرد دوباره شروع به صحبت کند، همان شناسه قبلی برایش ثبت میشود. برنامهها در صورت نیاز میتوانند این شناسهها را به نام واقعی افراد متصل کنند. همچنین احساسات و رویدادهای کلامی به صورت تگهای داخل براکت در کنار کلمات مربوطه ظاهر میشوند.
{
\"text\": \"<|speaker:0|>Hello.<|speaker:1|>[happy]Nice to meet you.<|speaker:0|>Same here.\",
\"duration\": 6.4,
\"segments\": [],
\"language_code\": \"en\",
\"language\": \"English\"
}اگر درخواست دریافت تایماستمپ را ارسال کرده باشید، بخش segments حاوی کلمات اداشده خواهد بود که البته نشانگرهای گوینده، احساسات و رویدادها از آن حذف شدهاند. با توجه به اینکه این بخش فاقد فیلد مجزای speaker_id برای هر سگمنت است، سیستمهای تولید زیرنویس که به برچسبهای زمانبندیشده گویندهها نیاز دارند، باید متن حاشیهنویسیشده را با متن دارای تایماستمپ تطبیق دهند.
با یک رجکس (Regular Expression) ساده و جمعوجور در پایتون میتوانید این رشته را به آبجکتهای تفکیکشده برای مراحل بعدی پردازش تبدیل کنید:
import re
pattern = r\"<\\|speaker:(\\d+)\\|>(.*?)(?=<\\|speaker:\\d+\\|>|$)\"
for turn in re.finditer(pattern, result[\"text\"], re.DOTALL):
speaker_id = turn.group(1)
text = turn.group(2).strip()
print(f\"Speaker {speaker_id}: {text}\")پروژههای فعلی میتوانند به سادگی با اضافه کردن هدر model: transcribe-1-pro به درخواست خود، این مدل جدید را به کار بگیرند. مراحل احراز هویت، آپلود فایل صوتی و تنظیمات مربوط به تایماستمپ دقیقاً روی همان کال API قبلی باقی مانده است:
curl --request POST https://api.fish.audio/v1/asr \\
--header \"Authorization: Bearer $FISH_API_KEY\" \\
--header \"model: transcribe-1-pro\" \\
--form audio=@speech.wav \\
--form ignore_timestamps=falseدر SDK پایتون، انتخاب مدل از طریق RequestOptions.additional_headers={\"model\": \"transcribe-1-pro\"} انجام میشود، چرا که نام مدل به شکل یک آرگومان مستقیم در متدها تعریف نشده است.
این اندپوینت از فرمتهای صوتی معروفی مثل WAV، MP3 و Opus در قالب multipart form data یا بدنه درخواستهای MessagePack پشتیبانی میکند. در حال حاضر هر درخواست یک فایل را پردازش میکند؛ بنابراین برنامههایی که فایلهای صوتی طولانی را به چند بخش تقسیم میکنند، باید هنگام سرهمکردن نتایج، آفستهای زمانی تجمیعی را لحاظ نمایند.
قیمت بدون تغییر؛ همان ۳۶ سنت به ازای هر ساعت!
- تعرفه: مدل
transcribe-1-proبه ازای هر ساعت فایل صوتی تنها ۰.۳۶ دلار هزینه دارد که دقیقاً برابر با قیمت مدل استاندارد است. - واحد محاسبه هزینه: سیستم Fish Audio هزینه را بر حسب ثانیههای پردازششده محاسبه میکند و کاری به تعداد توکنها یا تعداد کل درخواستها ندارد.
- دسترسی: نسخه Pro در حال حاضر از طریق API در دسترس قرار گرفته و قرار است به زودی در وباپلیکیشن هم فعال شود.
- زبانها: این مدل از ۸۳ زبان زنده دنیا پشتیبانی میکند و زبان گفتگو را به طور کاملاً خودکار تشخیص میدهد.
- راهنمای انتخاب زبان: شما میتوانید با ارسال پارامتر
languageبه تشخیص بهتر کمک کنید، هرچند اگر مدل تشخیص دهد زبان دیگری صحبت شده، اولویت را به تشخیص خود میدهد.
در پایپلاینهای سنتی، توسعهدهندگان معمولاً تبدیل گفتار به متن، تفکیک گویندگان و طبقهبندی حالتهای احساسی را در چند مرحله مجزا اجرا و سپس خروجیها را با هم ادغام میکردند. اما مدل Pro تمام این دادهها را به شکل یکجا تولید میکند. حالا خلاصه جلسات میتوانند تصمیمات را به افراد نسبت دهند، ابزارهای تحلیل پشتیبانی مشتریان واکنشها را به بخشهای خاص مکالمه متصل کنند و سیستمهای ارزیابی ایجنتهای صوتی هم از تگهایی مثل [laughter] (خنده)، [surprised] (تعجب) یا [frustrated] (کلافگی) برای امتیازدهی هوشمندانهتر بهره ببرند.
البته این نوع خروجی فشرده بخشی از پردازش را به کدهای سمت برنامه واگذار میکند؛ برنامهنویسان باید بخشهای صحبت هر گوینده را پارس کنند، شناسههای عددی را به نام اشخاص تطبیق دهند و متن حاشیهنویسیشده را با سگمنتهای زمانی همگام سازند. از آنجا که نشانگرهای احساسات و رویدادها صرفاً پیشبینیهای مدل هستند، حتماً باید بر اساس لهجهها، نویز محیط، همپوشانی صدای چند نفر و دایره لغات پروژه شما اعتبارسنجی شوند.
انقلاب در تماسها، پادکستها و چرخه عملکرد ایجنتها
استک صوتی کاملتر Fish Audio شامل مدل تبدیل متن به گفتار (TTS) به نام S2.1 Pro نیز میشود؛ مدلی که زمان پاسخدهی آن تا اولین خروجی صدا حدود ۹۰ میلیثانیه اعلام شده، از ۸۳ زبان پشتیبانی میکند و لحن و هویت صدا را در زبانهای مختلف حفظ مینماید. ترکیب آن مدل تولیدکننده صدا با transcribe-1-pro، به برنامهها یک API کامل میدهد تا تمام بستر مکالمه را پیش از ورود به مدلهای زبانی بزرگ، ایجنتها یا بخش تولید صدا استخراج کنند.
- جلسات و تماسها: ثبت دقیق اینکه چه تصمیمی، چه سوالی و چه وظیفهای به کدام فرد حاضر در جلسه تعلق دارد.
- پادکستها و مصاحبهها: حفظ خندهها، مکثها، آه کشیدنها و لحن بیان افراد در فایلهای متنی قابل جستجو.
- ارزیابی ایجنتهای صوتی: وارد کردن نشانههای هویت گوینده و واکنشهای احساسی به فرآیند تحلیل کیفیت مکالمات.
- دوبله و بومیسازی: انتقال دقیق لحن و احساسات به متن ترجمهشده برای بازتولید صدای هماهنگ و طبیعی.
با قیمت تعیینشده، پردازش یک فایل صوتی ۶۰ دقیقهای فقط ۳۶ سنت برایتان هزینه دارد. تیمهایی که تا امروز برای تبدیل متن، تفکیک گویندگان یا تحلیل احساسات هزینههای جداگانهای پرداخت میکردند، حالا میتوانند با این راهکار تکمرحلهای هزینههایشان را به شدت کاهش دهند. تنها کار اصلی پیش روی توسعهدهندگان، هماهنگ کردن سیستمهایی است که انتظار فرمتهای سنتی سگمنتمحور را دارند با ساختار جدید رشتههای متنی علامتگذاریشده Fish Audio.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

استارتاپ Wabi به پیامرسان هوش مصنوعی تبدیل شد؛ ایجنتی که در لحظه براتون اپلیکیشن میسازه!
استارتاپ Wabi که با ابزار ساخت اپلیکیشن از طریق پرامپت سروصدا کرده بود، حالا با معرفی نسخه ۲.۰ مسیرش رو تغییر داده و به یک پیامرسان هوشمند تبدیل شده است. این ایجنت شخصی جدید نهتنها کارهای روزمرهتان را انجام میدهد، بلکه در لحظه و درست وسط چت، هر رابط کاربری یا مینیاپی را که نیاز داشته باشید خلق میکند.

ابزار متنباز Jevstiller معرفی شد؛ هوش مصنوعی Jev را روی سیستم خودتان و با سرعت برقآسا اجرا کنید!
توسعهدهندگان با ابزار متنباز جدیدی به نام Jevstiller راهکاری ارائه کردهاند که خروجیهای هوش مصنوعی Jev را تقطیر کرده و روی سختافزار محلی شما اجرا میکند. با این ترفند، درخواستهای آشنا در عرض تنها ۱۵ میلیثانیه روی پردازنده سیستم پاسخ داده میشوند و نیازی به پرداخت هزینه توکن نخواهید داشت.

اوپنایآی کادکس را متحول کرد: محیطهای ابری پایدار، کدنویسی صوتی و ایجنتهای همهکاره!
اوپنایآی در رویداد DevDay قابلیتهای جدیدی را برای ایجنت مهندسی نرمافزار خود، کادکس (Codex)، معرفی کرد که امکان اجرای آن را در محیطهای ابری پایدار و از طریق هر دستگاهی فراهم میکند. این بهروزرسانی بزرگ شامل رابط کاربری خط فرمان با دستور صوتی، ابزار جدید بازبینی کد در نسخه دسکتاپ چتجیپیتی و سرویس ابری امنیتی برای اسکن و رفع خودکار آسیبپذیریها است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.