پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار جدید Fish Audio در تبدیل صوت به متن: تشخیص گوینده و احساسات فقط با ساعتی ۳۶ سنت!

انتشار:۷ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ Fish Audio با رونمایی از مدل transcribe-1-pro، قابلیت جذاب تفکیک گویندگان و برچسب‌گذاری احساسات مختلف را در کنار تبدیل گفتار به متن با هزینه استثنایی ساعتی ۳۶ سنت در دسترس توسعه‌دهندگان قرار داد. این نوآوری با یک‌دست کردن تمام خروجی‌های صوتی در یک فراخوانی ساده، کار ایجنت‌های هوشمند، پردازش پادکست‌ها و خلاصه‌سازی جلسات را فوق‌العاده راحت و کم‌هزینه می‌کند.

شاهکار جدید Fish Audio در تبدیل صوت به متن: تشخیص گوینده و احساسات فقط با ساعتی ۳۶ سنت!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ Fish Audio از مدل جدید transcribe-1-pro رونمایی کرد که علاوه بر تبدیل گفتار به متن، به صورت هم‌زمان گوینده‌ها و حتی حس‌وحال صدا مثل خنده و هیجان را تشخیص می‌دهد.
  • هزینه استفاده از این نسخه حرفه‌ای فوق‌العاده اقتصادی است و درست مثل مدل استاندارد قبلی، به ازای هر ساعت فایل صوتی تنها ۰.۳۶ دلار (۳۶ سنت) محاسبه می‌شود.
  • این مدل از ۸۳ زبان مختلف پشتیبانی می‌کند و با ارسال داده‌های متن، گویندگان و برچسب‌های احساسی در یک پاسخ یک‌پارچه، کار ایجنت‌های صوتی و تحلیل جلسات را به مراتب ساده‌تر کرده است.

قابلیت‌های جدید در نسخه Pro تبدیل صوت به متن Fish Audio؛ تشخیص گوینده و ریزه‌کاری‌های لحن

استارتاپ صوتی Fish Audio با معرفی مدل transcribe-1-pro دو قابلیت فوق‌العاده کاربردی را به API تبدیل گفتار به متن (STT) خود اضافه کرده است: تفکیک گویندگان (Speaker Diarization) که مشخص می‌کند چه کسی در چه زمانی صحبت کرده، و برچسب‌گذاری رویدادهای صوتی لحن. این مدل هوش مصنوعی در کنار تشخیص خودکار زبان و ثبت دقیق زمان‌بندی (تایم‌استمپ) در سطح هر کلمه، تغییر گویندگان، احساسات کلامی و صداهایی مثل خندیدن را مستقیماً داخل متن پیاده می‌کند. به لطف این ویژگی، سیستم‌های مدیریت جلسه، سامانه‌های پشتیبانی مشتریان، پادکست‌ها و ایجنت‌های صوتی می‌توانند تمام این سیگنال‌ها را تنها در یک مرحله پردازش صوتی دریافت کنند.

نکته جالب اینجاست که هر دو مدل transcribe-1-pro و مدل استاندارد transcribe-1 از اندپوینت POST /v1/asr استفاده می‌کنند؛ بنابراین کاربرانی که از قبل از این سرویس استفاده می‌کردند، تنها با تغییر یک هدر ساده در درخواست HTTP می‌توانند نسخه Pro را فعال کنند، بدون اینکه نیاز باشد ساختار اندپوینت یا فرمت درخواستشان را دستکاری کنند.

همه مکالمات در قالب یک خروجی یک‌پارچه

در فیلد text پاسخ دریافتی، از نشانگرهای درون‌متنی به فرمت <|speaker:N|> استفاده شده که در آن N یک شناسه عددی برای هر گوینده است. هر نشانگر تا زمان رسیدن به گوینده بعدی معتبر می‌ماند و اگر همان فرد دوباره شروع به صحبت کند، همان شناسه قبلی برایش ثبت می‌شود. برنامه‌ها در صورت نیاز می‌توانند این شناسه‌ها را به نام واقعی افراد متصل کنند. همچنین احساسات و رویدادهای کلامی به صورت تگ‌های داخل براکت در کنار کلمات مربوطه ظاهر می‌شوند.

{
  \"text\": \"<|speaker:0|>Hello.<|speaker:1|>[happy]Nice to meet you.<|speaker:0|>Same here.\",
  \"duration\": 6.4,
  \"segments\": [],
  \"language_code\": \"en\",
  \"language\": \"English\"
}

اگر درخواست دریافت تایم‌استمپ را ارسال کرده باشید، بخش segments حاوی کلمات اداشده خواهد بود که البته نشانگرهای گوینده، احساسات و رویدادها از آن حذف شده‌اند. با توجه به اینکه این بخش فاقد فیلد مجزای speaker_id برای هر سگمنت است، سیستم‌های تولید زیرنویس که به برچسب‌های زمان‌بندی‌شده گوینده‌ها نیاز دارند، باید متن حاشیه‌نویسی‌شده را با متن دارای تایم‌استمپ تطبیق دهند.

با یک رجکس (Regular Expression) ساده و جمع‌وجور در پایتون می‌توانید این رشته را به آبجکت‌های تفکیک‌شده برای مراحل بعدی پردازش تبدیل کنید:

import re

pattern = r\"<\\|speaker:(\\d+)\\|>(.*?)(?=<\\|speaker:\\d+\\|>|$)\"

for turn in re.finditer(pattern, result[\"text\"], re.DOTALL):
    speaker_id = turn.group(1)
    text = turn.group(2).strip()
    print(f\"Speaker {speaker_id}: {text}\")

پروژه‌های فعلی می‌توانند به سادگی با اضافه کردن هدر model: transcribe-1-pro به درخواست خود، این مدل جدید را به کار بگیرند. مراحل احراز هویت، آپلود فایل صوتی و تنظیمات مربوط به تایم‌استمپ دقیقاً روی همان کال API قبلی باقی مانده است:

curl --request POST https://api.fish.audio/v1/asr \\
  --header \"Authorization: Bearer $FISH_API_KEY\" \\
  --header \"model: transcribe-1-pro\" \\
  --form audio=@speech.wav \\
  --form ignore_timestamps=false

در SDK پایتون، انتخاب مدل از طریق RequestOptions.additional_headers={\"model\": \"transcribe-1-pro\"} انجام می‌شود، چرا که نام مدل به شکل یک آرگومان مستقیم در متدها تعریف نشده است.

این اندپوینت از فرمت‌های صوتی معروفی مثل WAV، MP3 و Opus در قالب multipart form data یا بدنه درخواست‌های MessagePack پشتیبانی می‌کند. در حال حاضر هر درخواست یک فایل را پردازش می‌کند؛ بنابراین برنامه‌هایی که فایل‌های صوتی طولانی را به چند بخش تقسیم می‌کنند، باید هنگام سرهم‌کردن نتایج، آفست‌های زمانی تجمیعی را لحاظ نمایند.

قیمت بدون تغییر؛ همان ۳۶ سنت به ازای هر ساعت!

  • تعرفه: مدل transcribe-1-pro به ازای هر ساعت فایل صوتی تنها ۰.۳۶ دلار هزینه دارد که دقیقاً برابر با قیمت مدل استاندارد است.
  • واحد محاسبه هزینه: سیستم Fish Audio هزینه را بر حسب ثانیه‌های پردازش‌شده محاسبه می‌کند و کاری به تعداد توکن‌ها یا تعداد کل درخواست‌ها ندارد.
  • دسترسی: نسخه Pro در حال حاضر از طریق API در دسترس قرار گرفته و قرار است به زودی در وب‌اپلیکیشن هم فعال شود.
  • زبان‌ها: این مدل از ۸۳ زبان زنده دنیا پشتیبانی می‌کند و زبان گفتگو را به طور کاملاً خودکار تشخیص می‌دهد.
  • راهنمای انتخاب زبان: شما می‌توانید با ارسال پارامتر language به تشخیص بهتر کمک کنید، هرچند اگر مدل تشخیص دهد زبان دیگری صحبت شده، اولویت را به تشخیص خود می‌دهد.

در پایپ‌لاین‌های سنتی، توسعه‌دهندگان معمولاً تبدیل گفتار به متن، تفکیک گویندگان و طبقه‌بندی حالت‌های احساسی را در چند مرحله مجزا اجرا و سپس خروجی‌ها را با هم ادغام می‌کردند. اما مدل Pro تمام این داده‌ها را به شکل یک‌جا تولید می‌کند. حالا خلاصه جلسات می‌توانند تصمیمات را به افراد نسبت دهند، ابزارهای تحلیل پشتیبانی مشتریان واکنش‌ها را به بخش‌های خاص مکالمه متصل کنند و سیستم‌های ارزیابی ایجنت‌های صوتی هم از تگ‌هایی مثل [laughter] (خنده)، [surprised] (تعجب) یا [frustrated] (کلافگی) برای امتیازدهی هوشمندانه‌تر بهره ببرند.

البته این نوع خروجی فشرده بخشی از پردازش را به کدهای سمت برنامه واگذار می‌کند؛ برنامه‌نویسان باید بخش‌های صحبت هر گوینده را پارس کنند، شناسه‌های عددی را به نام اشخاص تطبیق دهند و متن حاشیه‌نویسی‌شده را با سگمنت‌های زمانی همگام سازند. از آنجا که نشانگرهای احساسات و رویدادها صرفاً پیش‌بینی‌های مدل هستند، حتماً باید بر اساس لهجه‌ها، نویز محیط، هم‌پوشانی صدای چند نفر و دایره لغات پروژه شما اعتبارسنجی شوند.

انقلاب در تماس‌ها، پادکست‌ها و چرخه عملکرد ایجنت‌ها

استک صوتی کامل‌تر Fish Audio شامل مدل تبدیل متن به گفتار (TTS) به نام S2.1 Pro نیز می‌شود؛ مدلی که زمان پاسخ‌دهی آن تا اولین خروجی صدا حدود ۹۰ میلی‌ثانیه اعلام شده، از ۸۳ زبان پشتیبانی می‌کند و لحن و هویت صدا را در زبان‌های مختلف حفظ می‌نماید. ترکیب آن مدل تولیدکننده صدا با transcribe-1-pro، به برنامه‌ها یک API کامل می‌دهد تا تمام بستر مکالمه را پیش از ورود به مدل‌های زبانی بزرگ، ایجنت‌ها یا بخش تولید صدا استخراج کنند.

  • جلسات و تماس‌ها: ثبت دقیق اینکه چه تصمیمی، چه سوالی و چه وظیفه‌ای به کدام فرد حاضر در جلسه تعلق دارد.
  • پادکست‌ها و مصاحبه‌ها: حفظ خنده‌ها، مکث‌ها، آه کشیدن‌ها و لحن بیان افراد در فایل‌های متنی قابل جستجو.
  • ارزیابی ایجنت‌های صوتی: وارد کردن نشانه‌های هویت گوینده و واکنش‌های احساسی به فرآیند تحلیل کیفیت مکالمات.
  • دوبله و بومی‌سازی: انتقال دقیق لحن و احساسات به متن ترجمه‌شده برای بازتولید صدای هماهنگ و طبیعی.

با قیمت تعیین‌شده، پردازش یک فایل صوتی ۶۰ دقیقه‌ای فقط ۳۶ سنت برایتان هزینه دارد. تیم‌هایی که تا امروز برای تبدیل متن، تفکیک گویندگان یا تحلیل احساسات هزینه‌های جداگانه‌ای پرداخت می‌کردند، حالا می‌توانند با این راهکار تک‌مرحله‌ای هزینه‌هایشان را به شدت کاهش دهند. تنها کار اصلی پیش روی توسعه‌دهندگان، هماهنگ کردن سیستم‌هایی است که انتظار فرمت‌های سنتی سگمنت‌محور را دارند با ساختار جدید رشته‌های متنی علامت‌گذاری‌شده Fish Audio.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

استارتاپ Wabi به پیام‌رسان هوش مصنوعی تبدیل شد؛ ایجنتی که در لحظه براتون اپلیکیشن می‌سازه!
آخرین اخبار

استارتاپ Wabi به پیام‌رسان هوش مصنوعی تبدیل شد؛ ایجنتی که در لحظه براتون اپلیکیشن می‌سازه!

استارتاپ Wabi که با ابزار ساخت اپلیکیشن از طریق پرامپت سروصدا کرده بود، حالا با معرفی نسخه ۲.۰ مسیرش رو تغییر داده و به یک پیام‌رسان هوشمند تبدیل شده است. این ایجنت شخصی جدید نه‌تنها کارهای روزمره‌تان را انجام می‌دهد، بلکه در لحظه و درست وسط چت، هر رابط کاربری یا مینی‌اپی را که نیاز داشته باشید خلق می‌کند.

۳ دقیقه مطالعه
۰
۷ مهر
ابزار متن‌باز Jevstiller معرفی شد؛ هوش مصنوعی Jev را روی سیستم خودتان و با سرعت برق‌آسا اجرا کنید!
آخرین اخبار

ابزار متن‌باز Jevstiller معرفی شد؛ هوش مصنوعی Jev را روی سیستم خودتان و با سرعت برق‌آسا اجرا کنید!

توسعه‌دهندگان با ابزار متن‌باز جدیدی به نام Jevstiller راهکاری ارائه کرده‌اند که خروجی‌های هوش مصنوعی Jev را تقطیر کرده و روی سخت‌افزار محلی شما اجرا می‌کند. با این ترفند، درخواست‌های آشنا در عرض تنها ۱۵ میلی‌ثانیه روی پردازنده سیستم پاسخ داده می‌شوند و نیازی به پرداخت هزینه توکن نخواهید داشت.

۴ دقیقه مطالعه
۰
۷ مهر
اوپن‌ای‌آی کادکس را متحول کرد: محیط‌های ابری پایدار، کدنویسی صوتی و ایجنت‌های همه‌کاره!
آخرین اخبار

اوپن‌ای‌آی کادکس را متحول کرد: محیط‌های ابری پایدار، کدنویسی صوتی و ایجنت‌های همه‌کاره!

اوپن‌ای‌آی در رویداد DevDay قابلیت‌های جدیدی را برای ایجنت مهندسی نرم‌افزار خود، کادکس (Codex)، معرفی کرد که امکان اجرای آن را در محیط‌های ابری پایدار و از طریق هر دستگاهی فراهم می‌کند. این به‌روزرسانی بزرگ شامل رابط کاربری خط فرمان با دستور صوتی، ابزار جدید بازبینی کد در نسخه دسکتاپ چت‌جی‌پی‌تی و سرویس ابری امنیتی برای اسکن و رفع خودکار آسیب‌پذیری‌ها است.

۳ دقیقه مطالعه
۰
۷ مهر