پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

ترجمه هوش مصنوعی کاملاً آفلاین در iPhone؛ رونمایی Tencent از اپلیکیشن Hy Translate به ۳۳ زبان

انتشار:۳ مهر ۱۴۰۵(۳ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

شرکت Tencent با معرفی اپلیکیشن اختصاصی Hy Translate برای سیستم‌عامل iOS، امکان ترجمه متنی، صوتی و تصویری را به‌صورت کاملاً آفلاین و محلی برای ۳۳ زبان مختلف فراهم کرد. این ابزار از مدل فشرده ۱٫۸ میلیارد پارامتری Hy-MT2 با حجم تنها ۴۴۰ مگابایت قدرت می‌گیرد تا رقیبی جدی برای Google Translate در محیط‌های بدون اینترنت باشد.

ترجمه هوش مصنوعی کاملاً آفلاین در iPhone؛ رونمایی Tencent از اپلیکیشن Hy Translate به ۳۳ زبان

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • عرضه اپلیکیشن مستقل Hy Translate توسط Tencent برای کاربران iOS با پشتیبانی آفلاین از ۳۳ زبان زنده
  • فشرده‌سازی مدل ۱٫۸ میلیارد پارامتری Hy-MT2 به حجم ۴۴۰ مگابایت از طریق فناوری کوانتایزیشن AngelSlim
  • حذف تأخیر شبکه، قطع هزینه‌های مکرر API و افزایش حریم خصوصی از طریق استنتاج محلی روی دستگاه
  • انتشار وزن‌های متن‌باز خانواده Hy-MT2 و بنچمارک IFMTBench روی Hugging Face و GitHub برای توسعه‌دهندگان

اجرای مدل ترجمه Hy-MT2 شرکت Tencent روی iPhone

شرکت Tencent از اپلیکیشن مستقل Hy Translate برای سیستم‌عامل iOS رونمایی کرده است؛ ابزاری که بدون ارسال درخواست‌ها به سرویس‌های ابری، متن، گفتار و تصاویر را ترجمه می‌کند. این برنامه در ۱۲ کشور و منطقه مختلف منتشر شده است و از ۳۳ زبان زنده به همراه پنج گویش و زبان اقلیت در چین پشتیبانی می‌کند.

استنتاج محلی (Local Inference) راهکاری کاربردی و کارآمد برای رقابت مستقیم Tencent با سرویس‌هایی چون Google Translate، DeepL و Microsoft Translator فراهم می‌سازد. این رویکرد تأخیر شبکه و هزینه‌های ناشی از فراخوانی مکرر API را به‌طور کامل حذف کرده و امکان استفاده از خدمات ترجمه را در هواپیما، مترو و هر موقعیت دیگری با اینترنت ناپایدار یا بدون اتصال شبکه میسر می‌سازد.

بخش
جزئیات عرضه
پلتفرم
سیستم‌عامل iOS؛ شرکت Tencent وعده پشتیبانی از Android را داده، اما هنوز تاریخ انتشار رسمی آن را اعلام نکرده است
ورودی‌ها
متن، صوت و تصویر
پوشش زبانی
۳۳ زبان به همراه پنج زبان و گویش محلی در چین
استفاده آفلاین
فرایند ترجمه به‌صورت کاملاً محلی اجرا می‌شود؛ مشخص نشده است که آیا نیاز به دانلود اولیه مدل وجود دارد یا خیر
دسترس‌پذیری
در مرحله نخست در ۱۲ کشور و منطقه عرضه شده است

مسیر ۴۴۰ مگابایتی برای دستیابی به پردازش محلی

خانواده متن‌باز Hy-MT2 شامل سه مدل متنوع با ظرفیت‌ها و اهداف پردازشی مختلف است:

مدل
معماری
کاربرد هدف
Hy-MT2-30B-A3B
در مجموع ۳۰ میلیارد پارامتر با ۳ میلیارد پارامتر فعال به ازای هر توکن
استنتاج سروری با ظرفیت و بار پردازشی بالا
Hy-MT2-7B
مدل متراکم (Dense) با ۷ میلیارد پارامتر
استقرار روی سرورها و ایستگاه‌های کاری (Workstations)
Hy-MT2-1.8B
مدل متراکم (Dense) با ۱٫۸ میلیارد پارامتر
سخت‌افزارهای موبایل و دستگاه‌های لبه (Edge)

شرکت Tencent مدل ۱٫۸ میلیارد پارامتری را اختصاصاً برای گوشی‌های هوشمند طراحی کرده است؛ هرچند در صفحه مشخصات App Store به‌طور دقیق اشاره نشده که کدام چک‌پوینت در اپلیکیشن Hy Translate مورد استفاده قرار گرفته است. طبق اعلام این شرکت، فناوری کوانتایزیشن اختصاصی موسوم به AngelSlim 1.25-bit حجم مدل نسخه موبایل را تا حدود ۴۴۰ مگابایت فشرده می‌کند و با چیپست‌های ساخت Apple، Qualcomm و MediaTek سازگاری کامل دارد.

کوانتایزیشن به ذخیره‌سازی وزن‌های مدل با دقت پایین‌تر اطلاق می‌شود که میزان حافظه مصرفی و فضای ذخیره‌سازی را با هزینه افت کیفی ناچیز کاهش می‌دهد. بر اساس گزارش Tencent، سرعت استنتاج این مدل ۱٫۵ برابر بیشتر از نسل پیشین ارزیابی شده است؛ هرچند در مستندات رسمی منتشرشده به مدل مورد مقایسه، سخت‌افزار تست یا بار کاری مورد سنجش اشاره‌ای نشده است.

مدل Hy-MT2-30B-A3B از معماری ترکیب کارشناسان (Mixture of Experts یا MoE) بهره می‌برد که هر توکن را تنها از میان زیرمجموعه‌ای از پارامترهای تخصصی هدایت می‌کند. در این ساختار برای پردازش هر توکن تنها ۳ میلیارد پارامتر فعال می‌شوند که بار محاسباتی را در قیاس با فعال‌سازی کامل ۳۰ میلیارد پارامتر به طرز چشمگیری کاهش می‌دهد. در مقابل، مدل‌های 7B و 1.8B از نوع متراکم هستند و تمام پارامترها در تک‌تک مراحل تولید متن مشارکت دارند.

بنچمارک‌ها و محدودیت‌های نتایج ارزیابی

بر اساس اعلام Tencent، مدل‌های 7B و 30B-A3B در حالت «تفکر سریع» (Fast-Thinking) عملکرد بهتری نسبت به DeepSeek-V4-Pro و Kimi K2.6 به نمایش می‌گذارند. منظور از تفکر سریع در اینجا، تولید بلادرنگ و مستقیم ترجمه بدون طی کردن مراحل طولانی استدلال زنجیره‌ای است که سبب به حداقل رسیدن تأخیر پاسخگویی می‌شود.

این شرکت همچنین مدعی است که مدل ۱٫۸ میلیارد پارامتری در ارزیابی‌های تجمیعی از APIهای ترجمه Microsoft و Doubao پیشی گرفته است. با این حال، این ادعاها به آزمون‌های سطح مدل مربوط می‌شوند و بازتاب‌دهنده عملکرد عملیاتی درون اپلیکیشن iOS نیستند. گزارش منتشرشده فاقد جزئیات نتایج به تفکیک زبان‌ها، توان پردازشی روی دستگاه، اوج مصرف حافظه رم، میزان مصرف باتری یا رفتار حرارتی گوشی است.

شرکت Tencent در کنار این مدل‌ها بنچمارک IFMTBench را نیز برای سنجش میزان پیروی از دستورالعمل‌ها در ترجمه منتشر کرده است. وظایف این بنچمارک شامل مواردی نظیر حفظ ساختار داده‌ای JSON، همگام‌سازی زمان‌بندی زیرنویس‌ها و رعایت دقیق قالب‌بندی متنی است. از آنجا که نمرات تجمیعی بنچمارک‌ها ممکن است ضعف در جفت‌زبان‌های خاص یا عملکردهای نامناسب در حوزه‌های تخصصی را پنهان کنند، ارزیابی‌های کاربردی در محیط عملیاتی باید متکی بر داده‌های واقعی متناسب با کاربری مورد نظر صورت گیرد.

مسیر پیش روی توسعه‌دهندگان: از سرورها تا دستگاه‌های لبه

مجموعه Hy-MT2 شامل وزن‌ها و ابزارهای مرتبط است که روی پلتفرم‌های Hugging Face، ModelScope و GitHub در دسترس قرار گرفته‌اند. توسعه‌دهندگان می‌توانند از این مدل‌ها به چند شیوه بهره‌برداری کنند:

  • اجرای چک‌پوینت‌های اصلی به‌منظور ارزیابی کیفیت یا راه‌اندازی سرور اختصاصی ترجمه (Self-Hosted).
  • فاین‌تیون کامل تمام پارامترها بر روی مجموعه‌داده‌های تخصصی هر حوزه.
  • به‌کارگیری آداپتورهای LoRA جهت به حداقل رساندن حافظه و فضای ذخیره‌سازی مورد نیاز برای تنظیم دقیق مدل.
  • آموزش مدل با پیکربندی‌های پشتیبانی‌شده در DeepSpeed ZeRO یا فریم‌ورک LLaMA-Factory.
  • استقرار نسخه‌های کوانتایزشده بر روی سخت‌افزارهای پشتیبانی‌شده مبتنی بر معماری ARM و Intel.

ارزیابی عملکرد در سمت سرور می‌تواند از طریق الگوی اجرایی ارائه‌شده در فریم‌ورک SGLang آغاز شود:

python3 -m sglang.launch_server \\
  --model tencent/Hy-MT2-1.8B \\
  --tp 1

این دستور یک سرور را با یک ورکر موازی تانسوری (Tensor-Parallel) راه‌اندازی می‌کند. برخلاف استقرار سروری با SGLang، پیاده‌سازی روی دستگاه‌های موبایل نیازمند موتور اجرای کوانتایزشده جداگانه و ادغام سازگار با سخت‌افزار دستگاه است. تیم‌های فنی همچنین باید پیش از توزیع نسخه‌های ویرایش‌شده یا استفاده تجاری، مجوزهای نرم‌افزاری ریپازیتوری را به‌دقت بررسی کنند.

آزمون همه‌جانبه محصول در قالب یک اپلیکیشن مستقل

شرکت Tencent پیش‌تر مدل‌های Hy-MT2 را در قالب یک مینی‌پروگرام در پیام‌رسان WeChat ارائه کرده بود و وعده داده بود که نسخه‌های نیتیو با قابلیت استنتاج محلی برای پلتفرم‌های iOS و Android عرضه خواهند شد. نسخه اخیر iOS نخستین گام در تحقق این وعده به شمار می‌رود، در حالی که نسخه اختصاصی Android همچنان در دست توسعه قرار دارد.

گنجاندن یک مدل هوش مصنوعی در یک اپلیکیشن مصرفی، فراتر از سنجش کیفیت ترجمه، جنبه‌های فنی متعددی را به چالش می‌کشد. شرکت سازنده باید فرایند دانلود مدل، فشار وارده بر حافظه رم، سرعت راه‌اندازی اپلیکیشن، مصرف باتری، مدیریت ورودی‌های دوربین و میکروفون و همچنین ارائه به‌روزرسانی‌ها را در میان نسل‌های مختلف سخت‌افزار موبایل مدیریت کند.

از سوی دیگر، پردازش محلی مانع از خروج اطلاعات و متون ترجمه‌شده به سمت APIهای راه دور می‌شود. این معماری سطح دسترسی و احتمال افشای داده‌ها را کاهش می‌دهد؛ هرچند مواردی مانند داده‌های تله‌متری، گزارش‌های خرابی اپلیکیشن و سیاست‌های حریم خصوصی همچنان مشخص می‌کنند چه اطلاعات دیگری ممکن است از دستگاه ارسال شود.

مدل‌های کوچک معادله هزینه‌های ترجمه را تغییر می‌دهند

خانواده Hy-MT2 نشان می‌دهد که چگونه یک مدل تخصصی با ۱٫۸ میلیارد پارامتر می‌تواند درون بسته‌ای کمتر از ۵۰۰ مگابایت قرار گیرد و طبق ادعاهای Tencent با سیستم‌های ابری بسیار بزرگ‌تر رقابت کند. در سناریوهای با حجم کاری سنگین، اجرای محلی هزینه‌های ناشی از هر فراخوانی ابری را جایگزین بهره‌گیری از توان محاسباتی خود دستگاه، توزیع مدل و هزینه‌های نگهداری می‌کند.

با وجود این، سرویس‌های ابری همچنان مزایایی چون به‌روزرسانی‌های متمرکز، مقیاس‌پذیری انعطاف‌پذیر و دسترسی به مدل‌های غول‌پیکر را ارائه می‌دهند. در سوی مقابل، مدل‌های روی دستگاه (On-Device) پایداری زمانی و تأخیر قابل پیش‌بینی، عملکرد آفلاین و کنترل بیشتر روی داده‌های ورودی را تضمین می‌کنند. تعیین نقطه تعادل به فاکتورهایی نظیر تعداد زبان‌های تحت پوشش، محدودیت‌های سخت‌افزاری، استانداردهای کیفی و نیازمندی‌های به‌روزرسانی وابسته است.

شرکت Tencent همچنین پیش‌نمایشی از مدل تشخیص گفتار Hy ASR 3.0 را ارائه داده است که از استراتژی کلان این غول فناوری بر پایه توسعه مدل‌های فشرده و وظیفه‌محور خبر می‌دهد. ابزار ترجمه نخستین استقرار مصرفی این راهبرد محسوب می‌شود و فناوری‌های تشخیص گفتار و سایر پردازش‌های تخصصی می‌توانند فرصت‌های مشابهی برای بهره‌گیری از استنتاج محلی پدید آورند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر