تنسنت از مدل هوش مصنوعی Hy Image 3.5 با قابلیت یکپارچه تولید و ویرایش تصویر رونمایی کرد
تیم Hunyuan شرکت تنسنت نسخه پیشنمایش مدل هوش مصنوعی تولید تصویر نسل بعدی خود یعنی Hy Image 3.5 را منتشر کرد.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- ادغام قابلیتهای تولید تصویر از روی متن و ویرایش تصویر به تصویر در یک مدل واحد با کیفیت 2K.
- بهبود ۳۰ درصدی کیفیت خروجی در ارزیابیهای انسانی نسبت به نسخه قبلی (3.0).
- رایگان بودن بارگذاری تصاویر مرجع و دریافت ۰.۰۲۴ دلار به ازای هر خروجی برای مدیریت بهتر هزینههای توسعهدهندگان.
پیشنمایش تنسنت از Hy Image 3.5 با قابلیت یکپارچه تولید و ویرایش
تیم Hunyuan شرکت تنسنت نسخه پیشنمایش Hy Image 3.5 را که جدیدترین مدل هوش مصنوعی مولد تصویر این شرکت است، منتشر کرد. بر اساس اعلام تنسنت، این مدل در ارزیابیهای انسانی ۳۰ درصد بهتر از مدل Hy Image 3.0 عمل میکند. این مدل اکنون از تولید متن به تصویر و تصویر به تصویر از طریق یک درگاه واحد پشتیبانی میکند، خروجیهایی تا وضوح 2K ارائه میدهد و در تولید تصاویر مرتبط یکپارچگی بیشتری دارد.
جزئیات | مشخصات نسخه پیشنمایش |
|---|---|
وضعیت | پیشنمایش در Tencent Cloud |
شناسه مدل | hy-image-v3.5-preview |
حالتها | متن به تصویر و تصویر به تصویر |
حداکثر خروجی | وضوح تصویر تا 2K |
قیمتگذاری | ۰.۰۲۴ دلار به ازای هر تصویر تولیدشده |
هزینه تصاویر مرجع | بدون هزینه برای بارگذاری تصاویر مرجع |
بهبود کیفیت اعلامشده | بهبود ۳۰ درصدی پیروزی در ارزیابی انسانی نسبت به نسخه 3.0 |
یک شناسه مدل، دو روند کاری
نسخه پیشنمایش هر دو حالت تولید تصویر را تحت شناسه hy-image-v3.5-preview ارائه میدهد. اپلیکیشنهایی که پیش از این درخواستهای تولید تصویر جدید و ویرایش مبتنی بر تصویر مرجع را به مدلهای جداگانهای هدایت میکردند، اکنون میتوانند این منطق را یکپارچه کنند؛ اگرچه تیمهای توسعه همچنان باید ساختار درخواستها، پارامترهای پشتیبانیشده، فرمتهای پاسخ و رفتار مدل در زمان بروز خطا را در مستندات فعلی Tencent Cloud بررسی کنند.
تنسنت سقف وضوح خروجی را 2K اعلام کرده است. توسعهدهندگانی که با طرحهای ثابت کار میکنند، باید پیش از تغییر مسیرهای رندر گرافیکی یا برآوردهای فضای ذخیرهسازی، ترکیبهای عرض، ارتفاع و نسبت تصویر قابلقبول را تایید کنند.
قیمتگذاری بهصرفه برای پروژههای متکی بر تصاویر مرجع
با نرخ ۰.۰۲۴ دلار به ازای هر تصویر تولیدشده، هزینه پایه ۱۰۰۰ خروجی برابر با ۲۴ دلار خواهد بود. تنسنت تنها برای خروجیهای تولیدشده هزینه دریافت میکند و بارگذاری تصاویر مرجع کاملا رایگان است؛ این موضوع به تیمها اجازه میدهد تا وقتی درخواستی شامل چندین تصویر مرجع از محصول، شخصیت، سبک طراحی یا چیدمان است، بتوانند هزینههای ورودی را بهصورت پیشبینیپذیرتری مدیریت کنند.
این نسخه پیشنمایش همچنین از طریق Miora (یک ایجنت طراحی) و OnSolo در دسترس است. بنا بر اعلام تنسنت، هر دو ابزار شریک به مدت دو هفته دسترسی رایگان ارائه خواهند داد. این رابطهای کاربری میتوانند برای ارزیابی بصری مناسب باشند، اما تستهای تخصصی API مانند بررسی تأخیر، پردازش همزمان، پوشش پارامترها و مدیریت خطا همچنان نیازمند دسترسی به پلتفرم ابری تنسنت است.
پایههای نسخه 3.0 همچنان مشهود است
تنسنت مدل Hy Image 3.5 را بهعنوان نسخهای ارتقایافته از Hunyuan Image 3.0 معرفی کرده است. مدل قبلی دارای ۸۰ میلیارد پارامتر کل بود و از معماری «ترکیب متخصصان» با ۶۴ متخصص و ۱۳ میلیارد پارامتر فعال بهره میبرد. به زبان ساده، هر درخواست تنها بخش خاصی از شبکه را فعال میکند که این امر موجب کاهش پردازشهای محاسباتی موردنیاز نسبت به استفاده از تمام پارامترها برای هر استنتاج میشود.
تنسنت پیش از این برای ویرایش مبتنی بر تصویر مرجع، یک نسخه اختصاصی به نام 3.0-Instruct ارائه میداد. آن مدل، تصویر ورودی را تحلیل میکرد، بخشهایی که باید تغییر کنند یا حفظ شوند را تشخیص میداد و با استفاده از روش آموزشی اختصاصی MixGRPO تنسنت، میزان پیروی از دستورالعملها و یکپارچگی مناطق دستنخورده را بهبود میبخشید.
نسخه 3.5 مسیرهای تولید و ویرایش را در یک مدل میزبانیشده واحد ادغام کرده است. با این حال، گزینههای استقرار همچنان متفاوت هستند: Hunyuan Image 3.0 بهصورت کد منبعباز در دسترس است، اما نسخه 3.5 در حال حاضر تنها از طریق API ابری پولی تنسنت و اپلیکیشنهای شرکا ارائه میشود.
مناسبترین کاربردها
- محتوای گرافیکی محصولات و کمپینها: تولید مجموعهای از تصاویر هماهنگ با کیفیت 2K که یکپارچگی بصری در آنها بر تجربه کاربری تأثیرگذار است.
- ویرایش مبتنی بر مرجع: امکان بارگذاری چندین تصویر منبع بدون پرداخت هزینه اضافی به ازای هر تصویر مرجع.
- پلتفرمهای طراحی: استفاده از یک زیرساخت واحد برای تولید مبتنی بر پرامپت و ویرایشهای هدایتشده.
- سیستمهای طراحی شخصیت و برند: آزمایش اینکه آیا استفاده مکرر از تصاویر مرجع میتواند هویت، لباسها، رنگها و ترکیببندی را در تمام خروجیها حفظ کند یا خیر.
- طراحی گرافیک دو زبانه و چینی: ارزیابی تمرکز شناختهشده Hunyuan بر رندر کردن زبان چینی در کنار دقت نمایش متنهای انگلیسی.
ادعای بهبود ۳۰ درصدی نیازمند بنچمارک است
تنسنت از بهبود ۳۰ درصدی پیروزی در ارزیابیهای انسانی نسبت به Hy Image 3.0 خبر داده است. این آمار ارائهشده، لزوماً به معنای رشد ۳۰ درصدی کیفیت مطلق نیست و ارزش واقعی آن به مجموعه پرامپتها، اندازه نمونه، دستورالعملهای ارزیابها، فرایند انتخاب خروجی و معیارهای ارزیابی بستگی دارد.
مقایسههای مستقل با نسخههای فعلی Seedream، Imagen، GPT-image و Midjourney میتواند تصویر رقابتی شفافتری ارائه دهد. تستهای درونسازمانی باید با استفاده از پرامپتهای تولیدی واقعی و تصاویر مرجع انجام شوند و نتایج در ابعاد مختلفی امتیازدهی گردند:
- میزان پیروی از پرامپت و دستورالعملهای ویرایشی
- یکپارچگی هویت و اجسام در مجموعهای از خروجیها
- دقت تولید متن به دو زبان چینی و انگلیسی
- حفظ بخشهایی از تصویر که از فرایند ویرایش مستثنی شدهاند
- تأخیر پردازش، نرخ قطعی ارتباط و رفتار سیستم در هنگام پردازش همزمان
- عملکرد فیلترهای ایمنی و نحوه مدیریت درخواستهای ردشده
- هزینه نهایی موثر پس از تلاشهای مجدد و خروجیهای دورریختهشده
چکلیست کاربردی برای مهاجرت به نسخه جدید
- در محیطهایی که تنظیمات مشابه را پشتیبانی میکنند، پرامپتها، Seedها، نسبتهای تصویر و مرجعهای یکسان را در هر دو نسخه 3.0 و 3.5 اجرا کنید.
- ارزیابی کیفیت بصری در ابزارهایی مانند Miora یا OnSolo را از تستهای API نظیر سنجش تأخیر، محدودیت درخواستها، احراز هویت و بازیابی خطا جدا کنید.
- در دسترس بودن خدمات منطقهای، محدودیتهای ترافیکی، شرایط حفظ دادهها، سیاستهای محتوایی و شرایط استفاده تجاری را تایید کنید.
- بهجای انتخاب یک خروجی مطلوب و گزینشی، میزان یکپارچگی را در یک مجموعه کامل از خروجیها بسنجید.
- تا زمانی که نسخه پیشنمایش به استانداردهای محیط عملیاتی نرسیده و تنسنت مسیر پایداری برای انتشار آن معرفی نکرده است، مسیر اتصال به مدل 3.0 را در سیستمهای خود حفظ کنید.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعهدهندهها قید مدلهای گرانقیمت را میزنند!
مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمعوجور و تخصصی نشان میدهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدلهای غولپیکر و پرهزینه ندارید و گزینههای بهینه همچنان در اوج هستند.

جاسوسی هوش مصنوعی در محل کار؛ کارمندان میگویند کارفرماها باید قانوناً مچگیریهایشان را لو بدهند!
نظرسنجیهای تازه نشان میدهد که بیشتر کارمندان حس میکنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آنها را زیر نظر گرفتهاند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شدهاند که شرکتها را مجبور کند هرگونه مچگیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
مایکروسافت در تازهترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفتانگیز که نشان میدهد امارات و سنگاپور با فاصلهای خیرهکننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمیدارد.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.