پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

مدل هوش مصنوعی Kimi K3 به پلتفرم Amazon Bedrock اضافه شد

انتشار:۳۱ شهریور ۱۴۰۵(۵ روز پیش)
۵ دقیقه زمان مطالعه
۰ دیدگاه

مدل هوش مصنوعی Kimi K3 از شرکت Moonshot AI با پنجره زمینه یک‌ میلیون‌ توکنی و قابلیت پردازش تصویر، اکنون از طریق سرویس Amazon Bedrock در دسترس کاربران قرار گرفته است.

مدل هوش مصنوعی Kimi K3 به پلتفرم Amazon Bedrock اضافه شد

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل هوش مصنوعی Kimi K3 با معماری ترکیبی از متخصص‌ها (MoE) و پنجره زمینه یک‌ میلیون‌ توکنی به سرویس ابری Amazon Bedrock افزوده شد.
  • این مدل ۲.۸ تریلیون پارامتری از طراحی پراکنده (Sparse) بهره می‌برد که منجر به کاهش قابل‌توجه هزینه‌های استنتاج نسبت به مدل‌های متراکم می‌شود.
  • هزینه استفاده از Kimi K3 در پلتفرم آمازون حدود ۱.۷۶ برابر بیشتر از OpenRouter است، اما با امکانات امنیتی و مدیریتی یکپارچه AWS عرضه می‌شود.

پیوستن Kimi K3 به Amazon Bedrock

سرویس Amazon Bedrock اکنون مدل Kimi K3 از شرکت Moonshot AI را از طریق پروفایل‌های استنتاج مدیریت‌شده جهانی و بین‌منطقه‌ای در آمریکا ارائه می‌دهد. این مدل به مشتریان AWS امکان می‌دهد تا به پنجره زمینه یک‌ میلیون‌ توکنی و ورودی تصویر K3 دسترسی داشته باشند. علاوه بر این، امکاناتی مانند مجوزهای IAM، گزینه‌های رمزنگاری، ثبت گزارش‌های حسابرسی و صورت‌حساب یکپارچه نیز در دسترس قرار گرفته است.

این استقرار برای پایگاه‌های کد بزرگ، مجموعه‌های اسناد و پردازش‌های طولانی ایجنت‌ها هدف‌گذاری شده است. همچنین به تیم‌هایی که نمی‌توانند داده‌های خود را به سرورهای Moonshot ارسال کنند، یک مسیر مدیریت‌شده توسط AWS با رعایت الزامات امنیتی، اقامت داده و تدارکات ارائه می‌دهد.

غول پراکنده برای درک متن

مدل Kimi K3 یک مدل ترکیبی از متخصص‌ها (MoE) با حدود ۲.۸ تریلیون پارامتر است. بر اساس مستندات Moonshot، این مدل تنها ۱۶ متخصص از ۸۹۶ متخصص را برای هر توکن فعال می‌کند و اجازه می‌دهد تنها کسری از شبکه در زمان استنتاج اجرا شود. این طراحی پراکنده باعث می‌شود که مدل با این اندازه در مقایسه با مدل‌های متراکم با تعداد پارامتر یکسان، برای سرویس‌دهی ارزان‌تر باشد.

معماری این مدل ترکیبی از Kimi Delta Attention، بازمانده‌های توجه (Attention Residuals) و چارچوب Stable LatentMoE است. شرکت Moonshot اعلام کرده که Kimi Delta Attention نیازهای حافظه و محاسباتی را در پردازش‌های طولانی کاهش می‌دهد، در حالی که Stable LatentMoE بهبود ۲.۵ برابری در مقیاس‌پذیری نسبت به Kimi K2 ارائه می‌دهد.

مدل K3 متن و تصویر را در پنجره زمینه یک‌ میلیون‌ توکنی خود می‌پذیرد. اگرچه وزن‌های باز این مدل از ورودی ویدیو نیز پشتیبانی می‌کند، اما استقرار در Bedrock در حال حاضر ورودی چندوجهی را تنها به تصاویر محدود کرده است.

در زمان عرضه در Bedrock، ارزیابی Artificial Analysis به K3 نمره ۶۰ را در شاخص هوش خود اختصاص داد که هم‌تراز با GLM-5.3 و سه امتیاز کمتر از Claude Opus 5 است. این شاخص چندین ارزیابی را تجمیع می‌کند و یک مقایسه کلی ارائه می‌دهد. البته تست‌های کدنویسی، بازیابی اطلاعات، استفاده از ابزار و تأخیر هنوز باید بار کاری واقعی را در محیط تولید منعکس کنند.

سه رابط برنامه‌نویسی و یک باگ در Converse

سرویس Bedrock مدل K3 را از طریق رابط‌های برنامه‌نویسی (API) شامل Responses، Chat Completions و Converse یا Invoke در دسترس قرار می‌دهد. آمازون AWS استفاده از رابط‌های سازگار با OpenAI یعنی Responses و Chat Completions را توصیه می‌کند که فرآیند انتقال برای برنامه‌های ساخته‌شده با OpenAI SDK را کاهش می‌دهند.

در حال حاضر یک باگ در Converse وجود دارد که بر درخواست‌های چندمرحله‌ای (Multi-turn) که شامل محتوای استدلال از پیام‌های قبلی دستیار هستند، تأثیر می‌گذارد. این درخواست‌ها ممکن است خطای InternalServerException برگردانند که می‌تواند تنظیمات پیش‌فرض LangChain و پیکربندی ایجنت‌ها را مختل کند. برنامه‌هایی که از Converse استفاده می‌کنند باید بلوک‌های استدلالی را از تاریخچه مکالمه حذف کنند؛ برنامه‌هایی که از Chat Completions استفاده می‌کنند با این مشکل مواجه نمی‌شوند.

  • ذخیره‌سازی پرامپت (Prompt caching): کش صریح حداقل به ۱۰۲۴ توکن در هر نقطه بازرسی نیاز دارد و حداقل ۳۰ دقیقه زمان ماندگاری دارد. هزینه خواندن از کش معادل ۱۰ درصد از نرخ ورودی توکن‌ها است.
  • ورودی تصویر: شرکت AWS برای نتایج بهتر توصیه می‌کند بلوک‌های تصویری قبل از بلوک‌های متنی قرار گیرند. قابلیت Chat Completions پارامتر detail را با تنظیمات low و high پشتیبانی می‌کند، در حالی که Responses تصاویر را با جزئیات بالا پردازش می‌کند.
  • ورودی ویدیو: پلتفرم Bedrock از قابلیت ویدیویی که در وزن‌های باز Moonshot وجود دارد پشتیبانی نمی‌کند.
  • مسیریابی منطقه‌ای: سرویس US Geo استنتاج‌ها را در مناطق پشتیبانی‌شده آمریکا مسیریابی می‌کند. مسیریابی جهانی (Global routing) از مناطق تجاری پشتیبانی‌شده توسط AWS استفاده می‌کند؛ بنابراین برای پروژه‌های حساس به محل ذخیره‌سازی داده‌ها، باید مناطق مجاز را تأیید کرد.

افزایش قیمت ۷۶ درصدی در Bedrock

قیمت‌گذاری منتشرشده برای استاندارد جهانی (Global Standard) معادل ۳ دلار برای هر میلیون توکن ورودی و ۱۵ دلار برای هر میلیون توکن خروجی است. هزینه خواندن از کش ۰.۳۰ دلار به ازای هر میلیون توکن بوده و نوشتن در کش به مدت ۳۰ دقیقه ۳.۷۵ دلار هزینه دارد. پروفایل استاندارد آمریکا (US Geo Standard) نیز ۱۰ درصد به این نرخ‌ها اضافه می‌کند.

پلتفرم OpenRouter مدل Kimi K3 را با قیمت ۱.۷۰ دلار برای هر میلیون توکن ورودی، ۸.۵۰ دلار برای خروجی و ۰.۱۷ دلار برای خواندن کش فهرست کرده است. بنابراین، نسخه جهانی Bedrock برای پردازش‌های بدون کش حدود ۱.۷۶ برابر گران‌تر است. با این حال، Bedrock با امکانات یکپارچه هویتی، ثبت وقایع، مسیریابی، صورت‌حساب و کنترل‌های پشتیبانی AWS ارائه می‌شود.

سطح خدمات (Service tier)
ورودی (Input)
خروجی (Output)
خواندن از کش (Cache read)
Bedrock Global Standard
۳.۰۰ دلار
۱۵.۰۰ دلار
۰.۳۰ دلار
Bedrock US Standard
۳.۳۰ دلار
۱۶.۵۰ دلار
۰.۳۳ دلار
Bedrock Priority
۵.۲۵ دلار
۲۶.۲۵ دلار
۰.۵۳ دلار
Bedrock Flex
۱.۵۰ دلار
۷.۵۰ دلار
۰.۱۵ دلار
OpenRouter
۱.۷۰ دلار
۸.۵۰ دلار
۰.۱۷ دلار

سطح Flex نصف قیمت جهانی هزینه دارد و برای کارهای گروهی که می‌توانند اولویت زمان‌بندی پایین‌تری داشته باشند، مناسب است. سطح Priority برای ترافیک‌های حساس به زمان پاسخ‌دهی ۱.۷۵ برابر نرخ استاندارد است. این مقایسه با OpenRouter تنها براساس لیست قیمت‌ها است؛ زیرا تنظیمات، مسیریابی، نگهداری داده‌ها و پشتیبانی در ارائه‌دهندگان مختلف متفاوت است.

فراخوانی K3 با OpenAI SDK

رابط Responses سازگار با OpenAI نیازمند آدرس پایه Bedrock، یک توکن در محدوده منطقه‌ای و یک شناسه پروفایل استنتاج است:

from aws_bedrock_token_generator import provide_token
from openai import OpenAI

region = "us-west-2"

client = OpenAI(
    api_key=provide_token(region=region),
    base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
)

response = client.responses.create(
    model="global.moonshotai.kimi-k3",
    input="Summarize this repository.",
)

print(response.output_text)

شناسه‌های پروفایل استنتاج شامل us.moonshotai.kimi-k3 و global.moonshotai.kimi-k3 است. کاربر نیاز به اعتبارنامه‌های پیکربندی‌شده AWS و دسترسی اجرای مدل دارد، از جمله bedrock:InvokeModel برای درخواست‌های استاندارد و bedrock:InvokeModelWithResponseStream برای پاسخ‌های جریانی.

موارد استفاده و محدودیت‌ها

پلتفرم Bedrock در حال حاضر از مدل‌های Anthropic، Meta و Mistral پشتیبانی می‌کند؛ با اضافه‌شدن K3، یک مدل بزرگ با وزن‌های باز، پنجره زمینه بسیار طولانی و بینایی ماشینی نیز فراهم می‌شود. بررسی کل مخازن کد، استخراج داده‌ها از اسناد بزرگ و تاریخچه طولانی ایجنت‌ها از کاربردهای قابل‌قبول این مدل است؛ به‌ویژه زمانی که تکرار یک پرامپت ثابت بتواند از تخفیف‌های کش استفاده کند.

پنجره زمینه طولانی همچنان در مواجهه با پرامپت‌های حاوی حجم عظیمی از داده‌های بدون ساختار، ممکن است جزئیات مهم را از دست بدهد. ارزیابی‌های پیش از عرضه باید کیفیت بازیابی، انتخاب ابزار، سازگاری خروجی، زمان دریافت اولین توکن و مجموع تأخیر در طول‌های زمینه واقعی را آزمایش کنند.

کارهایی که ورودی بالایی دارند بیشترین بهره را از قیمت‌گذاری کش در Bedrock می‌برند. یک میلیون توکن کش‌شده در استاندارد جهانی ۰.۳۰ دلار هزینه دارد، در حالی که هزینه یک میلیون توکن تولیدشده ۱۵.۰۰ دلار است. از این رو، تحلیل مکرر پایگاه‌های کد ثابت یا اسناد، نمایه‌ هزینه‌ای متفاوتی نسبت به پردازش‌هایی دارد که گزارش‌های طولانی تولید کرده یا ایجنت‌ها را برای مدت زمان طولانی فعال نگه می‌دارند.

محدودیت‌های تجاری در مجوز استفاده

شرکت Moonshot وزن‌های K3 را تحت یک مجوز سفارشی توزیع می‌کند که فراتر از تعاریف استاندارد متن‌باز (Open Source) است. شرکت‌هایی با درآمد سالانه بیش از ۲۰ میلیون دلار باید پیش از ارائه سرویس K3 به مشتریان خارجی خود، با Moonshot مذاکره کنند. همچنین، شرکت‌هایی با درآمد بیش از ۲۰ میلیون دلار در ماه یا بیش از ۱۰۰ میلیون کاربر فعال ماهانه ملزم به رعایت شرط ذکر نام و اعتبار سازنده مدل هستند.

آمازون AWS وزن‌ها را برای درخواست‌های Bedrock ذخیره و ارائه می‌کند. اما تعهدات محصول همچنان به شرایط خدمات AWS، مجوز فعلی Moonshot و نحوه ارائه مدل به مشتریان بستگی دارد. شرکت‌هایی که در محدوده آستانه درآمد یا کاربر قرار دارند، باید این شرایط را پیش از راه‌اندازی پروژه‌های خود به‌دقت بررسی کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!
آخرین اخبار

رکورد ۸۳۳ هزار دانلود ماهانه برای LEGAL-BERT؛ وقتی توسعه‌دهنده‌ها قید مدل‌های گران‌قیمت را می‌زنند!

مدل زبانی تخصصی LEGAL-BERT با ثبت بیش از ۸۳۳ هزار دانلود در ماه روی پلتفرم هاگینگ فیس حسابی خبرساز شده است. این ابزار جمع‌وجور و تخصصی نشان می‌دهد که برای پردازش و تحلیل متون حقوقی، حتماً نیازی به مدل‌های غول‌پیکر و پرهزینه ندارید و گزینه‌های بهینه همچنان در اوج هستند.

۲ دقیقه مطالعه
۰
۶ مهر
جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!
آخرین اخبار

جاسوسی هوش مصنوعی در محل کار؛ کارمندان می‌گویند کارفرماها باید قانوناً مچ‌گیری‌هایشان را لو بدهند!

نظرسنجی‌های تازه نشان می‌دهد که بیشتر کارمندان حس می‌کنند مدیرانشان با ابزارهای هوش مصنوعی تمام حرکات آن‌ها را زیر نظر گرفته‌اند. حالا بیش از ۸۰ درصد شاغلان خواستار تصویب قانونی شده‌اند که شرکت‌ها را مجبور کند هرگونه مچ‌گیری و نظارت هوش مصنوعی در محیط کار را رسماً اعلام کنند.

۳ دقیقه مطالعه
۰
۶ مهر
گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!
آخرین اخبار

گزارش داغ مایکروسافت از نفوذ جهانی هوش مصنوعی؛ امارات در صدر و رتبه عجیب آمریکا!

مایکروسافت در تازه‌ترین گزارش خود از ضریب نفوذ هوش مصنوعی در جهان پرده برداشت؛ آماری شگفت‌انگیز که نشان می‌دهد امارات و سنگاپور با فاصله‌ای خیره‌کننده پیشتاز دنیا هستند و در مقابل، آمریکا در رتبه ۲۱ جا مانده است. همچنین الگوی استفاده از هوش مصنوعی میان کشورهای غربی و کشورهای در حال توسعه، از تفاوتی عمیق میان کاربردهای روزمره و آموزش پرده برمی‌دارد.

۳ دقیقه مطالعه
۰
۶ مهر