پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

شاهکار جدید xAI با ۶۵ درصد قیمت کمتر؛ مدل ویدیوساز Grok Imagine 1.5 Lite مدل Veo گوگل را پشت سر گذاشت!

انتشار:۱۸ مهر ۱۴۰۵(۵۸ دقیقه پیش)
۶ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ xAI از مدل ویدیوساز جدید Grok Imagine Video 1.5 Lite رونمایی کرد؛ مدلی سبک و تقطیرشده که با وجود کاهش ۶۵ درصدی هزینه‌ها نسبت به مدل Veo 3.1 گوگل، در رتبه‌بندی‌های بنچمارک حتی از آن پیشی گرفته است. این ابزار تازه با ارائه ترکیبی فوق‌العاده از سرعت، کیفیت و قیمت اقتصادی، کار را برای تولیدکنندگان محتوا و توسعه‌دهندگان بسیار آسان‌تر و مقرون‌به‌صرفه‌تر می‌کند.

شاهکار جدید xAI با ۶۵ درصد قیمت کمتر؛ مدل ویدیوساز Grok Imagine 1.5 Lite مدل Veo گوگل را پشت سر گذاشت!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • استارتاپ xAI نسخه تقطیرشده و سبک‌تر مدل پرچمدار خود به نام Grok Imagine Video 1.5 Lite را با سرعت بالا‌تر و هزینه‌ای به‌مراتب کم‌تر منتشر کرد.
  • در بنچمارک معتبر Artificial Analysis، این مدل سبک دو پله بالا‌تر از Veo 3.1 گوگل ایستاده و در کیفیت 1080p حدود ۶۵ درصد از رقیب گوگلی خود ارزان‌تر تمام می‌شود.
  • تولید هر ۱۰ ثانیه ویدیو در این مدل حدود ۱ دقیقه زمان می‌برد که همراه با تعرفه اقتصادی‌اش، آن را به گزینه‌ای ایده‌آل برای تست پرامپت‌ها، معماری، کلیپ‌های شبکه‌های اجتماعی و پروژه‌های کم‌هزینه تبدیل کرده است.

مدل Grok Imagine Video 1.5 Lite؛ کاهش چشمگیر هزینه‌ها و زمان ساخت ویدیو

استارتاپ هوش مصنوعی xAI به‌تازگی از مدل Grok Imagine Video 1.5 Lite پرده برداشته؛ نسخه‌ای تقطیرشده (Distilled) و جمع‌وجور از مدل پرچمدار ویدیوساز این شرکت که حسابی توجهات را به خود جلب کرده است. در زمان انتشار این گزارش، مرجع تخصصی Artificial Analysis نسخه لایت را در هر دو جدول رده‌بندی بنچمارک AA-Video-T2V v2.0 و نسخه بدون صدای آن در رتبه هفدهم قرار داده است. نکته شگفت‌انگیز ماجرا اینجاست که این مدل ارزان‌قیمت، دو پله بالا‌تر از مدل معروف Veo 3.1 گوگل قرار گرفته، در حالی که در وضوح 1080p تنها حدود ۳۵ درصد آن (یعنی ۶۵ درصد ارزان‌تر!) هزینه روی دست کاربر می‌گذارد.

علاوه بر این، مدل لایت گراک موفق شده روی «مرز پارتو» (Pareto Frontier) در دو مقایسه کلیدی قرار بگیرد: کیفیت در برابر سرعت، و کیفیت در برابر قیمت. وقتی یک مدل در مرز بهینه پارتو قرار می‌گیرد، یعنی در میان تمامی گزینه‌های آزمایش‌شده، هیچ مدل دیگری وجود ندارد که هم‌زمان کیفیت بالا‌تر و سرعت بیش‌تر یا قیمت پایین‌تری ارائه دهد. به بیان ساده‌تر، اگر به دنبال تعادل بی‌نظیری میان کیفیت تصویر و جیب مبارکتان باشید، فعلاً گزینه‌ای بهتر از این پیدا نخواهید کرد!

جادوی تقطیر؛ چطور همه‌چیز سریع‌تر و ارزان‌تر شد؟

در توضیحات رسمی صفحه این مدل در OpenRouter، نسخه لایت به عنوان مدلی سریع‌تر و اقتصادی معرفی شده که با فرآیند «تقطیر دانش» از مدل اصلی Grok Imagine Video 1.5 به دست آمده است. در این فرآیند، یک مدل کوچک‌تر (شاگرد) آموزش می‌بیند تا رفتارهای مدل بزرگ‌تر و اصلی (معلم) را تقلید کند، اما با سخت‌افزار بسیار سبک‌تر و منابع محاسباتی کم‌تر اجرا شود. بررسی‌های دقیق Artificial Analysis هم دقیقاً همین موضوع را تأیید می‌کند: زمان پاسخ‌دهی و هزینه‌ها به طرز چشمگیری افت کرده، اما طبیعتاً در ۹ شاخه از ۱۰ شاخص سنجش عملکرد، امتیازات مدل لایت کمی از نسخه کامل و سنگین کم‌تر است.

مدل لایت از قابلیت ساخت ویدیو با متن (Text-to-Video) و تصویر به ویدیو (Image-to-Video)، تولید صدای پیش‌فرض، هفت نسبت تصویر گوناگون و ساخت کلیپ‌هایی به طول ۱ تا ۱۵ ثانیه پشتیبانی می‌کند. تنظیمات خروجی شامل کیفیت‌های 480p، 720p و 1080p است و فرمت‌های پرکاربردی مثل واید اسکرین ۱۶:۹ یا ویدیوهای عمودی ۹:۱۶ (مخصوص استوری و ریلز اینستاگرام یا تیک‌تاک) را به‌راحتی تحویل می‌دهد.

پلتفرم OpenRouter اعلام کرده که گزینه 1080p در واقع ابتدا ویدیو را با رزولوشن 720p رندر می‌کند و سپس با الگوریتم‌های آپ‌اسکیلینگ (Upscaling) ابعاد آن را ارتقا می‌دهد. یعنی ابعاد فریم خروجی در قالب 1080p است، اما جزئیات بصری پایه‌ای آن از رندر 720p سرچشمه می‌گیرد. این تفاوت فنی برای کار‌هایی که به بافت‌های خیلی ظریف، متن‌های ریز، کراپ تصویر یا جلوه‌های ویژه پیچیده وابسته‌اند، اهمیت زیادی دارد.

تعرفه‌ها متحول شدند؛ صرفه‌جویی اساسی در تست و تولید ویدیو

استارتاپ xAI قیمت هر ثانیه خروجی مدل لایت را برای کیفیت 1080p معادل ۰.۱۴ دلار، برای 720p تنها ۰.۰۳ دلار و برای 480p فقط ۰.۰۲ دلار تعیین کرده است. در بالا‌ترین کیفیت یعنی 1080p، این مدل ۴۴ درصد از نسخه کامل Grok Imagine Video 1.5 و ۶۵ درصد از مدل Veo 3.1 گوگل (همراه با صدا) ارزان‌تر است که برای تولیدکنندگان ویدیو یک تخفیف هیجان‌انگیز به حساب می‌آید.

مدل و تنظیمات
هر ثانیه
۱۰ ثانیه
۶۰ ثانیه
گراک ایمجین لایت (1080p)
۰.۱۴ دلار
۱.۴۰ دلار
۸.۴۰ دلار
گراک ایمجین لایت (720p)
۰.۰۳ دلار
۰.۳۰ دلار
۱.۸۰ دلار
گراک ایمجین لایت (480p)
۰.۰۲ دلار
۰.۲۰ دلار
۱.۲۰ دلار
گراک ایمجین ۱.۵ کامل (1080p)
۰.۲۵ دلار
۲.۵۰ دلار
۱۵.۰۰ دلار
مدل Veo 3.1 با صدا (1080p)
۰.۴۰ دلار
۴.۰۰ دلار
۲۴.۰۰ دلار

فقط یک دقیقه انتظار برای ساخت یک ویدیوی ۱۰ ثانیه‌ای

گزارش مرجع Artificial Analysis نشان می‌دهد میانگین زمان ساخت یک کلیپ ۱۰ ثانیه‌ای با کیفیت 1080p در مدل لایت حدود ۶۰.۵ ثانیه است. در میان ۱۲ مدل مختلفی که سرعتشان مقایسه شده، نسخه لایت توانسته جایگاه برتر در تعادل کیفیت و سرعت را از آن خود کند.

برای مقایسه، مدل Kling 3.0 1080p Pro با وجود کسب امتیاز کیفیتی اندکی بالاتر، برای ساخت یک ویدیوی ۵ ثانیه‌ای به ۹۴ ثانیه زمان نیاز دارد. از سوی دیگر، مدل Vidu Q3 Turbo در تنظیمات 720p و ۵ ثانیه‌ای حدود ۹ ثانیه سریع‌تر از ویدیوی ۱۰ ثانیه‌ای 1080p گراک کار را تمام می‌کند، اما امتیاز کیفیت بسیار پایین‌تری به دست می‌آورد. البته به دلیل تفاوت در طول کلیپ‌ها و رزولوشن‌ها، مقایسه توان پردازشی مستقیم کار دشواری است و این اعداد وضعیت پیکربندی‌های آزمایش‌شده را نشان می‌دهند.

مدت زمان حدوداً یک‌دقیقه‌ای برای رندر ویدیو، دست طراحان را برای آزمون و خطای پرامپت‌ها، ساخت استوری‌بورد و خلق نمونه‌های متنوع باز می‌گذارد؛ بدون اینکه نیازی به صف‌های طولانی پردازش دسته‌ای (Batch) باشد. البته تأخیر واقعی API با توجه به شلوغی سرور ارائه‌دهنده، تلاش مجدد (Retry)، موقعیت جغرافیایی و تنظیمات درخواست ممکن است متغیر باشد.

نقاط قوت و ضعف؛ درخشش در نورپردازی و روایت داستان

بنچمارک تخصصی AA-Video-T2V v2.0 عملکرد مدل‌ها را در ۱۰ قابلیت فنی و ۱۰ سناریوی کاربردی می‌سنجد. نسخه لایت در سه دسته از قابلیت‌ها بیش‌ترین نزدیکی را به مرز بالا‌ترین کیفیت ثبت کرده است:

  • روایت و صحنه‌های چندگانه (Multi-Scene & Narrative): داستان‌های چندرویدادی، تغییر نما و انتقال شات‌ها، مونتاژ و ثبات چهره و هویت سوژه در طول ویدیو.
  • نورپردازی و بافت متریال (Lighting & Materials): نورسنجی، سایه‌ها، دمای رنگ، لباس، مو و پوست یا پشم حیوانات.
  • رندر متن (Text Rendering): نگارش متون کوتاه و بلند، چیدمان دوبعدی متن و قرار دادن نوشته روی سطوح متحرک و ناهموار.

بزرگ‌ترین نقاط ضعف این مدل در هماهنگی لب و دیالوگ (Lip Sync) و آناتومی بدن انسان دیده می‌شود. در مقایسه با نسخه کامل Grok Imagine Video 1.5، مدل لایت در قوانین فیزیک امتیاز برابری کسب کرده اما در ۹ شاخص دیگر کمی عقب‌تر ایستاده است؛ هرچند کم‌ترین اختلاف میان این دو مدل در بخش صحنه‌های چندگانه و روایت داستانی بوده است.

در سناریوهای کاربردی، بیش‌ترین امتیازات مدل لایت به حوزه‌های معماری و املاک، محتوای عمومی کاربران و پروژه‌های اداری و دانشی تعلق گرفته است. این حوزه‌ها مواردی مانند نماهای هوایی از نمای بیرونی ساختمان‌ها، تورهای مجازی درون خانه، ویدیوهای سلفی، تصاویر مکمل (B-roll)، ویدیوهای توضیحی و آموزشی، و مصورسازی متحرک داده‌ها را پوشش می‌دهند.

بزرگ‌ترین فاصله کیفیتی مدل لایت با رقبا در دسته‌بندی فیلم‌های سینمایی زنده (Live-Action) و تست‌های فوق‌پیشرفته هوش مصنوعی ظاهر شده است. بنابراین صحنه‌های پر از دیالوگ، نماهای بسته از دست‌ها یا چهره‌ها، و سکانس‌های سینمایی سنگین حتماً قبل از استفاده نهایی در پروژه‌های تجاری به آزمون دقیق پرامپت‌ها نیاز دارند.

از نوشتن پرامپت تا فایل MP4؛ راهنمای سریع برای برنامه‌نویسان

مدل لایت در حال حاضر از طریق API رسمی xAI، پلتفرم fal و همچنین گیت‌وی هوش مصنوعی Vercel (Vercel AI Gateway) در دسترس توسعه‌دهندگان است. پلتفرم fal همان قیمت‌های پایه را ارائه می‌دهد و ورسل نیز این مدل را از طریق هلپر آزمایشی ویدیو در بسته‌ توسعه AI SDK در اختیار برنامه‌نویسان گذاشته است.

اگر کلید هوش مصنوعی را در متغیر محیطی AI_GATEWAY_API_KEY تنظیم کرده باشید، یک نمونه کد ساده در Node.js به این صورت خواهد بود:

import { experimental_generateVideo as generateVideo } from 'ai';
import { writeFile } from 'node:fs/promises';

const result = await generateVideo({
  model: 'xai/grok-imagine-video-1.5-lite',
  prompt:
    'A drone shot of a coastal cliff with crashing waves at golden hour.',
  duration: 5,
  providerOptions: {
    xai: {
      pollTimeoutMs: 600000,
    },
  },
});

const video = result.videos[0];

if (video === undefined) {
  throw new Error('The provider returned no video.');
}

await writeFile('output.mp4', video.uint8Array);

مقدار pollTimeoutMs به ابزار SDK اجازه می‌دهد وضعیت پردازش نامتقارن ویدیو را تا ۱۰ دقیقه زیر نظر بگیرد. در این مثال، رزولوشن و نسبت ابعاد روی مقادیر پیش‌فرض قرار دارند. البته فیلدهای پشتیبانی‌شده در هر ارائه‌دهنده (بین xAI، fal و ورسل) ممکن است متفاوت باشد؛ بنابراین پیش از ارائه قابلیت‌ها به کاربران نهایی، گزینه‌های فعال هر مسیر را بررسی کنید. از آنجا که این هلپر هنوز حالت آزمایشی دارد، تثبیت نسخه AI SDK برای محیط‌های پروداکشن توصیه می‌شود.

نحوه ارائه کیفیت 1080p در کاتالوگ ارائه‌دهندگان مختلف نیز یکدست نیست؛ اوپن‌روتر آن را به عنوان یک رندر آپ‌اسکیل‌شده از 720p معرفی می‌کند، در حالی که برخی سرویس‌های متفرقه تنها گزینه‌های 480p و 720p را برای این شناسه مدل فعال کرده‌اند. اپلیکیشن‌هایی که به جزئیات دقیق 1080p وابسته هستند، بهتر است با پرامپت‌های نمونه کیفیت آپ‌اسکیل‌شده لایت را با خروجی مدل اصلی مقایسه کنند.

معماری دو لایه‌ای هوشمند؛ ترفندی طلایی برای کاهش هزینه‌ها

یک روش کاری دولایه و بسیار هوشمندانه این است که از مدل سبک لایت برای آزمون و خطای پرامپت‌ها و ساخت نسخه‌های اولیه استفاده کنید و مدل پرچمدار و گران‌تر را فقط برای رندر نهایی پرامپت‌های منتخب نگه دارید. ساخت ۱۰ پیش‌نویس ویدیوی ۱۰ ثانیه‌ای با کیفیت 1080p در مدل لایت حدود ۱۴ دلار هزینه می‌برد. حال اگر پرامپت برتر را با نسخه اصلی دوباره بسازید، ۲.۵۰ دلار دیگر اضافه می‌شود و مجموع هزینه به ۱۶.۵۰ دلار می‌رسد؛ در حالی که ساخت تمام آن ۱۰ پیش‌نویس با مدل پرچمدار، مستقیماً ۲۵ دلار تمام می‌شد!

حتی جالب‌تر اینکه اگر برای مرحله پیش‌نویس از کیفیت 720p استفاده کنید، هزینه تولید ۱۰ ویدیوی تستی تنها ۳ دلار می‌شود و با اضافه شدن ۲.۵۰ دلار برای نسخه نهایی 1080p، کل پروژه با ۵.۵۰ دلار جمع می‌شود. البته هر بار اجرای مجدد یک ویدیوی تازه خلق می‌کند و تکرارپذیری دقیق صحنه‌ها به کنترل سید (Seed) در ارائه‌دهنده بستگی خواهد داشت.

نتایج بنچمارک نشان می‌دهد مدل لایت برای پروژه‌هایی مثل انیمیشن‌های معماری، ویدیوهای توضیحی، کلیپ‌های شبکه‌های اجتماعی، فوتیج‌های مکمل و استوری‌بوردهای چندصحنه‌ای بهترین عملکرد را دارد. اما اگر سناریوی شما شامل دیالوگ‌های هماهنگ با لب، نماهای نزدیک و حساس از اعضای بدن یا سکانس‌های اکشن و سینمایی سنگین است، استفاده از مدل کامل یا ابزار‌های تخصصی‌تر انتخاب مطمئن‌تری خواهد بود.

این نسخه تازه، گزینه‌ای اقتصادی و بسیار کارآمد را میان ابزار‌های ساده و مدل‌های بسیار گران‌قیمت پرچمدار در اختیار توسعه‌دهندگان قرار می‌دهد. قرار گرفتن این مدل بالا‌تر از Veo 3.1 گوگل فشار رقابتی بر قیمت‌ها را در این بازار بیش‌تر می‌کند؛ هرچند این رتبه‌بندی بر اساس مجموعه پرامپت‌ها و شیوه امتیازدهی مشخصی به دست آمده است. توسعه‌دهندگان در ارزیابی نهایی برای محصولات خود باید علاوه بر کیفیت، پایداری سرور، مدیریت خطاهای احتمالی، زمان ماندن در صف و کیفیت صدا را نیز در پرامپت‌های اختصاصی خود بررسی کنند.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
آخرین اخبار

دسته‌گل‌های جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!

پس از دسته‌گل‌های اخیر مدل‌های هوش مصنوعی آنتروپیک و نفوذ ناخواسته آن‌ها به سامانه‌های دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعه‌دهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدل‌های خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

۴ دقیقه مطالعه
۰
۱۸ مهر
شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
آخرین اخبار

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!

استارتاپ پرایم اینتلکت در اقدامی شگفت‌انگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریم‌ورک پرایم ایجنت را ظرف دو هفته از تایپ‌اسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متن‌باز است.

۵ دقیقه مطالعه
۰
۱۸ مهر
هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو می‌سازد؛ آن‌هم با ۷۵ سنت!
آخرین اخبار

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو می‌سازد؛ آن‌هم با ۷۵ سنت!

پروژه متن‌باز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وب‌گردی شما از نو می‌سازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصی‌سازی‌شده و جذاب آماده می‌کند.

۲ دقیقه مطالعه
۰
۱۸ مهر