شاهکار جدید xAI با ۶۵ درصد قیمت کمتر؛ مدل ویدیوساز Grok Imagine 1.5 Lite مدل Veo گوگل را پشت سر گذاشت!
استارتاپ xAI از مدل ویدیوساز جدید Grok Imagine Video 1.5 Lite رونمایی کرد؛ مدلی سبک و تقطیرشده که با وجود کاهش ۶۵ درصدی هزینهها نسبت به مدل Veo 3.1 گوگل، در رتبهبندیهای بنچمارک حتی از آن پیشی گرفته است. این ابزار تازه با ارائه ترکیبی فوقالعاده از سرعت، کیفیت و قیمت اقتصادی، کار را برای تولیدکنندگان محتوا و توسعهدهندگان بسیار آسانتر و مقرونبهصرفهتر میکند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- استارتاپ xAI نسخه تقطیرشده و سبکتر مدل پرچمدار خود به نام Grok Imagine Video 1.5 Lite را با سرعت بالاتر و هزینهای بهمراتب کمتر منتشر کرد.
- در بنچمارک معتبر Artificial Analysis، این مدل سبک دو پله بالاتر از Veo 3.1 گوگل ایستاده و در کیفیت 1080p حدود ۶۵ درصد از رقیب گوگلی خود ارزانتر تمام میشود.
- تولید هر ۱۰ ثانیه ویدیو در این مدل حدود ۱ دقیقه زمان میبرد که همراه با تعرفه اقتصادیاش، آن را به گزینهای ایدهآل برای تست پرامپتها، معماری، کلیپهای شبکههای اجتماعی و پروژههای کمهزینه تبدیل کرده است.
مدل Grok Imagine Video 1.5 Lite؛ کاهش چشمگیر هزینهها و زمان ساخت ویدیو
استارتاپ هوش مصنوعی xAI بهتازگی از مدل Grok Imagine Video 1.5 Lite پرده برداشته؛ نسخهای تقطیرشده (Distilled) و جمعوجور از مدل پرچمدار ویدیوساز این شرکت که حسابی توجهات را به خود جلب کرده است. در زمان انتشار این گزارش، مرجع تخصصی Artificial Analysis نسخه لایت را در هر دو جدول ردهبندی بنچمارک AA-Video-T2V v2.0 و نسخه بدون صدای آن در رتبه هفدهم قرار داده است. نکته شگفتانگیز ماجرا اینجاست که این مدل ارزانقیمت، دو پله بالاتر از مدل معروف Veo 3.1 گوگل قرار گرفته، در حالی که در وضوح 1080p تنها حدود ۳۵ درصد آن (یعنی ۶۵ درصد ارزانتر!) هزینه روی دست کاربر میگذارد.
علاوه بر این، مدل لایت گراک موفق شده روی «مرز پارتو» (Pareto Frontier) در دو مقایسه کلیدی قرار بگیرد: کیفیت در برابر سرعت، و کیفیت در برابر قیمت. وقتی یک مدل در مرز بهینه پارتو قرار میگیرد، یعنی در میان تمامی گزینههای آزمایششده، هیچ مدل دیگری وجود ندارد که همزمان کیفیت بالاتر و سرعت بیشتر یا قیمت پایینتری ارائه دهد. به بیان سادهتر، اگر به دنبال تعادل بینظیری میان کیفیت تصویر و جیب مبارکتان باشید، فعلاً گزینهای بهتر از این پیدا نخواهید کرد!
جادوی تقطیر؛ چطور همهچیز سریعتر و ارزانتر شد؟
در توضیحات رسمی صفحه این مدل در OpenRouter، نسخه لایت به عنوان مدلی سریعتر و اقتصادی معرفی شده که با فرآیند «تقطیر دانش» از مدل اصلی Grok Imagine Video 1.5 به دست آمده است. در این فرآیند، یک مدل کوچکتر (شاگرد) آموزش میبیند تا رفتارهای مدل بزرگتر و اصلی (معلم) را تقلید کند، اما با سختافزار بسیار سبکتر و منابع محاسباتی کمتر اجرا شود. بررسیهای دقیق Artificial Analysis هم دقیقاً همین موضوع را تأیید میکند: زمان پاسخدهی و هزینهها به طرز چشمگیری افت کرده، اما طبیعتاً در ۹ شاخه از ۱۰ شاخص سنجش عملکرد، امتیازات مدل لایت کمی از نسخه کامل و سنگین کمتر است.
مدل لایت از قابلیت ساخت ویدیو با متن (Text-to-Video) و تصویر به ویدیو (Image-to-Video)، تولید صدای پیشفرض، هفت نسبت تصویر گوناگون و ساخت کلیپهایی به طول ۱ تا ۱۵ ثانیه پشتیبانی میکند. تنظیمات خروجی شامل کیفیتهای 480p، 720p و 1080p است و فرمتهای پرکاربردی مثل واید اسکرین ۱۶:۹ یا ویدیوهای عمودی ۹:۱۶ (مخصوص استوری و ریلز اینستاگرام یا تیکتاک) را بهراحتی تحویل میدهد.
پلتفرم OpenRouter اعلام کرده که گزینه 1080p در واقع ابتدا ویدیو را با رزولوشن 720p رندر میکند و سپس با الگوریتمهای آپاسکیلینگ (Upscaling) ابعاد آن را ارتقا میدهد. یعنی ابعاد فریم خروجی در قالب 1080p است، اما جزئیات بصری پایهای آن از رندر 720p سرچشمه میگیرد. این تفاوت فنی برای کارهایی که به بافتهای خیلی ظریف، متنهای ریز، کراپ تصویر یا جلوههای ویژه پیچیده وابستهاند، اهمیت زیادی دارد.
تعرفهها متحول شدند؛ صرفهجویی اساسی در تست و تولید ویدیو
استارتاپ xAI قیمت هر ثانیه خروجی مدل لایت را برای کیفیت 1080p معادل ۰.۱۴ دلار، برای 720p تنها ۰.۰۳ دلار و برای 480p فقط ۰.۰۲ دلار تعیین کرده است. در بالاترین کیفیت یعنی 1080p، این مدل ۴۴ درصد از نسخه کامل Grok Imagine Video 1.5 و ۶۵ درصد از مدل Veo 3.1 گوگل (همراه با صدا) ارزانتر است که برای تولیدکنندگان ویدیو یک تخفیف هیجانانگیز به حساب میآید.
مدل و تنظیمات | هر ثانیه | ۱۰ ثانیه | ۶۰ ثانیه |
|---|---|---|---|
گراک ایمجین لایت (1080p) | ۰.۱۴ دلار | ۱.۴۰ دلار | ۸.۴۰ دلار |
گراک ایمجین لایت (720p) | ۰.۰۳ دلار | ۰.۳۰ دلار | ۱.۸۰ دلار |
گراک ایمجین لایت (480p) | ۰.۰۲ دلار | ۰.۲۰ دلار | ۱.۲۰ دلار |
گراک ایمجین ۱.۵ کامل (1080p) | ۰.۲۵ دلار | ۲.۵۰ دلار | ۱۵.۰۰ دلار |
مدل Veo 3.1 با صدا (1080p) | ۰.۴۰ دلار | ۴.۰۰ دلار | ۲۴.۰۰ دلار |
فقط یک دقیقه انتظار برای ساخت یک ویدیوی ۱۰ ثانیهای
گزارش مرجع Artificial Analysis نشان میدهد میانگین زمان ساخت یک کلیپ ۱۰ ثانیهای با کیفیت 1080p در مدل لایت حدود ۶۰.۵ ثانیه است. در میان ۱۲ مدل مختلفی که سرعتشان مقایسه شده، نسخه لایت توانسته جایگاه برتر در تعادل کیفیت و سرعت را از آن خود کند.
برای مقایسه، مدل Kling 3.0 1080p Pro با وجود کسب امتیاز کیفیتی اندکی بالاتر، برای ساخت یک ویدیوی ۵ ثانیهای به ۹۴ ثانیه زمان نیاز دارد. از سوی دیگر، مدل Vidu Q3 Turbo در تنظیمات 720p و ۵ ثانیهای حدود ۹ ثانیه سریعتر از ویدیوی ۱۰ ثانیهای 1080p گراک کار را تمام میکند، اما امتیاز کیفیت بسیار پایینتری به دست میآورد. البته به دلیل تفاوت در طول کلیپها و رزولوشنها، مقایسه توان پردازشی مستقیم کار دشواری است و این اعداد وضعیت پیکربندیهای آزمایششده را نشان میدهند.
مدت زمان حدوداً یکدقیقهای برای رندر ویدیو، دست طراحان را برای آزمون و خطای پرامپتها، ساخت استوریبورد و خلق نمونههای متنوع باز میگذارد؛ بدون اینکه نیازی به صفهای طولانی پردازش دستهای (Batch) باشد. البته تأخیر واقعی API با توجه به شلوغی سرور ارائهدهنده، تلاش مجدد (Retry)، موقعیت جغرافیایی و تنظیمات درخواست ممکن است متغیر باشد.
نقاط قوت و ضعف؛ درخشش در نورپردازی و روایت داستان
بنچمارک تخصصی AA-Video-T2V v2.0 عملکرد مدلها را در ۱۰ قابلیت فنی و ۱۰ سناریوی کاربردی میسنجد. نسخه لایت در سه دسته از قابلیتها بیشترین نزدیکی را به مرز بالاترین کیفیت ثبت کرده است:
- روایت و صحنههای چندگانه (Multi-Scene & Narrative): داستانهای چندرویدادی، تغییر نما و انتقال شاتها، مونتاژ و ثبات چهره و هویت سوژه در طول ویدیو.
- نورپردازی و بافت متریال (Lighting & Materials): نورسنجی، سایهها، دمای رنگ، لباس، مو و پوست یا پشم حیوانات.
- رندر متن (Text Rendering): نگارش متون کوتاه و بلند، چیدمان دوبعدی متن و قرار دادن نوشته روی سطوح متحرک و ناهموار.
بزرگترین نقاط ضعف این مدل در هماهنگی لب و دیالوگ (Lip Sync) و آناتومی بدن انسان دیده میشود. در مقایسه با نسخه کامل Grok Imagine Video 1.5، مدل لایت در قوانین فیزیک امتیاز برابری کسب کرده اما در ۹ شاخص دیگر کمی عقبتر ایستاده است؛ هرچند کمترین اختلاف میان این دو مدل در بخش صحنههای چندگانه و روایت داستانی بوده است.
در سناریوهای کاربردی، بیشترین امتیازات مدل لایت به حوزههای معماری و املاک، محتوای عمومی کاربران و پروژههای اداری و دانشی تعلق گرفته است. این حوزهها مواردی مانند نماهای هوایی از نمای بیرونی ساختمانها، تورهای مجازی درون خانه، ویدیوهای سلفی، تصاویر مکمل (B-roll)، ویدیوهای توضیحی و آموزشی، و مصورسازی متحرک دادهها را پوشش میدهند.
بزرگترین فاصله کیفیتی مدل لایت با رقبا در دستهبندی فیلمهای سینمایی زنده (Live-Action) و تستهای فوقپیشرفته هوش مصنوعی ظاهر شده است. بنابراین صحنههای پر از دیالوگ، نماهای بسته از دستها یا چهرهها، و سکانسهای سینمایی سنگین حتماً قبل از استفاده نهایی در پروژههای تجاری به آزمون دقیق پرامپتها نیاز دارند.
از نوشتن پرامپت تا فایل MP4؛ راهنمای سریع برای برنامهنویسان
مدل لایت در حال حاضر از طریق API رسمی xAI، پلتفرم fal و همچنین گیتوی هوش مصنوعی Vercel (Vercel AI Gateway) در دسترس توسعهدهندگان است. پلتفرم fal همان قیمتهای پایه را ارائه میدهد و ورسل نیز این مدل را از طریق هلپر آزمایشی ویدیو در بسته توسعه AI SDK در اختیار برنامهنویسان گذاشته است.
اگر کلید هوش مصنوعی را در متغیر محیطی AI_GATEWAY_API_KEY تنظیم کرده باشید، یک نمونه کد ساده در Node.js به این صورت خواهد بود:
import { experimental_generateVideo as generateVideo } from 'ai';
import { writeFile } from 'node:fs/promises';
const result = await generateVideo({
model: 'xai/grok-imagine-video-1.5-lite',
prompt:
'A drone shot of a coastal cliff with crashing waves at golden hour.',
duration: 5,
providerOptions: {
xai: {
pollTimeoutMs: 600000,
},
},
});
const video = result.videos[0];
if (video === undefined) {
throw new Error('The provider returned no video.');
}
await writeFile('output.mp4', video.uint8Array);مقدار pollTimeoutMs به ابزار SDK اجازه میدهد وضعیت پردازش نامتقارن ویدیو را تا ۱۰ دقیقه زیر نظر بگیرد. در این مثال، رزولوشن و نسبت ابعاد روی مقادیر پیشفرض قرار دارند. البته فیلدهای پشتیبانیشده در هر ارائهدهنده (بین xAI، fal و ورسل) ممکن است متفاوت باشد؛ بنابراین پیش از ارائه قابلیتها به کاربران نهایی، گزینههای فعال هر مسیر را بررسی کنید. از آنجا که این هلپر هنوز حالت آزمایشی دارد، تثبیت نسخه AI SDK برای محیطهای پروداکشن توصیه میشود.
نحوه ارائه کیفیت 1080p در کاتالوگ ارائهدهندگان مختلف نیز یکدست نیست؛ اوپنروتر آن را به عنوان یک رندر آپاسکیلشده از 720p معرفی میکند، در حالی که برخی سرویسهای متفرقه تنها گزینههای 480p و 720p را برای این شناسه مدل فعال کردهاند. اپلیکیشنهایی که به جزئیات دقیق 1080p وابسته هستند، بهتر است با پرامپتهای نمونه کیفیت آپاسکیلشده لایت را با خروجی مدل اصلی مقایسه کنند.
معماری دو لایهای هوشمند؛ ترفندی طلایی برای کاهش هزینهها
یک روش کاری دولایه و بسیار هوشمندانه این است که از مدل سبک لایت برای آزمون و خطای پرامپتها و ساخت نسخههای اولیه استفاده کنید و مدل پرچمدار و گرانتر را فقط برای رندر نهایی پرامپتهای منتخب نگه دارید. ساخت ۱۰ پیشنویس ویدیوی ۱۰ ثانیهای با کیفیت 1080p در مدل لایت حدود ۱۴ دلار هزینه میبرد. حال اگر پرامپت برتر را با نسخه اصلی دوباره بسازید، ۲.۵۰ دلار دیگر اضافه میشود و مجموع هزینه به ۱۶.۵۰ دلار میرسد؛ در حالی که ساخت تمام آن ۱۰ پیشنویس با مدل پرچمدار، مستقیماً ۲۵ دلار تمام میشد!
حتی جالبتر اینکه اگر برای مرحله پیشنویس از کیفیت 720p استفاده کنید، هزینه تولید ۱۰ ویدیوی تستی تنها ۳ دلار میشود و با اضافه شدن ۲.۵۰ دلار برای نسخه نهایی 1080p، کل پروژه با ۵.۵۰ دلار جمع میشود. البته هر بار اجرای مجدد یک ویدیوی تازه خلق میکند و تکرارپذیری دقیق صحنهها به کنترل سید (Seed) در ارائهدهنده بستگی خواهد داشت.
نتایج بنچمارک نشان میدهد مدل لایت برای پروژههایی مثل انیمیشنهای معماری، ویدیوهای توضیحی، کلیپهای شبکههای اجتماعی، فوتیجهای مکمل و استوریبوردهای چندصحنهای بهترین عملکرد را دارد. اما اگر سناریوی شما شامل دیالوگهای هماهنگ با لب، نماهای نزدیک و حساس از اعضای بدن یا سکانسهای اکشن و سینمایی سنگین است، استفاده از مدل کامل یا ابزارهای تخصصیتر انتخاب مطمئنتری خواهد بود.
این نسخه تازه، گزینهای اقتصادی و بسیار کارآمد را میان ابزارهای ساده و مدلهای بسیار گرانقیمت پرچمدار در اختیار توسعهدهندگان قرار میدهد. قرار گرفتن این مدل بالاتر از Veo 3.1 گوگل فشار رقابتی بر قیمتها را در این بازار بیشتر میکند؛ هرچند این رتبهبندی بر اساس مجموعه پرامپتها و شیوه امتیازدهی مشخصی به دست آمده است. توسعهدهندگان در ارزیابی نهایی برای محصولات خود باید علاوه بر کیفیت، پایداری سرور، مدیریت خطاهای احتمالی، زمان ماندن در صف و کیفیت صدا را نیز در پرامپتهای اختصاصی خود بررسی کنند.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

دستهگلهای جنجالی هوش مصنوعی آنتروپیک؛ کاخ سفید گزارش تخلفات را اجباری کرد!
پس از دستهگلهای اخیر مدلهای هوش مصنوعی آنتروپیک و نفوذ ناخواسته آنها به سامانههای دولتی، کاخ سفید رویکرد ملایم قبلی را کنار گذاشت. حالا دولت آمریکا با ابلاغ دستورالعملی تازه، تمامی توسعهدهندگان هوش مصنوعی را موظف کرده که هرگونه حادثه و خطای امنیتی مدلهای خود را فوراً گزارش داده و خسارات ناشی از آن را جبران کنند.

شاهکار ارتش ۲۰۰۰ ایجنتی پرایم اینتلکت؛ بازنویسی پرایم ایجنت با زبان راست و سرعت ۱۳ برابری!
استارتاپ پرایم اینتلکت در اقدامی شگفتانگیز، با هماهنگی بیش از ۲۰۰۰ ایجنت هوش مصنوعی موفق شد فریمورک پرایم ایجنت را ظرف دو هفته از تایپاسکریپت به زبان راست بازنویسی کند. نتیجه این مهاجرت عظیم، کاهش ۸۳ درصدی مصرف حافظه و جهش چشمگیر ۱۳ برابری در سرعت اجرای این ابزار متنباز است.

هوش مصنوعی کلود هر روز صبح صفحه تب جدید کروم را از نو میسازد؛ آنهم با ۷۵ سنت!
پروژه متنباز جدیدی به نام ai-newtab با تکیه بر هوش مصنوعی کلود، هر روز صفحه تب جدید کروم را متناسب با علایق و تاریخچه وبگردی شما از نو میسازد. این ابزار با هزینه روزانه حدود ۰.۷۵ دلار، یک صفحه خانگی شخصیسازیشده و جذاب آماده میکند.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.