میدجرنی اول فکر میکند، بعد تصویر میسازد؛ کاهش ۸۰ درصدی خطاهای پرامپت با قابلیت Thinking Mode
میدجرنی آزمایش قابلیت جدیدی به نام «حالت تفکر» (Thinking Mode) را روی وبسایت آلفای خود کلید زده تا قبل از تولید تصویر، پرامپتهای پیچیده را دقیقتر پردازش کند. طبق ادعای توسعهدهندگان، این پردازش اضافه میتواند خطاهای درک پرامپت، تایپوگرافی و ناهماهنگی صحنه را تا ۸۰ درصد کاهش دهد. در حال حاضر کاربران نسخه وب میتوانند این ویژگی آزمایشی را هنگام بازتولید یا ویرایش تصاویر تست کنند.

در یک نگاه (نکات کلیدی خبر)
خلاصه مهمترین نکات و تحولات این گزارش برای مطالعه سریع
- میدجرنی در حال آزمایش قابلیت تجربی «Thinking Mode» در وبسایت آلفای خود است که قبل از رندر نهایی تصویر، زمانی را به تجزیهوتحلیل دقیق دستورات متنی اختصاص میدهد.
- توسعهدهندگان ادعا کردهاند این قابلیت میتواند خطاهای مربوط به درک پرامپت، تایپوگرافی نوشتهها و چیدمان المانهای پیچیده را بین ۶۰ تا ۸۰ درصد کاهش دهد.
- این ویژگی هنوز در مرحله آزمایشی است، فقط هنگام ویرایش یا بازتولید مجدد عکس در وب در دسترس قرار گرفته و فعلاً خبری از پشتیبانی در دیسکورد یا API نیست.
میدجرنی «حالت تفکر» را برای تولید دقیقتر تصاویر آزمایش میکند
میدجرنی در وبسایت نسخه آلفای خود در حال بررسی و آزمایش قابلیتی آزمایشی به نام «حالت تفکر» (Thinking Mode) است. این ویژگی تجربی، قبل از اینکه تصویر نهایی کشیده و رندر شود، یک مرحله پردازش محاسباتی اضافه میکند؛ با این هدف که هوش مصنوعی دقیقتر به پرامپتها پایبند بماند، متنهای داخل عکس را بدون غلط بنویسد و اجزای مختلف صحنه را هماهنگتر در کنار هم بچیند. این دقیقاً همان جاهایی است که وقتی چندین سوژه، روابط فضایی پیچیده یا جزئیات بصری حساس را در یک پرامپت ترکیب میکنید، مدلهای تصویری معمولاً کم میآورند و خرابکاری میکنند.
این ویژگی اکنون در وبسایت نسخه آلفای میدجرنی فعال شده است. طبق خلاصه منتشرشده از نشست هفتگی تیم در گزارش جلسات Office Hours، کاربران میتوانند هنگام تولید مجدد یک تصویر یا ویرایش تصاویر موجود، این حالت را فعال کنند. حالا میدجرنی از تسترهای نسخه آلفا خواسته این گزینه را زیر ذرهبین ببرند و بازخوردهایشان را ارسال کنند.
برنامهریزی قبل از چیدن پیکسلها
هوش مصنوعیهای مولد تصویر برای ساخت یک خروجی بینقص، اول از همه باید کلمات را به سوژهها، ویژگیها، موقعیتهای مکانی و تعاملات بصری ترجمه کنند. مثلاً اگر از سیستم بخواهید «سه مکعب قرمز کنار یک کره آبی» بسازد، مدل باید در طول کل فرایند تولید، حواسش به تعداد، رنگها، اشیا و رابطه فضایی بین آنها باشد. به نظر میرسد حالت تفکر دقیقاً زمان استنتاج و پردازش بیشتری (Test-time computation) اختصاص میدهد تا قبل از رندر، این شروط و محدودیتها را تفسیر و برای چیدمانشان برنامهریزی کند.
البته میدجرنی هنوز معماری فنی این قابلیت را منتشر نکرده و نگفته این پردازش اضافه دقیقاً در کدام مرحله انجام میشود. برچسب «تفکر» (Thinking) بیشتر یک نامگذاری تجاری برای محصول است تا یک الگوریتم استدلال خاص؛ بنابراین نشانی از استدلال انسانگونه یا زنجیره افکار (Chain of Thought) مشابه مدلهای زبانی در آن دیده نمیشود.
بر اساس گزارش جلسات هفتگی میدجرنی، توسعهدهندگان تخمین زدهاند که این روش بین ۶۰ تا ۸۰ درصد از شکستها و خطاهای مربوط به پرامپتخوانی را کاهش میدهد. با این حال هنوز هیچ بنچمارک رسمی، جامعه آماری مشخص، دیتاست تست یا شیوه مقایسهای ارائه نشده و این ارقام صرفاً نتایج داخلی و تأییدنشده هستند. علاوه بر این، میدجرنی هنوز اعلام نکرده که این قابلیت چه مقدار تأخیر به زمان تولید اضافه میکند یا چقدر بار روی دوش کارتهای گرافیک میگذارد.
این آزمایش آزمایشی بیشتر سناریوهایی را هدف گرفته که مدل باید چند شرط پیچیده را به صورت همزمان مدیریت کند. مهمترین کاربردهای این حالت عبارتند از:
- محدودیتهای چیدمان و ترکیببندی: صحنههایی با چند سوژه مجزا همراه با تعداد، رنگ، ابعاد یا موقعیت مکانی دقیق.
- تایپوگرافی و متنهای درون تصویر: تابلوها، لوگوها، برچسبها، پوسترها و ماکتهای رابط کاربری.
- تعاملات بین اشیا: فیگور و حالت دستها، همپوشانی اجسام، تماس فیزیکی و پنهان شدن بخشی از یک شی پشت شی دیگر.
- ویرایشهای هدفمند: تغییر دادن یک المان خاص بدون دستکاری و بههمریختن بقیه بخشهای تصویر.
- پرامپتهای شلوغ و متراکم: صحنههایی که همزمان شخصیتها، اکسسوار صحنه، نورپردازی، زاویه دوربین و سبک هنری را با هم ترکیب میکنند.
البته دستاندرکاران تأکید کردهاند این موارد صرفاً اهداف و پتانسیلهای این قابلیت هستند، نه وعدههای تضمینشده؛ خروجی نهایی بسته به نوع پرامپت، نسخه مدل، پیچیدگی تصویر و میزان دقت متنی یا فضایی درخواستشده، ممکن است متفاوت باشد.
نحوه دسترسی، محدودیتها و علامتهای سؤال
بخش | وضعیت فعلی |
|---|---|
دسترسی وب | از طریق وبسایت نسخه آلفا در دسترس است. |
تولید مجدد (Reruns) | هنگام بازتولید تصویر میتوان حالت تفکر را فعال کرد. |
ویرایش تصاویر | این گزینه حین ادیت و دستکاری تصاویر قبلی فعال است. |
تولید اولیه | استفاده مستقیم از آن در اولین دستور هنوز تأیید نشده است. |
دیسکورد و API | فعلاً هیچ دسترسی رسمی برای ربات دیسکورد یا رابط برنامهنویسی اعلام نشده است. |
قیمتگذاری و مصرف | هیچ نرخ مجزا یا کسر ساعت سریع (Fast Hours) اضافه مشخص نشده است. |
میزان تأخیر | هنوز مقایسهای درباره تفاوت زمان پردازش و رندر منتشر نشده است. |
برای مقایسه دقیق عملکرد این حالت، میتوانید پرامپت، نسبت تصویر، نسخه مدل و سید (Seed) را ثابت نگه دارید؛ سپس یک بار در حالت معمولی و یک بار با حالت تفکر تصویر را بازتولید کنید تا میزان پایبندی به جزئیات، درستی متنها، تغییرات ناخواسته، زمان پردازش و مصرف اشتراکتان را با هم بسنجید.
سنجش سود و زیان: آیا به هزینهاش میارزد؟
استفاده از محاسبات زمان استنتاج، یک راهکار هوشمندانه به میدجرنی میدهد تا بدون نیاز به آموزش مجدد و سنگین کل مدل اصلی، کیفیت خروجیها را بالاتر ببرد. البته این پردازش اضافه به احتمال زیاد توان پردازشی بیشتری از کارتهای گرافیک میبلعد و مدتزمان تولید تصویر را بالا میبرد؛ گرچه شرکت هنوز ابعاد دقیق این تأثیرات را اعلام نکرده است. از طرفی، نبود پشتیبانی از API در حال حاضر این قابلیت را فقط به کاربران نسخه وب آلفا محدود کرده است.
تیمهایی که قصد ارزیابی دقیق این قابلیت را دارند، میتوانند مجموعهای از پرامپتهای تست آماده کنند و معیارهای زیر را در چند خروجی متوالی زیر نظر بگیرند:
- پایبندی به شروط دستور: امتیازدهی به هر سوژه، ویژگی، تعداد و روابط فضایی خواستهشده در پرامپت.
- دقت کلمات و متنها: تطبیق تکتک حروف و کلمات درجشده روی عکس با متن اصلی پرامپت.
- حفظ ثبات در ویرایش: ثبت اینکه آیا بخشهای دستنخورده تصویر پس از ادیت، دستنخورده و پایدار ماندهاند یا نه.
- ثبات و تکرارپذیری خروجیها: اجرای دوباره پرامپتها برای بررسی اینکه آیا این بهبود کیفیت همیشگی است یا تصادفی رخ میدهد.
- مدتزمان تولید و مصرف اعتبار: ثبت دقیق ثانیههای پردازش و تغییرات در کسر ساعتهای Fast حساب کاربری.
در نهایت، ارزش واقعی این قابلیت جدید زمانی مشخص میشود که ببینیم آیا بهبود دقت و حذف خطاهای بصری به زمان انتظار طولانیتر و مصرف کارت گرافیک بیشتر میارزد یا نه. نسخه آلفای میدجرنی در حال حاضر بهترین فرصت برای محک زدن این تعادل است؛ آن هم در شرایطی که جزئیات فنی، هزینهها، ارائه API و زمان عرضه عمومی هنوز در هالهای از ابهام قرار دارد.
برچسب های مرتبط
مطالب مرتبط و پیشنهادی

آزمون جنجالی ایجنت متا میوز در دنیای واقعی؛ وقتی هوش مصنوعی پشت درهای بسته ضدربات گیر میافتد!
در یک آزمون تجربی، از ایجنت هوش مصنوعی متا میوز (Meta Muse) خواسته شد تا مشکل کلافهکننده تماسها و پیامکهای مزاحم مربوط به مالک قبلی یک خط موبایل را حل کند. با این حال، دیوارهای امنیتی ضدربات وبسایتها و خطای ۴۰۳، این دستیار خودمختار را قدمبهقدم متوقف کردند تا نشان دهند ایجنتهای هوش مصنوعی هنوز برای انجام کارهای اداری روزمره مسیر پرچالشی در پیش دارند.

پایان دوران پول مفت؛ هوش مصنوعی و «سرمایه شناختی» چطور بازی سرمایهگذاری را عوض میکنند؟
با پایان عصر طلایی وامهای ارزانقیمت، شرکتهای سرمایهگذاری دیگر نمیتوانند فقط با سودهای مالی رشد کنند. حالا با سقوط چشمگیر هزینههای هوش مصنوعی مولد، مفهومی به نام «سرمایه شناختی» به برگ برنده بیزینسها تبدیل شده است؛ دارایی ارزشمندی که تصمیمگیریهای پیچیده و قیمتگذاریها را الگوریتمی میکند و موتور محرک رشد آینده بازار خواهد بود.

استعفای غافلگیرکننده در اوپنایآی؛ مدیر ارشد سیاستگذاری آسیا فقط ۶ ماه دوام آورد!
سانگهیون لی، مدیر ارشد سیاستگذاری عمومی اوپنایآی در منطقه آسیا-اقیانوسیه، تنها شش ماه پس از قبول این مسئولیت از این شرکت جدا شد. این جدایی غیرمنتظره درست در شرایطی رخ میدهد که اوپنایآی به خاطر خطاهای اخیر مدلهایش در استرالیا، زیر ذرهبین سختگیرانه نهادهای نظارتی منطقه قرار گرفته است.
دیدگاه ها و گفتگوی تخصصی
نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید
هنوز دیدگاهی برای این مطلب ثبت نشده است
اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.