پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

میدجرنی اول فکر می‌کند، بعد تصویر می‌سازد؛ کاهش ۸۰ درصدی خطاهای پرامپت با قابلیت Thinking Mode

انتشار:۱۷ مهر ۱۴۰۵(۵۵ دقیقه پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

میدجرنی آزمایش قابلیت جدیدی به نام «حالت تفکر» (Thinking Mode) را روی وب‌سایت آلفای خود کلید زده تا قبل از تولید تصویر، پرامپت‌های پیچیده را دقیق‌تر پردازش کند. طبق ادعای توسعه‌دهندگان، این پردازش اضافه می‌تواند خطاهای درک پرامپت، تایپوگرافی و ناهماهنگی صحنه را تا ۸۰ درصد کاهش دهد. در حال حاضر کاربران نسخه وب می‌توانند این ویژگی آزمایشی را هنگام بازتولید یا ویرایش تصاویر تست کنند.

میدجرنی اول فکر می‌کند، بعد تصویر می‌سازد؛ کاهش ۸۰ درصدی خطاهای پرامپت با قابلیت Thinking Mode

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • میدجرنی در حال آزمایش قابلیت تجربی «Thinking Mode» در وب‌سایت آلفای خود است که قبل از رندر نهایی تصویر، زمانی را به تجزیه‌وتحلیل دقیق دستورات متنی اختصاص می‌دهد.
  • توسعه‌دهندگان ادعا کرده‌اند این قابلیت می‌تواند خطاهای مربوط به درک پرامپت، تایپوگرافی نوشته‌ها و چیدمان المان‌های پیچیده را بین ۶۰ تا ۸۰ درصد کاهش دهد.
  • این ویژگی هنوز در مرحله آزمایشی است، فقط هنگام ویرایش یا بازتولید مجدد عکس در وب در دسترس قرار گرفته و فعلاً خبری از پشتیبانی در دیسکورد یا API نیست.

میدجرنی «حالت تفکر» را برای تولید دقیق‌تر تصاویر آزمایش می‌کند

میدجرنی در وب‌سایت نسخه آلفای خود در حال بررسی و آزمایش قابلیتی آزمایشی به نام «حالت تفکر» (Thinking Mode) است. این ویژگی تجربی، قبل از اینکه تصویر نهایی کشیده و رندر شود، یک مرحله پردازش محاسباتی اضافه می‌کند؛ با این هدف که هوش مصنوعی دقیق‌تر به پرامپت‌ها پایبند بماند، متن‌های داخل عکس را بدون غلط بنویسد و اجزای مختلف صحنه را هماهنگ‌تر در کنار هم بچیند. این دقیقاً همان جاهایی است که وقتی چندین سوژه، روابط فضایی پیچیده یا جزئیات بصری حساس را در یک پرامپت ترکیب می‌کنید، مدل‌های تصویری معمولاً کم می‌آورند و خرابکاری می‌کنند.

این ویژگی اکنون در وب‌سایت نسخه آلفای میدجرنی فعال شده است. طبق خلاصه منتشرشده از نشست هفتگی تیم در گزارش جلسات Office Hours، کاربران می‌توانند هنگام تولید مجدد یک تصویر یا ویرایش تصاویر موجود، این حالت را فعال کنند. حالا میدجرنی از تسترهای نسخه آلفا خواسته این گزینه را زیر ذره‌بین ببرند و بازخوردهایشان را ارسال کنند.

برنامه‌ریزی قبل از چیدن پیکسل‌ها

هوش مصنوعی‌های مولد تصویر برای ساخت یک خروجی بی‌نقص، اول از همه باید کلمات را به سوژه‌ها، ویژگی‌ها، موقعیت‌های مکانی و تعاملات بصری ترجمه کنند. مثلاً اگر از سیستم بخواهید «سه مکعب قرمز کنار یک کره آبی» بسازد، مدل باید در طول کل فرایند تولید، حواسش به تعداد، رنگ‌ها، اشیا و رابطه فضایی بین آن‌ها باشد. به نظر می‌رسد حالت تفکر دقیقاً زمان استنتاج و پردازش بیشتری (Test-time computation) اختصاص می‌دهد تا قبل از رندر، این شروط و محدودیت‌ها را تفسیر و برای چیدمانشان برنامه‌ریزی کند.

البته میدجرنی هنوز معماری فنی این قابلیت را منتشر نکرده و نگفته این پردازش اضافه دقیقاً در کدام مرحله انجام می‌شود. برچسب «تفکر» (Thinking) بیش‌تر یک نام‌گذاری تجاری برای محصول است تا یک الگوریتم استدلال خاص؛ بنابراین نشانی از استدلال انسان‌گونه یا زنجیره افکار (Chain of Thought) مشابه مدل‌های زبانی در آن دیده نمی‌شود.

بر اساس گزارش جلسات هفتگی میدجرنی، توسعه‌دهندگان تخمین زده‌اند که این روش بین ۶۰ تا ۸۰ درصد از شکست‌ها و خطاهای مربوط به پرامپت‌خوانی را کاهش می‌دهد. با این حال هنوز هیچ بنچمارک رسمی، جامعه آماری مشخص، دیتاست تست یا شیوه مقایسه‌ای ارائه نشده و این ارقام صرفاً نتایج داخلی و تأییدنشده هستند. علاوه بر این، میدجرنی هنوز اعلام نکرده که این قابلیت چه مقدار تأخیر به زمان تولید اضافه می‌کند یا چقدر بار روی دوش کارت‌های گرافیک می‌گذارد.

این آزمایش آزمایشی بیش‌تر سناریوهایی را هدف گرفته که مدل باید چند شرط پیچیده را به صورت هم‌زمان مدیریت کند. مهم‌ترین کاربردهای این حالت عبارتند از:

  • محدودیت‌های چیدمان و ترکیب‌بندی: صحنه‌هایی با چند سوژه مجزا همراه با تعداد، رنگ، ابعاد یا موقعیت مکانی دقیق.
  • تایپوگرافی و متن‌های درون تصویر: تابلوها، لوگوها، برچسب‌ها، پوسترها و ماکت‌های رابط کاربری.
  • تعاملات بین اشیا: فیگور و حالت دست‌ها، همپوشانی اجسام، تماس فیزیکی و پنهان شدن بخشی از یک شی پشت شی دیگر.
  • ویرایش‌های هدفمند: تغییر دادن یک المان خاص بدون دستکاری و به‌هم‌ریختن بقیه بخش‌های تصویر.
  • پرامپت‌های شلوغ و متراکم: صحنه‌هایی که هم‌زمان شخصیت‌ها، اکسسوار صحنه، نورپردازی، زاویه دوربین و سبک هنری را با هم ترکیب می‌کنند.

البته دست‌اندرکاران تأکید کرده‌اند این موارد صرفاً اهداف و پتانسیل‌های این قابلیت هستند، نه وعده‌های تضمین‌شده؛ خروجی نهایی بسته به نوع پرامپت، نسخه مدل، پیچیدگی تصویر و میزان دقت متنی یا فضایی درخواست‌شده، ممکن است متفاوت باشد.

نحوه دسترسی، محدودیت‌ها و علامت‌های سؤال

بخش
وضعیت فعلی
دسترسی وب
از طریق وب‌سایت نسخه آلفا در دسترس است.
تولید مجدد (Reruns)
هنگام بازتولید تصویر می‌توان حالت تفکر را فعال کرد.
ویرایش تصاویر
این گزینه حین ادیت و دستکاری تصاویر قبلی فعال است.
تولید اولیه
استفاده مستقیم از آن در اولین دستور هنوز تأیید نشده است.
دیسکورد و API
فعلاً هیچ دسترسی رسمی برای ربات دیسکورد یا رابط برنامه‌نویسی اعلام نشده است.
قیمت‌گذاری و مصرف
هیچ نرخ مجزا یا کسر ساعت سریع (Fast Hours) اضافه مشخص نشده است.
میزان تأخیر
هنوز مقایسه‌ای درباره تفاوت زمان پردازش و رندر منتشر نشده است.

برای مقایسه دقیق عملکرد این حالت، می‌توانید پرامپت، نسبت تصویر، نسخه مدل و سید (Seed) را ثابت نگه دارید؛ سپس یک بار در حالت معمولی و یک بار با حالت تفکر تصویر را بازتولید کنید تا میزان پایبندی به جزئیات، درستی متن‌ها، تغییرات ناخواسته، زمان پردازش و مصرف اشتراکتان را با هم بسنجید.

سنجش سود و زیان: آیا به هزینه‌اش می‌ارزد؟

استفاده از محاسبات زمان استنتاج، یک راهکار هوشمندانه به میدجرنی می‌دهد تا بدون نیاز به آموزش مجدد و سنگین کل مدل اصلی، کیفیت خروجی‌ها را بالا‌تر ببرد. البته این پردازش اضافه به احتمال زیاد توان پردازشی بیشتری از کارت‌های گرافیک می‌بلعد و مدت‌زمان تولید تصویر را بالا می‌برد؛ گرچه شرکت هنوز ابعاد دقیق این تأثیرات را اعلام نکرده است. از طرفی، نبود پشتیبانی از API در حال حاضر این قابلیت را فقط به کاربران نسخه وب آلفا محدود کرده است.

تیم‌هایی که قصد ارزیابی دقیق این قابلیت را دارند، می‌توانند مجموعه‌ای از پرامپت‌های تست آماده کنند و معیارهای زیر را در چند خروجی متوالی زیر نظر بگیرند:

  • پایبندی به شروط دستور: امتیازدهی به هر سوژه، ویژگی، تعداد و روابط فضایی خواسته‌شده در پرامپت.
  • دقت کلمات و متن‌ها: تطبیق تک‌تک حروف و کلمات درج‌شده روی عکس با متن اصلی پرامپت.
  • حفظ ثبات در ویرایش: ثبت اینکه آیا بخش‌های دست‌نخورده تصویر پس از ادیت، دست‌نخورده و پایدار مانده‌اند یا نه.
  • ثبات و تکرارپذیری خروجی‌ها: اجرای دوباره پرامپت‌ها برای بررسی اینکه آیا این بهبود کیفیت همیشگی است یا تصادفی رخ می‌دهد.
  • مدت‌زمان تولید و مصرف اعتبار: ثبت دقیق ثانیه‌های پردازش و تغییرات در کسر ساعت‌های Fast حساب کاربری.

در نهایت، ارزش واقعی این قابلیت جدید زمانی مشخص می‌شود که ببینیم آیا بهبود دقت و حذف خطاهای بصری به زمان انتظار طولانی‌تر و مصرف کارت گرافیک بیش‌تر می‌ارزد یا نه. نسخه آلفای میدجرنی در حال حاضر بهترین فرصت برای محک زدن این تعادل است؛ آن هم در شرایطی که جزئیات فنی، هزینه‌ها، ارائه API و زمان عرضه عمومی هنوز در هاله‌ای از ابهام قرار دارد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

آزمون جنجالی ایجنت متا میوز در دنیای واقعی؛ وقتی هوش مصنوعی پشت درهای بسته ضدربات گیر می‌افتد!
آخرین اخبار

آزمون جنجالی ایجنت متا میوز در دنیای واقعی؛ وقتی هوش مصنوعی پشت درهای بسته ضدربات گیر می‌افتد!

در یک آزمون تجربی، از ایجنت هوش مصنوعی متا میوز (Meta Muse) خواسته شد تا مشکل کلافه‌کننده تماس‌ها و پیامک‌های مزاحم مربوط به مالک قبلی یک خط موبایل را حل کند. با این حال، دیوارهای امنیتی ضدربات وب‌سایت‌ها و خطای ۴۰۳، این دستیار خودمختار را قدم‌به‌قدم متوقف کردند تا نشان دهند ایجنت‌های هوش مصنوعی هنوز برای انجام کار‌های اداری روزمره مسیر پرچالشی در پیش دارند.

۶ دقیقه مطالعه
۰
۱۷ مهر
پایان دوران پول مفت؛ هوش مصنوعی و «سرمایه شناختی» چطور بازی سرمایه‌گذاری را عوض می‌کنند؟
آخرین اخبار

پایان دوران پول مفت؛ هوش مصنوعی و «سرمایه شناختی» چطور بازی سرمایه‌گذاری را عوض می‌کنند؟

با پایان عصر طلایی وام‌های ارزان‌قیمت، شرکت‌های سرمایه‌گذاری دیگر نمی‌توانند فقط با سودهای مالی رشد کنند. حالا با سقوط چشمگیر هزینه‌های هوش مصنوعی مولد، مفهومی به نام «سرمایه شناختی» به برگ برنده بیزینس‌ها تبدیل شده است؛ دارایی ارزشمندی که تصمیم‌گیری‌های پیچیده و قیمت‌گذاری‌ها را الگوریتمی می‌کند و موتور محرک رشد آینده بازار خواهد بود.

۶ دقیقه مطالعه
۰
۱۷ مهر
استعفای غافلگیرکننده در اوپن‌ای‌آی؛ مدیر ارشد سیاست‌گذاری آسیا فقط ۶ ماه دوام آورد!
آخرین اخبار

استعفای غافلگیرکننده در اوپن‌ای‌آی؛ مدیر ارشد سیاست‌گذاری آسیا فقط ۶ ماه دوام آورد!

سانگهیون لی، مدیر ارشد سیاست‌گذاری عمومی اوپن‌ای‌آی در منطقه آسیا-اقیانوسیه، تنها شش ماه پس از قبول این مسئولیت از این شرکت جدا شد. این جدایی غیرمنتظره درست در شرایطی رخ می‌دهد که اوپن‌ای‌آی به خاطر خطاهای اخیر مدل‌هایش در استرالیا، زیر ذره‌بین سخت‌گیرانه نهادهای نظارتی منطقه قرار گرفته است.

۲ دقیقه مطالعه
۰
۱۷ مهر