پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

انقلاب بلک فارست لبز در ساخت عکس: با FLUX 3 Image جای تک‌تک اجزای تصویر رو با مختصات دقیق تعیین کنید!

انتشار:۱۰ مهر ۱۴۰۵(۱ ساعت پیش)
۴ دقیقه زمان مطالعه
۰ دیدگاه

استارتاپ بلک فارست لبز از مدل جدید FLUX 3 Image رونمایی کرد که کنترل کاملی روی چیدمان بصری به توسعه‌دهندگان می‌دهد. با این ابزار دیگر نیازی به کلنجار رفتن با پرامپت‌های طولانی برای تنظیم جای سوژه‌ها ندارید و می‌توانید مکان دقیق هر المان را با باکس‌های مختصاتی مشخص کنید.

انقلاب بلک فارست لبز در ساخت عکس: با FLUX 3 Image جای تک‌تک اجزای تصویر رو با مختصات دقیق تعیین کنید!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • مدل جدید FLUX 3 Image به شما اجازه می‌دهد به‌جای پرامپت‌های متنی طولانی، جای دقیق هر عنصر را با کادرهای مختصاتی (Bounding Box) در یک شبکه ۰ تا ۱۰۰۰ مشخص کنید.
  • قابلیت ویرایش موضعی فوق‌العاده؛ می‌توانید فقط یک بخش خاص (مثل لباس یا تخته موج‌سواری) را تغییر دهید، بدون اینکه حتی یک پیکسل از پس‌زمینه یا بقیه تصویر دست بخورد.
  • پشتیبانی از ترکیب همزمان تا ۱۰ تصویر مرجع و ارائه خروجی با وضوح خیره‌کننده ۱۶.۸ مگاپیکسل، بدون افت کیفیت بافت‌ها و نوشته‌های ریز.

استارتاپ «بلک فارست لبز» (Black Forest Labs) از مدل جدید FLUX 3 Image رونمایی کرد؛ بخشی از خانواده چندوجهی FLUX 3 که به تولید و ویرایش حرفه‌ای تصویر اختصاص دارد. با این مدل جدید، توسعه‌دهندگان می‌توانند با استفاده از کادرهای مرزبندی (Bounding Boxes)، توصیف هر بخش و یک متن کلی، صحنه را به‌دقت تعریف کنند و دستوراتی کاملاً شفاف درباره جایگاه هر عنصر به مدل بدهند.

سیستم‌های سنتی تبدیل متن به تصویر معمولاً چیدمان صحنه را از لابه‌لای جملات توصیفی پرامپت حدس می‌زنند؛ رویکردی که تکرارپذیری چیدمان‌های دقیق را فوق‌العاده سخت می‌کرد. اما مدل FLUX 3 Image چیدمان را به یک ورودی ساختاریافته تبدیل می‌کند. این رویکرد جدید به‌طور ویژه برای طراحی جلد مجلات، ترکیب تصاویر محصولات، کلاژها و فرایندهای ویرایشی که در آن‌ها جای‌گیری و فاصله‌گذاری عناصر به‌اندازه سبک بصری اهمیت دارد، طراحی شده است.

خداحافظی با کلنجار رفتن سر پرامپت؛ مختصات دقیق جایگزین حدس و گمان شد

مدل FLUX 3 Image هر بوم نقاشی را فارغ از ابعاد پیکسلی یا نسبت تصویر، به یک شبکه استاندارد ۰ تا ۱۰۰۰ نقشه‌برداری می‌کند. هر عنصر درون تصویر دارای یک شناسه (ID)، توضیحات و یک کادر به‌شکل [y_min, x_min, y_max, x_max] است. عدد اول و سوم بازه عمودی و عدد دوم و چهارم محدوده افقی آن عنصر را مشخص می‌کنند.

یک درخواست چیدمان، جدولی از این عناصر را با توضیحی کلی از کل صحنه ترکیب می‌کند:

[
  {
    "id": "dome_1",
    "bbox": [250, 150, 650, 850],
    "desc": "a massive, smooth parabolic dome of pale concrete"
  },
  {
    "id": "swimmers_1",
    "bbox": [580, 200, 720, 800],
    "desc": "dozens of small, silhouetted figures wading in dark water"
  },
  {
    "id": "crowd_1",
    "bbox": [740, 0, 1000, 1000],
    "desc": "a large crowd seated on the beach in light summer attire"
  }
]

توسعه‌دهندگان می‌توانند این مختصات را مستقیماً تعریف کنند یا از یک مدل زبانی بزرگ (LLM) بخواهند با دریافت یک دستور کوتاه و نسبت تصویر، این جدول المان‌ها و توضیحات را بسازد. از آنجا که شناسه‌ها و مختصات در مراحل بعدی همچنان قابل ویرایش هستند، اپلیکیشن‌ها می‌توانند وضعیت پروژه را ذخیره کرده و به یک ایجنت اجازه دهند المان‌ها را یکی‌یکی و به‌طور مجزا بازبینی یا اصلاح کند.

ویرایش موضعی بدون به‌هم‌ریختن کل تصویر

مدل FLUX 3 Image از ویرایش‌های چندمرحله‌ای درون کادرهای انتخابی پشتیبانی می‌کند. بلک فارست لبز تأکید کرده که پیکسل‌های خارج از این کادرها «بیت‌به‌بیت یکسان و دست‌نخورده» باقی می‌مانند؛ یعنی مقادیر عددی رنگ آن‌ها ذره‌ای تغییر نمی‌کند. در دموی رسمی این محصول، رنگ لباس غواصی و تخته یک موج‌سوار تغییر داده می‌شود، در حالی که موج، آسمان و افکت‌های تک‌رنگ در سایر بخش‌های فریم کوچک‌ترین تغییری نمی‌کنند.

تیم BFL این پایداری کم‌نظیر را تا حدی مدیون فناوری «آپسمپلر پرامپت» (Prompt Upsampler) می‌داند؛ سیستمی که درخواست‌های کوتاه را به توضیحات پرجزئیات و استانداردی که مدل در دوران آموزش دیده تبدیل می‌کند. شناسه باکس‌ها و مختصات دقیق از فرایند بازنویسی عبور می‌کنند و بدون تغییر به مدل می‌رسند. به‌گفته این شرکت، جزئیات تولیدشده تنها زمانی روی خروجی نهایی اثر می‌گذارند که پرامپت بسط‌یافته صراحتاً به آن‌ها اشاره کرده باشد.

۱۰ تصویر مرجع در یک قاب واحد

در هر بار تولید تصویر، می‌توانید تا سقف ۱۰ تصویر مرجع مختلف را با هم ترکیب کنید. رابط برنامه‌نویسی (API) این مدل به ترتیب آپلود تصاویر، توکن‌هایی مانند ref_image_0 به آن‌ها اختصاص می‌دهد و در متن پرامپت هم مستقیماً به همین توکن‌ها ارجاع داده می‌شود:

A fashion streetwear portrait in Times Square with ref_image_0,
ref_image_1, ref_image_2, ref_image_3, ref_image_4 and ref_image_5.

این مدل پیش از رندر کردن کل فریم، جایگاه و مقیاس هر تصویر مرجع را تعیین می‌کند؛ بنابراین حفظ ترتیب آپلود تصاویر هنگام ساخت پرامپت‌ها از طریق کد اهمیت زیادی دارد. این قابلیت فوق‌العاده برای عکاسی تبلیغاتی محصولات، ژورنال‌های مد و فشن (Lookbook)، مودبوردها و ترکیب دارایی‌های بصری موجود بسیار کاربردی است.

خروجی با وضوح خیره‌کننده ۱۶.۸ مگاپیکسل

حداکثر وضوح تصویر خروجی به حدود ۱۶.۸ مگاپیکسل (با ابعادی نزدیک به ۵۴۵۶ در ۳۰۷۲ پیکسل) می‌رسد. به‌گفته BFL، مدل تصویر را مستقیماً با وضوح درخواستی تولید می‌کند و نیازی به مراحل جداگانه بزرگ‌نمایی (Upscaling) ندارد؛ مراحلی که در مدل‌های دیگر معمولاً باعث محو شدن نوشته‌های ریز و بافت‌های ظریف می‌شدند. در یکی از دموها، تابلوی یک مغازه نودل‌فروشی ژاپنی نشان داده شده که در آن حروف دست‌نویس با ارتفاع حدود ۲۲۵ پیکسل کاملاً واضح و خوانا رندر شده‌اند.

عضوی از یک خانواده چهارگانه

بلک فارست لبز سری FLUX 3 را یک مدل چندوجهی توصیف می‌کند که به‌صورت یکپارچه و همزمان با داده‌های تصویر، ویدیو و صدا آموزش دیده است. این آموزش مشترک باعث می‌شود اعضای این خانواده درک یکپارچه‌ای از صحنه‌ها در رسانه‌های مختلف داشته باشند.

این آزمایشگاه مستقر در فرایبورگ آلمان، در اوت ۲۰۲۴ توسط پژوهشگرانی تأسیس شد که پیش‌تر روی پروژه معروف Stable Diffusion در شرکت Stability AI کار کرده بودند. این تیم خانواده محصولات FLUX 3 را در چهار شاخه سامان‌دهی کرده است:

محصول
کاربرد
وضعیت عرضه
FLUX 3 Video
تولید ویدیو
دسترسی اولیه (Early access)
FLUX 3 Image
تولید و ویرایش تصویر
پلی‌گراند و دسترسی از طریق API
FLUX 3 Action
جزئیات کاربرد هنوز اعلام نشده
دسترسی اولیه (Early access)
FLUX 3 Dev
نسخه متن‌باز ویژه توسعه‌دهندگان
به‌زودی

از پلی‌گراند تا میزبانی اختصاصی

مدل FLUX 3 Image هم‌اکنون از طریق پلی‌گراند آنلاین BFL و رابط برنامه‌نویسی (API) در دسترس است. همزمان با این عرضه، ۵۰ درصد تخفیف برای استفاده از API تا تاریخ ۸ اکتبر در نظر گرفته شده است. مستندات این API شامل ساختار پرامپت‌ها، توکن‌های مرجع و اسکیماهای چیدمان نیز به‌طور کامل در دسترس قرار دارد.

شرکت‌ها همچنین می‌توانند با دریافت لایسنس تجاری، وزن‌های مدل را برای فاین‌تیون و استقرار روی زیرساخت اختصاصی خود به کار بگیرند. علاوه بر این، BFL اعلام کرده که نسخه با وزن‌های باز (Open-weights) مدل FLUX 3 Image ظرف چند هفته آینده منتشر خواهد شد؛ هرچند هنوز تاریخ دقیقی برای آن اعلام نشده است. مدل FLUX 3 Dev نیز که شرکت آن را متن‌باز معرفی کرده، به‌عنوان یک محصول مجزا باقی خواهد ماند.

کادرهای مختصاتی کجاها بیش‌ترین کاربرد را دارند؟

  • طراحی جلد مجلات و طرح‌های گرافیکی که در آن‌ها متن و تصویر باید با هم ترکیب شوند
  • شبکه‌بندی پنل‌ها، کلاژها و لوک‌بوک‌ها با فواصل و روابط فضایی مشخص
  • ترکیب‌های تبلیغاتی برای محصولات فروشگاهی با استفاده از تصاویر مرجع اختصاصی
  • ویرایش‌های چندمرحله‌ای که در آن‌ها بخش‌های تأییدشده باید کاملاً دست‌نخورده باقی بمانند
  • جریان‌های کاری مبتنی بر ایجنت‌ها که در آن یک مدل زبانی ترکیب‌بندی تصویر را برنامه‌ریزی می‌کند

البته در گزارش‌های اولیه، بنچمارک‌های دقیقی از دقت چیدمان، میزان تأخیر API یا درصد پایداری تصویر در ویرایش‌های طولانی‌مدت گزارش نشده است. در محیط‌های کاری واقعی، ارزیابی این متغیرها در کنار مواردی مثل وفاداری به تصاویر مرجع، کیفیت رندر متون، نرخ پردازش و هزینه‌های جاری API باید مورد سنجش قرار گیرد.

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

معرفی پروژه متن‌باز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشه‌بیدار با دسترسی به وب، اسلک و صدا
آخرین اخبار

معرفی پروژه متن‌باز OpenDots توسط CopilotKit؛ ساخت همکاران هوش مصنوعی همیشه‌بیدار با دسترسی به وب، اسلک و صدا

تیم CopilotKit با انتشار قالب متن‌باز OpenDots، ساخت همکاران هوش مصنوعی همیشه‌بیدار را برای برنامه‌نویسان راحت‌تر از همیشه کرده است. این ابزار به ایجنت‌ها اجازه می‌دهد به وب، اسلک و حتی مکالمات صوتی دسترسی داشته باشند و در محیط‌هایی کاملاً ایزوله کار‌های تیمی را جلو ببرند.

۲ دقیقه مطالعه
۰
۱۰ مهر
۹ دستور «اسلش» شگفت‌انگیز در چت‌جی‌پی‌تی برای گرفتن بهترین پاسخ‌ها
آخرین اخبار

۹ دستور «اسلش» شگفت‌انگیز در چت‌جی‌پی‌تی برای گرفتن بهترین پاسخ‌ها

اگر از پرحرفی یا پاسخ‌های کلیشه‌ای چت‌جی‌پی‌تی کلافه شده‌اید، با اضافه کردن چند دستور ساده با علامت اسلش (/) می‌توانید خروجی هوش مصنوعی را متحول کنید. در این راهنما با ۹ دستور کاربردی آشنا می‌شوید که کیفیت پاسخ‌های مدل‌های زبانی را به اوج می‌رسانند.

۷ دقیقه مطالعه
۰
۱۰ مهر
شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوق‌العاده ۰.۹ درصد!
آخرین اخبار

شاهکار آزمایشگاه کیوتای؛ بازآموزی مدل صوتی PocketTTS با روش جدید و نرخ خطای فوق‌العاده ۰.۹ درصد!

آزمایشگاه فرانسوی کیوتای با بازآموزی مدل صوتی کم‌حجم PocketTTS از طریق روش خلاقانه Drifting، موفق شد پیچیدگی‌های محاسباتی سنگین را کنار بگذارد و به نرخ خطای خارق‌العاده ۰.۹۰ درصد برسد. این مدل ۱۰۰ میلیون پارامتری به طور کامل روی CPU اجرا می‌شود، از شبیه‌سازی صدا و استریم زنده پشتیبانی می‌کند و با حفظ کیفیت چشمگیر، فرایند آموزش مدل‌های گفتاری را بسیار ساده‌تر و بهینه‌تر کرده است.

۴ دقیقه مطالعه
۰
۱۰ مهر