پرش به محتوای اصلی
آخرین اخبار
۲ وایر پاداش مطالعه

انقلاب در جستجوی فایل‌های مک؛ اپلیکیشن رایگان DigUp مفهوم عکس‌ها و ویدیوها را هم می‌فهمد!

انتشار:۱۹ مهر ۱۴۰۵(۱ ساعت پیش)
۲ دقیقه زمان مطالعه
۰ دیدگاه
اشتراک و پسندیدن

کاربران مک به‌زودی شیوه جستجوی فایل‌ها در سیستم خود را ارتقا می‌دهند؛ اپلیکیشن رایگان و متن‌باز DigUp با بهره‌گیری از هوش مصنوعی، فایل‌ها، تصاویر، ویدیوها و اسناد را بر اساس مفهوم و محتوای درونی‌شان پیدا می‌کند. تمامی پردازش‌ها و تحلیل داده‌ها نیز کاملاً روی خود دستگاه و بدون ارسال اطلاعات به فضای ابری انجام می‌شود تا امنیت و حریم خصوصی کاربران به طور کامل حفظ شود.

انقلاب در جستجوی فایل‌های مک؛ اپلیکیشن رایگان DigUp مفهوم عکس‌ها و ویدیوها را هم می‌فهمد!

در یک نگاه (نکات کلیدی خبر)

خلاصه مهم‌ترین نکات و تحولات این گزارش برای مطالعه سریع

  • اپلیکیشن رایگان و متن‌باز DigUp به منوبار مک اضافه می‌شود و برخلاف اسپات‌لایت اپل، به جای نام فایل، محتوا و مفهوم عکس‌ها، فایل‌های صوتی، ویدیوها، کدهای برنامه‌نویسی و اسناد PDF را درک می‌کند.
  • این ابزار از مدل چندوجهی EmbeddingGemma 2 گوگل با ۷۴۰ میلیون پارامتر استفاده می‌کند تا محتوای متنی، صوتی و تصویری را به بردارهای معنایی یکسان تبدیل کند و جستجوی چندرسانه‌ای را ممکن سازد.
  • تمام پردازش‌ها و ایندکس‌گذاری‌ها کاملاً آفلاین و روی تراشه‌های اختصاصی مک (Apple Silicon) انجام می‌شود و نتایج جستجو در عرض چند میلی‌ثانیه آماده می‌شوند.

جستجوی چندوجهی فایل‌ها با اپلیکیشن DigUp در مک‌های اپل سیلیکون

اپلیکیشن DigUp یک ابزار رایگان و متن‌باز (با لایسنس MIT) برای منوبار مک است که فایل‌ها را بر اساس مفهوم و معنایشان در میان انواع محتوای متنی، تصویری، صوتی، ویدیویی، فایل‌های PDF و حتی سورس‌کدها جستجو می‌کند. در حالی که قابلیت اسپات‌لایت (Spotlight) مک در حال حاضر فقط نام فایل‌ها، متادیتا و متن ساده اسناد را جستجو می‌کند، DigUp قابلیت بازیابی متقابل و چندوجهی (cross-modal) را به سیستم اضافه کرده است؛ بنابراین اگر مثلاً عبارت «گورخری در دشت» را تایپ کنید، فریم متناسب در یک فایل ویدیویی را پیدا می‌کند یا با جستجوی عبارت «بند فسخ قرارداد»، مستقیماً به صفحه مربوطه در فایل اجاره‌نامه هدایت می‌شوید. جالب‌تر این‌که پس از دانلود اولیه مدل، تمام مراحل ایندکس‌گذاری و جستجو کاملاً روی خود دستگاه (on-device) انجام می‌شود.

DigUp logo showing text, image, audio, and video connected through a shared search system

مدل EmbeddingGemma 2 وظیفه تبدیل متن، تصویر و صدا را به نقاطی در یک فضای برداری ۷۶۸ بعدی مشترک بر عهده دارد. گوگل این مدل ۷۴۰ میلیون پارامتری را به عنوان اولین مدل امبدینگ ذاتاً چندوجهی (natively multimodal) خود معرفی کرده که دقیقاً برای کار‌هایی مثل پیدا کردن یک ویدیو بر اساس یک یادداشت صوتی یا تطبیق عکس با توضیحات متنی طراحی شده است.

در این فرآیند، هر فایلی که ایندکس می‌شود، به فهرستی از ۷۶۸ عدد تبدیل خواهد شد که نشان‌دهنده معنا و مفهوم عمیق آن است. فایل‌هایی با محتوای نزدیک به هم، در فواصل بسیار کمی از یکدیگر در این فضا قرار می‌گیرند؛ به این ترتیب وقتی عبارتی مثل «سگی در ساحل» را جستجو می‌کنید، سیستم بدون این‌که نیازی به تولید کپشن یا توصیف متنی برای عکس‌ها داشته باشد، می‌تواند هم‌زمان یک عکس، یک صفحه از فایل PDF و فریم خاصی از یک ویدیو را در نتایج رتبه‌بندی کند. همچنین اپلیکیشن DigUp برای امبد کردن ویدیوها، ابتدا آن‌ها را به فریم‌های تصویری و ترک‌های صوتی تفکیک می‌کند و سپس به تحلیل هر بخش می‌پردازد.

اپلیکیشن DigUp پوشه‌های انتخابی کاربر را اسکن و ایندکس می‌کند، سپس تمام بردارهای تولیدشده را در یک فایل دیتابیس سبک SQLite ذخیره می‌نماید و هم‌زمان یک شاخص کلیدواژه‌ای برای جستجوهای لفظی و سنتی نگه می‌دارد. طبق اعلام توسعه‌دهندگان این پروژه، فرآیند امبد کردن عبارت جستجو تنها در چند میلی‌ثانیه انجام می‌شود و بلافاصله با بردارهای ذخیره‌شده عکس‌ها، بخش‌های متنی اسناد، صفحات PDF، فریم‌های ویدیویی و قطعات صوتی مقایسه خواهد شد تا دقیق‌ترین نتایج پیش روی کاربر قرار گیرد.

بازخورد و اشتراک‌گذاری این مطلب

اگر این گزارش برایتان مفید بود، با پسندیدن و اشتراک‌گذاری آن با دیگران، از محتوای تخصصی هوش مصنوعی حمایت کنید.

اشتراک‌گذاری در شبکه‌های اجتماعی:

دیدگاه ها و گفتگوی تخصصی

نظرات خود را با جامعه مخاطبان وایر ای آی در میان بگذارید

۰ دیدگاه

هنوز دیدگاهی برای این مطلب ثبت نشده است

اولین نفری باشید که دیدگاه، تحلیل یا دیدگاه خود را درباره این موضوع با دیگران به اشتراک می گذارد.

مطالب مرتبط و پیشنهادی

جاده‌های تگزاس در تسخیر تریلی‌های بدون راننده؛ وقتی هوش مصنوعی فرمان غول‌های ۱۸ چرخ را می‌گیرد!
آخرین اخبار

جاده‌های تگزاس در تسخیر تریلی‌های بدون راننده؛ وقتی هوش مصنوعی فرمان غول‌های ۱۸ چرخ را می‌گیرد!

این روز‌ها رانندگان تگزاس در بزرگراه‌های شلوغ هم‌مسیر تریلی‌های غول‌پیکری شده‌اند که صندلی راننده‌شان کاملاً خالی است! در حالی که بیش‌تر نگاه‌ها به تاکسی‌های خودران دوخته شده، شرکت‌های پیشرو هوش مصنوعی با تریلی‌های سنگین خودران در سکوت خبری در حال دگرگون کردن صنعت باربری هستند.

۳ دقیقه مطالعه
۰
۱۹ مهر
تبدیل نقاشی دو‌بعدی به آواتار سه‌بعدی متحرک؛ با ابزار رایگان و جذاب Charakuru آشنا شوید
آخرین اخبار

تبدیل نقاشی دو‌بعدی به آواتار سه‌بعدی متحرک؛ با ابزار رایگان و جذاب Charakuru آشنا شوید

ابزار جدید و رایگان Charakuru به شما اجازه می‌دهد تنها با یک نقاشی دو‌بعدی، یک آواتار سه‌بعدی ریگ‌شده و آماده حرکت تحویل بگیرید. این جعبه‌ابزار کاربردی با ترکیب هوش مصنوعی، ایجنت‌های کدنویسی و کنترل انسانی، ساخت کاراکترهای سه‌بعدی را از همیشه ساده‌تر کرده است.

۲ دقیقه مطالعه
۰
۱۹ مهر
تله خطرناک ایجنت‌های خودسر؛ چرا هوش مصنوعی حتی با اجرای درست ابزارها، قوانین سازمان را دور می‌زند؟
آخرین اخبار

تله خطرناک ایجنت‌های خودسر؛ چرا هوش مصنوعی حتی با اجرای درست ابزارها، قوانین سازمان را دور می‌زند؟

خیلی از مدیران شرکت‌ها تصور می‌کنند اگر به مدل‌های زبانی چند ابزار سازمانی بدهند، کار تمام است و فرآیندها خودکار می‌شوند؛ اما واقعیت این است که ایجنت‌ها در ذات خود هیچ درکی از قوانین حقوقی و سازمانی ندارند. این ناهماهنگی باعث می‌شود یک ایجنت کار‌های محوله را مو به مو انجام دهد، ولی در مسیرش قوانین مالیاتی و اداری را نادیده بگیرد. کارشناسان معتقدند تنها راه نجات، تعریف گاردریل‌ها و فیلترهای کنترلی مستقیم در لایه استنتاج و سیستم اصلی سازمان است، نه ساخت سیستم‌های موازی و پرهزینه.

۶ دقیقه مطالعه
۰
۱۹ مهر