Nahal · نهال
هوش مصنوعی فارسی

درک عمیق محتوای چندرسانه‌ای؛ خانواده مدل‌های هوشمند WeMM معرفی شد

مدل‌های WeMM-Embedding وی‌چت با درک عمیق روابط فضایی و مفهومی، جستجوی تصاویر و ویدیوها را بر اساس زبان انسانی و هوش مصنوعی متحول کرده‌اند.

جستجوی دقیق در انبوهی از تصاویر و ویدیوها همیشه یکی از چالش‌های بزرگ در حوزه‌ی پردازش داده بوده است. تصور کنید در آرشیو شخصی خود به دنبال عکسی می‌گردید که در آن یک فنجان چای روی میز چوبی در کنار یک کتاب قدیمی قرار دارد. اگر سیستم جستجوی شما فقط بر اساس برچسب‌های متنی ساده کار کند، احتمالاً با دشواری زیادی روبرو خواهید شد. اما مدل‌های جدیدی که تحت عنوان WeMM-Embedding توسط تیم بینایی ماشین وی‌چت در شرکت تنسنت توسعه یافته‌اند، این معادله را تغییر داده‌اند. این خانواده از مدل‌ها با هدف ایجاد یک پل ارتباطی مستحکم میان زبان انسانی و داده‌های بصری طراحی شده‌اند.

چرا رویکرد تنسنت در مدل‌های تعبیه متفاوت است؟

بسیاری از مدل‌های قدیمی‌تر در درک جزئیات ظریف تصاویر دچار لغزش می‌شدند. برای مثال، تفاوت بین یک گربه که روی مبل خوابیده با گربه‌ای که زیر مبل پنهان شده، برای یک هوش مصنوعی معمولی چندان شفاف نیست. مدل‌های WeMM با بهره‌گیری از معماری‌های پیشرفته در تعبیه چندوجهی، تلاش می‌کنند تا نه تنها اشیاء، بلکه روابط فضایی و مفهومی میان آن‌ها را نیز درک کنند. این مدل‌ها به گونه‌ای آموزش دیده‌اند که بتوانند مفاهیم انتزاعی موجود در متن را با ویژگی‌های بصری در تصاویر تطبیق دهند.

در دنیای واقعی، این فناوری می‌تواند تحولی بزرگ در پلتفرم‌های فروشگاهی ایجاد کند. فرض کنید کاربری در یک اپلیکیشن ایرانی به دنبال لباسی با طرح سنتی اسلیمی اما با برشی مدرن می‌گردد. مدل‌های سنتی ممکن است فقط کلمه اسلیمی را شناسایی کنند، اما WeMM می‌تواند ارتباط دقیق بین سبک طراحی و نوع برش را در فضای برداری خود تحلیل کرده و دقیق‌ترین نتایج را به کاربر نمایش دهد.

ساختار فنی و توانمندی‌های خانواده WeMM

این مدل‌ها در نسخه‌های مختلفی عرضه شده‌اند تا پاسخگوی نیازهای گوناگون، از پردازش‌های سبک موبایلی تا تحلیل‌های سنگین سروری باشند. یکی از ویژگی‌های کلیدی این مجموعه، توانایی بالای آن‌ها در بازیابی اطلاعات است. به این معنا که وقتی شما یک توصیف متنی ارائه می‌دهید، مدل با سرعت بسیار بالا، نزدیک‌ترین معادل بصری آن را در پایگاه داده پیدا می‌کند.

بازیابی چندوجهی چگونه کار می‌کند؟

در این فرآیند، هر تصویر و هر قطعه متن به یک بردار عددی تبدیل می‌شود. هنر تیم تنسنت در این بوده است که این بردارها را به گونه‌ای تنظیم کنند که مفاهیم مشابه، فارغ از اینکه تصویر هستند یا متن، در فضای ریاضیاتی نزدیک به هم قرار بگیرند. این هماهنگی باعث می‌شود که دقت سیستم در مواجهه با پرسش‌های پیچیده به طرز چشم‌گیری افزایش یابد.

انعطاف‌پذیری در کاربردهای متنوع

مدل‌های WeMM صرفاً برای جستجوی تصویر کاربرد ندارند. از این ابزارها می‌توان در خوشه‌بندی داده‌های حجیم، سیستم‌های توصیه‌گر و حتی نظارت بر محتوا استفاده کرد. به دلیل بهینه‌سازی‌های انجام شده، سرعت پاسخ‌دهی این مدل‌ها در مقایسه با نمونه‌های مشابه، بهبود یافته است که این موضوع برای سرویس‌هایی با میلیون‌ها کاربر هم‌زمان، حیاتی محسوب می‌شود.

آینده درک بصری و زبانی

توسعه چنین ابزارهایی نشان‌دهنده مسیری است که هوش مصنوعی برای درک بهتر جهان فیزیکی طی می‌کند. ما دیگر به دنبال سیستم‌هایی نیستیم که فقط کلمات را تکرار کنند، بلکه به دنبال درک معنای نهفته در پس هر پیکسل و هر واژه هستیم. انتشار این مدل‌ها به صورت متن‌باز در پلتفرم‌هایی مانند گیت‌هاب، این فرصت را به توسعه‌دهندگان در سراسر جهان می‌دهد تا اپلیکیشن‌های هوشمندتر و انسانی‌تری بسازند.

منبع: github.com

مقاله‌های مرتبط

در حال بارگذاری نهال…