درک عمیق محتوای چندرسانهای؛ خانواده مدلهای هوشمند WeMM معرفی شد
مدلهای WeMM-Embedding ویچت با درک عمیق روابط فضایی و مفهومی، جستجوی تصاویر و ویدیوها را بر اساس زبان انسانی و هوش مصنوعی متحول کردهاند.
جستجوی دقیق در انبوهی از تصاویر و ویدیوها همیشه یکی از چالشهای بزرگ در حوزهی پردازش داده بوده است. تصور کنید در آرشیو شخصی خود به دنبال عکسی میگردید که در آن یک فنجان چای روی میز چوبی در کنار یک کتاب قدیمی قرار دارد. اگر سیستم جستجوی شما فقط بر اساس برچسبهای متنی ساده کار کند، احتمالاً با دشواری زیادی روبرو خواهید شد. اما مدلهای جدیدی که تحت عنوان WeMM-Embedding توسط تیم بینایی ماشین ویچت در شرکت تنسنت توسعه یافتهاند، این معادله را تغییر دادهاند. این خانواده از مدلها با هدف ایجاد یک پل ارتباطی مستحکم میان زبان انسانی و دادههای بصری طراحی شدهاند.
چرا رویکرد تنسنت در مدلهای تعبیه متفاوت است؟
بسیاری از مدلهای قدیمیتر در درک جزئیات ظریف تصاویر دچار لغزش میشدند. برای مثال، تفاوت بین یک گربه که روی مبل خوابیده با گربهای که زیر مبل پنهان شده، برای یک هوش مصنوعی معمولی چندان شفاف نیست. مدلهای WeMM با بهرهگیری از معماریهای پیشرفته در تعبیه چندوجهی، تلاش میکنند تا نه تنها اشیاء، بلکه روابط فضایی و مفهومی میان آنها را نیز درک کنند. این مدلها به گونهای آموزش دیدهاند که بتوانند مفاهیم انتزاعی موجود در متن را با ویژگیهای بصری در تصاویر تطبیق دهند.
در دنیای واقعی، این فناوری میتواند تحولی بزرگ در پلتفرمهای فروشگاهی ایجاد کند. فرض کنید کاربری در یک اپلیکیشن ایرانی به دنبال لباسی با طرح سنتی اسلیمی اما با برشی مدرن میگردد. مدلهای سنتی ممکن است فقط کلمه اسلیمی را شناسایی کنند، اما WeMM میتواند ارتباط دقیق بین سبک طراحی و نوع برش را در فضای برداری خود تحلیل کرده و دقیقترین نتایج را به کاربر نمایش دهد.
ساختار فنی و توانمندیهای خانواده WeMM
این مدلها در نسخههای مختلفی عرضه شدهاند تا پاسخگوی نیازهای گوناگون، از پردازشهای سبک موبایلی تا تحلیلهای سنگین سروری باشند. یکی از ویژگیهای کلیدی این مجموعه، توانایی بالای آنها در بازیابی اطلاعات است. به این معنا که وقتی شما یک توصیف متنی ارائه میدهید، مدل با سرعت بسیار بالا، نزدیکترین معادل بصری آن را در پایگاه داده پیدا میکند.
بازیابی چندوجهی چگونه کار میکند؟
در این فرآیند، هر تصویر و هر قطعه متن به یک بردار عددی تبدیل میشود. هنر تیم تنسنت در این بوده است که این بردارها را به گونهای تنظیم کنند که مفاهیم مشابه، فارغ از اینکه تصویر هستند یا متن، در فضای ریاضیاتی نزدیک به هم قرار بگیرند. این هماهنگی باعث میشود که دقت سیستم در مواجهه با پرسشهای پیچیده به طرز چشمگیری افزایش یابد.
انعطافپذیری در کاربردهای متنوع
مدلهای WeMM صرفاً برای جستجوی تصویر کاربرد ندارند. از این ابزارها میتوان در خوشهبندی دادههای حجیم، سیستمهای توصیهگر و حتی نظارت بر محتوا استفاده کرد. به دلیل بهینهسازیهای انجام شده، سرعت پاسخدهی این مدلها در مقایسه با نمونههای مشابه، بهبود یافته است که این موضوع برای سرویسهایی با میلیونها کاربر همزمان، حیاتی محسوب میشود.
آینده درک بصری و زبانی
توسعه چنین ابزارهایی نشاندهنده مسیری است که هوش مصنوعی برای درک بهتر جهان فیزیکی طی میکند. ما دیگر به دنبال سیستمهایی نیستیم که فقط کلمات را تکرار کنند، بلکه به دنبال درک معنای نهفته در پس هر پیکسل و هر واژه هستیم. انتشار این مدلها به صورت متنباز در پلتفرمهایی مانند گیتهاب، این فرصت را به توسعهدهندگان در سراسر جهان میدهد تا اپلیکیشنهای هوشمندتر و انسانیتری بسازند.
منبع: github.com