بهینهسازی خودکار مدلهای زبانی روی سختافزار شخصی با موتور مگنیتود
موتور استنتاج Magnitude با بهینهسازی خودکار کرنلها بر اساس سختافزار شخصی، سرعت اجرای مدلهای زبانی را تا ۹۲ درصد افزایش داده و مصرف حافظه را ۲۷ درصد کاهش می
توسعهدهندگان پروژه Magnitude موتور استنتاج جدیدی را معرفی کردهاند که با هدف رفع محدودیتهای فعلی در اجرای محلی مدلهای هوش مصنوعی طراحی شده است. این ابزار که به صورت متنباز در دسترس قرار گرفته، برخلاف موتورهای رایج، کرنلهای محاسباتی خود را دقیقاً بر اساس مشخصات سختافزاری دستگاه کاربر تنظیم و کامپایل میکند. این رویکرد باعث شده است تا سرعت رمزگشایی در برخی سختافزارها تا ۹۲ درصد نسبت به کتابخانههای محبوبی مانند llama.cpp افزایش یابد.
چالش موتورهای استنتاج سنتی و راهکار مگنیتود
اغلب موتورهای استنتاج فعلی در یکی از سه دسته کلی قرار میگیرند: یا برای پردازشهای دستهای در مراکز داده بهینهسازی شدهاند که سرعت تکنشست را فدا میکنند، یا برای سازگاری با طیف وسیعی از سختافزارها از بهینهسازیهای جزئی چشمپوشی کردهاند، و یا تنها بر روی یک معماری خاص مانند تراشههای اپل یا انویدیا تمرکز دارند. Magnitude با استفاده از پارامترهای منعطف در لایه کرنل، این شکاف را پر کرده است. این موتور در زمان اجرا، توان پردازشی تراشه شما را ارزیابی کرده و بهینهترین کد محاسباتی را برای آن تولید میکند.
برای مثال، اگر یک کاربر در ایران بخواهد از مدلهای زبانی بزرگ روی یک سیستم معمولی با پردازنده مرکزی یا یک کارت گرافیک میانرده استفاده کند، این موتور به جای استفاده از تنظیمات پیشفرض و کلی، خود را با محدودیتهای حافظه و توان پردازشی همان سیستم تطبیق میدهد. این موضوع برای ایجنتهای هوش مصنوعی که معمولاً نشستهای طولانیمدت دارند و چندین پردازش را به صورت همزمان پیش میبرند، حیاتی است.
ویژگیهای فنی و مدیریت هوشمند حافظه
یکی از نوآوریهای مگنیتود در مدیریت حافظه نهفته است. این موتور میتواند تا ۲۷ درصد حافظه کمتری به ازای هر ایجنت مصرف کند و به محض توقف فعالیت ایجنت، منابع اشغال شده را آزاد نماید. همچنین در نشستهای همزمان، از کش پیشوند مشترک استفاده میشود تا سرعت پاسخگویی در گفتگوهای موازی کاهش نیابد. این قابلیت اجازه میدهد کاربر در حالی که ایجنت هوش مصنوعی در پسزمینه مشغول تحلیل دادهها یا کدنویسی است، بدون کندی محسوس به سایر کارهای روزمره خود بپردازد.
سازگاری و نحوه استفاده
این موتور از سیستمعاملهای مک، لینوکس و ویندوز پشتیبانی میکند و با انواع پردازندههای گرافیکی انویدیا، ایامدی و اپل سیلیکون سازگار است. حتی در نبود پردازنده گرافیکی، امکان اجرای مدلها روی سیپییو نیز وجود دارد. در حال حاضر مدلهای محبوبی مانند Pi، OpenCode و Codex به راحتی و با یک کلیک به این بستر متصل میشوند. برای سایر ابزارها نیز یک رابط برنامهنویسی سازگار با استانداردهای OpenAI در نظر گرفته شده است.
باید توجه داشت که سرعت نهایی همواره به حجم مدل انتخابی و میزان رم دستگاه بستگی دارد. با وجود بهینهسازیهای نرمافزاری، اجرای مدلهای بسیار سنگین روی سختافزارهای ضعیف همچنان با محدودیتهای فیزیکی روبرو خواهد بود. در چنین شرایطی، استفاده از زیرساختهای ابری مانند هوش مصنوعی نهال که دسترسی به مدلهای بینالمللی را در بستری فارسی و تومانی فراهم میکند، میتواند جایگزین مناسبی برای کاربرانی باشد که سختافزار لازم برای اجرای محلی را در اختیار ندارند.
حریم خصوصی و دسترسی
تمامی فرآیندهای پردازشی در Magnitude به صورت محلی انجام میشود. پس از دانلود مدل، هیچ دادهای از دستگاه کاربر خارج نمیشود و نیازی به اتصال اینترنت دائمی نیست. این ویژگی برای پروژههای حساس که امنیت داده در آنها اولویت دارد، مزیتی کلیدی محسوب میشود. این پروژه تحت لایسنس آپاچی ۲ منتشر شده و توسعهدهندگان میتوانند به کدهای منبع آن در گیتهاب دسترسی داشته باشند.
منبع: github.com