مدل لاما ۳.۲ ۱۱ب بینایی دستور از سازندهٔ متا است. این مدل برای ترکیب دادههای تصویری و متنی به خوبی طراحی شده و قابلیت پردازش همزمان تصویر و متن را پشتیبانی میکند. با پشتیبانی از پنجرهٔ زمینهٔ طولانی، این مدل برای کارهایی مانند توصیف تصویر و تحلیل محتوای چندمدیای مناسب است. نقطهٔ قوت آن در درک ارتباط بین تصویر و متن و تولید پاسخهای مرتبط و دقیق است.
این مدل توسط سازنده بازنشسته شده و دیگر برای تولید تازه قابل انتخاب نیست؛ صفحه بهعنوان بایگانی رسمی باقی میماند. تاریخ پایان: 2026-09-03.
| سازنده | Meta Llama (ایالات متحده) |
|---|---|
| خانواده | Llama3 |
| تاریخ عرضه | 2024-09-25 |
| پنجرهٔ زمینه | ۱۳۱٬۰۷۲ توکن |
| حداکثر خروجی در هر پاسخ | ۱۶٬۳۸۴ توکن |
| ورودی | متن، تصویر |
| خروجی | متن |
| قابلیتها | درک تصویر |
| وضعیت در نهال | بازنشسته (بایگانی) |
مدل لاما ۳.۲ ۱۱ب بینایی دستور از سازندهٔ متا است. این مدل برای ترکیب دادههای تصویری و متنی به خوبی طراحی شده و قابلیت پردازش همزمان تصویر و متن را پشتیبانی میکند. با پشتیبانی از پنجرهٔ زمینهٔ طولانی، این مدل برای کارهایی مانند توصیف تصویر و تحلیل محتوای چندمدیای مناسب است.
۱۳۱٬۰۷۲ توکن؛ یعنی این مدل میتواند در یک درخواست، متن ورودی و تاریخچهٔ گفتگو را تا همین اندازه همزمان در نظر بگیرد. هر پاسخ حداکثر ۱۶٬۳۸۴ توکن است.
درک تصویر. ورودی: متن، تصویر؛ خروجی: متن.
خیر؛ سازنده این مدل را بازنشسته کرده و در نهال برای تولید تازه قابل انتخاب نیست. مدلهای فعال Meta Llama در همین صفحه فهرست شدهاند.