مدل Google: Gemma 4 31B یک مدل چندحسی پیشرفته است که همزمان متن، تصویر و ویدیو را پردازش میکند و خروجی متن تولید میکند. این مدل با پشتیبانی از ورودیهای چندحسی، برای کارهایی مانند تحلیل تصویر، توضیح ویدیو و پاسخگویی مبتنی بر چندحسی مناسب است. قابلیت استدلال آن آن را به انتخاب مناسب برای کاربردهایی تبدیل میکند که نیاز به درک عمیق از محتوای چندحسی و ارائه پاسخهای متناسب دارند.
این مدل توسط سازنده بازنشسته شده و دیگر برای تولید تازه قابل انتخاب نیست؛ صفحه بهعنوان بایگانی رسمی باقی میماند. تاریخ پایان: 2026-09-22.
| سازنده | Google (ایالات متحده) |
|---|---|
| خانواده | |
| تاریخ عرضه | 2026-04-02 |
| پنجرهٔ زمینه | ۲۶۲٬۱۴۴ توکن |
| حداکثر خروجی در هر پاسخ | ۲۳۵٬۹۲۹ توکن |
| ورودی | متن، تصویر |
| خروجی | متن |
| قابلیتها | استدلال چندمرحلهای، فراخوانی ابزار، درک تصویر |
| وضعیت در نهال | بازنشسته (بایگانی) |
مدل Google: Gemma 4 31B یک مدل چندحسی پیشرفته است که همزمان متن، تصویر و ویدیو را پردازش میکند و خروجی متن تولید میکند. این مدل با پشتیبانی از ورودیهای چندحسی، برای کارهایی مانند تحلیل تصویر، توضیح ویدیو و پاسخگویی مبتنی بر چندحسی مناسب است.
۲۶۲٬۱۴۴ توکن؛ یعنی این مدل میتواند در یک درخواست، متن ورودی و تاریخچهٔ گفتگو را تا همین اندازه همزمان در نظر بگیرد. هر پاسخ حداکثر ۲۳۵٬۹۲۹ توکن است.
استدلال چندمرحلهای، فراخوانی ابزار، درک تصویر. ورودی: متن، تصویر؛ خروجی: متن.
خیر؛ سازنده این مدل را بازنشسته کرده و در نهال برای تولید تازه قابل انتخاب نیست. مدلهای فعال Google در همین صفحه فهرست شدهاند.