گوگل با معرفی Gemma 4، استانداردهای مدلهای متنباز را جابهجا کرده است. این نسخه نسبت به Gemma 2 و 3، جهش بزرگی در بهرهوری داشته؛ به طوری که مدلهای کوچک آن (مثل نسخه E2B و E4B) اکنون میتوانند با سرعتی باورنکردنی روی سختافزارهای معمولی و حتی گوشیهای هوشمند اجرا شوند. تمرکز اصلی در این نسل، بهبود قدرت استدلال (Reasoning) و کاهش مصرف حافظه بوده تا توسعهدهندگان بتوانند بدون نیاز به اینترنت و سرورهای گرانقیمت، از هوش مصنوعی در سطح جهانی استفاده کنند.
پیشرفت کلیدی دیگر در Gemma 4، استفاده از معماری Mixture of Experts (MoE) در نسخههای بزرگتر (مثل 26B A4B) است. این یعنی مدل با وجود داشتن پارامترهای بالا، در هر لحظه فقط بخش بهینهای از آنها را فعال میکند که منجر به سرعت پاسخدهی بسیار بالاتر نسبت به نسخههای قدیمیتر میشود. همچنین پنجره بافتی (Context Window) در این نسخه به 128K تا 256K ارتقا یافته که اجازه میدهد کتابها یا کدهای بسیار طولانی را یکجا به حافظه مدل بسپارید.

قدرت بینایی با mmproj: فراتر از متن
یکی از جذابترین بخشهای Gemma 4، پشتیبانی بومی و بهینه از قابلیتهای دیداری (Vision) است. با استفاده از فایلهای mmproj (Multi-Modal Projector)، شما میتوانید این مدل را به یک تحلیلگر تصویر تبدیل کنید. این قابلیت به کاربران اجازه میدهد تا با افزودن یک فایل مکمل کوچک به مدل اصلی، امکاناتی مثل OCR (تشخیص متن از تصویر)، شرح تصاویر و حتی تحلیل نمودارهای پیچیده را به صورت کاملاً آفلاین در اختیار داشته باشند.

دیدگاه خود را بنویسید