Gemma
De open broertjes van Gemini, perfect om lokaal te draaien.
De fiche van Olya
- Bijzonderheden
- Gemma is Googles familie van modellen met open gewichten, gebouwd op hetzelfde onderzoek als Gemini maar bedoeld om onder een Apache 2.0-licentie zelf te downloaden en te hosten. Wat haar echt onderscheidt is het bereik aan maten: van een 270M-model dat op een telefoon past tot 27-31 miljard parameters, zodat je zelf de afweging tussen gewicht en kwaliteit kiest. Gemma 3 verwerkt tekst en beelden, 128K tokens context en meer dan 140 talen; Gemma 4, uitgebracht in 2026, verruimt de context en voegt audio toe.
- Sterke punten
- Ze draait lokaal op consumentenhardware: een 27B Gemma 3 past op één GPU van 24 GB zoals een RTX 3090, en de kleinere varianten reiken tot laptops en telefoons. Omdat ze open gewichten en Apache 2.0 heeft, kun je haar commercieel gebruiken, finetunen op je eigen data en alles binnen je muren houden, zonder aanroepen naar een externe API. Ze wordt overal ondersteund waar het telt: Hugging Face, Ollama, llama.cpp, JAX, PyTorch en Keras.
- Wanneer te gebruiken
- Ze loont wanneer data om privacy- of nalevingsredenen je infrastructuur niet mag verlaten, of wanneer je voorspelbare kosten wilt in plaats van betalen per token. Ze is de natuurlijke keuze voor offline prototypen, voor finetuning op een specifiek domein, of om iets nuttigs te draaien op edge-apparaten waar de verbinding schaars is.
- Wanneer te vermijden
- Heb je topklasse redeneren nodig voor de moeilijkste taken, dan lopen de gesloten topmodellen nog voorop, en dan kun je net zo goed de Gemini-API direct aanroepen. Bedenk ook dat een model hosten betekent GPU's, updates en latentie beheren: wil je die operationele last niet, dan bespaart een beheerde dienst je meer moeite dan geld.