Gemma
Les cousins ouverts de Gemini, parfaits pour tourner en local.
La fiche d'Olya
- Particularités
- Gemma est la famille de modèles à poids ouverts de Google, bâtie sur la même recherche que Gemini mais conçue pour être téléchargée et hébergée par vos soins sous licence Apache 2.0. Ce qui la distingue vraiment, c'est l'éventail des tailles : d'un modèle de 270M qui tient sur un téléphone jusqu'à 27-31 milliards de paramètres, à vous de choisir le compromis entre poids et qualité. Gemma 3 gère le texte et les images, 128K tokens de contexte et plus de 140 langues ; Gemma 4, sortie en 2026, élargit le contexte et ajoute l'audio.
- Points forts
- Elle tourne en local sur du matériel grand public : un Gemma 3 de 27B tient sur un seul GPU de 24 Go comme une RTX 3090, et les petites variantes atteignent portables et smartphones. Comme elle est à poids ouverts et Apache 2.0, vous pouvez l'utiliser commercialement, l'affiner sur vos propres données et tout garder chez vous, sans appel à une API externe. Elle est prise en charge partout où ça compte : Hugging Face, Ollama, llama.cpp, JAX, PyTorch et Keras.
- Quand l'utiliser
- Elle s'impose quand les données ne doivent pas quitter votre infrastructure, pour des raisons de confidentialité ou de conformité, ou quand vous voulez des coûts prévisibles plutôt qu'un paiement au token. C'est le choix naturel pour prototyper hors ligne, pour un affinage sur un domaine précis, ou pour faire tourner quelque chose d'utile sur des appareils en périphérie où la connexion est faible.
- Quand l'éviter
- S'il vous faut le meilleur raisonnement sur les tâches les plus ardues, les modèles fermés de pointe gardent l'avantage, et autant appeler directement l'API Gemini pour cela. Rappelez-vous aussi qu'héberger un modèle, c'est gérer GPU, mises à jour et latence : si vous ne voulez pas cette charge opérationnelle, un service géré vous épargne plus d'efforts que d'argent.