Gemma
Os irmãos abertos do Gemini, perfeitos para correr localmente.
A ficha de Olya
- Particularidades
- Gemma é a família de modelos de pesos abertos do Google, construída sobre a mesma pesquisa por trás do Gemini mas pensada para ser baixada e hospedada por você sob licença Apache 2.0. O que de fato a distingue é o leque de tamanhos: de um modelo de 270M que cabe num telefone até 27-31 bilhões de parâmetros, de modo que você escolhe o compromisso entre peso e qualidade. O Gemma 3 lida com texto e imagens, 128K tokens de contexto e mais de 140 idiomas; o Gemma 4, lançado em 2026, amplia o contexto e acrescenta áudio.
- Pontos fortes
- Roda localmente em hardware de consumo: um Gemma 3 de 27B cabe numa única GPU de 24 GB como uma RTX 3090, e as variantes menores chegam a notebooks e celulares. Por ser de pesos abertos e Apache 2.0, você pode usá-la comercialmente, ajustá-la com seus próprios dados e manter tudo dentro de casa, sem chamadas a uma API externa. É suportada onde importa: Hugging Face, Ollama, llama.cpp, JAX, PyTorch e Keras.
- Quando usá-la
- Vale a pena quando os dados não podem sair da sua infraestrutura, por privacidade ou conformidade, ou quando você quer custos previsíveis em vez de pagar por token. É a escolha natural para prototipar offline, para um ajuste fino num domínio específico, ou para rodar algo útil em dispositivos de borda onde a conexão é fraca.
- Quando evitá-la
- Se precisa do melhor raciocínio nas tarefas mais difíceis, os modelos fechados de fronteira ainda estão à frente, e para isso mais vale chamar a API do Gemini diretamente. Lembre também que hospedar um modelo significa gerir GPUs, atualizações e latência: se não quer essa carga operacional, um serviço gerenciado poupa mais esforço do que dinheiro.