O Google anunciou no dia 25 de maio variantes do Gemma 4 pareadas com drafters de Multi-Token Prediction (MTP, previsao de varios tokens em paralelo). A tecnica usa speculative decoding e atinge ate cerca de 3x mais velocidade de inferencia sem perda de qualidade. Para devs que rodam modelo local em consumer GPU ou em celular, e a diferenca entre “funciona, mas lento” e “da para usar interativamente”.
O gargalo que o MTP ataca
Durante a inferencia, uma LLM gasta a maior parte do tempo nao em computar, mas em mover bilhoes de parametros da VRAM ate as unidades de computacao. A cada token gerado, o mesmo trafego acontece. Engenheiros do Google descrevem isso como um problema de largura de banda de memoria, agravado pelo fato de que o modelo gasta o mesmo custo para predizer um token obvio e um token de raciocinio complexo.
A solucao do MTP e simples na ideia, sofisticada na execucao. Um modelo drafter leve, rodando ao lado do Gemma 4, tenta predizer varios tokens futuros de uma vez. O modelo principal entao verifica todos esses tokens em paralelo, em uma unica passada. Quando o drafter acerta, voce ganha velocidade. Quando erra, a verificacao do modelo principal evita degradacao de qualidade.
Como o drafter convive com o modelo principal
Um dos pontos tecnicos relevantes — apontado por usuarios como Gohab2001 em discussao no Reddit — e que MTP, na sua forma tradicional, exige carregar dois modelos na memoria, o que pesa em hardware de consumidor. A implementacao da Gemma 4 contorna isso fazendo o drafter compartilhar o kV cache do modelo alvo. Isso reduz o overhead de memoria que tradicionalmente desencoraja MTP em deploys locais.
Google implementou ainda enhancements arquiteturais e otimizacoes especificas de hardware para que o drafter entregue maxima eficiencia em GPUs de consumidor e em chips mobile.
Variantes disponiveis e onde rodam
O Google entrega variantes MTP-enabled cobrindo cenarios diferentes:
- PC com GPU de consumidor — Gemma 4 26B Mixture-of-Experts (MoE) e a versao 31B densa.
- Mobile — variantes E2B e E4B otimizadas para celular.
O foco em mobile e PC, em vez de servidor em escala, e proposital. A propria empresa fala em “melhorar responsividade em dispositivos”. E ai mora uma observacao importante.
Onde MTP realmente compensa
Comentadores em Hacker News e Reddit ja apontaram um limite. O usuario zozbot234 observa que MTP brilha quando voce tem 1 ou poucos usuarios e compute sobrando — exatamente o cenario de edge, mobile, ou estacao de trabalho local. Em provedor de API atendendo milhares de usuarios em paralelo, o ganho marginal e menor, porque o gargalo ja nao e o token sequencial individual.
FarrisAT, em outro comentario no Reddit, chamou o resultado de “pretty impressive stuff”, mas ressaltou que modelos locais ainda erram demais, e o ganho real chega quando esses modelos se aproximarem do estado da arte.
O ponto delicado: qualidade vs velocidade
O ganho de ate ~3x e atribuido pelo Google a manutencao da verificacao final pelo modelo principal — entao a saida e identica em raciocinio e precisao a do Gemma 4 sem MTP. Isso e o argumento central: voce ganha velocidade sem trocar nada em qualidade.
Na pratica, vale validar caso a caso. Cenarios com prompts onde o drafter acerta com frequencia (texto previsivel, codigo padrao, traducao) tendem a ganhar mais. Prompts criativos ou de raciocinio aberto podem ver ganhos menores, porque o drafter erra mais e a verificacao do modelo alvo precisa intervir.
Onde baixar
As variantes Gemma 4 com MTP estao disponiveis em Hugging Face, Kaggle, Ollama e outras plataformas. O Google publicou tambem uma explicacao visual detalhada em um thread no x.com via @googlegemma.
O que vale testar primeiro
Se voce ja roda Gemma 4 localmente, baixe a variante MTP-enabled equivalente (26B MoE ou 31B densa para PC, E2B/E4B para mobile) e meca a diferenca em prompts do seu workload real, nao em benchmark generico. Para quem nao rodava modelo local porque achava lento demais, este e um bom momento para testar — o ganho de responsividade muda o que da para fazer interativamente em hardware modesto.
Reportado originalmente por Google Blog em 2026-05-25.



