Grok 4.6 no Google Cloud: a prévia tem contexto amplo e limites estreitos

Para usar o Grok 4.6 no Google Cloud, prepare um projeto com faturamento, libere o acesso a modelos parceiros, habilite a oferta no Model Garden e faça as chamadas pelo endpoint global com o ID grok-4.6. O serviço é uma API gerenciada em Preview: não exige infraestrutura de inferência própria, mas ainda tem restrições importantes para produção.
A janela de contexto é ampla, com entrada de texto e imagem, function calling e saída estruturada. O limite aparece na operação: não há batch predictions nem Provisioned Throughput, e o tráfego está sujeito a cotas fixas de chamadas e tokens. Por isso, o primeiro uso deve ser um piloto interativo com concorrência controlada, validação das respostas e medição de custo por tarefa.
Como habilitar o Grok 4.6 no Model Garden

O Grok 4.6 é oferecido como modelo como serviço, ou MaaS, nos endpoints da Gemini Enterprise Agent Platform. A documentação de modelos parceiros do Google define o serviço como uma API gerenciada e sem servidor, além de exigir o papel Consumer Procurement Entitlement Manager para habilitar modelos e a permissão aiplatform.endpoints.predict para enviar prompts.
- Selecione o projeto do Google Cloud que receberá a cobrança e confirme que o faturamento está ativo.
- No IAM, conceda ao responsável pela ativação o papel Consumer Procurement Entitlement Manager.
- Conceda à identidade que enviará as solicitações o papel Agent Platform User, que inclui a permissão aiplatform.endpoints.predict.
- Se a organização restringir serviços, permita a Cloud Commerce Consumer Procurement API e o acesso a modelos parceiros no Model Garden.
- Abra o Model Garden no projeto correto, localize o Grok 4.6, habilite a oferta e aceite os termos apresentados.
- Confirme que o modelo está disponível para a localização global antes de conectá-lo ao agente.
As identidades de ativação e execução não precisam ser as mesmas. Uma conta administrativa pode aceitar a oferta, enquanto a aplicação usa uma conta de serviço apenas com as permissões necessárias para inferência. Essa separação reduz o alcance das credenciais do agente.
Faça uma chamada mínima antes de montar o agente
Comece com uma solicitação curta de texto, sem ferramenta externa e com uma resposta limitada. Use global como localização e grok-4.6 como ID do modelo. Registre o código HTTP, a latência, os metadados de tokens e a resposta bruta para distinguir falhas de acesso de problemas introduzidos pela orquestração.
Se o caso real inclui imagens, adicione uma amostra representativa no teste seguinte. Só depois conecte uma função sem efeito crítico, como uma consulta a um catálogo de teste. Function calling permite ao modelo propor argumentos; cabe à aplicação validá-los, autorizar a operação, executar a ferramenta e devolver o resultado ao turno posterior.
Para saída estruturada, use um esquema pequeno e valide a resposta fora do modelo. O fluxo precisa tratar JSON inválido, campos ausentes, timeout e chamadas repetidas. Como o recurso está em Preview, testes de regressão devem detectar mudanças de comportamento antes que elas alcancem operações sensíveis.
O que a prévia suporta — e onde ela para

A ficha técnica do Grok 4.6 registra o estágio Preview, entrada de texto e imagem, saída de texto e contexto de 524.288 tokens. Function calling, saída estruturada e raciocínio são suportados como recursos de prévia; batch predictions, pagamento padrão por uso e Provisioned Throughput não são suportados. O tipo de uso disponível é cota fixa, pelo endpoint global.
- Agente interativo: é compatível com os recursos disponíveis, desde que a aplicação limite a concorrência e trate esgotamento de cota.
- Extração estruturada: pode usar um esquema de saída, mas ainda requer validação externa e uma rota de recuperação.
- Análise multimodal: texto e imagem podem compor a entrada, enquanto a resposta permanece textual.
- Processamento em massa: não deve depender desse serviço, pois não há batch predictions.
- Capacidade reservada: não é uma opção para o modelo nessa prévia, porque Provisioned Throughput não está disponível.
A janela máxima não deve ser tratada como tamanho habitual de prompt. Históricos próximos do teto consomem rapidamente a cota por minuto, elevam o custo e reduzem o espaço para requisições simultâneas. Em agentes longos, resuma etapas concluídas e descarte resultados de ferramentas que já não influenciam a próxima decisão.
As cotas são o limite prático do fluxo

No endpoint global, os limites publicados são 13 consultas por minuto, 188 mil tokens de entrada por minuto e 16 mil tokens de saída por minuto. As três cotas se aplicam ao mesmo tempo: uma carga pode ficar abaixo do número de chamadas e ainda exceder o volume permitido de tokens.
Em um exemplo hipotético, um prompt de 100 mil tokens consumiria mais da metade da cota de entrada daquele minuto. Duas solicitações desse tamanho somariam 200 mil tokens e ultrapassariam o limite, apesar de representarem apenas duas das 13 consultas possíveis. Assim, o contexto de 524.288 tokens pode existir por solicitação sem ser repetível nessa escala dentro da cota por minuto.
Antes da integração, estime o pior caso de cada etapa: histórico reenviado, dados devolvidos pelas ferramentas, espaço para raciocínio e tamanho máximo da resposta. Implemente fila, limite de concorrência por projeto e espera progressiva para erros de cota. Se uma única tarefa já se aproxima do teto de tokens por minuto, apenas reduzir o número de workers não elimina o gargalo.
Quanto custa: uma estimativa simples em dólar
O anúncio da xAI para a plataforma do Google apresenta preços de US$ 2 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de entrada em cache e US$ 6 por milhão de tokens de saída. Para uma conta faturada no Brasil, o valor final em reais também depende do câmbio, de tributos e das condições de cobrança contratadas.
Em um exemplo hipotético, 5 milhões de tokens de entrada sem cache custariam US$ 10; 1 milhão de tokens de entrada em cache acrescentaria US$ 0,50; e 500 mil tokens de saída custariam US$ 3. O total estimado seria US$ 13,50, antes de impostos e conversão cambial.
O custo de um agente deve ser medido por tarefa concluída, não apenas por chamada. Cada turno pode reenviar instruções, histórico e resultados de ferramentas, enquanto a saída custa mais por token do que a entrada. Antes de aprovar um orçamento, confira os valores e termos exibidos no Model Garden para o projeto.
Quando a prévia serve — e quando impede o projeto
O Grok 4.6 é uma opção plausível para um piloto interativo que caiba nas cotas e possa tolerar as condições de uma oferta Pre-GA. O fluxo deve incluir validação de esquema, autorização externa das ferramentas, telemetria de tokens, fila de solicitações e controle financeiro.
Escolha outro modelo ou mantenha uma rota alternativa se a operação exigir batch, capacidade reservada, alta concorrência ou garantias estáveis de produção. O contexto amplo ajuda em tarefas com muito material de entrada, mas não compensa sozinho os limites de vazão. A decisão depende do volume completo do agente, incluindo todos os turnos e resultados de ferramentas, e não apenas da maior janela que o modelo aceita.
Leia também:
Assine nossa newsletter
Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.