Roteamos chat de alto volume pela API do Gemini 3.5 Flash: respostas multimodais rápidas em escala, e o desconto de 5% da RouterBase é margem pura.
A Gemini 3.5 Flash API é o modelo multimodal rápido e eficiente do Google —— janela de contexto de 1M tokens, entrada nativa de texto/imagem/áudio/vídeo/PDF, function calling e saídas JSON estruturadas, otimizada para baixa latência e alto throughput. A Gemini 3.5 Flash API é compatível com OpenAI: aponte qualquer SDK para a RouterBase e defina o modelo como gemini-3-5-flash. Entrada a $1.05 / 1M, saída a $6.30 / 1M, leituras em cache a $0.105 / 1M —— 5% abaixo da taxa padrão, tudo por um endpoint REST.
API do Gemini 3.5 Flash: Chat
Use a API do Gemini 3.5 Flash para rodar o modelo multimodal rápido e eficiente do Google com uma janela de contexto de 1M tokens.
A API do Gemini 3.5 Flash é o modelo multimodal do Google otimizado para velocidade: uma janela de contexto de 1M tokens, entrada nativa de texto, imagens, áudio, vídeo e PDF, function calling e saídas estruturadas em JSON, ajustado para baixa latência e alta vazão. Roteado pela RouterBase, é totalmente compatível com OpenAI: aponte qualquer SDK existente para a URL base da RouterBase, defina o modelo como gemini-3-5-flash e sua primeira chamada já é processada na hora.
O preço é de $1.05 / 1M tokens de entrada, $6.30 / 1M tokens de saída e $0.105 / 1M leituras de entrada em cache, 5% abaixo da tarifa padrão. Uma única chave da RouterBase, sem necessidade de credenciais do Google.
Seis motivos pelos quais as equipes lançam com a API do Gemini 3.5 Flash
Da inferência multimodal rápida ao preço com 5% de desconto: o que faz o Gemini 3.5 Flash se destacar.
Contexto de 1M tokens
Aceita até 1 milhão de tokens por requisição: documentos longos, código de múltiplos arquivos ou transcrições de vídeo cabem em uma única chamada à API do Gemini 3.5 Flash.
Entrada multimodal nativa
A API do Gemini 3.5 Flash entende texto, imagens, áudio, vídeo e PDF. Envie mídias variadas em uma única requisição para analisar, transcrever ou raciocinar entre modalidades.
Rápido e de alta vazão
Ajustado para baixa latência e alto volume: a API do Gemini 3.5 Flash entrega velocidade de nível Flash para chat, classificação, extração e roteamento em escala.
Function calling e JSON
Defina ferramentas e solicite um esquema JSON; a API do Gemini 3.5 Flash retorna chamadas de ferramentas estruturadas e JSON estritamente válido para pipelines de agentes e extração confiáveis.
Endpoint compatível com OpenAI
A API do Gemini 3.5 Flash fala o formato de chat-completions da OpenAI. Aponte qualquer SDK da OpenAI para a RouterBase: sem SDK do Google nem credenciais separadas.
Uma chave para mais de 200 modelos
A mesma chave da RouterBase que chama a API do Gemini 3.5 Flash também roteia para GPT-5, Claude Opus 4.8, GPT-4o mini e mais de 200 outros modelos, sem gerenciar credenciais por provedor.

Comece com a API do Gemini 3.5 Flash em 3 passos
Do cadastro à sua primeira resposta em menos de 5 minutos.
Crie uma chave de API da RouterBase
Cadastre-se e gere uma chave de API: uma única chave alcança a API do Gemini 3.5 Flash e todos os outros modelos do catálogo.
Envie sua primeira mensagem
Aponte qualquer SDK compatível com OpenAI para routerbase.com/v1 e defina o modelo como gemini-3-5-flash. A resposta segue o esquema padrão de chat-completions, com suporte a streaming e entrada multimodal.
Inspecione o uso
Cada resposta inclui um detalhamento completo de tokens (entrada, saída e leituras de cache), de modo que o custo e a taxa de acertos de cache ficam visíveis em cada chamada.
Paga apenas pelo que usas
A RouterBase repassa preços de nível partner. Comparado com o preço público oficial do modelo.
O que as equipes constroem com a API do Gemini 3.5 Flash
Cargas reais de produção rodando sobre a API do Gemini 3.5 Flash e o catálogo de modelos da RouterBase.
A visão nativa na API do Gemini 3.5 Flash substituiu um pipeline de OCR: uma única chamada rápida descreve e extrai, texto e imagem juntos.
As saídas JSON estruturadas da API do Gemini 3.5 Flash acabaram com nossa análise instável: JSON estritamente válido toda vez, mesmo em entradas multimodais.
A latência de nível Flash na API do Gemini 3.5 Flash nos permitiu mover a classificação para tempo real. A RouterBase ainda a torna 5% mais barata.
O contexto de 1M na API do Gemini 3.5 Flash significa que posso jogar documentos inteiros nela e ainda obter respostas rápidas. Sem gambiarra de fragmentação.
A RouterBase coloca a API do Gemini 3.5 Flash e mais de 200 outros modelos atrás de uma única chave. Nossa equipe parou de abrir chamados para novas contas de provedor.
Fazemos teste A/B da API do Gemini 3.5 Flash contra o Pro por requisição: o mesmo SDK, um único campo de modelo. A maior parte do tráfego fica no Flash e a latência caiu.
Migramos 42 serviços para a API do Gemini 3.5 Flash em um fim de semana. O único comentário no PR foi: 'peraí, é só isso?'.
As leituras de cache a $0.105 / 1M na API do Gemini 3.5 Flash tornaram nossos recursos de contexto longo acessíveis. A conta do ROI foi instantânea.
Perguntas frequentes
Perguntas comuns sobre a API do Gemini 3.5 Flash.
É o acesso direto da RouterBase ao Gemini 3.5 Flash do Google: um endpoint de chat multimodal rápido e eficiente com contexto de 1M tokens, entrada nativa de visão/áudio/vídeo, function calling e saídas estruturadas, servido por uma interface REST compatível com OpenAI.