A Gemini 2.5 Flash API é nosso padrão do dia a dia: rápida, multimodal e boa o suficiente para dispensar o modelo principal na maioria das chamadas. O desconto de 5% da RouterBase é margem pura.
A Gemini 2.5 Flash API é o modelo Gemini 2.5 do Google equilibrado em velocidade e custo —— janela de contexto de 1M tokens, pensamento opcional, entrada nativa de texto/imagem/áudio/vídeo/PDF, function calling e saídas JSON estruturadas, otimizada para baixa latência e alto throughput. A Gemini 2.5 Flash API é compatível com OpenAI: aponte qualquer SDK para a RouterBase e defina o modelo como gemini-2-5-flash. Entrada a $0.285 / 1M, saída a $2.375 / 1M, leituras em cache a $0.0285 / 1M —— 5% abaixo da tarifa oficial publicada, tudo por um endpoint REST.
API do Gemini 2.5 Flash: Chat
Use a Gemini 2.5 Flash API para executar o modelo multimodal rápido e eficiente do Google, com janela de contexto de 1M tokens e raciocínio integrado.
A Gemini 2.5 Flash API é o modelo Gemini 2.5 do Google com o melhor equilíbrio entre velocidade e custo: uma janela de contexto de 1M tokens, raciocínio opcional, entrada nativa de texto, imagens, áudio, vídeo e PDF, function calling e saídas JSON estruturadas, otimizado para baixa latência e alta vazão. Roteada pela RouterBase, a Gemini 2.5 Flash API é totalmente compatível com a OpenAI: aponte qualquer SDK existente para a URL base da RouterBase, defina o modelo como gemini-2-5-flash e sua primeira chamada já funciona de imediato.
O preço é de $0.285 / 1M tokens de entrada, $2.375 / 1M tokens de saída e $0.0285 / 1M leituras de entrada em cache, 5% abaixo da tarifa oficial publicada. Uma única chave da RouterBase, sem necessidade de credenciais do Google.
Seis motivos pelos quais as equipes lançam com a Gemini 2.5 Flash API
Do raciocínio integrado ao preço com 5% de desconto: o que faz a Gemini 2.5 Flash API se destacar.
Contexto de 1M tokens
Aceita até 1 milhão de tokens por requisição: documentos longos, código de vários arquivos ou transcrições de vídeo cabem em uma única chamada à Gemini 2.5 Flash API sem fragmentar.
Raciocínio opcional
Ative o raciocínio para que a Gemini 2.5 Flash API pense passo a passo antes de responder, ou desligue-o para obter as respostas mais rápidas e baratas: você controla o equilíbrio velocidade/qualidade em cada requisição.
Entrada multimodal nativa
A Gemini 2.5 Flash API entende texto, imagens, áudio, vídeo e PDF. Envie mídias combinadas em uma única requisição para analisar, transcrever ou raciocinar entre modalidades.
Function calling e JSON
Defina ferramentas e solicite um esquema JSON; a Gemini 2.5 Flash API retorna chamadas de ferramentas estruturadas e JSON estritamente válido para pipelines confiáveis de agentes e extração.
Endpoint compatível com a OpenAI
A Gemini 2.5 Flash API usa o formato de chat-completions da OpenAI. Aponte qualquer SDK da OpenAI para a RouterBase: não é preciso o SDK do Google nem credenciais separadas.
Uma chave para mais de 200 modelos
A mesma chave da RouterBase que chama a Gemini 2.5 Flash API também roteia para GPT-5, Claude Opus 4.8, Gemini 2.5 Pro e mais de 200 outros modelos: sem gestão de credenciais por provedor.

Comece com a Gemini 2.5 Flash API em 3 passos
Do cadastro à sua primeira resposta em menos de 5 minutos.
Crie uma chave de API da RouterBase
Cadastre-se e gere uma chave de API: uma única chave alcança a Gemini 2.5 Flash API e todos os demais modelos do catálogo.
Envie sua primeira mensagem
Aponte qualquer SDK compatível com a OpenAI para routerbase.com/v1 e defina o modelo como gemini-2-5-flash. A resposta segue o esquema padrão de chat-completions, com suporte a streaming e entrada multimodal.
Inspecione o uso
Cada resposta inclui um detalhamento completo de tokens (entrada, saída e leituras de cache) para que o custo e a taxa de acertos de cache fiquem visíveis em cada chamada.
Paga apenas pelo que usas
A RouterBase repassa preços de nível partner. Comparado com o preço público oficial do modelo.
O que as equipes constroem com a Gemini 2.5 Flash API
Cargas reais de produção rodando na Gemini 2.5 Flash API e no catálogo de modelos da RouterBase.
O multimodal nativo da Gemini 2.5 Flash API lê vídeo e áudio diretamente: uma única chamada rápida transcreve e raciocina sobre o conteúdo ao mesmo tempo.
As saídas JSON estruturadas da Gemini 2.5 Flash API acabaram com nosso parsing instável por regex. JSON estritamente válido sempre, zero novas tentativas.
Alternar o raciocínio na Gemini 2.5 Flash API nos permite ajustar velocidade contra qualidade por tarefa. A RouterBase deixa tudo 5% mais barato e roteia automaticamente contornando as quedas.
1M tokens de contexto significa que posso jogar documentos inteiros nela. A Gemini 2.5 Flash API simplesmente lida com eles de forma rápida e barata.
A RouterBase coloca a Gemini 2.5 Flash API e mais de 200 outros modelos atrás de uma única chave. Nossa equipe parou de abrir solicitações de novas contas de provedor.
Fazemos A/B da Gemini 2.5 Flash API contra o 2.5 Pro por requisição: mesmo SDK, um único campo de modelo. A maior parte do tráfego permanece no Flash e a conta caiu drasticamente.
Migramos 42 serviços para a Gemini 2.5 Flash API em um fim de semana. O único comentário no PR foi 'peraí, é só isso?'.
A $0.285 / 1M de entrada menos 5%, a Gemini 2.5 Flash API nos deu inferência multimodal rápida sem a conta do modelo principal. A conta do ROI foi instantânea.
Perguntas frequentes
Perguntas comuns sobre a Gemini 2.5 Flash API.
É o acesso direto da RouterBase ao Gemini 2.5 Flash do Google: um endpoint de chat multimodal rápido e eficiente com contexto de 1M tokens, raciocínio opcional, entrada nativa de visão/áudio/vídeo, function calling e saídas estruturadas, servido por uma interface REST compatível com a OpenAI.