Roteamos 90% do nosso tráfego pela Gemini 2.5 Flash Lite API: classificação e extração por uma fração do custo. Os 5% de desconto da RouterBase são margem pura.
A Gemini 2.5 Flash Lite API é o modelo Gemini 2.5 mais rápido e econômico do Google —— janela de contexto de 1M tokens, entrada nativa de texto/imagem/áudio/vídeo/PDF, function calling e saídas JSON estruturadas, otimizada para baixa latência e alto throughput. A Gemini 2.5 Flash Lite API é compatível com OpenAI: aponte qualquer SDK para a RouterBase e defina o modelo como gemini-2-5-flash-lite. Entrada a $0.095 / 1M, saída a $0.34 / 1M, leituras em cache a $0.0095 / 1M —— 5% abaixo da tarifa oficial publicada, tudo por um endpoint REST.
Gemini 2.5 Flash Lite API: Chat
Use a Gemini 2.5 Flash Lite API para executar o modelo Gemini 2.5 mais rápido e econômico do Google, com uma janela de contexto de 1M tokens e entrada multimodal.
A Gemini 2.5 Flash Lite API é o modelo Gemini 2.5 menor e mais econômico do Google: uma janela de contexto de 1M tokens, entrada nativa de texto, imagens, áudio, vídeo e PDF, function calling e saídas estruturadas em JSON, otimizado para a menor latência e a maior taxa de transferência em escala. Roteada pela RouterBase, a Gemini 2.5 Flash Lite API é totalmente compatível com OpenAI: aponte qualquer SDK existente para a URL base da RouterBase, defina o modelo como gemini-2-5-flash-lite e sua primeira chamada já é executada na hora.
O preço é de $0.095 / 1M tokens de entrada, $0.34 / 1M tokens de saída e $0.0095 / 1M leituras de entrada em cache, 5% abaixo da tarifa oficial publicada. Uma única chave da RouterBase, sem precisar de credenciais do Google.
Seis motivos pelos quais as equipes lançam na Gemini 2.5 Flash Lite API
De uma janela de contexto de 1M tokens a um preço com 5% de desconto: o que faz a Gemini 2.5 Flash Lite API se destacar.
Contexto de 1M tokens
Aceita até 1 milhão de tokens por requisição: documentos longos, código de múltiplos arquivos ou transcrições de vídeo cabem em uma única chamada à Gemini 2.5 Flash Lite API sem fragmentação.
O nível 2.5 mais rápido e barato
Feita para cargas de alto volume: a Gemini 2.5 Flash Lite API é o modelo Gemini 2.5 de menor custo, a $0.095 / 1M tokens de entrada, ideal para classificação, resumo, extração e roteamento em escala.
Entrada multimodal nativa
A Gemini 2.5 Flash Lite API entende texto, imagens, áudio, vídeo e PDF. Passe mídias mistas em uma única requisição para analisar, transcrever ou raciocinar entre modalidades.
Function calling e JSON
Defina ferramentas e solicite um esquema JSON; a Gemini 2.5 Flash Lite API retorna chamadas de ferramentas estruturadas e JSON estritamente válido para pipelines confiáveis de agentes e extração.
Endpoint compatível com OpenAI
A Gemini 2.5 Flash Lite API fala o formato de chat-completions da OpenAI. Aponte qualquer SDK da OpenAI para a RouterBase: sem SDK do Google nem credenciais separadas.
Uma chave para mais de 200 modelos
A mesma chave da RouterBase que chama a Gemini 2.5 Flash Lite API também roteia para GPT-5, Claude Opus 4.8, Gemini 2.5 Pro e mais de 200 outros modelos, sem gestão de credenciais por provedor.

Comece a usar a Gemini 2.5 Flash Lite API em 3 passos
Do cadastro à sua primeira resposta em menos de 5 minutos.
Crie uma chave de API da RouterBase
Cadastre-se e gere uma chave de API: uma única chave alcança a Gemini 2.5 Flash Lite API e todos os outros modelos do catálogo.
Envie sua primeira mensagem
Aponte qualquer SDK compatível com OpenAI para routerbase.com/v1 e defina o modelo como gemini-2-5-flash-lite. A resposta segue o esquema padrão de chat-completions, com suporte a streaming e entrada multimodal.
Inspecione o uso
Cada resposta inclui um detalhamento completo de tokens (entrada, saída e leituras de cache), de modo que o custo e a taxa de acerto de cache ficam visíveis em cada chamada.
Paga apenas pelo que usas
A RouterBase repassa preços de nível partner. Comparado com o preço público oficial do modelo.
O que as equipes constroem com a Gemini 2.5 Flash Lite API
Cargas reais de produção rodando na Gemini 2.5 Flash Lite API e no catálogo de modelos da RouterBase.
O multimodal nativo da Gemini 2.5 Flash Lite API lê imagens e áudio diretamente: uma única chamada rápida e barata legenda e transcreve ao mesmo tempo.
As saídas em JSON estruturado da Gemini 2.5 Flash Lite API acabaram com nosso parsing instável por regex. JSON estritamente válido sempre, zero retentativas.
No nosso volume, o Flash-Lite é o único modelo Gemini 2.5 que fecha a conta. A RouterBase ainda o deixa 5% mais barato.
A Gemini 2.5 Flash Lite API cuida do meu loop de resumo de alto volume. Barato o suficiente para eu parar de contar tokens.
A RouterBase coloca a Gemini 2.5 Flash Lite API e mais de 200 outros modelos atrás de uma única chave. Nossa equipe parou de abrir solicitações de novas contas de provedores.
Fazemos A/B da Gemini 2.5 Flash Lite API contra o Gemini 2.5 Pro por requisição: o mesmo SDK, um único campo de modelo. A maior parte do tráfego fica no Flash-Lite e a conta caiu 70%.
Migramos 42 serviços para a Gemini 2.5 Flash Lite API em um fim de semana. O único comentário no PR foi: 'peraí, é só isso?'.
A $0.095 / 1M de entrada menos 5%, a Gemini 2.5 Flash Lite API tornou nossos recursos de alto volume realmente lucrativos. O cálculo do ROI foi instantâneo.
Perguntas frequentes
Perguntas comuns sobre a Gemini 2.5 Flash Lite API.
É o acesso direto da RouterBase ao Gemini 2.5 Flash-Lite do Google: o endpoint de chat Gemini 2.5 mais rápido e barato, com contexto de 1M tokens, entrada nativa de visão/áudio/vídeo, function calling e saídas estruturadas, servido por uma interface REST compatível com OpenAI.