chat.gemini_3_5_flash
google/gemini-3-5-flash

A Gemini 3.5 Flash API é o modelo multimodal rápido e eficiente do Google —— janela de contexto de 1M tokens, entrada nativa de texto/imagem/áudio/vídeo/PDF, function calling e saídas JSON estruturadas, otimizada para baixa latência e alto throughput. A Gemini 3.5 Flash API é compatível com OpenAI: aponte qualquer SDK para a RouterBase e defina o modelo como gemini-3-5-flash. Entrada a $1.05 / 1M, saída a $6.30 / 1M, leituras em cache a $0.105 / 1M —— 5% abaixo da taxa padrão, tudo por um endpoint REST.

Input
Gemini 3.5 Flash
max_tokens4096
temperature1
top_p1
presence_penalty0
frequency_penalty0
Gemini 3.5 Flash Online
Hi! I'm a helpful AI assistant. What can I do for you?

API do Gemini 3.5 Flash: Chat

Use a API do Gemini 3.5 Flash para rodar o modelo multimodal rápido e eficiente do Google com uma janela de contexto de 1M tokens.

A API do Gemini 3.5 Flash é o modelo multimodal do Google otimizado para velocidade: uma janela de contexto de 1M tokens, entrada nativa de texto, imagens, áudio, vídeo e PDF, function calling e saídas estruturadas em JSON, ajustado para baixa latência e alta vazão. Roteado pela RouterBase, é totalmente compatível com OpenAI: aponte qualquer SDK existente para a URL base da RouterBase, defina o modelo como gemini-3-5-flash e sua primeira chamada já é processada na hora.

O preço é de $1.05 / 1M tokens de entrada, $6.30 / 1M tokens de saída e $0.105 / 1M leituras de entrada em cache, 5% abaixo da tarifa padrão. Uma única chave da RouterBase, sem necessidade de credenciais do Google.

Por que este modelo

Seis motivos pelos quais as equipes lançam com a API do Gemini 3.5 Flash

Da inferência multimodal rápida ao preço com 5% de desconto: o que faz o Gemini 3.5 Flash se destacar.

Contexto de 1M tokens

Aceita até 1 milhão de tokens por requisição: documentos longos, código de múltiplos arquivos ou transcrições de vídeo cabem em uma única chamada à API do Gemini 3.5 Flash.

Entrada multimodal nativa

A API do Gemini 3.5 Flash entende texto, imagens, áudio, vídeo e PDF. Envie mídias variadas em uma única requisição para analisar, transcrever ou raciocinar entre modalidades.

Rápido e de alta vazão

Ajustado para baixa latência e alto volume: a API do Gemini 3.5 Flash entrega velocidade de nível Flash para chat, classificação, extração e roteamento em escala.

Function calling e JSON

Defina ferramentas e solicite um esquema JSON; a API do Gemini 3.5 Flash retorna chamadas de ferramentas estruturadas e JSON estritamente válido para pipelines de agentes e extração confiáveis.

Endpoint compatível com OpenAI

A API do Gemini 3.5 Flash fala o formato de chat-completions da OpenAI. Aponte qualquer SDK da OpenAI para a RouterBase: sem SDK do Google nem credenciais separadas.

Uma chave para mais de 200 modelos

A mesma chave da RouterBase que chama a API do Gemini 3.5 Flash também roteia para GPT-5, Claude Opus 4.8, GPT-4o mini e mais de 200 outros modelos, sem gerenciar credenciais por provedor.

RouterBase dashboard preview
Início rápido

Comece com a API do Gemini 3.5 Flash em 3 passos

Do cadastro à sua primeira resposta em menos de 5 minutos.

  1. Crie uma chave de API da RouterBase

    Cadastre-se e gere uma chave de API: uma única chave alcança a API do Gemini 3.5 Flash e todos os outros modelos do catálogo.

  2. Envie sua primeira mensagem

    Aponte qualquer SDK compatível com OpenAI para routerbase.com/v1 e defina o modelo como gemini-3-5-flash. A resposta segue o esquema padrão de chat-completions, com suporte a streaming e entrada multimodal.

  3. Inspecione o uso

    Cada resposta inclui um detalhamento completo de tokens (entrada, saída e leituras de cache), de modo que o custo e a taxa de acertos de cache ficam visíveis em cada chamada.

Preços

Paga apenas pelo que usas

A RouterBase repassa preços de nível partner. Comparado com o preço público oficial do modelo.

Histórias de clientes

O que as equipes constroem com a API do Gemini 3.5 Flash

Cargas reais de produção rodando sobre a API do Gemini 3.5 Flash e o catálogo de modelos da RouterBase.

Marcus Reyes
Marcus ReyesCTO, Paradigm AI

Roteamos chat de alto volume pela API do Gemini 3.5 Flash: respostas multimodais rápidas em escala, e o desconto de 5% da RouterBase é margem pura.

Priya Lakshmi
Priya LakshmiFounder, Quillo

A visão nativa na API do Gemini 3.5 Flash substituiu um pipeline de OCR: uma única chamada rápida descreve e extrai, texto e imagem juntos.

Thomas Beck
Thomas BeckStaff Engineer, Northbeam

As saídas JSON estruturadas da API do Gemini 3.5 Flash acabaram com nossa análise instável: JSON estritamente válido toda vez, mesmo em entradas multimodais.

Aoi Tanaka
Aoi TanakaML Lead, Daybreak Robotics

A latência de nível Flash na API do Gemini 3.5 Flash nos permitiu mover a classificação para tempo real. A RouterBase ainda a torna 5% mais barata.

Jonas Keller
Jonas KellerIndie Developer

O contexto de 1M na API do Gemini 3.5 Flash significa que posso jogar documentos inteiros nela e ainda obter respostas rápidas. Sem gambiarra de fragmentação.

Ethan Nguyen
Ethan NguyenHead of Engineering, Compound Studio

A RouterBase coloca a API do Gemini 3.5 Flash e mais de 200 outros modelos atrás de uma única chave. Nossa equipe parou de abrir chamados para novas contas de provedor.

Sophia Martín
Sophia MartínCTO, Relay

Fazemos teste A/B da API do Gemini 3.5 Flash contra o Pro por requisição: o mesmo SDK, um único campo de modelo. A maior parte do tráfego fica no Flash e a latência caiu.

Lucas Fernandes
Lucas FernandesEngineering Manager, Light

Migramos 42 serviços para a API do Gemini 3.5 Flash em um fim de semana. O único comentário no PR foi: 'peraí, é só isso?'.

David Okonkwo
David OkonkwoCo-founder, Figment

As leituras de cache a $0.105 / 1M na API do Gemini 3.5 Flash tornaram nossos recursos de contexto longo acessíveis. A conta do ROI foi instantânea.

Perguntas frequentes

Perguntas comuns sobre a API do Gemini 3.5 Flash.

É o acesso direto da RouterBase ao Gemini 3.5 Flash do Google: um endpoint de chat multimodal rápido e eficiente com contexto de 1M tokens, entrada nativa de visão/áudio/vídeo, function calling e saídas estruturadas, servido por uma interface REST compatível com OpenAI.