La Gemini 3.1 Flash-Lite API est notre choix par défaut pour le gros volume — qualité de dernière génération, rapide et assez bon marché pour éviter le modèle phare sur la plupart des appels. La réduction RouterBase de 5% est de la marge pure.
L'API Gemini 3.1 Flash-Lite est le modèle Gemini 3.1 le plus rapide et le plus économique de Google —— une fenêtre de contexte de 1M tokens, une entrée native texte/image/audio/vidéo/PDF, le function calling et des sorties JSON structurées, optimisée pour une faible latence et un débit élevé. L'API Gemini 3.1 Flash-Lite est compatible OpenAI : pointez n'importe quel SDK vers RouterBase et définissez le modèle sur gemini-3-1-flash-lite. Entrée à $0.2375 / 1M, sortie à $1.425 / 1M, lectures en cache à $0.02375 / 1M —— 5% sous le tarif officiel publié, le tout via un endpoint REST.
Gemini 3.1 Flash-Lite API : Chat
Utilisez la Gemini 3.1 Flash-Lite API pour exécuter le modèle Gemini 3.1 le plus rapide et le moins cher de Google — un contexte de 1M tokens, une entrée multimodale native et des sorties structurées.
La Gemini 3.1 Flash-Lite API est le modèle Gemini 3.1 le plus rapide et le plus économique de Google — une fenêtre de contexte de 1M tokens, une entrée native pour le texte, les images, l'audio, la vidéo et le PDF, le function calling et des sorties JSON structurées, optimisé pour une faible latence et un débit élevé. Routée via RouterBase, la Gemini 3.1 Flash-Lite API est entièrement compatible OpenAI : pointez n'importe quel SDK existant vers l'URL de base de RouterBase, définissez le modèle sur gemini-3-1-flash-lite, et votre premier appel passe immédiatement.
Les tarifs sont de $0.2375 / 1M tokens en entrée, $1.425 / 1M tokens en sortie et $0.02375 / 1M lectures d'entrée mises en cache — 5% en dessous du tarif officiel publié. Une seule clé RouterBase — aucun identifiant Google requis.
Six raisons pour lesquelles les équipes déploient sur la Gemini 3.1 Flash-Lite API
De la vitesse de dernière génération à une réduction de 5% — ce qui distingue la Gemini 3.1 Flash-Lite API.
Le Gemini 3.1 le plus rapide et le moins cher
La Gemini 3.1 Flash-Lite API est le tout dernier modèle léger de Google — conçu pour le coût le plus bas et le débit le plus élevé de la famille Gemini 3.1.
Contexte de 1M tokens
Accepte jusqu'à 1 million de tokens par requête — documents longs, code multi-fichiers ou transcriptions vidéo tiennent dans un seul appel à la Gemini 3.1 Flash-Lite API sans découpage.
Entrée multimodale native
La Gemini 3.1 Flash-Lite API comprend le texte, les images, l'audio, la vidéo et les PDF. Transmettez des médias mixtes dans une seule requête pour analyser, transcrire ou raisonner sur plusieurs modalités.
Function calling & JSON
Définissez des outils et demandez un schéma JSON ; la Gemini 3.1 Flash-Lite API renvoie des appels d'outils structurés et un JSON strictement valide pour des pipelines d'agents et d'extraction fiables.
Endpoint compatible OpenAI
La Gemini 3.1 Flash-Lite API parle le format de transmission chat-completions d'OpenAI. Pointez n'importe quel SDK OpenAI vers RouterBase — aucun SDK Google ni identifiants distincts nécessaires.
Une clé pour 200+ modèles
La même clé RouterBase qui appelle la Gemini 3.1 Flash-Lite API route aussi vers GPT-5, Claude Opus 4.8, Gemini 3.1 Pro et 200+ autres modèles — aucune gestion d'identifiants par fournisseur.

Démarrez avec la Gemini 3.1 Flash-Lite API en 3 étapes
De l'inscription à votre première réponse en moins de 5 minutes.
Créez une clé API RouterBase
Inscrivez-vous et générez une clé API — une seule clé atteint la Gemini 3.1 Flash-Lite API et tous les autres modèles du catalogue.
Envoyez votre premier message
Pointez n'importe quel SDK compatible OpenAI vers routerbase.com/v1 et définissez le modèle sur gemini-3-1-flash-lite. La réponse suit le schéma standard chat-completions — streaming et entrée multimodale pris en charge.
Inspectez l'utilisation
Chaque réponse inclut une ventilation détaillée des tokens — entrée, sortie et tokens de lecture du cache — afin que le coût et le taux de succès du cache soient visibles à chaque appel.
Ne payez que ce que vous utilisez
RouterBase répercute les prix partenaires. Comparé au tarif public officiel du modèle.
Ce que les équipes construisent avec la Gemini 3.1 Flash-Lite API
De vraies charges de production tournant sur la Gemini 3.1 Flash-Lite API et le catalogue de modèles RouterBase.
Le multimodal natif de la Gemini 3.1 Flash-Lite API lit directement la vidéo et l'audio — un seul appel rapide transcrit et raisonne sur le contenu en même temps.
Les sorties JSON structurées de la Gemini 3.1 Flash-Lite API ont éliminé notre analyse regex peu fiable. Un JSON strictement valide à chaque fois, zéro relance.
Nous avons déplacé la classification et le routage vers la Gemini 3.1 Flash-Lite API et la latence a baissé tandis que la qualité montait. RouterBase la rend 5% moins chère et contourne automatiquement les pannes.
1M tokens de contexte aux prix de Flash-Lite signifie que je peux lui balancer des documents entiers à moindre coût. La Gemini 3.1 Flash-Lite API les traite tout simplement rapidement.
RouterBase place la Gemini 3.1 Flash-Lite API et 200+ autres modèles derrière une seule clé. Notre équipe a cessé de déposer des demandes pour de nouveaux comptes fournisseurs.
Nous testons en A/B la Gemini 3.1 Flash-Lite API contre 3.1 Pro par requête — même SDK, un seul champ de modèle. La majeure partie du trafic reste sur Flash-Lite et la facture a fortement chuté.
Nous avons routé nos endpoints à gros volume vers la Gemini 3.1 Flash-Lite API en un week-end. Le seul commentaire de PR était 'attends, c'est tout ?'.
À $0.2375 / 1M en entrée moins 5%, la Gemini 3.1 Flash-Lite API nous a donné une inférence multimodale de dernière génération à un prix qui passe à l'échelle. Le calcul du ROI était immédiat.
Questions fréquentes
Questions courantes sur la Gemini 3.1 Flash-Lite API.
C'est le pass-through de RouterBase vers Gemini 3.1 Flash-Lite de Google — le modèle Gemini 3.1 le plus rapide et le plus économique de Google, avec un contexte de 1M tokens, une entrée native vision/audio/vidéo, le function calling et des sorties structurées, servi via une interface REST compatible OpenAI.