Nous acheminons 90% de notre trafic via la Gemini 2.5 Flash Lite API — classification et extraction pour une fraction du coût. La remise de 5% de RouterBase est de la marge pure.
L'API Gemini 2.5 Flash Lite est le modèle Gemini 2.5 le plus rapide et le plus économique de Google —— une fenêtre de contexte de 1M tokens, une entrée native pour texte/image/audio/vidéo/PDF, le function calling et des sorties JSON structurées, optimisée pour une faible latence et un débit élevé. L'API Gemini 2.5 Flash Lite est compatible OpenAI : pointez n'importe quel SDK vers RouterBase et définissez le modèle sur gemini-2-5-flash-lite. Entrée à $0.095 / 1M, sortie à $0.34 / 1M, lectures en cache à $0.0095 / 1M —— 5% sous le tarif officiel publié, le tout via un endpoint REST.
Gemini 2.5 Flash Lite API : Chat
Utilisez la Gemini 2.5 Flash Lite API pour exécuter le modèle Gemini 2.5 le plus rapide et le plus économique de Google, avec une fenêtre de contexte de 1M tokens et une entrée multimodale.
La Gemini 2.5 Flash Lite API est le modèle Gemini 2.5 le plus petit et le plus économique de Google — une fenêtre de contexte de 1M tokens, une entrée native pour le texte, les images, l'audio, la vidéo et le PDF, le function calling et des sorties JSON structurées, optimisée pour la latence la plus faible et le débit le plus élevé à grande échelle. Acheminée via RouterBase, la Gemini 2.5 Flash Lite API est entièrement compatible OpenAI : pointez n'importe quel SDK existant vers l'URL de base de RouterBase, définissez le modèle sur gemini-2-5-flash-lite, et votre premier appel passe immédiatement.
La tarification est de $0.095 / 1M tokens d'entrée, $0.34 / 1M tokens de sortie et $0.0095 / 1M lectures d'entrée mises en cache — 5% en dessous du tarif officiel publié. Une seule clé RouterBase — aucun identifiant Google requis.
Six raisons pour lesquelles les équipes livrent sur la Gemini 2.5 Flash Lite API
D'un contexte de 1M tokens à une tarification réduite de 5% — ce qui distingue la Gemini 2.5 Flash Lite API.
Contexte de 1M tokens
Accepte jusqu'à 1 million de tokens par requête — documents longs, code multi-fichiers ou transcriptions vidéo tiennent dans un seul appel de la Gemini 2.5 Flash Lite API, sans découpage.
Niveau 2.5 le plus rapide et le moins cher
Conçue pour les charges de travail à fort volume : la Gemini 2.5 Flash Lite API est le modèle Gemini 2.5 le moins cher à $0.095 / 1M tokens d'entrée — idéale pour la classification, le résumé, l'extraction et le routage à grande échelle.
Entrée multimodale native
La Gemini 2.5 Flash Lite API comprend le texte, les images, l'audio, la vidéo et les PDF. Transmettez des médias mixtes dans une seule requête pour analyser, transcrire ou raisonner à travers les modalités.
Function calling et JSON
Définissez des outils et demandez un schéma JSON ; la Gemini 2.5 Flash Lite API renvoie des appels d'outils structurés et un JSON strictement valide pour des pipelines d'agents et d'extraction fiables.
Point de terminaison compatible OpenAI
La Gemini 2.5 Flash Lite API parle le format wire chat-completions d'OpenAI. Pointez n'importe quel SDK OpenAI vers RouterBase — aucun SDK Google ni identifiants distincts requis.
Une clé pour 200+ modèles
La même clé RouterBase qui appelle la Gemini 2.5 Flash Lite API achemine aussi vers GPT-5, Claude Opus 4.8, Gemini 2.5 Pro et 200+ autres modèles — sans gestion d'identifiants par fournisseur.

Démarrez avec la Gemini 2.5 Flash Lite API en 3 étapes
De l'inscription à votre première réponse en moins de 5 minutes.
Créez une clé API RouterBase
Inscrivez-vous et générez une clé API — une seule clé atteint la Gemini 2.5 Flash Lite API et tous les autres modèles du catalogue.
Envoyez votre premier message
Pointez n'importe quel SDK compatible OpenAI vers routerbase.com/v1 et définissez le modèle sur gemini-2-5-flash-lite. La réponse suit le schéma standard chat-completions — streaming et entrée multimodale pris en charge.
Inspectez l'utilisation
Chaque réponse inclut une ventilation détaillée des tokens — tokens d'entrée, de sortie et de lecture en cache — afin que le coût et le taux de succès du cache soient visibles à chaque appel.
Ne payez que ce que vous utilisez
RouterBase répercute les prix partenaires. Comparé au tarif public officiel du modèle.
Ce que les équipes construisent avec la Gemini 2.5 Flash Lite API
De vraies charges de production tournant sur la Gemini 2.5 Flash Lite API et le catalogue de modèles RouterBase.
Le multimodal natif de la Gemini 2.5 Flash Lite API lit directement les images et l'audio — un seul appel rapide et bon marché légende et transcrit ensemble.
Les sorties JSON structurées de la Gemini 2.5 Flash Lite API ont éliminé notre analyse regex instable. Un JSON strictement valide à chaque fois, zéro nouvelle tentative.
À notre volume, Flash-Lite est le seul modèle Gemini 2.5 qui soit rentable. RouterBase le rend encore 5% moins cher.
La Gemini 2.5 Flash Lite API gère ma boucle de résumé à fort volume. Assez bon marché pour que j'aie cessé de compter les tokens.
RouterBase place la Gemini 2.5 Flash Lite API et 200+ autres modèles derrière une seule clé. Notre équipe a cessé de déposer des demandes de nouveaux comptes fournisseurs.
Nous testons en A/B la Gemini 2.5 Flash Lite API contre Gemini 2.5 Pro par requête — même SDK, un seul champ de modèle. La majeure partie du trafic reste sur Flash-Lite et la facture a chuté de 70%.
Nous avons migré 42 services vers la Gemini 2.5 Flash Lite API en un week-end. Le seul commentaire de PR a été 'attends, c'est tout ?'.
À $0.095 / 1M d'entrée moins 5%, la Gemini 2.5 Flash Lite API a rendu nos fonctionnalités à fort volume réellement rentables. Le calcul du ROI a été instantané.
Questions fréquentes
Questions courantes sur la Gemini 2.5 Flash Lite API.
C'est le relais de RouterBase vers Gemini 2.5 Flash-Lite de Google — le point de terminaison de chat Gemini 2.5 le plus rapide et le moins cher, avec un contexte de 1M tokens, une entrée native vision/audio/vidéo, le function calling et des sorties structurées, servi via une interface REST compatible OpenAI.