Les tâches en long contexte qui faisaient exploser notre budget tournent maintenant sur la DeepSeek V3.2 API pour une fraction du coût.
Loading model information...
DeepSeek V3.2 API — Contexte long, attention creuse, radicalement moins cher
La DeepSeek V3.2 API exécute DeepSeek V3.2, qui utilise l'attention creuse pour tenir un long contexte à une fraction du coût d'avant — 0,028 $ par 1M en entrée.
DeepSeek V3.2 reconstruit la couche d'attention autour de DeepSeek Sparse Attention, si bien que le travail en long contexte ne monte plus en charge comme avant. La DeepSeek V3.2 API vous transmet cette efficacité directement : 0,028 $ par 1M de tokens en entrée et 0,42 $ par 1M en sortie — environ la moitié de la génération précédente — tout en gardant la conception hybride qui vous laisse penser pas à pas ou répondre directement par requête. Fichiers longs, transcriptions longues et traces d'outils longues restent abordables à l'échelle.
Vous appelez la DeepSeek V3.2 API via RouterBase avec le protocole chat-completions d'OpenAI ; réglez le modèle sur deepseek-v3-2 et votre client ne change pas. La DeepSeek V3.2 API facture 0,028 $ par 1M en entrée, 0,42 $ par 1M en sortie et 0,028 $ pour l'entrée en cache — 5 % sous le tarif, sur une clé qui atteint tout le catalogue.
Ce que donne la DeepSeek V3.2 API
L'attention creuse fait baisser la facture du long contexte.
Attention creuse
DeepSeek Sparse Attention laisse la DeepSeek V3.2 API gérer le long contexte sans la courbe de coût habituelle.
Radicalement moins chère
À 0,028 $ en entrée et 0,42 $ en sortie, la DeepSeek V3.2 API tourne à environ la moitié de la génération précédente — 5 % sous le tarif.
Long contexte, coût bas
Fichiers et transcriptions longs restent abordables, si bien que la DeepSeek V3.2 API convient au travail à haut volume et à longue entrée.
La réflexion hybride reste
Penser pas à pas ou répondre directement par requête ; la DeepSeek V3.2 API porte les deux modes dans un modèle.
Code et outils
Un code solide et un appel de fonctions fiable font de la DeepSeek V3.2 API un socle robuste pour assistants et agents.
De forme OpenAI
Un endpoint chat-completions, une clé RouterBase — pointez vers routerbase.com/v1, nommez le modèle, sautez le SDK DeepSeek.

Premier appel à la DeepSeek V3.2 API en trois étapes
Branchez une fois, puis envoyez-lui de longues entrées.
Créez une clé
Une clé RouterBase atteint la DeepSeek V3.2 API et tous les autres modèles du catalogue.
Pointez et choisissez le mode
Dirigez n'importe quel client OpenAI vers routerbase.com/v1 avec model=deepseek/deepseek-v3.2, et activez ou coupez la réflexion par requête.
Surveillez l'usage
La DeepSeek V3.2 API renvoie l'usage de tokens par réponse, donc coût et latence restent visibles à chaque appel.
Ne payez que ce que vous utilisez
RouterBase répercute les prix partenaires. Comparé au tarif public officiel du modèle.
Des équipes qui bâtissent sur la DeepSeek V3.2 API
Un long contexte qui tient enfin dans le budget.
À 0,028 $ par 1M en entrée, la DeepSeek V3.2 API nous a permis d'arrêter de rogner les prompts pour économiser.
L'attention creuse, c'est pourquoi nos longues transcriptions tiennent enfin dans le budget sur la DeepSeek V3.2 API.
Nous avons gardé les modes hybrides et à peu près divisé par deux notre facture en passant à la DeepSeek V3.2 API.
La DeepSeek V3.2 API est restée bon marché même quand nos fenêtres de contexte ont grandi, ce que les anciens modèles n'ont jamais fait.
L'appel de fonctions a tenu, donc nos agents sont passés à la DeepSeek V3.2 API sans réécriture.
Une chaîne changée depuis notre ancien endpoint ; la baisse de coût sur la DeepSeek V3.2 API a été immédiate.
On donne maintenant des documents entiers à la DeepSeek V3.2 API parce que le prix du long contexte a enfin du sens.
Même clé, long contexte moins cher — la DeepSeek V3.2 API a été un choix facile pour nous.
DeepSeek V3.2 API — questions courantes
Ce qu'il faut savoir avant de lui envoyer du trafic.
L'accès hébergé de RouterBase à DeepSeek V3.2, qui utilise l'attention creuse pour une inférence en long contexte moins chère, via un endpoint compatible OpenAI.