Gemini 3.1 Flash-Lite API 是我们高吞吐量的默认选择——最新一代品质,快速,而且便宜到大多数调用都无需动用旗舰模型。RouterBase 的 5% 折扣纯属利润。
Gemini 3.1 Flash-Lite API 是 Google 最快、最具性价比的 Gemini 3.1 模型 —— 100 万 token 上下文、原生支持文本/图像/音频/视频/PDF 输入、function calling、结构化 JSON 输出,针对低延迟与高吞吐优化。Gemini 3.1 Flash-Lite API 兼容 OpenAI:现有 SDK 指向 RouterBase、模型设为 gemini-3-1-flash-lite 即可。输入 $0.2375 / 1M tokens,输出 $1.425 / 1M tokens,缓存读取 $0.02375 / 1M tokens —— 比官方公布价低 5%,全部通过一个 REST 接口完成。
Gemini 3.1 Flash-Lite API:对话
使用 Gemini 3.1 Flash-Lite API 运行 Google 最快、最便宜的 Gemini 3.1 模型——1M token 上下文、原生多模态输入与结构化输出。
Gemini 3.1 Flash-Lite API 是 Google 最快、最具性价比的 Gemini 3.1 模型——拥有 1M token 上下文窗口,原生支持文本、图像、音频、视频和 PDF 输入,支持 function calling 和结构化 JSON 输出,专为低延迟和高吞吐量调优。通过 RouterBase 路由,Gemini 3.1 Flash-Lite API 完全兼容 OpenAI:将任何现有 SDK 指向 RouterBase 的 base URL,把模型设为 gemini-3-1-flash-lite,首次调用即刻通过。
定价为每 1M 输入 token $0.2375、每 1M 输出 token $1.425、每 1M 缓存输入读取 $0.02375——比官方公布价低 5%。一把 RouterBase 密钥——无需 Google 凭据。
团队选择 Gemini 3.1 Flash-Lite API 上线的六大理由
从最新一代的速度到立减 5% 的定价——看 Gemini 3.1 Flash-Lite API 何以脱颖而出。
最快、最便宜的 Gemini 3.1
Gemini 3.1 Flash-Lite API 是 Google 最新的轻量级模型——在 Gemini 3.1 家族中专为最低成本和最高吞吐量打造。
1M token 上下文
每次请求最多接受 100 万 token——长文档、多文件代码或视频转录都能装进一次 Gemini 3.1 Flash-Lite API 调用,无需分块。
原生多模态输入
Gemini 3.1 Flash-Lite API 能理解文本、图像、音频、视频和 PDF。在一次请求中传入混合媒体,跨模态分析、转录或推理。
function calling 与 JSON
定义工具并请求 JSON schema;Gemini 3.1 Flash-Lite API 返回结构化工具调用和严格有效的 JSON,为可靠的智能体和提取流水线服务。
兼容 OpenAI 的端点
Gemini 3.1 Flash-Lite API 使用 OpenAI chat-completions 的传输格式。将任何 OpenAI SDK 指向 RouterBase——无需 Google SDK 或单独凭据。
一把密钥,200+ 模型
调用 Gemini 3.1 Flash-Lite API 的同一把 RouterBase 密钥,也可路由到 GPT-5、Claude Opus 4.8、Gemini 3.1 Pro 等 200+ 模型——无需逐家管理凭据。

三步开始使用 Gemini 3.1 Flash-Lite API
从注册到首个响应,不到 5 分钟。
创建 RouterBase API 密钥
注册并生成 API 密钥——一把密钥即可访问 Gemini 3.1 Flash-Lite API 以及目录中的所有其他模型。
发送你的第一条消息
将任何兼容 OpenAI 的 SDK 指向 routerbase.com/v1,并把模型设为 gemini-3-1-flash-lite。响应遵循标准 chat-completions schema——支持流式传输和多模态输入。
查看用量
每个响应都包含详细的 token 明细——输入、输出和缓存读取 token——让每次调用的成本和缓存命中率一目了然。
按使用量付费
RouterBase 透传合作方价格,与模型官方公开 API 价格对比。
团队用 Gemini 3.1 Flash-Lite API 构建什么
在 Gemini 3.1 Flash-Lite API 和 RouterBase 模型目录上运行的真实生产负载。
Gemini 3.1 Flash-Lite API 的原生多模态能直接读取视频和音频——一次快速调用就能同时转录并对内容进行推理。
Gemini 3.1 Flash-Lite API 的结构化 JSON 输出终结了我们脆弱的正则解析。每次都是严格有效的 JSON,零重试。
我们把分类和路由迁移到 Gemini 3.1 Flash-Lite API,延迟下降,质量却提升了。RouterBase 让它便宜 5%,并自动绕过故障。
以 Flash-Lite 的价格享有 1M token 上下文,意味着我能廉价地把整份文档丢给它。Gemini 3.1 Flash-Lite API 处理起来又快又轻松。
RouterBase 把 Gemini 3.1 Flash-Lite API 和 200+ 其他模型放在一把密钥之后。我们团队再也不用为新的供应商账户提交申请了。
我们逐请求地对 Gemini 3.1 Flash-Lite API 与 3.1 Pro 做 A/B 测试——同一个 SDK,一个模型字段。大部分流量留在 Flash-Lite 上,账单大幅下降。
我们用一个周末就把高吞吐量端点路由到了 Gemini 3.1 Flash-Lite API。唯一的 PR 评论是「等等,就这么简单?」。
以每 1M 输入 $0.2375 再减 5% 的价格,Gemini 3.1 Flash-Lite API 让我们以可规模化的价格用上最新一代多模态推理。ROI 一算即明。
常见问题
关于 Gemini 3.1 Flash-Lite API 的常见问题。
它是 RouterBase 对 Google Gemini 3.1 Flash-Lite 的透传——Google 最快、最具性价比的 Gemini 3.1 模型,拥有 1M token 上下文、原生视觉/音频/视频输入、function calling 和结构化输出,通过兼容 OpenAI 的 REST 接口提供服务。