Gemini 3.1 Flash-Lite API는 우리의 대용량 기본값입니다. 최신 세대 품질에 빠르고, 대부분의 호출에서 플래그십을 건너뛸 만큼 저렴합니다. RouterBase의 5% 할인은 그대로 마진이 됩니다.
Gemini 3.1 Flash-Lite API 는 Google 의 가장 빠르고 비용 효율적인 Gemini 3.1 모델입니다 —— 100만 토큰 컨텍스트, 텍스트/이미지/오디오/비디오/PDF 네이티브 입력, function calling, 구조화 JSON 출력을 갖추고 저지연·고처리량에 최적화되어 있습니다. Gemini 3.1 Flash-Lite API 는 OpenAI 호환: 기존 SDK 를 RouterBase 로 지정하고 모델을 gemini-3-1-flash-lite 로 설정하면 됩니다. 입력 $0.2375 / 1M, 출력 $1.425 / 1M, 캐시 읽기 $0.02375 / 1M —— 공식 공개가 대비 5% 저렴, 모두 하나의 REST 엔드포인트로.
Gemini 3.1 Flash-Lite API: 채팅
Gemini 3.1 Flash-Lite API로 Google에서 가장 빠르고 저렴한 Gemini 3.1 모델을 실행하세요. 1M 토큰 컨텍스트, 네이티브 멀티모달 입력, 구조화된 출력을 지원합니다.
Gemini 3.1 Flash-Lite API는 Google에서 가장 빠르고 비용 효율적인 Gemini 3.1 모델로, 1M 토큰 컨텍스트 윈도우, 텍스트·이미지·오디오·비디오·PDF 네이티브 입력, function calling, 구조화된 JSON 출력을 갖추고 있으며 낮은 지연 시간과 높은 처리량에 맞게 튜닝되어 있습니다. RouterBase를 통해 라우팅되는 Gemini 3.1 Flash-Lite API는 완전히 OpenAI 호환입니다. 기존 SDK를 RouterBase의 기본 URL로 지정하고 모델을 gemini-3-1-flash-lite로 설정하면 첫 호출이 바로 통과됩니다.
가격은 입력 토큰 $0.2375 / 1M, 출력 토큰 $1.425 / 1M, 캐시 입력 읽기 $0.02375 / 1M로, 공식 공개 요금보다 5% 저렴합니다. RouterBase 키 하나면 충분하며 Google 자격 증명은 필요하지 않습니다.
팀이 Gemini 3.1 Flash-Lite API로 출시하는 여섯 가지 이유
최신 세대의 속도부터 5% 할인 가격까지, Gemini 3.1 Flash-Lite API가 돋보이는 이유를 소개합니다.
가장 빠르고 저렴한 Gemini 3.1
Gemini 3.1 Flash-Lite API는 Google의 최신 경량 모델로, Gemini 3.1 제품군에서 가장 낮은 비용과 가장 높은 처리량을 위해 설계되었습니다.
1M 토큰 컨텍스트
요청당 최대 100만 토큰을 처리합니다. 긴 문서, 여러 파일의 코드, 비디오 자막도 청크 분할 없이 한 번의 Gemini 3.1 Flash-Lite API 호출에 담을 수 있습니다.
네이티브 멀티모달 입력
Gemini 3.1 Flash-Lite API는 텍스트·이미지·오디오·비디오·PDF를 이해합니다. 혼합 미디어를 한 요청에 전달해 여러 모달리티를 넘나들며 분석·전사·추론할 수 있습니다.
function calling 및 JSON
도구를 정의하고 JSON 스키마를 요청하면 Gemini 3.1 Flash-Lite API는 구조화된 도구 호출과 엄격하게 유효한 JSON을 반환합니다. 안정적인 에이전트 및 추출 파이프라인에 적합합니다.
OpenAI 호환 엔드포인트
Gemini 3.1 Flash-Lite API는 OpenAI chat-completions 와이어 포맷을 사용합니다. OpenAI SDK를 RouterBase로 지정하기만 하면 되며, Google SDK나 별도 자격 증명이 필요하지 않습니다.
200+ 모델을 위한 단일 키
Gemini 3.1 Flash-Lite API를 호출하는 동일한 RouterBase 키로 GPT-5, Claude Opus 4.8, Gemini 3.1 Pro 및 200+ 개의 다른 모델로도 라우팅됩니다. 공급자별 자격 증명 관리가 필요 없습니다.

3단계로 Gemini 3.1 Flash-Lite API 시작하기
가입부터 첫 응답까지 5분 이내에 완료됩니다.
RouterBase API 키 생성
가입하고 API 키를 생성하세요. 키 하나로 Gemini 3.1 Flash-Lite API와 카탈로그의 모든 모델에 접근할 수 있습니다.
첫 메시지 보내기
OpenAI 호환 SDK를 routerbase.com/v1로 지정하고 모델을 gemini-3-1-flash-lite로 설정하세요. 응답은 표준 chat-completions 스키마를 따르며 스트리밍과 멀티모달 입력을 지원합니다.
사용량 확인
모든 응답에는 입력·출력·캐시 읽기 토큰에 대한 상세한 내역이 포함되어 있어, 호출마다 비용과 캐시 적중률을 확인할 수 있습니다.
사용한 만큼만 지불
RouterBase 는 파트너 등급 가격을 그대로 전달합니다. 모델의 공식 API 가격과 비교해 보세요.
팀이 Gemini 3.1 Flash-Lite API로 구축하는 것
Gemini 3.1 Flash-Lite API와 RouterBase 모델 카탈로그에서 실행되는 실제 프로덕션 워크로드입니다.
Gemini 3.1 Flash-Lite API의 네이티브 멀티모달은 비디오와 오디오를 직접 읽습니다. 빠른 한 번의 호출로 전사와 콘텐츠 추론을 함께 처리합니다.
Gemini 3.1 Flash-Lite API의 구조화된 JSON 출력 덕분에 불안정하던 정규식 파싱을 없앴습니다. 매번 엄격하게 유효한 JSON이 나오고 재시도는 전혀 없습니다.
분류와 라우팅을 Gemini 3.1 Flash-Lite API로 옮겼더니 지연 시간이 줄고 품질은 올라갔습니다. RouterBase는 이를 5% 더 저렴하게 만들고 장애도 자동으로 우회합니다.
Flash-Lite 가격에 1M 토큰 컨텍스트를 쓸 수 있어 문서 전체를 저렴하게 던질 수 있습니다. Gemini 3.1 Flash-Lite API는 그것을 빠르게 처리합니다.
RouterBase는 Gemini 3.1 Flash-Lite API와 200+ 개의 다른 모델을 키 하나 뒤에 둡니다. 우리 팀은 새 공급자 계정 요청을 그만두게 되었습니다.
요청마다 Gemini 3.1 Flash-Lite API와 3.1 Pro를 A/B 테스트합니다. 같은 SDK에 모델 필드 하나만 바꾸면 됩니다. 대부분의 트래픽은 Flash-Lite에 남고 청구액은 크게 줄었습니다.
주말 동안 대용량 엔드포인트를 Gemini 3.1 Flash-Lite API로 라우팅했습니다. 유일한 PR 코멘트는 '잠깐, 이게 다야?'였습니다.
$0.2375 / 1M 입력에서 5% 더 할인된 가격으로, Gemini 3.1 Flash-Lite API는 최신 세대 멀티모달 추론을 확장 가능한 가격에 제공했습니다. ROI 계산은 즉각적이었습니다.
자주 묻는 질문
Gemini 3.1 Flash-Lite API에 대한 자주 묻는 질문입니다.
Google의 Gemini 3.1 Flash-Lite로 연결되는 RouterBase의 패스스루입니다. Google에서 가장 빠르고 비용 효율적인 Gemini 3.1 모델로, 1M 토큰 컨텍스트, 네이티브 비전/오디오/비디오 입력, function calling, 구조화된 출력을 갖추고 있으며 OpenAI 호환 REST 인터페이스로 제공됩니다.