대용량 채팅을 Gemini 3.5 Flash API로 라우팅합니다. 대규모에서도 빠른 멀티모달 응답을 얻고, RouterBase의 5% 할인은 고스란히 마진이 됩니다.
Gemini 3.5 Flash API 는 Google 의 빠르고 효율적인 멀티모달 모델입니다 —— 100만 토큰 컨텍스트, 텍스트/이미지/오디오/비디오/PDF 네이티브 입력, function calling, 구조화 JSON 출력을 갖추고 저지연·고처리량에 최적화되어 있습니다. Gemini 3.5 Flash API 는 OpenAI 호환: 기존 SDK 를 RouterBase 로 지정하고 모델을 gemini-3-5-flash 로 설정하면 됩니다. 입력 $1.05 / 1M, 출력 $6.30 / 1M, 캐시 읽기 $0.105 / 1M —— 표준가 대비 5% 저렴, 모두 하나의 REST 엔드포인트로.
Gemini 3.5 Flash API: 채팅
Gemini 3.5 Flash API로 1M 토큰 컨텍스트 윈도우를 갖춘 Google의 빠르고 효율적인 멀티모달 모델을 실행하세요.
Gemini 3.5 Flash API는 Google의 속도 최적화 멀티모달 모델입니다. 1M 토큰 컨텍스트 윈도우, 텍스트·이미지·오디오·비디오·PDF 네이티브 입력, function calling, 구조화된 JSON 출력을 갖추고 낮은 지연 시간과 높은 처리량에 맞춰 튜닝되었습니다. RouterBase를 통하면 완전히 OpenAI 호환됩니다. 기존 SDK를 RouterBase의 베이스 URL로 향하게 하고 모델을 gemini-3-5-flash로 설정하면 첫 호출이 곧바로 통과됩니다.
요금은 입력 토큰 $1.05 / 1M, 출력 토큰 $6.30 / 1M, 캐시 입력 읽기 $0.105 / 1M로 표준 요금보다 5% 저렴합니다. RouterBase 키 하나면 충분하며 Google 자격 증명은 필요하지 않습니다.
팀이 Gemini 3.5 Flash API로 출시하는 6가지 이유
빠른 멀티모달 추론부터 5% 할인 요금까지, Gemini 3.5 Flash가 돋보이는 이유를 소개합니다.
1M 토큰 컨텍스트
요청당 최대 100만 토큰을 받아들입니다. 긴 문서, 여러 파일의 코드, 비디오 자막도 단 한 번의 Gemini 3.5 Flash API 호출에 담깁니다.
네이티브 멀티모달 입력
Gemini 3.5 Flash API는 텍스트·이미지·오디오·비디오·PDF를 이해합니다. 혼합 미디어를 한 요청으로 전달해 여러 모달리티에 걸쳐 분석·전사·추론할 수 있습니다.
빠르고 높은 처리량
낮은 지연 시간과 대용량 처리에 맞춰 튜닝되었습니다. Gemini 3.5 Flash API는 채팅·분류·추출·라우팅을 대규모로 Flash 등급의 속도로 제공합니다.
function calling 및 JSON
도구를 정의하고 JSON 스키마를 요청하면 Gemini 3.5 Flash API가 구조화된 도구 호출과 엄격하게 유효한 JSON을 반환합니다. 안정적인 에이전트 및 추출 파이프라인에 적합합니다.
OpenAI 호환 엔드포인트
Gemini 3.5 Flash API는 OpenAI chat-completions 와이어 포맷을 따릅니다. 어떤 OpenAI SDK든 RouterBase로 향하게 하면 되며, Google SDK나 별도 자격 증명이 필요 없습니다.
키 하나로 200+ 모델
Gemini 3.5 Flash API를 호출하는 동일한 RouterBase 키로 GPT-5, Claude Opus 4.8, GPT-4o mini를 비롯한 200+의 다른 모델로도 라우팅됩니다. 제공업체별 자격 증명 관리가 필요 없습니다.

3단계로 Gemini 3.5 Flash API 시작하기
가입부터 첫 응답까지 5분 이내에 끝납니다.
RouterBase API 키 생성하기
가입하고 API 키를 생성하세요. 키 하나로 Gemini 3.5 Flash API와 카탈로그의 모든 다른 모델에 접근할 수 있습니다.
첫 메시지 보내기
OpenAI 호환 SDK를 routerbase.com/v1로 향하게 하고 모델을 gemini-3-5-flash로 설정하세요. 응답은 표준 chat-completions 스키마를 따르며 스트리밍과 멀티모달 입력을 지원합니다.
사용량 확인하기
모든 응답에는 입력·출력·캐시 읽기 토큰의 상세한 내역이 포함됩니다. 덕분에 호출마다 비용과 캐시 적중률을 확인할 수 있습니다.
사용한 만큼만 지불
RouterBase 는 파트너 등급 가격을 그대로 전달합니다. 모델의 공식 API 가격과 비교해 보세요.
팀이 Gemini 3.5 Flash API로 만드는 것
Gemini 3.5 Flash API와 RouterBase 모델 카탈로그에서 돌아가는 실제 프로덕션 워크로드입니다.
Gemini 3.5 Flash API의 네이티브 비전으로 OCR 파이프라인을 대체했습니다. 빠른 한 번의 호출로 텍스트와 이미지를 함께 캡션하고 추출합니다.
Gemini 3.5 Flash API의 구조화된 JSON 출력으로 불안정한 파싱이 사라졌습니다. 멀티모달 입력에서도 매번 엄격하게 유효한 JSON이 나옵니다.
Gemini 3.5 Flash API의 Flash 등급 지연 시간 덕분에 분류를 온라인으로 옮길 수 있었습니다. RouterBase로 거기서 5% 더 저렴해집니다.
Gemini 3.5 Flash API의 1M 컨텍스트 덕분에 문서 전체를 통째로 던져도 빠른 답을 얻습니다. 분할용 접착 코드가 필요 없습니다.
RouterBase는 Gemini 3.5 Flash API와 200+의 다른 모델을 키 하나 뒤에 둡니다. 우리 팀은 새 제공업체 계정 요청을 더 이상 올리지 않게 되었습니다.
요청마다 Gemini 3.5 Flash API와 Pro를 A/B 테스트합니다. 같은 SDK에 모델 필드 하나뿐입니다. 트래픽 대부분이 Flash에 머물고 지연 시간이 떨어졌습니다.
주말 동안 42개 서비스를 Gemini 3.5 Flash API로 마이그레이션했습니다. 유일한 PR 코멘트는 '잠깐, 이게 다야?'였습니다.
Gemini 3.5 Flash API의 캐시 읽기가 $0.105 / 1M라서 긴 컨텍스트 기능을 감당할 만해졌습니다. ROI 계산은 즉각적이었습니다.
자주 묻는 질문
Gemini 3.5 Flash API에 관한 자주 묻는 질문입니다.
RouterBase가 제공하는 Google Gemini 3.5 Flash로의 패스스루입니다. 1M 토큰 컨텍스트, 네이티브 비전/오디오/비디오 입력, function calling, 구조화된 출력을 갖춘 빠르고 효율적인 멀티모달 채팅 엔드포인트로, OpenAI 호환 REST 인터페이스를 통해 제공됩니다.