Os nossos agentes de suporte enviam à GLM-4.6V uma captura do que o utilizador vê e ela aponta o elemento avariado —— muito mais barato que o modelo de visão que usávamos antes.
A GLM 4.6V API é o modelo de visão e linguagem de 4.ª·6 geração da Z.ai —— recebe imagens, fotogramas de vídeo e documentos junto ao texto para OCR, extração de gráficos e tabelas e raciocínio visual, com tool calling nativo e saídas estruturadas. A GLM 4.6V API é compatível com OpenAI: aponte qualquer SDK para a RouterBase e defina o modelo como glm-4-6v. Entrada a $0.255 / 1M tokens, saída a $0.765 / 1M, entrada em cache a $0.0425 / 1M —— 15% abaixo do oficial, tudo por um endpoint REST.
GLM 4.6V API: Chat
Use a GLM 4.6V API para dar olhos à sua app —— o modelo de visão e linguagem de 4.ª·6 geração da Z.ai lê imagens, fotogramas de vídeo, capturas de ecrã e documentos, e responde em texto ou com chamadas a ferramentas.
A GLM 4.6V API é o modelo de visão e linguagem (multimodal) de 4.ª·6 geração da Z.ai —— recebe imagens, fotogramas de vídeo e documentos junto ao texto para OCR, extração de gráficos e tabelas e raciocínio visual, com tool calling nativo e saídas estruturadas. Através da RouterBase, a GLM 4.6V API é totalmente compatível com OpenAI: aponte qualquer SDK existente para a base URL da RouterBase, defina o modelo como glm-4-6v e a sua primeira chamada à GLM 4.6V API passa de imediato.
O preço da GLM 4.6V API é $0.255 / 1M tokens de entrada, $0.765 / 1M tokens de saída e $0.0425 / 1M de leituras de entrada em cache —— 15% abaixo da tarifa oficial publicada. Uma chave RouterBase chega à GLM 4.6V API e a mais de 200 modelos —— sem conta Z.ai.
Seis razões para usar a GLM 4.6V API
Da leitura de imagens com precisão por fotograma ao preço com 15% de desconto —— porque as equipas põem a GLM-4.6V por trás das suas funcionalidades multimodais.
Vê imagens, vídeo e documentos
A GLM 4.6V API recebe imagens, documentos de várias páginas e fotogramas de vídeo junto ao texto —— tratando OCR, extração de gráficos e tabelas e raciocínio visual numa única chamada multimodal.
Documentos, gráficos e OCR
Aponte a GLM 4.6V API a uma captura de ecrã, um PDF digitalizado, uma fatura ou um painel e ela extrai texto, tabelas e estrutura —— sem um pipeline de OCR à parte para executar.
Tool calling nativo
A GLM 4.6V API chama funções no formato de ferramentas da OpenAI diretamente a partir do que vê —— deixe-a ler um formulário e depois acionar as suas ferramentas num só ciclo de agente multimodal.
Janela de contexto longa
Coloque documentos longos com várias imagens, o histórico de chat completo e turnos que alternam imagem e texto num único pedido da GLM 4.6V API.
Compatível com OpenAI, uma chave
A GLM 4.6V API fala o formato chat-completions da OpenAI, imagens incluídas; a mesma chave RouterBase também encaminha para GPT-5.5, Claude, Gemini e mais de 200 modelos.
15% abaixo do oficial
A GLM 4.6V API custa 15% menos que a tarifa publicada da Z.ai —— $0.255 / 1M entrada, $0.765 / 1M saída, $0.0425 / 1M em cache. A entrada de imagem é faturada como tokens, por isso o multimodal continua barato.

Comece a usar a GLM 4.6V API em 3 passos
Do registo à primeira resposta em menos de 5 minutos.
Crie uma chave RouterBase
Crie uma conta e gere uma chave —— ela desbloqueia a GLM-4.6V e todos os outros modelos do catálogo da RouterBase.
Envie a primeira mensagem
Aponte qualquer SDK compatível com OpenAI para routerbase.com/v1, defina o modelo como glm-4-6v e envie mensagens com partes image_url junto ao texto. As respostas seguem o esquema padrão chat-completions, streaming incluído.
Inspecione o uso
Cada resposta traz um detalhe completo de tokens —— entrada de texto e imagem, saída e entrada em cache —— para acompanhar o custo multimodal da GLM 4.6V API chamada a chamada.
Paga apenas pelo que usas
A RouterBase repassa preços de nível partner. Comparado com o preço público oficial do modelo.
O que as equipas constroem com a GLM 4.6V API
Cargas de produção reais sobre o catálogo de mais de 200 modelos da RouterBase.
Lançámos a digitalização de recibos e faturas num fim de semana —— uma troca de base URL para a GLM 4.6V API e a análise de imagens simplesmente funcionou, sem fornecedor de OCR.
Os nossos robôs transmitem fotogramas de câmara à GLM-4.6V e ela devolve ações fundamentadas através de chamadas a ferramentas padrão —— o formato OpenAI significou zero trabalho de adaptador.
Comparámos a GLM-4.6V com modelos de visão maiores por trás de uma chave RouterBase —— na leitura de gráficos e tabelas aguentou-se por uma fração do preço.
O nosso RAG agora indexa contratos digitalizados como imagens de página —— a GLM-4.6V lê-os diretamente, e a tarifa de entrada em cache mantém baratos os documentos de referência longos.
Intercalar imagens e texto numa só mensagem simplesmente funciona com a GLM 4.6V API —— enviamos um gráfico mais uma pergunta e recebemos uma resposta fundamentada.
Perguntas frequentes
Perguntas comuns sobre a GLM 4.6V API.
A GLM 4.6V API é a ligação direta da RouterBase à GLM-4.6V da Z.ai —— um modelo de visão e linguagem de 4.ª·6 geração que recebe imagens, fotogramas de vídeo e documentos como entrada, servido por uma interface REST compatível com OpenAI com tool calling nativo e saídas estruturadas.