chat.glm_4_6v
zai/glm-4-6v

La GLM 4.6V API es el modelo de visión y lenguaje de 4.ª·6 generación de Z.ai —— recibe imágenes, fotogramas de vídeo y documentos junto al texto para OCR, extracción de gráficos y tablas y razonamiento visual, con tool calling nativo y salidas estructuradas. La GLM 4.6V API es compatible con OpenAI: apunta cualquier SDK a RouterBase y pon el modelo en glm-4-6v. Entrada a $0.255 / 1M tokens, salida a $0.765 / 1M, entrada en caché a $0.0425 / 1M —— un 15% por debajo del oficial, todo por un endpoint REST.

Input
GLM-4.6V
max_tokens4096
temperature1
top_p1
presence_penalty0
frequency_penalty0
GLM-4.6V Online
Hi! I'm a helpful AI assistant. What can I do for you?

GLM 4.6V API: Chat

Usa la GLM 4.6V API para darle ojos a tu app —— el modelo de visión y lenguaje de 4.ª·6 generación de Z.ai lee imágenes, fotogramas de vídeo, capturas y documentos, y responde en texto o con llamadas a herramientas.

La GLM 4.6V API es el modelo de visión y lenguaje (multimodal) de 4.ª·6 generación de Z.ai —— recibe imágenes, fotogramas de vídeo y documentos junto al texto para OCR, extracción de gráficos y tablas y razonamiento visual, con tool calling nativo y salidas estructuradas. A través de RouterBase, la GLM 4.6V API es totalmente compatible con OpenAI: apunta cualquier SDK existente a la base URL de RouterBase, pon el modelo en glm-4-6v y tu primera llamada a la GLM 4.6V API pasa de inmediato.

El precio de la GLM 4.6V API es $0.255 / 1M tokens de entrada, $0.765 / 1M tokens de salida y $0.0425 / 1M de lecturas de entrada en caché —— un 15% por debajo de la tarifa oficial publicada. Una clave de RouterBase llega a la GLM 4.6V API y más de 200 modelos —— sin cuenta de Z.ai.

Por qué este modelo

Seis razones para usar la GLM 4.6V API

De la lectura de imágenes con precisión por fotograma al precio con 15% de descuento —— por qué los equipos ponen GLM-4.6V detrás de sus funciones multimodales.

Ve imágenes, vídeo y documentos

La GLM 4.6V API recibe imágenes, documentos de varias páginas y fotogramas de vídeo junto al texto —— resolviendo OCR, extracción de gráficos y tablas y razonamiento visual en una sola llamada multimodal.

Documentos, gráficos y OCR

Apunta la GLM 4.6V API a una captura, un PDF escaneado, una factura o un panel y extrae texto, tablas y estructura —— sin un pipeline de OCR aparte que ejecutar.

Tool calling nativo

La GLM 4.6V API llama a funciones en el formato de herramientas de OpenAI directamente a partir de lo que ve —— deja que lea un formulario y luego dispare tus herramientas en un mismo bucle de agente multimodal.

Ventana de contexto larga

Mete documentos largos con varias imágenes, el historial de chat completo y turnos que alternan imagen y texto en una sola petición de la GLM 4.6V API.

Compatible con OpenAI, una clave

La GLM 4.6V API habla el formato chat-completions de OpenAI, imágenes incluidas; la misma clave de RouterBase también enruta a GPT-5.5, Claude, Gemini y más de 200 modelos.

15% bajo el oficial

La GLM 4.6V API cuesta un 15% menos que la tarifa publicada de Z.ai —— $0.255 / 1M entrada, $0.765 / 1M salida, $0.0425 / 1M en caché. La entrada de imagen se factura como tokens, así que lo multimodal sigue siendo barato.

RouterBase dashboard preview
Inicio rápido

Empieza con la GLM 4.6V API en 3 pasos

Del registro a tu primera respuesta en menos de 5 minutos.

  1. Crea una clave de RouterBase

    Crea una cuenta y genera una clave —— desbloquea GLM-4.6V y todos los demás modelos del catálogo de RouterBase.

  2. Envía tu primer mensaje

    Apunta cualquier SDK compatible con OpenAI a routerbase.com/v1, pon el modelo en glm-4-6v y envía mensajes con partes image_url junto al texto. Las respuestas siguen el esquema estándar de chat-completions, con streaming incluido.

  3. Revisa el uso

    Cada respuesta trae un desglose completo de tokens —— entrada de texto e imagen, salida y entrada en caché —— para que vigiles el coste multimodal de la GLM 4.6V API llamada a llamada.

Precios

Paga sólo por lo que usas

RouterBase repercute precios de nivel partner. Comparado con la tarifa pública oficial del modelo.

Historias de clientes

Lo que los equipos construyen con la GLM 4.6V API

Cargas de producción reales sobre el catálogo de más de 200 modelos de RouterBase.

Marcus Reyes
Marcus ReyesCTO, Paradigm AI

Nuestros agentes de soporte le envían a GLM-4.6V una captura de lo que ve el usuario y señala el elemento roto —— mucho más barato que el modelo de visión que usábamos antes.

Priya Lakshmi
Priya LakshmiFounder, Quillo

Lanzamos el escaneo de recibos y facturas en un fin de semana —— un cambio de base URL a la GLM 4.6V API y el análisis de imágenes simplemente funcionó, sin proveedor de OCR.

Aoi Tanaka
Aoi TanakaML Lead, Daybreak Robotics

Nuestros robots transmiten fotogramas de cámara a GLM-4.6V y devuelve acciones fundamentadas mediante llamadas a herramientas estándar —— el formato OpenAI supuso cero trabajo de adaptador.

Ethan Nguyen
Ethan NguyenHead of Engineering, Compound Studio

Comparamos GLM-4.6V con modelos de visión más grandes detrás de una clave de RouterBase —— en lectura de gráficos y tablas aguantó el tipo a una fracción del precio.

Sophia Martín
Sophia MartínCTO, Relay

Nuestro RAG ahora indexa contratos escaneados como imágenes de página —— GLM-4.6V los lee directamente, y la tarifa de entrada en caché mantiene baratos los documentos de referencia largos.

Lucas Fernandes
Lucas FernandesEngineering Manager, Light

Intercalar imágenes y texto en un mismo mensaje simplemente funciona con la GLM 4.6V API —— enviamos un gráfico más una pregunta y recibimos una respuesta fundamentada.

Preguntas frecuentes

Preguntas comunes sobre la GLM 4.6V API.

La GLM 4.6V API es el paso directo de RouterBase a la GLM-4.6V de Z.ai —— un modelo de visión y lenguaje de 4.ª·6 generación que recibe imágenes, fotogramas de vídeo y documentos como entrada, servido por una interfaz REST compatible con OpenAI con tool calling nativo y salidas estructuradas.