MODELOS
Suscripción Unlimited Basic: Qwen 3.8 27B ilimitado por 14,95 €/mes, sin facturación por token

LLM MODELROUTING.

Convierte varios modelos en un único sistema.

LLM Model Routing te permite trabajar con varios modelos desde una misma integración. Tu aplicación se conecta a QDivZero en lugar de hacerlo directamente con cada modelo, dejando el routing en una capa independiente. Así puedes ampliar o modificar los modelos que utilizas sin acumular integraciones y lógica específica dentro de tu código.

¿Quieres probarlo con tus modelos?Configura tu routing

DISEÑA CÓMO TRABAJAN JUNTOS.

Decide qué función cumple cada modelo dentro de tu aplicación y establece cómo deben coordinarse. Un mismo routing puede combinar modelos generalistas, especializados o de distinta capacidad según lo que estés construyendo.

Planifica el coste de tus modelos

Las decisiones de routing viven en QDivZero, no repartidas por el código de tu aplicación. Puedes consultar y modificar cómo se distribuyen las peticiones entre tus modelos desde una configuración centralizada.

CÓMO FUNCIONA

UNA ÚNICA FORMA DE LLAMAR A TUS MODELOS.

Configura en QDivZero los modelos que quieres utilizar y agrúpalos en una misma ruta. Tu aplicación llama siempre al mismo endpoint mediante una API compatible con OpenAI, y QDivZero dirige cada petición a uno de esos modelos según la estrategia que hayas definido.

Empezar

INTENT-BASED MODEL ROUTING

QDivZero identifica la intención de cada petición —por ejemplo, resumir, programar o analizar una imagen— y la dirige al modelo que hayas asignado a ese tipo de tarea. Así puedes combinar modelos especializados y utilizar opciones más rápidas o económicas cuando no necesitas el modelo más potente.

Qué optimiza

01 —

Coste

No pagues capacidad que la petición no necesita. Reserva los modelos más costosos para las tareas donde realmente aportan una mejora y utiliza opciones más eficientes para el resto.

02 —

Latencia

No todas las respuestas necesitan esperar al modelo más pesado. Las tareas que admiten modelos más rápidos pueden resolverse con menor tiempo de respuesta sin condicionar toda tu aplicación al mismo perfil de rendimiento.

03 —

Calidad

El routing te permite conservar modelos de mayor capacidad para las peticiones que realmente requieren sus prestaciones, en lugar de bajar la calidad de todo el sistema para reducir costes.

Adapta cada decisión a la petición.

El modelo más capaz también puede ser más caro o más lento. LLM routing te permite utilizar distintos modelos según el equilibrio que busques entre calidad, coste y latencia, en lugar de aplicar la misma elección a todas las peticiones.

Probar LLM Routing

Qué incluye LLM Model Routing

Intent-Based Routing

Detecta la intención de cada petición y la dirige al modelo que hayas asignado para ese tipo de tarea.

Failover Routing

Define modelos alternativos por orden de prioridad para continuar con otro destino cuando el principal no pueda atender una petición.

Grupos de modelos

Agrupa varios modelos dentro de una misma ruta y gestiona desde un solo lugar cómo quieres utilizarlos.

Prioridades de routing

Decide qué modelo utilizar primero y en qué orden probar las alternativas que hayas configurado.

API compatible con OpenAI

Mantén el formato de la API de OpenAI para utilizar tus rutas sin crear una integración diferente para cada modelo.

El modelo adecuado para cada petición

Dirige cada tarea al modelo que ofrece el mejor equilibrio entre calidad, velocidad y coste, en lugar de utilizar siempre la misma opción.

FAQ sobre LLM Model Routing en QDivZero

Respuestas sobre routing por intención, failover entre modelos, compatibilidad con OpenAI, latencia y costes al enrutar peticiones de IA.

¿Qué es LLM Model Routing y cuándo conviene utilizarlo?

LLM Model Routing permite conectar varios modelos de IA a un único endpoint y decidir qué destino atiende cada petición. Resulta útil cuando una aplicación combina tareas con requisitos distintos, necesita reducir costes reservando los modelos más capaces para los casos complejos o quiere disponer de alternativas si un modelo no está disponible.

¿Cuál es la diferencia entre routing por intención y failover routing?

El routing por intención analiza el objetivo de la petición y la envía al modelo configurado para esa tarea, como resumir, programar o analizar imágenes. El failover routing sigue un orden de prioridad: intenta primero el modelo principal y utiliza el siguiente destino disponible si el anterior no puede responder.

¿Puedo usar LLM Model Routing con una aplicación compatible con OpenAI?

Sí. La aplicación llama a un endpoint compatible con OpenAI y utiliza el nombre público del routing como modelo. Puedes mantener los SDK y formatos de petición habituales mientras QDivZero aplica la estrategia y selecciona el destino detrás de ese contrato estable.

¿Cómo afecta el routing de modelos al coste y la latencia?

El routing por intención añade una evaluación para clasificar la petición, por lo que puede incorporar latencia y coste adicionales. A cambio, permite enviar tareas sencillas a modelos más rápidos o económicos. El routing ordenado evita esa clasificación semántica y aplica directamente las prioridades y rutas de respaldo configuradas.

¿Puedo combinar despliegues propios y Modelos Públicos en una ruta?

Sí. QDivZero permite construir rutas con destinos respaldados por Compute y por Modelos Públicos compatibles. Los destinos de Compute descuentan saldo por el tiempo de cómputo activo y los Modelos Públicos según los tokens de entrada y salida. En la misma cuenta también puedes activar Unlimited Basic con Qwen 3.8 27B por una cuota mensual fija sin consumir saldo.

¿Qué ocurre si el modelo principal no está disponible?

En una ruta con prioridades y alternativas configuradas, QDivZero prueba el siguiente destino disponible según el orden definido. La aplicación continúa utilizando el mismo endpoint, por lo que la lógica de failover permanece en la plataforma y no tiene que implementarse en cada cliente.

Haz que tus modelos trabajen como un sistema.

Configura tu LLM Model Routing, distribuye las peticiones entre distintos modelos y ajusta la lógica de routing según las necesidades de tu aplicación.