Elige un modelo
Escoge un modelo compatible de Hugging Face. El scheduling inteligente elimina la selección manual de GPU en despliegues estándar.
Compute valida los requisitos del modelo y prepara la capacidad, el almacenamiento y la configuración del runtime detrás de una sola API. Elige un modelo, despliega y empieza a servirlo con capacidad activa.

Escoge un modelo compatible de Hugging Face. El scheduling inteligente elimina la selección manual de GPU en despliegues estándar.
El scheduler selecciona la capacidad óptima entre los proveedores disponibles. Runtime, red y escalado se aprovisionan automáticamente.
Tu modelo queda expuesto como un endpoint compatible con OpenAI. Usa el SDK de Python o cualquier cliente HTTP compatible.
Usa una tarifa fijada al lanzar; el tiempo activo se factura por segundo. Añade capacidad cuando la necesites y detenla cuando no. El precio depende de la capacidad activa, no del número de usuarios; más tráfico puede requerir más capacidad.
Carga de trabajo de ejemplo
8 h/día · 20 días/mes
Comparación orientativa; benchmarks y contexto de precios disponibles bajo petición.
Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.
Carga de trabajo de ejemplo
8 h/día · 20 días/mes
Modelo de embeddings multimodal. Genera embeddings de texto e imágenes con un coste predecible.
Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.
Carga de trabajo de ejemplo
8 h/día · 20 días/mes
Comparación orientativa; benchmarks y contexto de precios disponibles bajo petición.
Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.
Carga de trabajo de ejemplo
8 h/día · 20 días/mes
Comparación orientativa; benchmarks y contexto de precios disponibles bajo petición.
Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.
Estimaciones de proveedores externos
Estimación orientativa; el coste real depende de la capacidad activa. Los proveedores externos se estiman con 15 M de tokens de entrada y 10 M de salida al mes. La salida suele ser la parte más cara.
Claude 3.7 Sonnet
200k context
GPT-5.4 mini
OpenAI fast tier
GPT-5.5
OpenAI standard tier
Opus 4.7
Anthropic reasoning tier
El precio depende de la capacidad activa, no del número de usuarios; más tráfico puede requerir más capacidad.
Estimaciones orientativas; benchmarks y contexto de precios disponibles bajo petición. El precio depende de los recursos asignados.
Controles regionales, capacidad verificada y operaciones privadas por defecto para cargas de IA en producción. Añade Firewall cuando la política deba estar en la ruta de la petición.
Regiones
Despliegues europeos para cargas sensibles al RGPD, con opción de desactivar servidores no verificados.
Runtime
Imágenes de runtime verificadas y controles de scheduling regional.
Privacidad
No almacenamos logs de conversaciones.
Crea reglas cron para encender las instancias antes del tráfico y apagarlas después del horario de trabajo. Reduce la factura, evita consumo inactivo y mantén las operaciones previsibles.
Paga solo mientras Compute está ejecutándose.
Evita que las GPU consuman energía por la noche o el fin de semana sin trabajo.
Levanta las instancias antes de que empiecen los usuarios, jobs o jornadas de trabajo.
Reglas de inicio y parada basadas en el tiempo para esta instancia.
Acción
Iniciar
Zona horaria
UTC
Expresión cron
0 9 * * 1-5
Acción
Parar
Zona horaria
UTC
Expresión cron
0 19 * * 1-5
Despliegue, routing, precios, seguridad, programación y compatibilidad con la API en un solo runtime.
Elige un modelo y deja que Compute valide los requisitos del runtime y prepare la capacidad para servirlo.
El scheduler selecciona capacidad entre proveedores disponibles según coste, disponibilidad y latencia.
Monta discos persistentes en varias cargas, compártelos entre lanzamientos y mantenlos conectados aunque Compute reprograme el workload en otro proveedor.
Expón los modelos desplegados detrás del contrato estándar de OpenAI para que tus clientes actuales sigan funcionando.
Usa reglas de inicio y parada basadas en cron para que las cargas funcionen cuando hace falta y permanezcan apagadas cuando no.
Las instancias de Compute usan precio por capacidad activa; los Public Models mantienen el precio por token.
Aplica controles regionales, comprobaciones del runtime y operaciones privadas por defecto para cargas en producción.
Servicio de almacenamiento
El almacenamiento da a Compute una capa de estado que no depende de un único proveedor. Monta el mismo disco en varias cargas, compártelo cuando un proceso necesite estado común y mantenlo disponible aunque el runtime termine en otro sitio. También sirve para checkpoints de fine-tuning, cachés de modelos y salidas de cuantización que necesitan espacio durable para arrancar más rápido.
El plano de control puede mover la instancia, pero el disco sigue al trabajo. Así las cargas con estado pueden moverse entre proveedores.
Comportamiento del almacenamiento
Mantén checkpoints, ejecuciones de fine-tuning, cachés de modelos y salidas de cuantización conectados a la carga entre lanzamientos.
Monta un disco en varias cargas cuando un pipeline necesita la misma capa de estado.
Si Compute mueve la carga de un proveedor a otro, la capa de almacenamiento la sigue.
Apunta tu código compatible con OpenAI a QDivZero y ejecuta cargas de IA en producción sobre infraestructura con precio por capacidad.
Ver documentaciónfrom openai import OpenAI
client = OpenAI(
base_url="https://api.qdiv0.com/v1",
api_key="your-api-key",
)
response = client.chat.completions.create(
model="your-model",
messages=[
{"role": "user", "content": "Hello world"}
],
)Compute abstrae las decisiones de infraestructura para que te centres en tu producto. Empieza con un modelo y añade búsqueda, guardrails o routing cuando crezca la carga.