Ejecuta modelos compatibles de Hugging Face.

Compute valida los requisitos del modelo y prepara la capacidad, el almacenamiento y la configuración del runtime detrás de una sola API. Elige un modelo, despliega y empieza a servirlo con capacidad activa.

QDivZero Compute platform dashboard

Del modelo a la API en tres pasos.

01

Elige un modelo

Escoge un modelo compatible de Hugging Face. El scheduling inteligente elimina la selección manual de GPU en despliegues estándar.

02

Compute lo despliega

El scheduler selecciona la capacidad óptima entre los proveedores disponibles. Runtime, red y escalado se aprovisionan automáticamente.

03

Llama al endpoint

Tu modelo queda expuesto como un endpoint compatible con OpenAI. Usa el SDK de Python o cualquier cliente HTTP compatible.

Precio por capacidad activa.

Usa una tarifa fijada al lanzar; el tiempo activo se factura por segundo. Añade capacidad cuando la necesites y detenla cuando no. El precio depende de la capacidad activa, no del número de usuarios; más tráfico puede requerir más capacidad.

Qwen 3.6 35B A3B MTP logo

Carga de trabajo de ejemplo

Qwen 3.6 35B A3B MTP

8 h/día · 20 días/mes

0,25 €/h

Comparación orientativa; benchmarks y contexto de precios disponibles bajo petición.

Estimación mensual40 €/mes

Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.

Qwen3-VL-Embedding-2B logo

Carga de trabajo de ejemplo

Qwen3-VL-Embedding-2B

8 h/día · 20 días/mes

0,10 €/h

Modelo de embeddings multimodal. Genera embeddings de texto e imágenes con un coste predecible.

Estimación mensual16 €/mes

Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.

DeepSeek V4 Flash logo

Carga de trabajo de ejemplo

DeepSeek V4 Flash

8 h/día · 20 días/mes

1,11 €/h

Comparación orientativa; benchmarks y contexto de precios disponibles bajo petición.

Estimación mensual178 €/mes

Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.

Kimi K2.6 logo

Carga de trabajo de ejemplo

Kimi K2.6

8 h/día · 20 días/mes

13 €/h

Comparación orientativa; benchmarks y contexto de precios disponibles bajo petición.

Estimación mensual2.080 €/mes

Calculado con 8 horas/día y 20 días laborables/mes. El coste real depende de tu patrón de uso y puede ser menor con reglas programadas de inicio y parada.

Estimaciones de proveedores externos

Equivalentes con precio por token.

Estimación orientativa; el coste real depende de la capacidad activa. Los proveedores externos se estiman con 15 M de tokens de entrada y 10 M de salida al mes. La salida suele ser la parte más cara.

Claude 3.7 Sonnet logo

Claude 3.7 Sonnet

200k context

$195.00
USD / mes de referencia
GPT-5.4 mini logo

GPT-5.4 mini

OpenAI fast tier

$56.25
USD / mes de referencia
GPT-5.5 logo

GPT-5.5

OpenAI standard tier

$375.00
USD / mes de referencia
Opus 4.7 logo

Opus 4.7

Anthropic reasoning tier

$975.00
USD / mes de referencia

El precio depende de la capacidad activa, no del número de usuarios; más tráfico puede requerir más capacidad.

Estimaciones orientativas; benchmarks y contexto de precios disponibles bajo petición. El precio depende de los recursos asignados.

¿Seguridad? Desde el principio.

Controles regionales, capacidad verificada y operaciones privadas por defecto para cargas de IA en producción. Añade Firewall cuando la política deba estar en la ruta de la petición.

  • Regiones

    Regiones de confianza

    Despliegues europeos para cargas sensibles al RGPD, con opción de desactivar servidores no verificados.

  • Runtime

    Runtime verificado

    Imágenes de runtime verificadas y controles de scheduling regional.

  • Privacidad

    Privado por defecto

    No almacenamos logs de conversaciones.

Arranca cuando empieza el trabajo. Para cuando termina.

Crea reglas cron para encender las instancias antes del tráfico y apagarlas después del horario de trabajo. Reduce la factura, evita consumo inactivo y mantén las operaciones previsibles.

  • Reduce la factura

    Paga solo mientras Compute está ejecutándose.

  • Reduce el consumo inactivo

    Evita que las GPU consuman energía por la noche o el fin de semana sin trabajo.

  • Mantén la capacidad lista

    Levanta las instancias antes de que empiecen los usuarios, jobs o jornadas de trabajo.

Reglas de inicio y parada basadas en el tiempo para esta instancia.

Activo

Acción

Iniciar

Zona horaria

UTC

Expresión cron

0 9 * * 1-5

Acción

Parar

Zona horaria

UTC

Expresión cron

0 19 * * 1-5

Qué incluye Compute.

Despliegue, routing, precios, seguridad, programación y compatibilidad con la API en un solo runtime.

Despliegue de modelos

Elige un modelo y deja que Compute valide los requisitos del runtime y prepare la capacidad para servirlo.

Routing multi-proveedor

El scheduler selecciona capacidad entre proveedores disponibles según coste, disponibilidad y latencia.

Almacenamiento persistente

Monta discos persistentes en varias cargas, compártelos entre lanzamientos y mantenlos conectados aunque Compute reprograme el workload en otro proveedor.

API compatible con OpenAI

Expón los modelos desplegados detrás del contrato estándar de OpenAI para que tus clientes actuales sigan funcionando.

Operaciones programadas

Usa reglas de inicio y parada basadas en cron para que las cargas funcionen cuando hace falta y permanezcan apagadas cuando no.

Precio por capacidad

Las instancias de Compute usan precio por capacidad activa; los Public Models mantienen el precio por token.

Controles de seguridad

Aplica controles regionales, comprobaciones del runtime y operaciones privadas por defecto para cargas en producción.

Servicio de almacenamiento

Discos persistentes que se mueven con Compute.

El almacenamiento da a Compute una capa de estado que no depende de un único proveedor. Monta el mismo disco en varias cargas, compártelo cuando un proceso necesite estado común y mantenlo disponible aunque el runtime termine en otro sitio. También sirve para checkpoints de fine-tuning, cachés de modelos y salidas de cuantización que necesitan espacio durable para arrancar más rápido.

El plano de control puede mover la instancia, pero el disco sigue al trabajo. Así las cargas con estado pueden moverse entre proveedores.

Comportamiento del almacenamiento

Un disco. Varios lanzamientos.

Discos persistentes

Mantén checkpoints, ejecuciones de fine-tuning, cachés de modelos y salidas de cuantización conectados a la carga entre lanzamientos.

Volúmenes compartidos

Monta un disco en varias cargas cuando un pipeline necesita la misma capa de estado.

Continuidad multi-proveedor

Si Compute mueve la carga de un proveedor a otro, la capa de almacenamiento la sigue.

SDK de OpenAI. Tus modelos. Nuestra infraestructura.

Apunta tu código compatible con OpenAI a QDivZero y ejecuta cargas de IA en producción sobre infraestructura con precio por capacidad.

Ver documentación
quickstart.py
from openai import OpenAI

client = OpenAI(
    base_url="https://api.qdiv0.com/v1",
    api_key="your-api-key",
)

response = client.chat.completions.create(
    model="your-model",
    messages=[
        {"role": "user", "content": "Hello world"}
    ],
)

Despliega un modelo compatible con el flujo de lanzamiento de Compute.

Compute abstrae las decisiones de infraestructura para que te centres en tu producto. Empieza con un modelo y añade búsqueda, guardrails o routing cuando crezca la carga.