Sherry 35B 0.1: razonamiento controlable para código, análisis y tareas difíciles

Publicado el 19 de septiembre de 2026 por José Carlos García Ortega7 min de lectura

Prueba QDivZero en acción

Crea tu cuenta
Sherry 35B 0.1: razonamiento controlable para código, análisis y tareas difíciles

Hoy publicamos Sherry 35B-A3B 0.1 GRPO Preview: un modelo de razonamiento construido a partir de Qwen/Qwen3.6-35B-A3B con una incorporación práctica. Puedes decirle cuánto esfuerzo debe dedicar a cada petición.

Sherry ofrece tres niveles de razonamiento: low, medium y high. Así, una aplicación puede equilibrar calidad de respuesta, latencia y coste en tokens sin cambiar de modelo ni imponer el mismo presupuesto de pensamiento a todos los prompts.

El checkpoint preview está disponible en Hugging Face. En este artículo explicamos qué ha mejorado, para qué encaja Sherry y cómo hemos entrenado este comportamiento.

Qué mejora Sherry

Volvimos a ejecutar el modelo base y Sherry con el mismo harness interno: prompts idénticos, servicio BF16 con vLLM, decodificación greedy, una generación por problema y los mismos presupuestos de completion. Los resultados comparan el modelo base con Sherry usando reasoning_effort=high.

BenchmarkBaseSherry, esfuerzo altoDelta
MATH-500, math_verify88,3%97,1%+9,4 puntos
GPQA-Diamond57,1%78,3%+21,2 puntos
Suite básica de Python75,0%97,5%+22,5 puntos
AIME 2025*63,3%50,0%-13,3 puntos

Tres resultados son claramente positivos en esta comparación. Sherry es más fiable en matemáticas simbólicas con math_verify, responde mejor a preguntas difíciles de ciencia y conocimiento, y supera más tareas de Python de nuestra suite básica.

La mejora de eficiencia es igual de importante. En GPQA-Diamond, Sherry utilizó una media de 7,5k tokens de completion frente a los 20,0k del modelo base. Agotó el presupuesto de 32.768 tokens en el 3,5% de los problemas, frente al 27,8% del base. En esta prueba, la preview no solo responde correctamente a más preguntas: también utiliza su presupuesto de razonamiento de forma más predecible.

Hay un resultado que no queremos ocultar, con una advertencia importante. Sherry obtuvo un 50,0% en AIME 2025 frente al 63,3% del modelo base, pero estamos revisando si el test actual de AIME o su proceso de normalización de respuestas contiene un problema. Hasta completar esa revisión, el resultado debe considerarse una señal pendiente de validar, no una regresión definitiva. En cualquier caso, no debemos presentar esta preview como un modelo especializado en matemáticas de competición.

La comparación de AIME está en revisión porque el test de evaluación o la normalización de respuestas podría contener un error.

Tres mejoras claras. AIME sigue en revisión.

Sherry con esfuerzo alto frente a Qwen3.6-35B-A3B · mismos prompts, decodificación y presupuestos. * AIME 2025 sigue en revisión.

* AIME 2025 sigue en revisión.
Tres mejoras claras. AIME sigue en revisión.
BenchmarkBaseSherryDelta
MATH-500 · math_verify88.3%97.1%+9,4 puntos
GPQA-Diamond57.1%78.3%+21,2 puntos
Suite básica de Python75%97.5%+22,5 puntos
AIME 2025*63.3%50%EN REVISIÓN

Para qué encaja Sherry

Sherry encaja cuando la aplicación necesita un modelo capaz de razonar un problema sin hacer que cada petición pague el coste máximo.

  • Generación y depuración de código. La suite de Python pasó del 75,0% al 97,5% en nuestra ejecución controlada. Usa medium para implementar con normalidad y high cuando una tarea necesite depuración o planificación más profundas.
  • Análisis técnico y científico. GPQA-Diamond mejoró 21,2 puntos. Es el tipo de trabajo en el que unos pasos adicionales de razonamiento pueden convertir una respuesta incompleta en una respuesta útil.
  • Razonamiento estructurado de varios pasos. MATH-500 alcanzó el 97,1% con math_verify, así que Sherry resulta útil para tareas cuantitativas generales cuyo resultado pueda comprobarse.
  • Agentes con presupuesto controlado. Un agente puede usar low para routing y transformaciones sencillas, medium para llamadas de herramientas normales y high solo cuando la tarea justifica un presupuesto mayor.

Los niveles son una superficie de control, no una promesa de que todos los problemas serán más fáciles. low sirve para respuestas breves y focalizadas. medium es un buen punto de partida para el razonamiento normal. high deja al modelo explorar y es el nivel utilizado en la comparación de benchmarks.

Cómo se usa el control

La plantilla de chat publicada acepta un argumento reasoning_effort. En un despliegue compatible con OpenAI, el nivel se pasa mediante chat_template_kwargs:

1{
2  "model": "valendra/sherry-35b-a3b-0.1-grpo-preview",
3  "messages": [
4    {
5      "role": "user",
6      "content": "Revisa esta función y encuentra sus casos límite."
7    }
8  ],
9  "chat_template_kwargs": {
10    "reasoning_effort": "medium"
11  }
12}
13

La interfaz se apoya en tres tokens específicos del modelo:

1<|reasoning_effort_low|>
2<|reasoning_effort_medium|>
3<|reasoning_effort_high|>
4

Se emiten justo antes del bloque de pensamiento. Si omites reasoning_effort, se conserva el comportamiento de la plantilla base; el control de esfuerzo es opcional.

Cómo construimos los datos de entrenamiento

Las etiquetas de esfuerzo proceden de un dataset de self-distillation que publicamos junto al modelo: Sherry Reasoning Effort Dataset 0.1.

Tomamos problemas con respuesta numérica de NuminaMath-CoT y utilizamos Qwen3.6-35B-A3B-NVFP4-Fast mediante una API compatible con OpenAI para generar varias soluciones candidatas por problema. La configuración de generación buscaba profundidades de razonamiento diferentes, incluyendo soluciones más largas para los problemas difíciles.

Para cada problema comprobamos la respuesta final contra la verdad de referencia. Descartamos las candidatas incorrectas o truncadas. Entre las trazas verificadas, la más corta se convirtió en low, la mediana en medium y la más larga en high, según el número observado de tokens de pensamiento. Las etiquetas describen la profundidad medida del razonamiento; no son tres prompts distintos que el modelo ya suponga entender.

El dataset publicado contiene 2.061 filas verificadas. Cada fila incluye el problema, la fuente, la traza de pensamiento, el número de tokens de pensamiento, la respuesta final, la respuesta predicha, la verdad de referencia, la correctitud, el motivo de finalización y el nivel de esfuerzo asignado. Está pensado para fine-tuning supervisado y para estudiar el control del esfuerzo de razonamiento.

Cómo entrenamos Sherry

El entrenamiento tuvo dos etapas.

1. SFT para enseñar la interfaz

Usamos 1.854 trazas verificadas para el ajuste supervisado y reservamos 207 filas. El SFT enseñó al modelo a respetar la etiqueta de esfuerzo, producir una traza con la profundidad correspondiente, cerrar el bloque de pensamiento y devolver una respuesta final parseable.

El Sherry 35B-A3B 0.1 SFT Preview intermedio también es público como adaptador PEFT LoRA. Se carga sobre Qwen/Qwen3.6-35B-A3B; no es un conjunto independiente de pesos. La preview GRPO siguiente es el checkpoint BF16 fusionado utilizado para la comparación publicada.

2. GRPO para optimizar el comportamiento

Después ejecutamos GRPO durante 200 pasos, con cuatro generaciones por problema y nivel de esfuerzo. El reward priorizaba deliberadamente la correctitud:

ComponenteSeñal
Correctitud+2,0 por coincidencia numérica exacta
Correctitud parcialSeñal acotada de casi-acierto de hasta +0,05
Estructura+0,20 si el bloque se cierra y la respuesta es parseable; −0,20 si falta el límite, la respuesta o el completion se trunca
Longitud low/mediumBonus acotado por mantenerse cerca del rango objetivo y penalización por exceso
Longitud highSin penalización por longitud; el esfuerzo alto puede pensar más

Así evitamos que el modelo obtenga reward escribiendo explicaciones largas pero incorrectas. También hacemos que los niveles se comporten de forma diferente: low y medium se ajustan hacia presupuestos útiles, mientras que high no recibe una penalización por utilizar el espacio de razonamiento que necesita un problema difícil.

El adaptador final usa LoRA/QLoRA de rango 32 y se fusiona en el checkpoint BF16 preview publicado.

Coste de entrenamiento: aproximadamente 200 USD de cómputo para esta ejecución. Es un coste aproximado de este run, no un precio de inferencia ni una estimación universal para entrenar otro modelo.

SHERRY 35B 0.1 / RECETA DE ENTRENAMIENTO

De trazas verificadas a razonamiento controlable

  1. 01

    PROBLEMAS

    NuminaMath-CoT respuestas numéricas

  2. 02

    SELF-DISTILL

    3 trazas correctas ordenadas por tokens low / medium / high

  3. 03

    SFT

    1.854 filas 207 reservadas LoRA rango 32

  4. 04

    GRPO

    200 pasos 4 rollouts prioridad: correctitud

  5. 05

    PUBLICADO

    BF16 fusionado Sherry 35B-A3B preview 0.1

Aprox. US$200 de cómputo para esta ejecución

Las trazas incorrectas y truncadas se descartaron antes del SFT. El esfuerzo high no se penaliza por razonar más.

Limitaciones actuales

  • Estado de preview. Sherry 35B-A3B 0.1 se evaluó en una única ejecución interna controlada, no es una afirmación de leaderboard.
  • Datos de entrenamiento. Los datos proceden de NuminaMath-CoT, así que MATH-500 y AIME 2025 pueden estar contaminados. Trata esas cifras como un techo.
  • AIME 2025. La comparación está en revisión porque el test de evaluación o la normalización de respuestas podría contener un problema. Hasta completar esa revisión, trátala como una señal pendiente de validar y no presentes esta preview como especialista en matemáticas de competición.
  • GPQA-Diamond. Utiliza un mirror público porque el dataset oficial está restringido.
  • Protocolo de comparación. El modelo base está limitado por presupuesto en este protocolo y sus resultados publicados usan otros parámetros de muestreo. La tabla anterior es la comparación relevante porque ambos modelos se ejecutaron con el mismo harness.
  • Reward. El valor del reward es una señal de entrenamiento, no una puntuación de accuracy.

Prueba Sherry

La preview GRPO de Sherry 35B-A3B 0.1 y su dataset de self-distillation son públicos. Para ejecutar un modelo con distintas profundidades de razonamiento detrás de una interfaz compatible con OpenAI, empieza con medium, usa high para análisis más difíciles y valida las respuestas con tu propia carga de trabajo.

Despliega Sherry dentro de QDivZero

Sherry también puede desplegarse dentro de QDivZero. Ejecuta el checkpoint publicado de Hugging Face en Compute gestionado, expónlo mediante un endpoint compatible con OpenAI y conserva reasoning_effort como control por petición mientras QDivZero gestiona la infraestructura.

Desplegar Sherry en QDivZero Compute