random-moe-pruning: poda de expertos sin datos de calibración para checkpoints de mezcla de expertos

Publicado el 17 de junio de 2026 por José Carlos García Ortega3 min de lectura

Explora la investigación publicada

Leer la investigación
random-moe-pruning: poda de expertos sin datos de calibración para checkpoints de mezcla de expertos

random-moe-pruning es un proyecto de investigación de Valendra para aplicar poda de expertos a checkpoints de mezcla de expertos alojados en Hugging Face Hub.

La idea principal es sencilla: eliminar los expertos que el enrutador tiene menos probabilidades de utilizar, sin necesitar un conjunto de datos de calibración, inferencia en GPU ni reentrenamiento.

La versión actual se ha validado con la familia GPT-OSS, aunque el método está diseñado para funcionar con cualquier arquitectura MoE.

Qué hace

El procedimiento recorre las capas MoE de un checkpoint, puntúa cada experto según la respuesta del enrutador a muestras gaussianas aleatorias y reescribe los fragmentos safetensors, conservando únicamente los expertos que el enrutador tiene más probabilidades de utilizar.

El resultado es un checkpoint derivado más pequeño que mantiene la arquitectura general, el tokenizador y la plantilla de chat del modelo base, y que puede cargarse directamente mediante la API estándar de transformers.

Como el procedimiento solo necesita los pesos del enrutador, la escala RMSNorm anterior a las capas MoE y los propios tensores de los expertos, puede ejecutarse en un equipo convencional, sin GPU ni conjunto de datos de calibración.

Checkpoints publicados

Los checkpoints experimentales publicados a partir de este trabajo son:

Son variantes podadas de GPT-OSS concebidas como proyectos reproducibles para estudiar el efecto de reducir el número de expertos por capa en modelos de distintos tamaños. No pretenden sustituir a los checkpoints base ni presentarse como modelos listos para producción.

Por qué es importante

La poda de expertos ofrece a los equipos una forma práctica de estudiar el equilibrio entre el tamaño del modelo, el uso de memoria y el coste de inferencia sin tener que reentrenar el modelo completo.

En despliegues de IA reales, las decisiones de infraestructura, la operación de los modelos y el control de costes deben abordarse de forma conjunta. Este trabajo se ha desarrollado como una implementación pequeña y auditable que puede integrarse en procesos que ya utilizan checkpoints de Hugging Face.

El objetivo es deliberadamente concreto: conseguir que la poda de expertos sea fácil de reproducir, inspeccionar y ejecutar en local.

Limitaciones

Se trata de un proyecto de investigación, no de una receta para producción. La calidad de cada checkpoint podado debe evaluarse de forma individual frente a su modelo base.

La versión actual solo se ha validado con la familia GPT-OSS. El método está diseñado para funcionar con cualquier arquitectura de mezcla de expertos, pero no debe darse por hecho que sea compatible con otras familias hasta que se haya probado y documentado expresamente.

Próximos pasos

Las líneas de trabajo más relevantes son:

  • Evaluar los checkpoints publicados. Medir su calidad, latencia y uso de memoria frente a los modelos base.
  • Reforzar la compatibilidad con GPT-OSS. Consolidar la compatibilidad actual antes de ampliarla a otras familias MoE.
  • Explorar otras estrategias de poda. Investigar si otros métodos de puntuación o heurísticas mejoran la calidad de los checkpoints podados.
  • Ampliar el método a otras familias MoE. Cuando la compatibilidad con GPT-OSS sea estable, adaptar el enfoque a otras arquitecturas de mezcla de expertos.