Ornith-1.5-35B-A3B-GGUF: un MoE para código y agentes que corre en local
📌 TL;DR — Ornith-1.5-35B-A3B-GGUF es la versión cuantizada en formato GGUF de un modelo mixture-of-experts de 35B parámetros que solo activa ~3B por token durante la inferencia. Fue lanzado el 19 de agosto de 2026 bajo licencia MIT, junto a toda la familia Ornith-1.5. Está diseñado para tareas de código, razonamiento y agentes autónomos, y puede ejecutarse en infraestructura local con llama.cpp. Para empresas que quieren control sobre sus datos y reducir dependencia de APIs propietarias, merece una evaluación seria.
Qué es exactamente este modelo y por qué la nomenclatura importa
Cuando ves "35B-A3B" en el nombre, la cifra no es decorativa. Describe la arquitectura: 35 o 36 mil millones de parámetros totales, pero con solo aproximadamente 3 mil millones activos por token durante la inferencia [3][5][7][13]. Eso es lo que hace que un modelo mixture-of-experts (MoE) sea distinto de un modelo denso convencional.
En un modelo denso, todos los parámetros participan en cada predicción. En un MoE, la red aprende a enrutar cada token hacia un subconjunto de "expertos" especializados. El resultado práctico: el coste computacional de inferencia se aproxima al de un modelo de 3B, mientras que la capacidad de representación se acerca a la de uno de 35B. No es magia, pero sí una ventaja de ingeniería real cuando el hardware es el cuello de botella.
La familia Ornith-1.5 se lanzó el 19 de agosto de 2026 en tres tamaños: un modelo denso de 9B, el MoE de 35B con 3B activos (este), y un MoE de 397B [11][14][15]. Los tres se distribuyen con pesos abiertos y licencia MIT, lo que significa uso comercial sin restricciones de licencia.
El formato GGUF y por qué es la entrada para la mayoría
Los pesos de Ornith-1.5-35B-A3B se distribuyen en múltiples formatos: BF16, FP8, NVFP4, GGUF y MLX [5][11][15]. Cada uno apunta a un perfil de hardware distinto.
GGUF es el formato nativo de llama.cpp y sus derivados. Está pensado para inferencia en CPU, con soporte opcional de GPU parcial (offloading de capas). No necesitas una A100 ni una H100. Con suficiente RAM y, opcionalmente, una GPU de consumo, puedes ejecutar este modelo en un servidor propio, en un portátil de gama alta o en un entorno air-gapped sin conexión a internet.
El repositorio oficial de Ornith en Hugging Face [3] ofrece cuantizaciones Q4_K_M, Q5_K_M, Q6_K y Q8_0. La diferencia entre ellas es el equilibrio entre calidad de generación y uso de memoria:
- Q4_K_M: la opción más ligera. Máxima compresión, menor uso de RAM, algo de degradación en tareas complejas.
- Q5_K_M: buen equilibrio general. Recomendable como punto de partida.
- Q6_K: calidad cercana al original con un coste de memoria moderadamente mayor.
- Q8_0: cuantización mínima, la más fiel al modelo original en BF16, pero requiere más RAM.
Existen también repositorios derivados de la comunidad, como el de bartowski [8][9][12], que incluyen instrucciones específicas de descarga selectiva y guías de VRAM por cuantización. La adopción activa en la comunidad de modelos locales es una señal positiva: hay documentación real, no solo la oficial.
Para qué está optimizado y qué dicen los benchmarks
Ornith-1.5-35B-A3B está diseñado específicamente para tres workloads: coding, razonamiento y tareas agentic [5][7][13]. No es un modelo generalista con pretensiones de todo. Esa especialización tiene consecuencias en cómo evaluarlo.
Según la cobertura especializada del lanzamiento, la familia Ornith-1.5 alcanza 86.1 en Terminal-Bench 2.1 [11][14][15], un benchmark orientado a tareas de terminal y agentes de línea de comandos. En comparativas de programación y agentes, se reporta que supera a modelos como Qwen 3.6-35B, Gemma 4-31B y Muse Glimmer-30B [5][7][13].
Aquí viene la matización que importa: estas comparativas se basan en benchmarks concretos y públicos. No hay todavía un consenso amplio en la industria sobre el rendimiento de Ornith-1.5 en producción real, ni sobre el impacto de sus estrategias de entrenamiento fuera de entornos controlados [2][5][7][11][13]. Los benchmarks miden lo que miden. Tu repositorio de código, tu base de datos de tickets o tus flujos de automatización son un benchmark diferente.
La familia Ornith-1.5 adopta estrategias de self-improvement y self-scaffolding en su entrenamiento [2][13][14][15]. El proyecto las presenta como un diferencial frente a modelos propietarios de gama alta. Es una afirmación ambiciosa que merece verificación empírica en cada caso de uso.
"Ornith-1.5 positions itself as an open-source model comparable to high-end proprietary systems through self-improvement and self-scaffolding training strategies." — Ornith project communications [2][13]
Por qué le importa a una empresa española
El argumento para un empresario no es técnico, es operativo y económico.
Si hoy usas GPT-4o, Claude o Gemini para tareas de código interno, estás enviando contexto de tu negocio a infraestructura de terceros, pagando por token y dependiendo de la disponibilidad y política de precios de esos proveedores. Eso no es necesariamente malo, pero tiene un coste de dependencia que pocas empresas cuantifican.
Ornith-1.5-35B-A3B-GGUF, con licencia MIT [11][14][15], permite construir un asistente de programación interno, un agente de automatización o un bot de revisión de código que corre en tu propio servidor. Los datos no salen de tu red. El coste marginal por consulta es electricidad y amortización de hardware, no factura de API. Y si el modelo no encaja, puedes cambiarlo sin migrar contratos.
Eso no significa que sea la solución correcta para todos. Hay escenarios donde una API propietaria sigue siendo la opción más sensata: si no tienes equipo técnico para mantener la infraestructura, si el volumen de uso no justifica el hardware, o si necesitas capacidades multimodales que este modelo no cubre. Pero para empresas con datos sensibles, volumen alto de uso de código o necesidad de control, la ecuación cambia.
Lecciones accionables
1. Evalúalo como base para agentes de desarrollo interno
El foco explícito en coding y tareas agentic [5][11][13] lo hace candidato directo para code assistants internos, bots de revisión de pull requests o agentes que automatizan flujos de CI/CD. La licencia MIT permite uso comercial sin restricciones adicionales. El primer paso es definir qué tarea concreta quieres resolver antes de instalar nada.
2. Empieza con Q5_K_M y ajusta según hardware
No arranques con Q8_0 si no sabes cuánta RAM tienes disponible. Q5_K_M es un punto de partida razonable para la mayoría de servidores de gama media [3][9][12]. Mide latencia y calidad de respuesta en tus casos de uso reales, luego sube o baja la cuantización según los resultados. llama.cpp tiene documentación suficiente para hacer esto en menos de una tarde.
3. Benchmarks públicos como orientación, no como veredicto
Las comparativas frente a Qwen 3.6-35B, Gemma 4-31B o Muse Glimmer-30B [5][7][11][13] son útiles para saber en qué liga juega el modelo. Pero el único benchmark que importa para tu empresa es el rendimiento en tus propios datos y tareas. Diseña un conjunto de pruebas con ejemplos reales de tu repositorio o tus flujos antes de tomar una decisión de adopción.
4. Define una estrategia de formatos según el ciclo de vida
La disponibilidad en BF16, FP8, NVFP4, GGUF y MLX [5][11][15] no es solo comodidad de distribución. Permite una estrategia híbrida coherente: usa BF16 o FP8 en GPU para fine-tuning o evaluación de alta precisión, y despliega GGUF en CPU o edge para inferencia de producción donde el coste de GPU no se justifica. No tienes que elegir un único formato para todo el ciclo.
5. Monitoriza el ecosistema, no solo el modelo
La colección Ornith-1.5 en Hugging Face [1][10] se actualiza con frecuencia. La comunidad ya está generando repositorios derivados con guías de VRAM, instrucciones de descarga selectiva y servidores dedicados [8][9][12]. Eso reduce el coste de integración con el tiempo. Seguir esa evolución durante los próximos meses puede ahorrarte trabajo de ingeniería que otros ya habrán resuelto.
Lo que no sabemos todavía
Ser honesto sobre los límites es parte del análisis. A día de hoy no hay evidencia amplia de rendimiento de Ornith-1.5-35B-A3B en producción real fuera de benchmarks controlados [2][5][7][11][13]. Las afirmaciones sobre self-improvement y self-scaffolding son técnicamente plausibles pero no han sido verificadas de forma independiente a escala. Y el ecosistema, aunque activo, es joven: la familia se lanzó en agosto de 2026 y la madurez de herramientas, documentación y soporte comunitario seguirá creciendo.
Eso no invalida la propuesta, pero sí define el perfil de adopción adecuado: equipos técnicos con capacidad de evaluación propia, no organizaciones que necesitan una solución lista para producción sin fricción.
Conclusión
Ornith-1.5-35B-A3B-GGUF es un modelo con una propuesta técnica sólida: arquitectura MoE que reduce el coste de inferencia, especialización en código y agentes, licencia MIT sin restricciones comerciales, y un ecosistema de distribución que cubre desde GPU de datacenter hasta CPU local. Para empresas que quieren reducir dependencia de APIs propietarias y tienen datos que prefieren no externalizar, merece una evaluación real.
La evaluación real significa instalarlo, probarlo con tus propios casos de uso y medir. No significa confiar en los benchmarks públicos ni descartarlo por ser open-source. Los modelos open-weights de esta generación han cerrado la brecha con los propietarios en tareas específicas. La pregunta ya no es si son viables, sino cuáles encajan con qué problema.
Si estás valorando si Ornith-1.5-35B-A3B-GGUF u otro modelo local tiene sentido para tu caso concreto, cuéntame los detalles en /contacto. Puedo ayudarte a definir si la arquitectura, el hardware y el caso de uso encajan antes de que inviertas tiempo en una prueba de concepto.
Fuentes
- Ornith-1.5 — Collection — Hugging Face
- Ornith-1.5-35B-A3B: A Self-Improving MoE Model for Coding Agents — MindStudio
- ornith-ai/Ornith-1.5-35B-A3B-GGUF — Hugging Face
- ornith-ai/Ornith-1.5-35B-A3B-NVFP4 — Hugging Face
- bartowski/Ornith-1.5-35B-A3B-GGUF — Hugging Face
- Ornith releases Ornith-1.5 open weights under MIT — DataNorth
