Ornith-1.5 representa un avance importante hacia modelos base de auto-mejora completa. Basándose en el marco de auto-estructuración de Ornith-1.0, Ornith-1.5 establece un bucle completo de auto-mejora donde el modelo propone nuevas tareas, genera andamios específicos para cada tarea y produce despliegues de soluciones para el aprendizaje por refuerzo. Este ciclo continuo crea nuevas experiencias de aprendizaje que impulsan mejoras de capacidad sostenidas.
El sistema abarca tres escalas de modelo: 397B MoE, 35B MoE y 9B Dense. El modelo insignia Ornith-1.5-397B logra un rendimiento de vanguardia entre modelos de código abierto de tamaño comparable, obteniendo 86.1 en Terminal-Bench 2.1 y 56.0 en Deep SWE. Estos resultados coinciden con Claude Opus 4.8 (85.0 y 59.0) mientras supera a modelos de código abierto líderes como GLM-5.2 y Deep Seek-V4-Flash-0731.
En el extremo más pequeño, Ornith-1.5-9B ofrece resultados notablemente sólidos para su tamaño, alcanzando 47.0 en Terminal-Bench 2.1 y 70.6 en SWE-Bench Verified. Su versión cuantizada Ornith-1.5-9B-Mobile puede implementarse directamente en dispositivos iPhone y Android, superando ampliamente a modelos más grandes como Gemma 4-31B y Qwen 3.6-35B.
En lugar de depender de distribuciones de entrenamiento estáticas o diseños de agentes manualmente ingenierizados, Ornith-1.5 expande continuamente su propio currículo y adapta las estrategias de resolución de problemas a través de un bucle cerrado de auto-mejora que involucra generación de tareas, construcción de andamios y despliegues de soluciones.
Entidades clave: Empresas: Anthropic, Google, Meta, Zhipu AI, DeepSeek
Fuente: Hacker News · Resumido por HeadlinesBriefing