Ornith-1.5 représente une avancée majeure vers les modèles de fondation auto-améliorants. S'appuyant sur le cadre d'auto-échafaudage d'Ornith-1.0, Ornith-1.5 établit une boucle complète d'auto-amélioration où le modèle propose de nouvelles tâches, génère des échafaudages spécifiques aux tâches et produit des déploiements de solutions pour l'apprentissage par renforcement. Ce cycle continu crée de nouvelles expériences d'apprentissage qui stimulent des gains de capacité durables.
Le système couvre trois échelles de modèle : 397B MoE, 35B MoE et 9B Dense. Le modèle phare Ornith-1.5-397B obtient les performances les meilleures de son genre parmi les modèles open source de taille comparable, obtenant 86.1 sur Terminal-Bench 2.1 et 56.0 sur Deep SWE. Ces résultats correspondent à Claude Opus 4.8 (85.0 et 59.0) tout en surpassant les modèles open source majeurs comme GLM-5.2 et Deep Seek-V4-Flash-0731.
Du côté plus petit, Ornith-1.5-9B offre des résultats remarquablement solides pour sa taille, obtenant 47.0 sur Terminal-Bench 2.1 et 70.6 sur SWE-Bench Verified. Sa version quantifiée Ornith-1.5-9B-Mobile peut être déployée directement sur des appareils iPhone et Android tout en surpassant largement des modèles plus grands comme Gemma 4-31B et Qwen 3.6-35B.
Plutôt que de s'appuyer sur des distributions d'entraînement statiques ou sur un design d'agents manuellement conçu, Ornith-1.5 continue d'étendre son propre programme et s'adapte aux stratégies de résolution de problèmes à travers une boucle d'auto-amélioration fermée impliquant la génération de tâches, la construction d'échafaudages et les déploiements de solutions.
Entités clés : Entreprises : Anthropic, Google, Meta, Zhipu AI, DeepSeek
Source: Hacker News · Résumé par HeadlinesBriefing