HeadlinesBriefing HeadlinesBriefing.com

Ornith-1.5: Model Dasar Mandiri

Hacker News •
×

Ornith-1.5 mewakili kemajuan besar menuju model dasar yang dapat memperbaiki diri secara menyeluruh. Berdasarkan kerangka kerja penyeimbang sendiri dari Ornith-1.0, Ornith-1.5 membentuk loop lengkap untuk perbaikan diri di mana model mencadangkan tugas baru, menghasilkan scaffold khusus tugas, dan menghasilkan rollout solusi untuk pembelajaran penguatan. Siklus berkelanjutan ini menciptakan pengalaman belajar baru yang mendorong peningkatan kemampuan yang berkelanjutan.

Sistem ini mencakup tiga skala model: 397B MoE, 35B MoE, dan 9B Dense. Model andalan Ornith-1.5-397B mencapai kinerja terbaik di antara model sumber terbuka dengan ukuran yang setara, mendapatkan 86.1 pada Terminal-Bench 2.1 dan 56.0 pada Deep SWE. Hasil-hasil ini sesuai dengan Claude Opus 4.8 (85.0 dan 59.0) sementara mengalah dari model sumber terbuka terkemuka seperti GLM-5.2 dan Deep Seek-V4-Flash-0731.

Di ujung yang lebih kecil, Ornith-1.5-9B memberikan hasil yang sangat kuat untuk ukurannya, mencapai 47.0 pada Terminal-Bench 2.1 dan 70.6 pada SWE-Bench Verified. Versi terkuantisasinya Ornith-1.5-9B-Mobile dapat diterapkan langsung pada perangkat iPhone dan Android sementara secara signifikan mengalah dari model yang lebih besar seperti Gemma 4-31B dan Qwen 3.6-35B.

Alih-alih bergantung pada distribusi pelatihan statis atau desain agen yang dihasilkan secara manual, Ornith-1.5 terus memperluas kurikulumnya sendiri dan menyesuaikan strategi pemecahan masalah melalui loop penyempurnaan diri yang tertutup melibatkan generasi tugas, konstruksi scaffold, dan rollout solusi.

Entitas Kunci: Perusahaan: Anthropic, Google, Meta, Zhipu AI, DeepSeek

Sumber: Hacker News · Diringkas oleh HeadlinesBriefing