HeadlinesBriefing favicon HeadlinesBriefing.com

ラヤ:33msオープンマルチリンガル意思決定エンジン

Hacker News •
×

著者は ラヤ の開発について詳細に説明しています。ラヤは単一GPUで 32.8 ms のレイテンシーを達成するマルチリンガルシステム1意思決定エンジンであり、Type Safe AI の proprietary モデルである Jev よりも高速でオープンソースの代替手段として位置づけられています。著者は 2025年3月 (arXiv:2503.23303) まで遡る先行技術を主張しており、これには Hugging Face 上のモデル、データセット、およびPyPIパッケージが含まれ、Type Safe AI の2026年9月のリリースより前に存在しています。ラヤの創設者である Diogo AlmeidaOpenAIChatGPT の共同発明者であり、Type Safe AIRLCD(キャリブレーションされた意思決定のための強化学習)を $0.042 per 百万トークン、150 ms のレイテンシーで発表しました。

ラヤは、ルーティング、スパム検出、緊急度スコアリングなどの単純な分類タスクに生成LLMを使用することによるボトルネック(レイテンシー500–2000 ms、コスト増加、幻覚リスク)を解決します。代わりに、ラヤは双方向エンコーダを使用して、3つのプリミティブを介して瞬時にキャリブレートされた確率出力を提供します:choice(カテゴリ選択)、score(順序ルーブリック配置)、および noul(ヌル/棄権検出)。

ラヤモデルファミリーは 100以上の言語 をサポートし、バッチ処理時に 7.2 ms/質問 で動作し、APIサブスクリプションは不要で、重みは Apache 2.0 ライセンスでリリースされています。著者はラヤを、以前の作業におけるアーキテクチャの制限を修正する集大成とし、垂直販売軌道から水平で一般化されたスキーマ意思決定への移行として位置づけています。

主要エンティティ: 企業: Type Safe AI, OpenAI, Hugging Face | 人物: Diogo Almeida