HeadlinesBriefing favicon HeadlinesBriefing.com

4BモデルがPostgresを44.7%上回る

Hacker News •
×

クエリオプティマイザは実際どの程度優れているのでしょうか?Leis et al.は2015年にこの問いを立て、10年後に再び問いました。10年にわたる研究にもかかわらず、クエリオプティマイザは依然として多くの改善の余地を残していることが判明しました。Postgresデータベースは自身のテーブルについてすべてを知っているはずでは?そんなに難しいことでしょうか?実際には、極めて困難であることがわかりました。結合順序の決定は重要なタスクですが、NP困難です。しかし、クエリプランの品質を検証するのはより簡単です。優れたオプティマイザは高速なプランを生成し、悪いものは低速なプランを生成します。

言語モデルは、出力が容易に検証できるタスクに優れています。実行時間という単一の軸があれば、問題はより高速なクエリプランを生み出す行動を強化することに還元されます。私は実験を行いました。小さなオープンウェイトモデルが、教師ありファインチューニング(SFT)とエージェント強化学習(RL)によるポストトレーニングを通じて、Postgresのデフォルトプランを上回るPostgresクエリプランを生成できるでしょうか?

答えは断固としてイエスです。ハイライト:当初99件のクエリプランを生成できなかった4Bモデルが、113の結合重視クエリにわたって44.7%のレイテンシ削減を達成。Linuxページキャッシュの競合ノイズを最小化するPostgres測定リグの構築。ノイズの多い環境でRLロールアウトをスコアリングするためのカスタムGRPOバリアントの設計。RLを2台のマシンに分割:vLLMとトレーナーはレンタルした2x H100ノード上、4つのPostgresコンテナは私のデスク上。500件のGPT-6 Astraエージェント軌跡にわたるオフポリシー蒸留の実行。

最初から始めましょう。クエリオプティマイザの内部で、IMDbデータセットを考えます。クエリは問います:「2000年代に最も多くのタイトルをリリースした日本の企業はどこか?」Postgresのパスは選択的述語に依存します。フィルタがない場合、結合順序が重要になります。

主要エンティティ:企業:Postgres、Hacker News | 人物:Leis | 場所:Japan

FAQ:小さな言語モデルはPostgresのデフォルトクエリオプティマイザを上回ることができますか?

はい、SFTとRLでポストトレーニングされた4Bモデルが、113の結合重視クエリで44.7%のレイテンシ削減を達成し、Postgresのデフォルトプランを上回りました。