HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-5.6 Luna 対 GPT-6 Astra:1.20ドルのコードレビュー

Hacker News •
×

GPT-5.6 Lunaは100万入力トークンあたり0.20ドル、100万出力トークンあたり1.20ドルです。GPT-6 Astraは10ドルと50ドルです。同じpull requestで、Lunaのレビュー1回は0.0041ドル、Astraのレビュー1回は0.113ドルで、28倍の差でした。Lunaは50のpull requestで69の検証済みバグを見つけました。Astraは92でした。Lunaは実行全体で0.20ドル、Astraは5.66ドルでした。Lunaはより頻繁に間違い、93件の指摘のうち24件が検証に失敗したのに対し、Astraは96件中4件でした。また、24件のセキュリティバグのうちLunaは9件を見つけ、Astraは19件を見つけました。

私たちの見解:Lunaはその価格で日常的な正確性バグには十分であり、認証や権限のコードを単独でレビューさせるべきではありません。

私たちはAstra対Solの記事の設定を再利用しました。pull requestはAI-Code-Review-Evals組織の50の公開ベンチマークPRで、Cal.com、Sentry、Discourse、Keycloak、Grafanaからそれぞれ10件です。LunaとAstraは同じdiffで同じプロンプトを受け取りました。各pull requestについて、Astra、Sol、Lunaからの指摘と公開のEntelligenceレビュアーのコメントが1つの匿名化されたリストに入ります。GPT-6 AstraとGPT-5.6 Solがそれぞれそのリストをdiffに対して個別に判定します。問題は両方の判定者が本物と認めた場合にのみ検証済みと数えられます。

LunaはAstraの75%の検証済みバグを3.6%の費用で見つけました。検証済みバグあたりでは、Astraは20倍の費用がかかりました。LunaはレビューあたりAstraの3.1倍の出力トークンを書き、それでもはるかに安く済みました。出力価格が42倍低いからです。また、レビューあたり23秒で、36秒のAstraより速かったです。

主要エンティティ:企業:OpenAI、Cal.com、Sentry、Discourse、Keycloak、Grafana、Entelligence

FAQ:GPT-5.6 Lunaはコードレビューに十分ですか?

Lunaはその価格で日常的な正確性バグには十分ですが、24件のセキュリティバグのうち9件しか見つけられず、93件の指摘のうち24件が検証に失敗したため、認証や権限のコードを単独でレビューさせるべきではありません。

FAQ質問:GPT-5.6 Lunaはコードレビューに十分ですか?

FAQ回答:Lunaはその価格で日常的な正確性バグには十分ですが、24件のセキュリティバグのうち9件しか見つけられず、93件の指摘のうち24件が検証に失敗したため、認証や権限のコードを単独でレビューさせるべきではありません。