HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-5.6 Luna vs GPT-6 Astra : Revue de code à 1,20 $

Hacker News •
×

GPT-5.6 Luna coûte 0,20 $ par million de tokens d'entrée et 1,20 $ par million de tokens de sortie. GPT-6 Astra coûte 10 $ et 50 $. Sur les mêmes pull requests, une revue Luna a coûté 0,0041 $ et une revue Astra a coûté 0,113 $, une différence de 28x. Luna a trouvé 69 bugs vérifiés sur 50 pull requests ; Astra en a trouvé 92. Luna a coûté 0,20 $ pour toute l'exécution et Astra a coûté 5,66 $. Luna s'est trompé plus souvent, avec 24 de ses 93 constatations échouant à la vérification contre 4 sur 96 pour Astra, et il a trouvé 9 des 24 bugs de sécurité là où Astra en a trouvé 19.

Notre lecture : Luna est suffisamment bon pour les bugs de correction quotidiens à ce prix, et nous ne le laisserions pas examiner le code d'authentification ou de permissions seul.

Nous avons réutilisé la configuration du post Astra vs Sol. Les pull requests sont les 50 PR de benchmark publics dans l'organisation AI-Code-Review-Evals, dix chacun de Cal.com, Sentry, Discourse, Keycloak et Grafana. Luna et Astra ont reçu le même prompt sur les mêmes diffs. Pour chaque pull request, les constatations d'Astra, Sol, Luna et les commentaires du réviseur public Entelligence vont dans une liste anonymisée. GPT-6 Astra et GPT-5.6 Sol jugent chacun cette liste séparément par rapport au diff. Un problème n'est compté comme vérifié que lorsque les deux juges le déclarent réel.

Luna a trouvé 75 % autant de bugs vérifiés qu'Astra pour 3,6 % de l'argent. Par bug vérifié, Astra a coûté 20x plus. Luna a écrit 3,1x plus de tokens de sortie par revue qu'Astra et est resté bien moins cher, car son prix de sortie est 42x inférieur. Il était aussi plus rapide, à 23 secondes par revue contre 36.

Entités clés : Entreprises : OpenAI, Cal.com, Sentry, Discourse, Keycloak, Grafana, Entelligence

FAQ : GPT-5.6 Luna est-il suffisamment bon pour la revue de code ?

Luna est suffisamment bon pour les bugs de correction quotidiens à son prix, mais il n'a trouvé que 9 des 24 bugs de sécurité et 24 de ses 93 constatations ont échoué à la vérification, donc il ne devrait pas examiner le code d'authentification ou de permissions seul.

Question FAQ : GPT-5.6 Luna est-il suffisamment bon pour la revue de code ?

Réponse FAQ : Luna est suffisamment bon pour les bugs de correction quotidiens à son prix, mais il n'a trouvé que 9 des 24 bugs de sécurité et 24 de ses 93 constatations ont échoué à la vérification, donc il ne devrait pas examiner le code d'authentification ou de permissions seul.