HeadlinesBriefing favicon HeadlinesBriefing.com

Automatisation des Tests Pilotée par les Spécifications : Exécution et Correction Réelles

Towards Data Science •
×

La partie 2 suit une exécution réelle de test utilisant le framework qikly, où un agent de test indépendant détecte une faille que l'agent de codification a manquée. La tâche : vérifier l'écartement du radar et avertir s'il est inférieur à deux secondes. L'agent de codification, travaillant uniquement à partir des exigences, a autorisé un écart de zéro mètre—non valide selon des critères de test invisibles.

Après un test échoué, il a corrigé le code en changeant un seul caractère, resserrant la borne inférieure uniquement en raison du test caché, pas des règles explicites. Cela a pris moins d'une minute et moins de dix appels au modèle. La première version de la spécification avertissait de manière ambiguë sous 'la règle des deux secondes', laissant exactement 2,00 secondes non résolues.

Sur dix exécutions, seules trois ont convergé ; sept ont échoué en raison d'une mauvaise interprétation de l'ambiguïté. Cela prouve que les suites vertes peuvent être trompeuses si les vérificateurs ne sont pas indépendants—faisant écho à la règle Super Cruise de GM : les constructeurs ne doivent pas vérifier leur propre travail. Les critères cachés créent une fausse confiance ; seuls les flux de travail avec agents séparés révèlent la vraie correction.