Towards Spec-Driven Test Automation: Part 2
🇬🇧 English
Part 2 follows a real test run using the qikly framework, where an independent testing agent catches a flaw the coding agent missed. The task: check radar headway and warn if under two seconds. The coding agent, working only from requirements, allowed a zero-metre gap—invalid per unseen test criteria.
After one failed test, it patched the code by changing one character, tightening the lower bound solely due to the hidden test, not explicit rules. This took under a minute and fewer than ten model calls. The first spec version ambiguously warned under 'the two-second rule', leaving exactly 2.00 seconds unresolved.
Across ten runs, only three converged; seven failed due to misinterpreted ambiguity. This proves that green suites can mislead if verifiers aren't independent—echoing GM's Super Cruise rule: builders must not verify their own work. Hidden criteria create false confidence; only split-agent workflows reveal true correctness.
🇸🇦 العربية
الأتمتة المبنية على المواصفات للاختبار: التشغيل الحقيقي والإصلاح
الجزء الثاني يتبع تشغيل اختبار حقيقي باستخدام إطار عمل qikly، حيث يكتسب وكيل اختبار مستقل عيبًا فاته وكيل الترميز. المهمة: فحص مسافة headway للرادار وتحذير إذا كانت أقل من ثانيتين. وكيل الترميز، الذي يعمل فقط من المتطلبات، سمح بفجوة صفر متر—غير صالحة وفقًا لمعايير اختبار غير مرئية. بعد اختبار فاشل، عدل الكود بتغيير حرف واحد، وشدد الحد الأدنى فقط بسبب الاختبار المخفي، وليس القواعد الصريحة. استغرق ذلك أقل من دقيقة وأقل من عشر استدعاءات للنموذج. أول نسخة من المواصفات حذرت بشكل غامض تحت 'قاعدة ثانيتين'، تاركة exatamente 2.00 ثانية دون حل. عبر عشرة تشغيلات، تقارب فقط ثلاث؛ سبعة فشلت بسبب تفسير خاطئ للغموض. هذا يثبت أن المجموعات الخضراء يمكن أن تضلل إذا لم يكن المدققون مستقلين—معكوسًا لقاعدة سوبر كروز من جنرال موتورز: البناؤون يجب ألا يتحققوا من عملهم الخاص. المعايير المخفية تخلق ثقة زائفة؛ فقط سير عمل الوكيل المنفصل يكشف عن الصواب الحقيقي.
لماذا يمنع التحقق المستقل الثقة الزائفة في أتمتة الاختبار؟
عندما يتحقق البناؤون من عملهم الخاص، قد يلبون المتطلبات الغامضة بشكل خاطئ. وكيلو الاختبار المستقلون، غير مدركين للتنفيذ، يكشفون المعايير المخفية—مثل رفض فجوة الصفر متر—مما يضمن أن الصواب ليس ذاتيًا التحقق منه، بل مثبتًا حقًا.
🇧🇩 বাংলা
বিনिর্দেশ-চালিত টেস্ট অটোমেশন: বাস্তব রান এবং ফিক্স
অংশ 2 qikly ফ্রেমওয়ার্ক ব্যবহার করে একটি বাস্তব টেস্ট রান অনুসরণ করে, যেখানে একটি স্বাধীন টেস্টিং এজেন্ট কোডিং এজেন্ট দ্বারা চুকে গেল একটি ত্রুটিকে ধরে। কাজ: রডার হেডওয়ে পরীক্ষা করুন এবং যদি এটি দুটি সেকেন্ডের কম হয় তবে সতর্ক করুন। কোডিং এজেন্ট, শুধুমাত্র প্রয়োজনীয়তাগুলো থেকে কাজ করে, শূন্য-মিটার ফাঁক অনুমতি দিল—দৃশ্য না থাকা টেস্ট মানদণ্ডের অনুযায়ী অবৈধ। একটি ব্যর্থ টেস্টের পর, এটি একটি অক্ষর পরিবর্তন করে কোডকে প্যাচ করে মেরে দিল, শুধুমাত্র লুকানো টেস্টের কারণে নিম্ন সীমা কসিয়ে দিল, স্পষ্ট নিয়মের নয়। এটি এক মিনিটের কম সময়ে এবং দশ মডেল কলের কমে সম্পন্ন হয়। প্রথম স্পেসিফিকেশন সংস্করণ 'দুই-সেকেন্ড নিয়ম' এর তহত অস্পষ্টভাবে চेतাবনি দিল, যার ফলে genau 2.00 সেকেন্ডের ক্ষেত্রটি সমাধান নেই। দশ রানে, শুধুমাত্র তিনটি সমন্বিত
🇪🇸 Español
Automatización de Pruebas Impulsada por Especificaciones: Ejecución y Corrección Reales
La Parte 2 sigue una ejecución real de pruebas utilizando el framework qikly, donde un agente de prueba independiente detecta un fallo que el agente de codificación pasó por alto. La tarea: verificar el adelantamiento del radar y advertir si es inferior a dos segundos. El agente de codificación, trabajando solo desde los requisitos, permitió un espacio de cero metros—inválido según criterios de prueba no vistos.
Tras una prueba fallida, parcheó el código cambiando un solo carácter, apretando el límite inferior únicamente debido a la prueba oculta, no a reglas explícitas. Esto tomó menos de un minuto y menos de diez llamadas al modelo. La primera versión de la especificación advirtió ambigua mente bajo 'la regla de los dos segundos', dejando exactamente 2.00 segundos sin resolver.
En diez ejecuciones, solo tres convergieron; siete fallaron debido a una mala interpretación de la ambigüedad. Esto demuestra que las suites verdes pueden engañar si los verificadores no son independientes—eco de la regla de Super Cruise de GM: los constructores no deben verificar su propio trabajo. Los criterios ocultos generan falsa confianza; solo los flujos de trabajo con agentes separados revelan la verdadera corrección.
¿Por qué la verificación independiente evita la falsa confianza en la automatización de pruebas?
Cuando los constructores verifican su propio trabajo, pueden satisfacer incorrectamente requisitos ambiguos. Los agentes de prueba independientes, desconocedores de la implementación, exponen criterios ocultos—como rechazar espacios de cero metros—garantizando que la corrección no sea auto-validada, sino realmente probada.
🇫🇷 Français
Automatisation des Tests Pilotée par les Spécifications : Exécution et Correction Réelles
La partie 2 suit une exécution réelle de test utilisant le framework qikly, où un agent de test indépendant détecte une faille que l'agent de codification a manquée. La tâche : vérifier l'écartement du radar et avertir s'il est inférieur à deux secondes. L'agent de codification, travaillant uniquement à partir des exigences, a autorisé un écart de zéro mètre—non valide selon des critères de test invisibles.
Après un test échoué, il a corrigé le code en changeant un seul caractère, resserrant la borne inférieure uniquement en raison du test caché, pas des règles explicites. Cela a pris moins d'une minute et moins de dix appels au modèle. La première version de la spécification avertissait de manière ambiguë sous 'la règle des deux secondes', laissant exactement 2,00 secondes non résolues.
Sur dix exécutions, seules trois ont convergé ; sept ont échoué en raison d'une mauvaise interprétation de l'ambiguïté. Cela prouve que les suites vertes peuvent être trompeuses si les vérificateurs ne sont pas indépendants—faisant écho à la règle Super Cruise de GM : les constructeurs ne doivent pas vérifier leur propre travail. Les critères cachés créent une fausse confiance ; seuls les flux de travail avec agents séparés révèlent la vraie correction.
Pourquoi la vérification indépendante empêche-t-elle la fausse confiance dans l'automatisation des tests ?
Lorsque les constructeurs vérifient leur propre travail, ils peuvent satisfaire incorrectement des exigences ambiguës. Les agents de test indépendants, inconscients de l'implémentation, révèlent des critères cachés—comme le rejet d'un écart de zéro mètre—garantissant que la correction n'est pas auto-validée, mais véritablement prouvée.
🇮🇳 हिन्दी
स्पेसिफिकेशन-ड्रिवन टेस्ट ऑटोमेशन: वास्तविक रन और फिक्स
भाग 2 qikly फ्रेमवर्क का उपयोग करके एक वास्तविक टेस्ट रन का अनुसरण करता है, जहां एक स्वतंत्र टेस्टिंग एजेंट कोडिंग एजेंट द्वारा छोड़ी गई एक खामी को पकड़ता है। कार्य: रडार हेडवे की जाँच करें और यदि यह दो सेकंड से कम हो तो चेतावनी दें। कोडिंग एजेंट, केवल आवश्यकताओं से काम करते हुए, एक शून्य-मीटर अंतर की अनुमति दी—अदृश्य परीक्षण मानदंडों के अनुसार अमान्य। एक असफल परीक्षण के बाद, इसे एक अक्षर बदलकर कोड को पैच करके ठीक किया गया, केवल छिपे हुए परीक्षण के कारण निचली सीमा को कस दिया गया, स्पष्ट नियमों के नहीं। इसे एक मिनट से कम समय में और दस मॉडल कॉल से कम में किया गया। पहला स्पेसिफिकेशन संस्करण 'दो-सेकंड नियम' के तहत अस्पष्ट रूप से चेतावनी देता था, जिससे ठीक 2.00 सेकंड का मामला अनिर्णीत रह गया। दस रनों में, केवल तीन अभिसरित हुए; सात अस्पष्टता की गलत व्याख्या के कारण असफल हुए। यह सिद्ध करता है कि यदि सत्यापक स्वतंत्र नहीं हैं, तो हरे सूट्स भ्रामक हो सकते हैं—जीएम के सुपर क्रूज़ नियम की गूंज: निर्माताओं को अपना काम स्वयं सत्यापित नहीं करना चाहिए। छिपे हुए मानदंड झूठा विश्वास पैदा करते हैं; केवल स्प्लिट-एजेंट वर्कफ़्लो ही वास्तविक सहीपन को उजागर करते हैं।
स्वतंत्र सत्यापन टेस्ट ऑटोमेशन में झूठे विश्वास को कैसे रोकता है?
जब बिल्डर अपना स्वयं का काम सत्यापित करते हैं, तो वे अस्पष्ट आवश्यकताओं को गलत तरीके से पूरा कर सकते हैं। स्वतंत्र टेस्ट एजेंट, कार्यान्वयन से अनजान, छिपे हुए मानदंडों को उजागर करते हैं—जैसे शून्य-मीटर अंतर को अस्वीकार करना—यह सुनिश्चित करते हैं कि सहीपन स्वयं-验证 नहीं है, बल्कि वास्तव में सिद्ध है।
🇨🇳 简体中文
规格驱动的测试自动化:真实运行与修复
第二部分展示了使用qikly框架的真实测试运行,其中独立测试代理发现了编码代理遗漏的缺陷。任务:检查雷达车头距并在低于两秒时发出警告。编码代理仅基于需求工作,允许了零米间距——这违背了未见的测试标准。一次失败测试后,它通过修改一个字符来修补代码,仅因隐藏测试而非显式规则收紧了下限。这用时不到一分钟,且少于十次模型调用。第一个规格版本在“两秒规则”下存在歧义,使恰好2.00秒的情况未被解决。在十次运行中,只有三次收敛;七次因歧义误解而失败。这证明,如果验证者不独立,绿色套件可能会产生误导——呼应通用汽车Super Cruise规则:构建者不应验证自己的工作。隐藏标准会制造虚假信心;只有分离代理工作流才能揭示真正的正确性。
为什么独立验证能防止测试自动化中的虚假信心?
当构建者验证自己的工作时,他们可能会错误地满足模糊的需求。独立的测试代理对实现一无所知,能够暴露隐藏的标准——比如拒绝零米间距——从而确保正确性不是自我验证的,而是真正被证明的。