HeadlinesBriefing favicon HeadlinesBriefing.com

Les fenêtres de contexte ne savent pas ce qui est encore vrai - Couche de validité Benchmark

Towards Data Science •
×

J'ai créé un benchmark déterministe en Python pur pour mesurer le coût d'agir sur des fenêtres de contexte obsolètes. Le problème central : les fenêtres de contexte se souviennent de ce qui s'est passé, mais ne savent pas si ces informations restent valides. Deux exécuteurs effectuent le même travail — l'un valide les dépendances avant d'agir, l'autre découvre l'invalidité seulement après l'échec. Cette petite différence crée un gaspillage mesurable en étapes et tâches échouées.

J'ai exécuté une balayage de 96 configurations en m'attendant à ce que la forme du graphique entraîne le gaspillage de travail, mais la taille s'est révélée être le véritable moteur. J'ai mis à jour l'expérience plutôt que de forcer mon hypothèse, ce qui a donné des résultats plus précis. Le benchmark utilise un scénario de tarification de vols : à 10h00, le vol A coûte 420 dollars, un plan se forme à 10h01, le prix monte à 610 dollars à 10h03, pourtant la baseline réserve à 10h04 sur la base de l'hypothèse obsolète de 420 dollars. L'exécuteur conscient de la validité vérifie la validité du prix avant d'agir et replanifie immédiatement.

Ce n'est pas une perte de contexte — rien n'a été oublié ou coupé. Le fait qui entraîne la mauvaise décision est dans la fenêtre mais a cessé d'être vrai il y a quelques minutes. La couche de validité ne prévoit pas l'avenir ; elle re-vérifie les faits juste avant que les actions ne dépendent d'eux. Le dépôt exécutable démontre cet écart déterministe entre exécutants avec des chiffres réels.