HeadlinesBriefing favicon HeadlinesBriefing.com

Las ventanas de contexto no saben qué sigue siendo verdadero - Capa de validez Benchmark

Towards Data Science •
×

Creé un benchmark determinista en Python puro para medir el costo de actuar sobre ventanas de contexto obsoletas. El problema central: las ventanas de contexto recuerdan lo que sucedió, pero no saben si esa información sigue siendo válida. Dos ejecutores realizan el mismo trabajo — uno valida dependencias antes de actuar, el otro descubre la invalididad solo después del fracaso. Esa pequeña diferencia crea un desperdicio medible en pasos y tareas fallidas.

Ejecuté una barrida de 96 configuraciones esperando que la forma del gráfico impulsara el trabajo desperdiciado, pero el tamaño resultó ser el conductor real. Actualicé el experimento en lugar de forzar mi hipótesis, obteniendo resultados más precisos. El benchmark usa un escenario de precios de vuelos: a las 10:00, el vuelo A cuesta 420 dólares, se forma un plan a las 10:01, el precio sube a 610 dólares a las 10:03, sin embargo la base reserva a las 10:04 basándose en la suposición obsoleta de 420 dólares. El ejecutor consciente de la validez en actúa antes verifica la validez del precio y vuelve a planificar de inmediato.

No es pérdida de contexto — nada fue olvidado ni cortado. El hecho que impulsa la decisión incorrecta está en la ventana pero dejó de ser cierto hace minutos. La capa de validez no predice el futuro; vuelve a verificar hechos justo antes de que las acciones dependan de ellos. El repositorio ejecutable demuestra esta brecha determinista entre ejecutores con números reales.