HeadlinesBriefing favicon HeadlinesBriefing.com

Окна контекста не знают, что все еще верно - Валидность слой Benchmark

Towards Data Science •
×

Я построил детерминированный бенчмарк на чистом Python для измерения стоимости действий с устаревшими окнами контекста. Основная проблема: окна контекста помнят, что происходило, но не знают, осталась ли эта информация актуальной. Два исполнителя выполняют одинаковую работу — один проверяет зависимости перед действием, другой обнаруживает недействительность только после неудачи. Это небольшая разница создает измеримые потери в шагах и неудачных задачах.

Я провел sweep-ы 96 конфигураций, ожидая, что форма графика будет драйвером потраченной работы, но размер оказался реальным драйвером. Я обновил эксперимент, а не заставил свою гипотезу, получив более точные результаты. Бенчмарк использует сценарий ценообразования на рейсы: в 10:00 рейс А стоит 420 долларов, план формируется в 10:01, цена поднимается до 610 долларов в 10:03, однако baseline все еще бронирует в 10:04 на основе устаревшего предположения в 420 долларов. Исполнитель, осознающий валидность, проверяет валидность цены перед действием и сразу перепланирует.

Это не потеря контекста — ничего не было забыто или отрезано. Факт, который приводит к неверному решению, находится в окне, но перестал быть истинным несколько минут назад. Слой валидности не предсказывает будущее; он перепроверяет факты прямо перед тем, как действия на них полагаются. Запускаемый репозиторий демонстрирует этот детерминированный разрыв между исполнителями с реальными числами.