HeadlinesBriefing favicon HeadlinesBriefing.com

Ретроспектива модели Dataflow: испытание временем VLDB

Hacker News •
×

Через одиннадцать лет после статьи о модели Dataflow ее авторы размышляют о том, что хорошо сохранилось, а что нет. Основные идеи — примат времени события, тщетность ожидания полноты и сильная согласованность — остаются верными. Однако аналитический интерфейс был ошибочным: оконная обработка и триггеры были переоценены, а триггеры были переусложненным решением проблемы, с которой пользователи не должны сталкиваться. Потокоцентричный взгляд упустил, что потоки и таблицы — это просто разные семантики доступа к одному и тому же объекту.

Практическая эволюция пришла из мира баз данных: SQL, инкрементальное обслуживание представлений и материализованные представления с контрактами свежести. Авторы признают, что слишком много внимания уделяли механике потоковой обработки, а не завершению того, что начали базы данных — сделать сложность аналитической потоковой обработки исчезающей.

Принцип полноты разделился на две успешные формы: водяные знаки для видимых потоков и согласованное обновление снимков для скрытых. Последнее достигло большего числа пользователей, требуя меньше. Они обобщают водяные знаки в объявленные ограничения на изменения.

Они также отмечают, что спор между пакетной и потоковой обработкой был в основном семантическим, спрос на низкую задержку раздваивается по линиям OLTP/OLAP, и они принимают новую рамку: оставить внутри, исключить, толкать сильнее. Наконец, они размышляют о возможном исчезновении потоковой обработки за пределами аналитики.