HeadlinesBriefing favicon HeadlinesBriefing.com

Rétrospective du modèle Dataflow : Test du temps de VLDB

Hacker News •
×

Onze ans après l'article sur le modèle Dataflow, ses auteurs réfléchissent à ce qui a bien vieilli et à ce qui n'a pas. Les idées centrales—la primauté du temps d'événement, la futilité d'attendre la complétude et la cohérence forte—restent solides. Cependant, l'interface analytique était défectueuse : le fenêtrage et le déclenchement étaient surévalués, et les déclencheurs étaient une solution sur-ingénierie à un problème que les utilisateurs ne devraient pas rencontrer. La vision centrée sur le flux a manqué que les flux et les tables ne sont que des sémantiques d'accès différentes du même objet.

L'évolution pratique est venue du monde des bases de données : SQL, maintenance incrémentale des vues et vues matérialisées avec des contrats de fraîcheur. Les auteurs admettent avoir trop mis l'accent sur la mécanique du streaming plutôt que de terminer ce que les bases de données ont commencé—faire disparaître la complexité du streaming analytique.

Le principe de complétude s'est divisé en deux formes réussies : les marques d'eau pour les flux visibles et l'actualisation cohérente des instantanés pour les flux cachés. Cette dernière a atteint plus d'utilisateurs en exigeant moins. Ils généralisent les marques d'eau en contraintes déclarées sur le changement.

Ils notent également que le débat batch contre streaming était surtout sémantique, la demande de faible latence bifurque le long des lignes OLTP/OLAP, et ils adoptent un nouveau cadre : laisser dedans, laisser dehors, pousser plus fort. Enfin, ils réfléchissent à la disparition éventuelle du streaming au-delà de l'analytique.