Dan Harrison (Ingénieur) a annoncé que turbopuffer change son architecture de stockage avec turbopuffer v3. Le nouveau moteur modifie la façon dont les documents et les index sont disposés, écrits, compactés et interrogés, permettant beaucoup plus de plans de requête à une échelle bien plus grande. turbopuffer a été lancé comme une base de données vectorielle sans serveur, avec le stockage d'objets comme source de vérité pour l'économie et des caches NVMe SSD/mémoire hiérarchisés pour les performances. Cela a été validé par les premiers clients, notamment Cursor et Notion.
Au fil du temps, turbopuffer a évolué vers une base de données généralisée pour la recherche, prenant en charge le filtrage d'attributs et la recherche en texte intégral. Le moteur de requête a évolué, mais l'architecture de stockage est restée centrée sur l'index ANN en tant qu'index principal. Maintenant, ils passent à un nouvel index principal, faisant d'ANN "juste un autre" index secondaire.
Dans v1, les documents étaient simplement un ID et un vecteur, utilisant un index de clustering hiérarchique. v2 a ajouté le filtrage d'attributs via des index inversés et la recherche en texte intégral. L'équipe partagera des mises à jour pendant la transition. "Nous avons poussé l'index ANN principal aussi loin que possible, mais il est temps de passer à autre chose."
Source: Hacker News · Résumé par HeadlinesBriefing