HeadlinesBriefing favicon HeadlinesBriefing.com

Routage intelligent réduit coûts LLM 10x

ByteByteGo •
×

Lorsqu'une application adopte un grand modèle de langage (LLM), elle choisit généralement le modèle le plus capable possible. Cela signifie que chaque demande est envoyée à ce modèle coûteux. Bien que cette approche soit plus facile à mettre en œuvre, elle peut devenir assez coûteuse à long terme. Par exemple, une demande telle que "classer ce ticket de support comme facturation, technique ou lié au compte" ne nécessite pas le même niveau de raisonnement que "enquêter sur pourquoi ces dossiers financiers ne correspondent pas correctement et expliquer la cause probable".

Avec le routage intelligent des modèles, nous pouvons résoudre ce problème. Dans une telle approche de routage, nous choisissons un modèle spécifique pour chaque demande. En d'autres termes, le travail simple est envoyé à un petit modèle qui peut être moins coûteux, et le travail difficile est acheminé vers un modèle plus capable. Si la plupart des demandes sont simples, cette approche peut réduire considérablement le coût total, parfois même d'environ 10 fois. De plus, la qualité de la réponse ne diminue pas de manière notable.

Cependant, la réduction des coûts n'est pas garantie. Cela dépend également des types de demandes reçues par l'application, de la différence de prix entre les modèles et de la performance du système de routage. Le coût total de l'utilisation d'une API LLM dépend généralement du nombre de jetons traités. Les jetons d'entrée incluent le message de l'utilisateur, les instructions système, l'historique de conversation et tout document fourni au modèle. Les jetons de sortie sont les jetons générés dans la réponse. Les modèles plus grands et plus capables coûtent généralement plus cher car ils nécessitent plus de ressources informatiques.

Par exemple, imaginez une application de support client qui doit traiter un million de demandes par mois. Si chaque demande va au modèle le plus puissant, l'entreprise doit payer un prix premium même pour un travail assez simple. Vous pourriez considérer cela comme embaucher un architecte logiciel senior pour renommer des fichiers, trier des tickets de support et formater des dates—un gaspillage de capacité et une mauvaise gestion des ressources.