HeadlinesBriefing HeadlinesBriefing.com

Facture IA = Péage : Arrêtez de Payer Deux Fois

Towards Data Science •
×

Voici une question à poser à votre équipe financière : combien reste-t-il du budget IA de cette année ? Pour un nombre surprenant d'entreprises, la réponse honnête est « pas grand-chose ». Certaines sont à sec dès avril. Le budget annuel, disparu en un trimestre.

La raison principale est la façon dont nous l'utilisons. Nous sommes passés de questions posées aux chatbots à l'exécution d'agents. Et les agents ne se contentent pas de répondre.

Ils appellent des outils, lisent des fichiers, vérifient des résultats et appellent d'autres outils. Chacune de ces étapes brûle des tokens. Une seule requête d'agent peut coûter plusieurs fois ce qu'un simple message de chat coûte.

Cela n'aide pas que la tarification elle-même bouge constamment. Il y a des abonnements. Il y a un accès API à l'utilisation.

Il y a des promos qui apparaissent pendant quelques mois pour empêcher les gens de changer, et de nouveaux modèles haut de gamme arrivent tous les quelques mois avec leurs propres prix. Alors avant de voir comment réduire la facture, assurons-nous de tous comprendre ce pour quoi nous payons réellement. Parce qu'une fois que vous voyez comment le compteur fonctionne, les économies deviennent évidentes.

Un LLM prédit un token à la fois. Pour chaque token, il exécute une pile de maths. Pour prédire le token suivant, il a besoin des maths pour chaque token précédent.

Encore et encore, jusqu'à ce qu'il produise un token spécial « j'ai fini ». Imaginez chaque appel API comme une route à péage. Vous payez pour entrer (tokens d'entrée), et vous payez pour sortir (tokens de sortie).

La sortie est la voie la plus chère. Prenons la gamme Anthropic comme exemple. Claude Fable 5 coûte 10 $ par million de tokens en entrée et 50 $ par million en sortie. C'est un écart de 10x entre le modèle le moins cher et le plus cher de la même entreprise.

Cherchez maintenant la plus petite ligne sur cette feuille de prix. Les tokens en cache coûtent un dixième des tokens normaux. Gardez ce nombre dans votre poche.

Il vaut plus que tout le reste de cet article combiné. Sans mise en cache, le modèle a besoin de toute la conversation à chaque fois. Vous envoyez le message un.

Il renvoie le message un plus sa réponse. Vous envoyez le tout plus le message trois. Il renvoie tout cela plus la réponse deux.

Source: Towards Data Science · Résumé par HeadlinesBriefing