HeadlinesBriefing favicon HeadlinesBriefing.com

Cache prompts GPT-6 : IA plus rapide, moins chère

OpenAI Blog •
×

GPT-6 introduit un système de mise en cache des prompts amélioré qui offre des taux de réussite de cache plus élevés par défaut et des remises allant jusqu'à 90 % sur les tokens d'entrée mis en cache. Le système réutilise les préfixes partagés dans une fenêtre de 30 minutes, réduisant la latence et les coûts pour les tâches d'agent de longue durée. Les nouveaux outils incluent le Tableau de bord de mise en cache des prompts pour surveiller les taux de réussite et un outil de diagnostic pour analyser les échecs de cache en comparant les requêtes et en identifiant les changements dans les modèles, outils ou entrées.

Les développeurs peuvent désormais utiliser des points d'arrêt de cache explicites pour choisir quels préfixes de prompt mettre en cache et ajuster l'effort de raisonnement sans casser le cache. Pour préserver la stabilité du cache, maintenez les définitions d'outils et schémas cohérents, utilisez allowed_tools pour la pertinence, et ajoutez de nouvelles instructions via des messages développeur plutôt que d'écraser les anciennes. Le préchauffage prépare le contexte connu à l'avance, déplaçant le traitement hors du temps d'attente utilisateur.

Ces contrôles optionnels s'appuient sur les performances par défaut, permettant aux développeurs d'adapter le cache à leur charge de travail. Commencez par surveiller les taux de réussite, enquêter sur les échecs, et suivre le guide mis à jour de mise en cache des prompts ou utiliser Codex pour réviser le code.