HeadlinesBriefing favicon HeadlinesBriefing.com

Cache de Prompts GPT-6: IA Mais Rápida e Barata

OpenAI Blog •
×

O GPT-6 introduz um sistema aprimorado de cache de prompts que oferece taxas de acerto de cache mais altas por padrão e descontos de até 90% em tokens de entrada cacheados. O sistema reutiliza prefixos compartilhados dentro de uma janela de 30 minutos, reduzindo latência e custos para tarefas de agentes de longa duração. Novas ferramentas incluem o Painel de Cache de Prompts para monitorar taxas de acerto e uma ferramenta de diagnóstico para analisar falhas de cache comparando solicitações e identificando mudanças em modelos, ferramentas ou entradas.

Desenvolvedores agora podem usar pontos de interrupção de cache explícitos para escolher quais prefixos de prompt cachear e ajustar o esforço de raciocínio sem quebrar o cache. Para preservar a estabilidade do cache, mantenham definições e esquemas de ferramentas consistentes, usem allowed_tools para relevância, e adicionem novas instruções via mensagens de desenvolvedor em vez de sobrescrever as antigas. O pré-aquecimento prepara o contexto conhecido antecipadamente, movendo o processamento para fora do tempo de espera do usuário.

Esses controles opcionais se baseiam no desempenho padrão, permitindo que desenvolvedores adaptem o cache à sua carga de trabalho. Comecem monitorando taxas de acerto, investigando falhas, e seguindo o guia atualizado de cache de prompts ou usando o Codex para revisar código.