Aqui está uma pergunta que vale a pena fazer à sua equipe financeira: quanto do orçamento de IA deste ano sobrou? Para um número surpreendente de empresas, a resposta honesta é "não muito". Algumas estão secando em abril. O orçamento anual, desaparecido em um trimestre.
A razão maior é como estamos usando. Passamos de fazer perguntas a chatbots para executar agentes. E agentes não apenas respondem.
Eles chamam ferramentas, leem arquivos, verificam resultados e chamam mais ferramentas. Cada um desses passos queima tokens. Uma única solicitação de agente pode custar muitas vezes o que uma mensagem de chat simples custa.
Não ajuda que o próprio preço continue mudando. Há assinaturas. Há acesso API de pagamento por uso.
Há promoções que aparecem por alguns meses para impedir que as pessoas mudem, e novos modelos de ponta chegando a cada poucos meses com seus próprios preços. Então, antes de entrarmos em como cortar a conta, vamos garantir que todos entendamos pelo que estamos realmente pagando. Porque uma vez que você vê como o medidor funciona, as economias se tornam óbvias.
Um LLM prevê um token de cada vez. Para cada token, ele executa uma pilha de matemática. Para prever o próximo token, ele precisa da matemática para cada token anterior.
Volta e volta, até produzir um token especial "terminei". Imagine cada chamada de API como uma estrada com pedágio. Você paga para entrar (tokens de entrada) e paga para sair (tokens de saída).
A saída é a pista mais cara. Pegue a linha de produtos da Anthropic como exemplo. Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de saída. Isso é uma diferença de 10x entre o modelo mais barato e o mais caro da mesma empresa.
Agora procure a menor linha nessa folha de preços. Tokens em cache custam um décimo dos tokens normais. Guarde esse número no bolso.
Vale mais do que todo o resto deste artigo combinado. Sem cache, o modelo precisa de toda a conversa toda vez. Você envia a mensagem um.
Ele envia de volta a mensagem um mais sua resposta. Você envia tudo mais a mensagem três. Ele envia tudo isso de volta mais a resposta dois.
Fonte: Towards Data Science · Resumido por HeadlinesBriefing