HeadlinesBriefing HeadlinesBriefing.com

Conta de IA é Pedágio: Pare de Pagar Duas Vezes

Towards Data Science •
×

Aqui está uma pergunta que vale a pena fazer à sua equipe financeira: quanto do orçamento de IA deste ano sobrou? Para um número surpreendente de empresas, a resposta honesta é "não muito". Algumas estão secando em abril. O orçamento anual, desaparecido em um trimestre.

A razão maior é como estamos usando. Passamos de fazer perguntas a chatbots para executar agentes. E agentes não apenas respondem.

Eles chamam ferramentas, leem arquivos, verificam resultados e chamam mais ferramentas. Cada um desses passos queima tokens. Uma única solicitação de agente pode custar muitas vezes o que uma mensagem de chat simples custa.

Não ajuda que o próprio preço continue mudando. Há assinaturas. Há acesso API de pagamento por uso.

Há promoções que aparecem por alguns meses para impedir que as pessoas mudem, e novos modelos de ponta chegando a cada poucos meses com seus próprios preços. Então, antes de entrarmos em como cortar a conta, vamos garantir que todos entendamos pelo que estamos realmente pagando. Porque uma vez que você vê como o medidor funciona, as economias se tornam óbvias.

Um LLM prevê um token de cada vez. Para cada token, ele executa uma pilha de matemática. Para prever o próximo token, ele precisa da matemática para cada token anterior.

Volta e volta, até produzir um token especial "terminei". Imagine cada chamada de API como uma estrada com pedágio. Você paga para entrar (tokens de entrada) e paga para sair (tokens de saída).

A saída é a pista mais cara. Pegue a linha de produtos da Anthropic como exemplo. Claude Fable 5 custa $10 por milhão de tokens de entrada e $50 por milhão de saída. Isso é uma diferença de 10x entre o modelo mais barato e o mais caro da mesma empresa.

Agora procure a menor linha nessa folha de preços. Tokens em cache custam um décimo dos tokens normais. Guarde esse número no bolso.

Vale mais do que todo o resto deste artigo combinado. Sem cache, o modelo precisa de toda a conversa toda vez. Você envia a mensagem um.

Ele envia de volta a mensagem um mais sua resposta. Você envia tudo mais a mensagem três. Ele envia tudo isso de volta mais a resposta dois.

Fonte: Towards Data Science · Resumido por HeadlinesBriefing