HeadlinesBriefing favicon HeadlinesBriefing.com

Roteamento inteligente reduz custos LLM 10x

ByteByteGo •
×

Quando um aplicativo adota um modelo de linguagem grande (LLM), geralmente escolhe o modelo mais capaz possível. Isso significa que cada solicitação é enviada para esse modelo caro. Embora essa abordagem seja mais fácil de implementar, pode se tornar bastante cara a longo prazo. Por exemplo, uma solicitação como "classificar este ticket de suporte como cobrança, técnico ou relacionado à conta" não requer o mesmo nível de raciocínio que "investigar por que esses registros financeiros não correspondem corretamente e explicar a causa provável".

Com o roteamento inteligente de modelos, podemos resolver esse problema. Nessa abordagem de roteamento, escolhemos um modelo específico para cada solicitação. Em outras palavras, o trabalho simples é enviado para um modelo pequeno que pode ser menos caro, e o trabalho difícil é roteado para um modelo mais capaz. Se a maioria das solicitações for simples, essa abordagem pode reduzir o custo total de forma significativa, às vezes até cerca de 10 vezes. Além disso, a qualidade da resposta não diminui notavelmente.

No entanto, a redução de custos não é garantida. Também depende dos tipos de solicitações que o aplicativo recebe, da diferença de preço entre os modelos e do desempenho do sistema de roteamento. O custo total de usar uma API de LLM geralmente depende do número de tokens processados. Tokens de entrada incluem a mensagem do usuário, instruções do sistema, histórico de conversa e quaisquer documentos fornecidos ao modelo. Tokens de saída são os tokens gerados na resposta. Modelos maiores e mais capazes geralmente custam mais porque exigem mais recursos computacionais.

Por exemplo, imagine um aplicativo de suporte ao cliente que precisa processar um milhão de solicitações por mês. Se cada solicitação for para o modelo mais poderoso, a empresa tem que pagar um preço premium mesmo para trabalho bastante simples. Você poderia pensar nisso como contratar um arquiteto de software sênior para renomear arquivos, classificar tickets de suporte e formatar datas—um desperdício de capacidade e má gestão de recursos.