HeadlinesBriefing favicon HeadlinesBriefing.com

LLM 3x mais rápidos: decodificação especulativa

ByteByteGo •
×

Cada agente já executa um loop. A engenharia de loop adiciona um loop ao redor do próprio agente, permitindo que ele avalie sua saída, tente novamente quando o trabalho ficar aquém e refine suas instruções quando os mesmos erros se repetirem. Hoje, você desempenha esse papel: revisar o trabalho, diagnosticar o que deu errado e instruir o agente novamente. Este artigo mostra como automatizar esse processo com um exemplo prático, explorando onde o julgamento humano ainda é necessário.

Um modelo de 70 bilhões de parâmetros requer a leitura de aproximadamente 140 GB de pesos da memória da GPU. Em uma GPU moderna de data center, essa transferência pode levar dezenas de milissegundos. O cálculo real aplicado a esses pesos leva uma fração desse tempo. Isso significa que as unidades matemáticas do processador ficam sem uso na maior parte do tempo da etapa de geração de tokens. A decodificação especulativa é uma técnica que converte essa capacidade ociosa em saída.

Um segundo modelo, muito menor, produz vários tokens candidatos antecipadamente. O modelo grande avalia todos eles em uma única passagem direta, em vez de uma passagem por token, resultando em geração 2-3 vezes mais rápida. Para melhorar, o texto produzido permanece estatisticamente idêntico à saída do modelo grande rodando sozinho.

A geração de texto funciona um token por vez. O modelo lê tudo o que foi produzido até agora, calcula uma distribuição de probabilidade sobre seu vocabulário, seleciona o próximo token, anexa esse token à entrada e repete o ciclo. Cada ciclo é chamado de passagem direta, e cada passagem direta executa a entrada por todas as camadas do modelo. Sistemas de inferência modernos usam um cache KV, que armazena o estado de atenção para tokens já processados, reduzindo o trabalho dentro de cada passagem, embora o requisito de uma passagem por token ainda permaneça.

Entidades-chave: Empresas: ByteByteGo