HeadlinesBriefing favicon HeadlinesBriefing.com

LLMs de Parâmetros Infinitos: Pesos de Dados ao Vivo

Hacker News •
×

As leis de escala sustentam que um modelo de linguagem se torna mais capaz com mais parâmetros e dados de treinamento. Arquiteturas de Mistura de Especialistas (MoE) aproveitaram essas leis para obter resultados notáveis, ativando apenas uma fração de um enorme banco de parâmetros armazenados por token.

Esse sucesso é construído sobre dados de pré-treinamento estáticos. Um modelo implantado enfrenta um mundo diferente, onde grande parte dos dados que o tornariam mais útil não está em seu conjunto de treinamento, mas na interação ao vivo que ele está processando no momento, como fatos fornecidos por um usuário ou correções que ele dá. Um modelo convencional não pode aprender com esses dados, porque seus pesos são congelados após o treinamento. Em vez disso, o conhecimento e o comportamento fornecidos em tempo de execução são colocados no prompt e descartados assim que a solicitação termina.

Perguntamos como uma arquitetura poderia aprender com a interação ao vivo escrevendo-a em seus pesos. Inspirando-nos no MoE, propomos o LLM de Parâmetros Infinitos. Uma hiper-rede compacta transforma dados de tempo de execução em uma modulação de baixo posto de uma rede base compartilhada, de modo que os pesos feed-forward são gerados a partir de dados ao vivo em vez de armazenados em um banco fixo. Onde geradores de pesos anteriores leem o contexto uma vez e congelam, nós carregamos uma crença bayesiana sobre o código latente do gerador e a atualizamos online.

A pegada armazenada permanece fixa, mas os pesos que o modelo pode compilar são efetivamente infinitos. Carregar o conhecimento de tempo de execução nos pesos em vez do prompt é amortizado em computação, libera a janela de contexto, persiste entre turnos e pode generalizar melhor. Especificamos um protocolo de avaliação testando isso contra aprendizado em contexto e recuperação.

Entidades-chave: Pessoas: Jinli Hu