HeadlinesBriefing favicon HeadlinesBriefing.com

Revolução do hardware de inferência 2026: IA de treinamento para inferência

Hacker News •
×

O chip Napier da Tensordyne é projetado para acelerar a inferência de IA. Desde cerca de 2020, a IA tem se concentrado principalmente em treinar modelos maiores e melhores. Os modelos de linguagem grande (LLM) balonaram de milhões de parâmetros para trilhados. Isso provou eficaz: a maior versão do GPT-3 da Open AI, lançada em 2020, acertou apenas 43,9% das perguntas em um popular benchmark de conhecimento e raciocínio. Apenas quatro anos depois, o GPT-4o atingiu uma pontuação de 88,7% no mesmo exame, efetivamente igualando-se a especialistas humanos. Laboratórios de IA avançados ainda treinam modelos cada vez maiores, mas esse treinamento recuou um pouco para o segundo plano da conversa sobre IA. Em 2026, a inferência—o uso de modelos treinados para produzir código, escrever ensaios ou fazer imagens de nós mesmos como elfos—veio à tona.

“É como se o treinamento fosse as notícias de ontem”, diz Matt Kimball, analista principal de centro de dados da Moor Insights & Strategy. “Tudo que qualquer diretor de informação quer falar é sobre inferência”. O CEO da Nvidia, Jensen Huang, falando na conferência GTC 2026 da empresa, destacou essa mudança como o “ponto de virada da inferência”.

Parte do que causou a mudança é muito simples: os LLM estão se tornando úteis, então as pessoas estão usando-os. Além disso, muitos modelos no mercado hoje são modelos de raciocínio. Em resposta a uma consulta do usuário, eles executam a inferência não apenas uma vez, mas várias vezes, auto-promptando em um processo chamado chain of thought. Modelos de raciocínio geram saídas mais longas, e modelos com alto esforço de raciocínio podem produzir até 20 vezes mais texto do que aqueles com baixo ou nenhum esforço.

A explosão resultante na demanda por inferência levou a alianças inesperadas entre gigantes da tecnologia. Open AI e Amazon implantaram chips do tamanho de um prato de jantar projetados pela Cerebras, apesar de a Amazon ter seus próprios chips Trainium. A Nvidia comprou talento-chave e propriedade intelectual da startup de inferência de IA Groq em um acordo polêmico valido em US $ 20 bilhões. E a Anthropic está pagando ao concorrente de LLM Space XAI mais de um bilhão de dollars por mês para alugar compute de backup.