HeadlinesBriefing favicon HeadlinesBriefing.com

Modelos pequenos: nova fronteira em IA

Hacker News •
×

Nas últimas semanas, tenho brincado com o gpt-5.6-luna. Ele é surpreendentemente capaz, rápido e inteligente. Eu regularmente o vejo fazer ~100 tps, e percorrer meu código, e-mail e base de conhecimento. Claro, a maior coisa com o luna é o custo. Tentei executar alguns threads de pesquisa bastante complexos, e é bem difícil acumular uma conta grande. Mesmo fazendo-o pesquisar em milhares de e-mails, acabo com um custo de API de dezenas de centavos. Com o GLM 5.3, temos até uma nova opção na fronteira de Pareto.

Ao fazer trabalho de codificação, quase sempre recorro aos modelos mais caros e capazes (Fable 5, 5.6 Sol). Então, tem sido fácil perder o progresso que os modelos pequenos e rápidos fizeram. Uma coisa que alguns investidores com quem conversei mencionaram: "É estranho não vermos mais empresas de IA de consumo. Por quê?" Há uma resposta direta: custos de token.

Nos tempos anteriores à IA, o manual para grandes aplicativos de consumo era assim: criar algum tipo de site atraente que seja bastante barato de operar, atrair um monte de usuários (tipicamente com alguma viralidade), levantar dinheiro, escalar para mais usuários, criar um mercado de anúncios. Isso descreve aproximadamente a maioria das grandes empresas de consumo (Google, Facebook, Snapchat, etc.). Mas e se você quiser adicionar IA ao seu produto? Bem, agora você tem custos reais de inferência em cada solicitação! De repente, a quantidade de capital necessária aumenta drasticamente.

Uma avaliação minha é construir um site de notícias diárias, personalizado para mim: pesquisar @calvinfo na internet, descobrir quais notícias eles podem gostar, construir um micro-site com as principais histórias de hoje, personalizado para eles, pesquisar hn, reddit, twitter, etc. Com a geração anterior de modelos (classe Sonnet), você gastaria ~$1 para chegar a qualquer lugar. Cobrar $30/mês é insustentável para um aplicativo de consumo. Há muito que podemos otimizar aqui, mas se você está cobrando o que o WSJ ou o The Economist cobram, é melhor estar entregando valor semelhante. Mas olhando para o luna, os resultados são bastante decentes, e o custo médio é de ~$0,10. Agora estamos falando!

Onde acho que isso fica ainda mais interessante é no mundo dos negócios. Meu cofundador da Segment, Peter, e eu recentemente comparamos notas em uma caminhada. Em suas várias startups, Peter viu dois tipos de trabalho: o trabalho "QI 180" (algum tipo de gênio cientista maluco que surge com uma solução maluca que você nunca pensou) e o trabalho "cuspidor de tokens" (ser ultra responsivo, empurrando a bola para frente em dezenas de frentes diferentes). Peter dirige várias empresas. Além da Segment, ele levantou mais de $100 milhões para a Charm Industrial, e recentemente fechou uma Série A para a Revoy. Ele é incrivelmente organizado e eficiente com seu tempo. E ainda assim, Peter mencionou que ~95% do trabalho que ele faz cai no balde 2. É pular em chamadas, cutucar pessoas, bloquear e atacar. Para ser claro, Peter diz que suas empresas estariam mortas na água hoje sem uma mente técnica de QI 180 resolvendo os problemas profundos. Só que a maior parte do seu trabalho cai no balde 2.

Acho que a demanda por modelos de "nível de fronteira" vai continuar a crescer, especialmente para campos que exigem avanços ou descobertas inovadoras (engenharia, ciência dura, treinamento de modelos). Mas também acho que a demanda por modelos "rápidos/baratos/bons o suficiente" está prestes a decolar. Pense nas pessoas com quem você interage diariamente: colegas, fornecedores e clientes. Nove em cada dez vezes, você quer alguém que seja super responsivo e simplesmente cuide das coisas para você. A maioria dos "tokens humanos" nas empresas hoje é gasta dessa maneira — a contratação tende fortemente para o arquétipo rápido/barato/bom o suficiente. Há muito trabalho que precisa ser feito para tornar os modelos rápidos/baratos/bons o suficiente uma realidade para os negócios: novos harnesses, segurança contra injeção de prompt, funções e permissões. Mas estou confiante de que vamos descobrir isso. Se você também está experimentando tornar modelos pequenos úteis, por favor, me envie uma mensagem. Amazon e Netflix são as exceções notáveis. Peter também está sendo modesto aqui; ele é afiado como uma navalha.