HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash: análise de inteligência e preço

Hacker News •
×

A Artificial Analysis apresenta a análise do modelo GLM-5.3-Flash. O Índice de Inteligência da Artificial Analysis v4.1.1 incorpora 9 avaliações: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, Sci Code, Humanity's Last Exam, GPQA Diamond, Crit Pt, AA-Omniscience, AA-LCR. Modelos de raciocínio são indicados por um ícone de lâmpada.

O Índice de Inteligência inclui essas avaliações, com detalhes de metodologia disponíveis. Os modelos são rotulados como 'Uso comercial restrito' se o uso comercial for limitado, ou 'Não comercial' se a licença proibir o uso comercial. As avaliações de inteligência são medidas de forma independente pela Artificial Analysis, sendo melhores as pontuações mais altas.

O Índice AA-Omniscience mede a confiabilidade do conhecimento e a alucinação. Ele recompensa respostas corretas, penaliza alucinações e não penaliza a recusa em responder. As pontuações variam de -100 a 100, onde 0 significa tantas respostas corretas quanto incorretas, e pontuações negativas significam mais incorretas do que corretas.

As comparações incluem o Índice de Inteligência versus o custo por tarefa, usando o custo médio ponderado dos preços de tokens de entrada, acerto de cache, escrita de cache, raciocínio e resposta. O uso de tokens é medido como tokens de saída por tarefa do Índice de Inteligência, calculado multiplicando os tokens de saída por avaliação pelos pesos de referência.

Entidades-chave: Empresas: Artificial Analysis