HeadlinesBriefing favicon HeadlinesBriefing.com

Análise de Inteligência, Desempenho e Preço do Mercúrio 2.5

Hacker News •
×

O Índice de Inteligência da Análise Artificial v4.3.2 incorpora 10 avaliações: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. O índice mede os modelos de pesos abertos versus os modelos proprietários, com rótulos para restrições de uso comercial. AA-Briefcase v1.1 é um benchmark de trabalho de conhecimento agente que combina a taxa de aprovação do rubrico, a qualidade analítica Elo e a qualidade de apresentação Elo.

As pontuações do Índice AA-Omniscience variam de -100 a 100, medindo a confiabilidade do conhecimento e a alucinação, sem penalidade por recusa. O Índice de Custo por Tarefa de Inteligência calcula a média ponderada em USD do custo de entrada, acerto de cache, escrita de cache, raciocínio e preço dos tokens de resposta dividida pelo número de tarefas. A inteligência do modelo geralmente se traduz entre casos de uso, embora algumas avaliações possam ser mais relevantes para aplicações específicas.

A metodologia inclui uma análise detalhada de cada avaliação e como elas são executadas.