HeadlinesBriefing favicon HeadlinesBriefing.com

Análise do Índice de Inteligência AI v4.3

Hacker News •
×

O Índice de Inteligência AI v4.3 da Artificial Analysis incorpora 10 avaliações: AA-Briefcase, GDPval-AA v2, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Consulte a metodologia do Índice de Inteligência para mais detalhes, incluindo uma análise de cada avaliação e como as executamos.

Indica se os pesos do modelo estão disponíveis. Os modelos são rotulados como "Uso Comercial Restrito" se o uso comercial estiver limitado por condições, e como "Não Comercial" se a licença proibir o uso comercial.

Os Índices de Capacidade medem o desempenho dos modelos em capacidades e indústrias específicas.

Avaliações de inteligência são medidas independentemente pela Artificial Analysis · Quanto maior, melhor.

Codificação e uso terminal agente Raciocínio profissional de documentos Todos passam médico Raciocínio de contexto longo na medicina Embora a inteligência do modelo geralmente se traduza entre casos de uso, avaliações específicas podem ser mais relevantes para certos casos de uso.

AA-Briefcase Elo é uma métrica combinada que agrega taxa de aprovação da rúbrica, qualidade analítica Elo e Elo de apresentação. Elo e limites do intervalo de confiança de 95% são limitados a 0.

O Índice AA-Omniscience (quanto maior, melhor) mede a confiabilidade do conhecimento e alucinações. Ele recompensa respostas corretas, penaliza alucinações e não impõe penalidade por recusar-se a responder. As pontuações variam de -100 a 100.

Entidades-chave: Empresas: Artificial Analysis