HeadlinesBriefing favicon HeadlinesBriefing.com

Análise do Claude Opus 5.5: Inteligência, Desempenho e Preço

Hacker News •
×

O Índice de Inteligência v4.3.2 da Artificial Analysis incorpora 10 avaliações: AA-Briefcase v1.1, GDPval-AA v2.1, Automation Bench-AA, Terminal-Bench 4.0, Sci Code, Humanity's Last Exam, GDP.pdf, Crit Pt, AA-Omniscience, AA-LCR v1.1. Consulte a metodologia do Índice de Inteligência para mais detalhes, incluindo uma análise de cada avaliação e como as executamos.

AA-Briefcase v1.1 é um benchmark de trabalho de conhecimento agêntico desenvolvido pela Artificial Analysis. AA-Briefcase Elo é uma métrica combinada que agrega taxa de aprovação de rubricas, Elo de qualidade analítica e Elo de apresentação · Mais alto é melhor. O Índice AA-Omniscience mede a confiabilidade do conhecimento e a alucinação. Ele recompensa respostas corretas, penaliza alucinações e não tem penalidade por recusar responder. As pontuações variam de -100 a 100, onde 0 significa tantas respostas corretas quanto incorretas.

Comparações do Índice de Inteligência: Índice de Inteligência vs. Custo por Tarefa do Índice de Inteligência. Custo médio ponderado por tarefa do Índice de Inteligência. O custo de cada avaliação é calculado a partir dos preços de tokens de entrada, acerto de cache, escrita de cache, raciocínio e resposta, dividido pelo número de tarefas e ponderado pelo seu peso no Índice de Inteligência.

Entidades-chave: Empresas: Artificial Analysis