HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash: Intelligenz- und Preisanalyse

Hacker News •
×

Artificial Analysis präsentiert die Analyse des GLM-5.3-Flash-Modells. Der Artificial Analysis Intelligenzindex v4.1.1 umfasst 9 Bewertungen: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, Sci Code, Humanity's Last Exam, GPQA Diamond, Crit Pt, AA-Omniscience, AA-LCR. Denkende Modelle werden durch ein Glühbirnen-Symbol gekennzeichnet.

Der Intelligenzindex umfasst diese Bewertungen, mit verfügbaren Methodikdetails. Modelle werden als 'Kommerzielle Nutzung eingeschränkt' gekennzeichnet, wenn die kommerzielle Nutzung begrenzt ist, oder als 'Nicht-kommerziell', wenn die Lizenz die kommerzielle Nutzung verbietet. Intelligenzbewertungen werden unabhängig von Artificial Analysis gemessen, wobei höhere Punktzahlen besser sind.

Der AA-Omniscience-Index misst Wissenszuverlässigkeit und Halluzination. Er belohnt richtige Antworten, bestraft Halluzinationen und hat keine Strafe für die Verweigerung einer Antwort. Die Punktzahlen reichen von -100 bis 100, wobei 0 bedeutet, dass es genauso viele richtige wie falsche Antworten gibt, und negative Punktzahlen bedeuten mehr falsche als richtige.

Vergleiche umfassen den Intelligenzindex im Vergleich zu den Kosten pro Aufgabe, unter Verwendung der gewichteten Durchschnittskosten aus Eingabe-, Cache-Treffer-, Cache-Schreib-, Denk- und Antwort-Token-Preisen. Die Token-Nutzung wird als Ausgabe-Token pro Intelligenzindex-Aufgabe gemessen, berechnet durch Multiplikation der Ausgabe-Token pro Bewertung mit den Benchmark-Gewichten.

Wichtige Entitäten: Unternehmen: Artificial Analysis