HeadlinesBriefing favicon HeadlinesBriefing.com

Verbraucher-Schlussfolgernssysteme: Mobile AI-Benchmarks

Hacker News •
×

Artificial Analysis veröffentlicht Benchmarks für Verbraucher-Schlussfolgernssysteme, die die Leistung von KI-Modellen auf mobiler Hardware bewerten, speziell das iPhone 17 Pro. Die Studie verwendet einen einfachen Durchschnitt von fünf Evaluierungen — — BFCL (Teilmenge), IFBench, AA-Omniscience, GPQA Diamond und MATH-500 — — ausgewählt, um reale mobile Gerätenutzung zu repräsentieren. Der Kontext ist auf ein Maximum von 16K Tokens begrenzt.

Intelligenzwerte messen die Modellfähigkeit beim Toolaufruf, Anweisungen folgen, Wissen genauheit, Nicht-Halluzinationsrate, wissenschaftlichem Schlussfolgern und quantitativem Schlussfolgern. Höhere Werte bedeuten bessere Leistung.

Die End-to-End-Generierungszeit verfolgt die gesamten Wanduhr-Sekunden zur Verarbeitung eines 1,024-Token-Prompts und zur Generierung einer 256-Token-Antwort. Niedrigere Zeiten sind besser. Die Ergebnisse spiegeln grundlegende Hardware- und Architekturbedingungen wider, ausgenommen Wortläufigkeitseffekte.

Die Token-Effizienz verfolgt Kontextbudget-Überschreitungen — — Generierungen, die beim 16K-Token-Limit stoppen statt abgeschlossen zu werden. Modelle, die für das Gerät zu groß sind oder Zeitlimits überschreiten, werden aus den Leistungsmessungen ausgeschlossen.

Wesentliche Entitäten: Unternehmen: Artificial Analysis