HeadlinesBriefing favicon HeadlinesBriefing.com

Systèmes d'inférence grand public : références de l'IA mobile

Hacker News •
×

Artificial Analysis publie les références des systèmes d'inférence grand public évaluant les performances des modèles d'IA sur le matériel mobile, spécifiquement l'iPhone 17 Pro. L'étude utilise une moyenne simple de cinq évaluations — — BFCL (sous-ensemble), IFBench, AA-Omniscience, GPQA Diamond et MATH-500 — — choisies pour représenter une utilisation réelle des appareils mobiles. Le contexte est limité à un maximum de 16K tokens.

Les scores d'intelligence mesurent la capacité du modèle dans l'appel d'outils, le suivi d'instructions, la précision des connaissances, le taux d'absence d'hallucination, le raisonnement scientifique et le raisonnement quantitatif. Des scores plus élevés indiquent de meilleures performances.

Le temps de génération de bout en bout suit le total en secondes d'horloge murale pour traiter un prompt de 1,024 tokens et générer une réponse de 256 tokens. Des temps plus faibles sont meilleurs. Les résultats reflètent les contraintes fondamentales du matériel et de l'architecture, en excluant les effets de verbosité.

L'efficacité des tokens suit les dépassements du budget de contexte — — les générations qui s'arrêtent à la limite de 16K tokens au lieu de se terminer. Les modèles trop grands pour l'appareil ou dépassant les limites de temps sont exclus des mesures de performance.

Entités clés : Entreprises : Artificial Analysis