HeadlinesBriefing favicon HeadlinesBriefing.com

Pac-Bench: One-Shot Pac-Man Modell-Benchmark

Hacker News •
×

Der Hacker News-Benutzer jonclegg startete Pac-Bench, um zu bewerten, wie effektiv KI-Modelle ein spielbares Pac-Man-Klons aus einem einzigen Prompt generieren können. Die Herausforderung erfordert, dass Modelle eine vollständige HTML-Seite in einem einzigen Versuch erstellen, ohne Nachbearbeitung Prompts oder Korrekturen zuzulassen. Die Ergebnisse offenbaren erhebliche Leistungsunterschiede, wobei einige Modelle funktionierende Spiele erzeugen, während andere bei grundlegenden Mechaniken Schwierigkeiten haben.

Der Benchmark verfolgt Erfolgsraten, Code-Effizienz und die Einhaltung der strengen One-Shot-Beschränkung und liefert Erkenntnisse in die aktuellen KI-Codierungsfähigkeiten. Die Organisatoren sammelten Daten über Token-Nutzung, Generierungszeit und HTML-Ausgabegröße, um die praktische Umsetzbarkeit zu messen. Die Projektseite hostet die individuellen Modellierungsversuche und detaillierte Metriken für die Community-Analyse.