Performancebenchmark
Direkter Aufruf einer OpenAI-kompatiblen Chat-Completions-API. Erfasst werden Time to First Token, Prefill-Token/s, Generation-Token/s und die gesamte Laufzeit. Modell, Runtime, Quantisierung und Systemdaten gehören zum Ergebnis.
Harnessbenchmark
Das Modell läuft durch einen vollständigen Agent- oder Chat-Harness. Bewertet werden erreichte Punkte, maximal mögliche Punkte und Erfolgsquote. Dadurch wird neben Geschwindigkeit auch die praktische Aufgabenerfüllung sichtbar.
Vergleichbarkeit
Ergebnisse sind nur unter identischen Benchmarks und vergleichbaren Einstellungen direkt belastbar. Verifizierte Läufe sind im Leaderboard markiert.
