Powered bymario-alka.degodcore.detricoma.de
Reproduzierbarkeit

Benchmark-Methodik

Zwei Testarten beantworten zwei unterschiedliche Fragen.

Performancebenchmark

Direkter Aufruf einer OpenAI-kompatiblen Chat-Completions-API. Erfasst werden Time to First Token, Prefill-Token/s, Generation-Token/s und die gesamte Laufzeit. Modell, Runtime, Quantisierung und Systemdaten gehoeren zum Ergebnis.

Harnessbenchmark

Das Modell laeuft durch einen vollstaendigen Agent- oder Chat-Harness. Bewertet werden erreichte Punkte, maximal moegliche Punkte und Erfolgsquote. Dadurch wird neben Geschwindigkeit auch die praktische Aufgabenerfuellung sichtbar.

Vergleichbarkeit

Ergebnisse sind nur unter identischen Benchmarks und vergleichbaren Einstellungen direkt belastbar. Verifizierte Laeufe sind im Leaderboard markiert.