Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Reproduzierbarkeit

Benchmark-Methodik

Zwei Testarten beantworten zwei unterschiedliche Fragen.

Performancebenchmark

Direkter Aufruf einer OpenAI-kompatiblen Chat-Completions-API. Erfasst werden Time to First Token, Prefill-Token/s, Generation-Token/s und die gesamte Laufzeit. Modell, Runtime, Quantisierung und Systemdaten gehören zum Ergebnis.

Harnessbenchmark

Das Modell läuft durch einen vollständigen Agent- oder Chat-Harness. Bewertet werden erreichte Punkte, maximal mögliche Punkte und Erfolgsquote. Dadurch wird neben Geschwindigkeit auch die praktische Aufgabenerfüllung sichtbar.

Vergleichbarkeit

Ergebnisse sind nur unter identischen Benchmarks und vergleichbaren Einstellungen direkt belastbar. Verifizierte Läufe sind im Leaderboard markiert.