🤖
Harness-Benchmark
Wie gut löst das Modell echte Aufgaben?
Qualität in echten Agenten- und Chat-Aufgaben – das Modell muss reale Aufgaben mit Tools und mehreren Schritten bearbeiten. Bewertet nach Erfolgsquote und erreichten Aufgabenpunkten.
🎯 Erfolgsquote🏆 Aufgabenpunkte🔧 Tool-Nutzung🧠 echte Aufgaben
| # | Modell / Hersteller | Messwerte | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
Noch keine passenden Ergebnisse vorhanden. | |||||||
