🤖
Harness-Benchmark
Wie gut löst das Modell echte Aufgaben?
Qualität in echten Agenten- und Chat-Aufgaben – das Modell muss reale Aufgaben mit Tools und mehreren Schritten bearbeiten. Bewertet nach Erfolgsquote und erreichten Aufgabenpunkten.
🎯 Erfolgsquote🏆 Aufgabenpunkte🔧 Tool-Nutzung🧠 echte Aufgaben
| # | Modell / Hersteller | Messwerte | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|
| 1 | MiniMax-M2.5230BMiniMax HarnessbenchmarkTool Usage V 1.0 | 1.245 Pkt 70,7% · 15/15 Aufg. · 301,0 s | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | openclaw_cli | Details → | |
| 2 | MiniMax-M2.7230BMiniMax HarnessbenchmarkTool-Parcours Dossier 40 V1.0 | 3.641 Pkt 61,1% · 40/40 Aufg. · 8.209,0 s | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | vLLMgodclawAWQ | Details → | |
| 3 | MiniMax-M2.5230BMiniMax HarnessbenchmarkTool Usage Standard 1.0 | 1.762 Pkt 59,1% · 16/16 Aufg. · 526,0 s | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | openclaw_cli | Details → | |
| 4 | MiniMax-M2.5230BMiniMax HarnessbenchmarkTextgenerierung V 1.0 | 790 Pkt 52,0% · 15/15 Aufg. · 261,0 s | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | openclaw_cli | Details → | |
| 5 | MiniMax-M2.7230BMiniMax HarnessbenchmarkTool Usage Standard 1.0 | 858 Pkt 28,8% · 16/16 Aufg. · 1.222,0 s | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | godclaw | Details → |
