Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
🤖
Harness-Benchmark

Wie gut löst das Modell echte Aufgaben?

Qualität in echten Agenten- und Chat-Aufgaben – das Modell muss reale Aufgaben mit Tools und mehreren Schritten bearbeiten. Bewertet nach Erfolgsquote und erreichten Aufgabenpunkten.

🎯 Erfolgsquote🏆 Aufgabenpunkte🔧 Tool-Nutzung🧠 echte Aufgaben
Reset
Messwert:
#Modell / HerstellerMesswerteGPU / CPU / RAMRuntime
1MiniMax-M2.5230BMiniMax HarnessbenchmarkTool Usage V 1.0
1.245 Pkt
70,7% · 15/15 Aufg. · 301,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMopenclaw_cli
2MiniMax-M2.7230BMiniMax HarnessbenchmarkTool-Parcours Dossier 40 V1.0
3.641 Pkt
61,1% · 40/40 Aufg. · 8.209,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMvLLMgodclawAWQ
3MiniMax-M2.5230BMiniMax HarnessbenchmarkTool Usage Standard 1.0
1.762 Pkt
59,1% · 16/16 Aufg. · 526,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMopenclaw_cli
4MiniMax-M2.5230BMiniMax HarnessbenchmarkTextgenerierung V 1.0
790 Pkt
52,0% · 15/15 Aufg. · 261,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMopenclaw_cli
5MiniMax-M2.7230BMiniMax HarnessbenchmarkTool Usage Standard 1.0
858 Pkt
28,8% · 16/16 Aufg. · 1.222,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMgodclaw