Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
🤖
Harness benchmark

How well does the model solve real tasks?

Quality on real agent and chat tasks – the model must handle real tasks with tools and multiple steps. Scored by success rate and task points achieved.

🎯 Success rate🏆 Task points🔧 Tool use🧠 real tasks
Reset
Metric:
#Model / MakerMetricsGPU / CPU / RAMRuntime
1MiniMax-M2.5230BMiniMax Harness benchmarkTool Usage V 1.0
1.245 Pkt
70,7% · 15/15 Aufg. · 301,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMopenclaw_cli
2MiniMax-M2.7230BMiniMax Harness benchmarkTool-Parcours Dossier 40 V1.0
3.641 Pkt
61,1% · 40/40 Aufg. · 8.209,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMvLLMgodclawAWQ
3MiniMax-M2.5230BMiniMax Harness benchmarkTool Usage Standard 1.0
1.762 Pkt
59,1% · 16/16 Aufg. · 526,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMopenclaw_cli
4MiniMax-M2.5230BMiniMax Harness benchmarkTextgenerierung V 1.0
790 Pkt
52,0% · 15/15 Aufg. · 261,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMopenclaw_cli
5MiniMax-M2.7230BMiniMax Harness benchmarkTool Usage Standard 1.0
858 Pkt
28,8% · 16/16 Aufg. · 1.222,0 s
NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMgodclaw