🤖
Harness-Benchmark
Wie gut löst das Modell echte Aufgaben?
Qualität in echten Agenten- und Chat-Aufgaben – das Modell muss reale Aufgaben mit Tools und mehreren Schritten bearbeiten. Bewertet nach Erfolgsquote und erreichten Aufgabenpunkten.
🎯 Erfolgsquote🏆 Aufgabenpunkte🔧 Tool-Nutzung🧠 echte Aufgaben
| # | Modell / Hersteller | Messwerte | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|
| 1 | Devstral-Small-2-24B-Instruct-251224BMistral AI HarnessbenchmarkTool Usage Standard 1.0 | 2.597 Pkt 87,1% · 16/16 Aufg. · 165,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 2 | Gemma-4-26B-A4B-it26BGoogle HarnessbenchmarkTool Usage Standard 1.0 | 2.440 Pkt 81,9% · 16/16 Aufg. · 218,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 123 GB RAM | openclaw_cli | Details → | |
| 3 | Gemma-4-26B-A4B-it26BGoogle HarnessbenchmarkTool Usage Standard 1.0 | 2.383 Pkt 80,0% · 16/16 Aufg. · 245,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 123 GB RAM | openclaw_cli | Details → | |
| 4 | Gemma-4-26B-A4B-it26BGoogle HarnessbenchmarkTool Usage Standard 1.0 | 2.268 Pkt 76,1% · 16/16 Aufg. · 347,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 5 | Devstral-Small-2-24B-Instruct-251224BMistral AI HarnessbenchmarkGodBrain MCP Deep 40 - Wissensbasis-Lebenszyklus 1.0 | 5.738 Pkt 75,7% · 40/40 Aufg. · 1.879,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 6 | Gemma-4-26B-A4B-it26BGoogle HarnessbenchmarkTool Usage Standard 1.0 | 2.197 Pkt 73,7% · 16/16 Aufg. · 375,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | openclaw_cli | Details → | |
| 7 | Devstral-Small-2-24B-Instruct-251224BMistral AI HarnessbenchmarkTool Usage Extrem 40 - Tech-Radar Mission 1.0 | 5.629 Pkt 68,6% · 40/40 Aufg. · 2.018,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 8 | Gemma-4-26B-A4B-it26BGoogle HarnessbenchmarkGodBrain MCP Deep 40 - Wissensbasis-Lebenszyklus 1.0 | 2.271 Pkt 30,0% · 18/40 Aufg. · 982,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 9 | Gemma-4-26B-A4B-it26BGoogle HarnessbenchmarkTool-Parcours Dossier 40 V1.0 | 1.489 Pkt 25,0% · 22/40 Aufg. · 8.783,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 10 | Devstral-Small-2-24B-Instruct-251224BMistral AI HarnessbenchmarkTool-Parcours Dossier 40 V1.0 | 1.436 Pkt 24,1% · 21/40 Aufg. · 8.887,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | llama.cppgodclawQ8_0 | Details → | |
| 11 | Qwen2.5-32B-Instruct-AWQ32BQwen (Alibaba) HarnessbenchmarkTool Usage V 1.0 | 235 Pkt 13,4% · 15/15 Aufg. · 1.783,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 31 GB RAM | openclaw_cli | Details → | |
| 12 | gemma-4-31B-it31BGoogle HarnessbenchmarkTool Usage Standard 1.0 | 298 Pkt 10,0% · 16/16 Aufg. · 9.625,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 123 GB RAM | openclaw_cli | Details → | |
| 13 | Qwen2.5-32B-Instruct-AWQ32BQwen (Alibaba) HarnessbenchmarkTool Usage Standard 1.0 | 298 Pkt 10,0% · 16/16 Aufg. · 4.687,0 s | AMD Radeon 8060S GraphicsAMD RYZEN AI MAX+ 395 w/ Radeon 8060S · 123 GB RAM | openclaw_cli | Details → |
