Mistral AI
Devstral-Small-2-24B-Instruct-2512
Harnessbenchmark · gemessen am 17.07.2026 09:28
Benchmark-ID
run-20260722-161611-23baf9Tool Usage Extrem 40 - Tech-Radar Mission 1.0Dense24BRuntime: godclawQuantisierung: Q8_0
Punkte5.629,00von 8.210,00
Punktequote68,56%
Aufgaben bestanden40von 40
Gesamtdauer2.018,00s
Einordnung im Feld
11von 30 Systemen
Harnessbenchmark · Leitmetrik: Punktequote (%)
Dieser Lauf ist besser als 66 % aller vergleichbaren Systeme.
Punktequote
69 %
+26 % vs Ø 54,4
Aufgaben bestanden
40
+115 % vs Ø 18,6
Gesamtdauer
2.018,0 s
-16 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Wie schlägt sich dieser Benchmark?
Gemma-4-26B-A4B-itNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-05d866
91 %
Devstral-Small-2-24B-Instruct-2512 gleiches ModellAMD GPU · run-20260722-161611-5f2f86
87 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-12a767
82 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-f6cfe1
81 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-9b7325
80 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-54019f
79 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-0064a9
76 %
Devstral-Small-2-24B-Instruct-2512 gleiches ModellAMD GPU · run-20260722-161611-798dcc
76 %
Gemma-4-26B-A4B-itAMD GPU · run-20260722-161611-78ff78
74 %
MiniMax-M2.5-BF16-INT4-AWQNVIDIA GB10 · run-20260722-165444-51f2b3
71 %
Devstral-Small-2-24B-Instruct-2512 dieser LaufAMD GPU · run-20260722-161611-23baf9
69 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-a58abe
68 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161611-2a2c91
65 %
MiniMax-M2.53× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-161610-99f36d
61 %
Hardware
GPU: AMD GPU · 0 GB VRAM
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Setup
Runtime: godclaw
Quantisierung: Q8_0
Modell: Devstral-Small-2-24B-Instruct-2512
Aufgaben (40)
| Aufgabe | Status | Punkte | Dauer |
|---|---|---|---|
| Antwortzeit | bestanden | 5 / 50 | 28,00 s |
| Strukturierte Ausgabe | bestanden | 7 / 70 | 37,00 s |
| Arbeitsverzeichnis anlegen | bestanden | 10 / 100 | 99,00 s |
| Quelldatei schreiben | bestanden | 12 / 120 | 308,00 s |
| Gezielt lesen | bestanden | 72 / 100 | 11,00 s |
| Zählen im Dateisystem | bestanden | 99 / 130 | 12,00 s |
| CSV erzeugen | bestanden | 80 / 180 | 43,00 s |
| CSV nach JSON | bestanden | 70 / 220 | 68,00 s |
| Defektes JSON diagnostizieren | bestanden | 60 / 180 | 52,00 s |
| Datenfilter | bestanden | 185 / 220 | 16,00 s |
| Prüfsummen | bestanden | 131 / 180 | 21,00 s |
| Archiv packen | bestanden | 161 / 180 | 8,00 s |
| Internetrecherche Fakt | bestanden | 172 / 220 | 22,00 s |
| Internetrecherche Vergleich | bestanden | 217 / 250 | 16,00 s |
| Webseite auswerten | bestanden | 176 / 220 | 22,00 s |
| Rechercheergebnis sichern | bestanden | 36 / 200 | 73,00 s |
| Wissenseintrag anlegen | bestanden | 183 / 300 | 52,00 s |
| Wissenseintrag wiederfinden | bestanden | 115 / 200 | 38,00 s |
| Wissenseintrag erweitern | bestanden | 228 / 250 | 10,00 s |
| Versionierung prüfen | bestanden | 191 / 220 | 13,00 s |
| Kategorien erkunden | bestanden | 148 / 180 | 14,00 s |
| Aufgabenboards sichten | bestanden | 178 / 200 | 10,00 s |
| Aufgabe erstellen | bestanden | 239 / 250 | 5,00 s |
| Aufgabenliste anlegen | bestanden | 219 / 250 | 14,00 s |
| Aufgabenliste prüfen | bestanden | 141 / 180 | 17,00 s |
| Organisation erfassen | bestanden | 214 / 250 | 16,00 s |
| Fakt hinterlegen | bestanden | 232 / 250 | 8,00 s |
| Verknüpfung herstellen | bestanden | 236 / 280 | 19,00 s |
| Bestand durchsuchen | bestanden | 198 / 220 | 10,00 s |
| Erkenntnis merken | bestanden | 171 / 200 | 13,00 s |
| Erkenntnis abrufen | bestanden | 159 / 180 | 9,00 s |
| Titelbild erzeugen | bestanden | 222 / 250 | 15,00 s |
| Zweitmeinung einholen | bestanden | 25 / 250 | 465,00 s |
| Kette: Recherche in Datei | bestanden | 185 / 250 | 29,00 s |
| Kette: Datei ins Wissen | bestanden | 255 / 280 | 12,00 s |
| Konsistenzprüfung | bestanden | 198 / 250 | 23,00 s |
| Fehlerfall ehrlich melden | bestanden | 185 / 200 | 6,00 s |
| Abschlussbericht | bestanden | 28 / 280 | 148,00 s |
| Gezielt aufräumen | bestanden | 22 / 220 | 220,00 s |
| Selbstauskunft | bestanden | 164 / 200 | 16,00 s |
Konfiguration
# LLM-Benchmark Konfiguration
# Modell : Devstral-Small-2-24B-Instruct-2512
# Engine : llama.cpp
# Run-ID : run-20260722-161611-23baf9
# GPU : AMD GPU
# CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
# RAM : 31 GB
bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \
--model /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf \
--alias mistralai/Devstral-Small-2-24B-Instruct-2512 \
--host 0.0.0.0 \
--port 8000 \
--ctx-size 131072 \
--parallel 1 \
--temp 0.2 \
--repeat-penalty 1.05 \
--repeat-last-n 256 \
--gpu-layers 99 \
--flash-attn on \
--jinja \
--chat-template-file /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja \
--threads 8 \
--threads-batch 16
| Engine | llamacpp |
| Modellalias | mistralai/Devstral-Small-2-24B-Instruct-2512 |
| Kontextlaenge | 131072 |
| Modellpfad | /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf |
| Parallel | 1 |
| Temperatur | 0.2 |
| Repeat-Penalty | 1.05 |
| Repeat-Last-N | 256 |
| GPU-Layer | 99 |
| Flash Attention | on |
| Jinja | aktiv |
| Chat-Template | /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja |
| Threads | 8 |
| Batch-Threads | 16 |
