Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Mistral AI

Devstral-Small-2-24B-Instruct-2512

Harnessbenchmark · gemessen am 17.07.2026 09:28

Benchmark-IDrun-20260722-161611-23baf9
Tool Usage Extrem 40 - Tech-Radar Mission 1.0Dense24BRuntime: godclawQuantisierung: Q8_0
Punkte5.629,00von 8.210,00
Punktequote68,56%
Aufgaben bestanden40von 40
Gesamtdauer2.018,00s
Einordnung im Feld
11von 30 Systemen

Harnessbenchmark · Leitmetrik: Punktequote (%)

Dieser Lauf ist besser als 66 % aller vergleichbaren Systeme.
Punktequote 69 %
+26 % vs Ø 54,4
Aufgaben bestanden 40
+115 % vs Ø 18,6
Gesamtdauer 2.018,0 s
-16 % vs Ø 2.395,9
Verteilung im Feld10 – 91 %
Ø 54 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: AMD GPU · 0 GB VRAM
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB

Setup

Runtime: godclaw
Quantisierung: Q8_0
Modell: Devstral-Small-2-24B-Instruct-2512

Aufgaben (40)

AufgabeStatusPunkteDauer
Antwortzeitbestanden5 / 5028,00 s
Strukturierte Ausgabebestanden7 / 7037,00 s
Arbeitsverzeichnis anlegenbestanden10 / 10099,00 s
Quelldatei schreibenbestanden12 / 120308,00 s
Gezielt lesenbestanden72 / 10011,00 s
Zählen im Dateisystembestanden99 / 13012,00 s
CSV erzeugenbestanden80 / 18043,00 s
CSV nach JSONbestanden70 / 22068,00 s
Defektes JSON diagnostizierenbestanden60 / 18052,00 s
Datenfilterbestanden185 / 22016,00 s
Prüfsummenbestanden131 / 18021,00 s
Archiv packenbestanden161 / 1808,00 s
Internetrecherche Faktbestanden172 / 22022,00 s
Internetrecherche Vergleichbestanden217 / 25016,00 s
Webseite auswertenbestanden176 / 22022,00 s
Rechercheergebnis sichernbestanden36 / 20073,00 s
Wissenseintrag anlegenbestanden183 / 30052,00 s
Wissenseintrag wiederfindenbestanden115 / 20038,00 s
Wissenseintrag erweiternbestanden228 / 25010,00 s
Versionierung prüfenbestanden191 / 22013,00 s
Kategorien erkundenbestanden148 / 18014,00 s
Aufgabenboards sichtenbestanden178 / 20010,00 s
Aufgabe erstellenbestanden239 / 2505,00 s
Aufgabenliste anlegenbestanden219 / 25014,00 s
Aufgabenliste prüfenbestanden141 / 18017,00 s
Organisation erfassenbestanden214 / 25016,00 s
Fakt hinterlegenbestanden232 / 2508,00 s
Verknüpfung herstellenbestanden236 / 28019,00 s
Bestand durchsuchenbestanden198 / 22010,00 s
Erkenntnis merkenbestanden171 / 20013,00 s
Erkenntnis abrufenbestanden159 / 1809,00 s
Titelbild erzeugenbestanden222 / 25015,00 s
Zweitmeinung einholenbestanden25 / 250465,00 s
Kette: Recherche in Dateibestanden185 / 25029,00 s
Kette: Datei ins Wissenbestanden255 / 28012,00 s
Konsistenzprüfungbestanden198 / 25023,00 s
Fehlerfall ehrlich meldenbestanden185 / 2006,00 s
Abschlussberichtbestanden28 / 280148,00 s
Gezielt aufräumenbestanden22 / 220220,00 s
Selbstauskunftbestanden164 / 20016,00 s

Konfiguration

benchmark-konfiguration — run-20260722-161611-23baf9
# LLM-Benchmark Konfiguration # Modell : Devstral-Small-2-24B-Instruct-2512 # Engine : llama.cpp # Run-ID : run-20260722-161611-23baf9 # GPU : AMD GPU # CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S # RAM : 31 GB bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \ --model /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf \ --alias mistralai/Devstral-Small-2-24B-Instruct-2512 \ --host 0.0.0.0 \ --port 8000 \ --ctx-size 131072 \ --parallel 1 \ --temp 0.2 \ --repeat-penalty 1.05 \ --repeat-last-n 256 \ --gpu-layers 99 \ --flash-attn on \ --jinja \ --chat-template-file /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja \ --threads 8 \ --threads-batch 16
Enginellamacpp
Modellaliasmistralai/Devstral-Small-2-24B-Instruct-2512
Kontextlaenge131072
Modellpfad/home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf
Parallel1
Temperatur0.2
Repeat-Penalty1.05
Repeat-Last-N256
GPU-Layer99
Flash Attentionon
Jinjaaktiv
Chat-Template/home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja
Threads8
Batch-Threads16

Alle Benchmarks dieses Modells Zum Leaderboard