Mistral AI
Devstral-Small-2-24B-Instruct-2512
Performancebenchmark · gemessen am 20.07.2026 11:28
Benchmark-ID
run-20260722-165905-bc58b9Performancetest Small 1.0Dense24BRuntime: godclawQuantisierung: Q8_0
Generation8,88tok/s
Prefill22,07tok/s
Time to First Token906,00ms
Gesamtdauer14,99s
Concurrency1parallel
Einordnung im Feld
121von 135 Systemen
Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)
Dieser Lauf ist besser als 10 % aller vergleichbaren Systeme.
Generation
8,9 tok/s
-79 % vs Ø 42,5
Prefill
22,1 tok/s
-99 % vs Ø 2.885,5
Time to First Token
906 ms
-46 % vs Ø 1.685
Verteilung im Feld2 – 148 tok/s
Wie schlägt sich dieser Benchmark?
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-85f64f
147,8 tok/s
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-637af7
143,9 tok/s
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-65d35f
137,7 tok/s
Nemotron-Cascade-2-30B-A3B3× AMD Radeon AI PRO R9700 · run-20260722-181156-a273f2
107,9 tok/s
Nemotron-3-Nano-Omni-30B-A3B-Reasoning3× AMD Radeon AI PRO R9700 · run-20260722-182228-95c528
102,9 tok/s
gpt-oss-120b3× AMD Radeon AI PRO R9700 · run-20260722-165909-4e3ede
99,8 tok/s
Qwen3-30B-A3B-Instruct-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-cc8f3f
97,6 tok/s
NVIDIA-Nemotron-3-Nano-4B3× AMD Radeon AI PRO R9700 · run-20260722-190202-45dc8e
93,4 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165908-5712c8
91,4 tok/s
Qwen3-30B-A3B-Instruct-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-b20fe5
91,0 tok/s
Qwen3-VL-30B-A3B-Instruct3× AMD Radeon AI PRO R9700 · run-20260722-165908-4d91c3
89,8 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165908-40e052
88,6 tok/s
Qwen3-Coder-30B-A3B-Instruct3× AMD Radeon AI PRO R9700 · run-20260722-165907-0a4b43
88,2 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-83951d
87,8 tok/s
Devstral-Small-2-24B-Instruct-2512 dieser LaufAMD Radeon Graphics · run-20260722-165905-bc58b9
8,9 tok/s
Hardware
GPU: AMD Radeon Graphics · 0 GB VRAM
CPU: 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
RAM: 31 GB
Setup
Runtime: godclaw
Quantisierung: Q8_0
Modell: Devstral-Small-2-24B-Instruct-2512
Konfiguration
# LLM-Benchmark Konfiguration
# Modell : Devstral-Small-2-24B-Instruct-2512
# Engine : llama.cpp
# Run-ID : run-20260722-165905-bc58b9
# GPU : AMD Radeon Graphics
# CPU : 32x AMD RYZEN AI MAX+ 395 w/ Radeon 8060S
# RAM : 31 GB
bench@llm-benchmark:~$ /home/godcore/llama.cpp/build-rocm/bin/llama-server \
--model /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf \
--alias mistralai/Devstral-Small-2-24B-Instruct-2512 \
--host 0.0.0.0 \
--port 8000 \
--ctx-size 131072 \
--parallel 1 \
--temp 0.2 \
--repeat-penalty 1.05 \
--repeat-last-n 256 \
--gpu-layers 99 \
--flash-attn on \
--jinja \
--chat-template-file /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja \
--threads 8 \
--threads-batch 16
| Engine | llamacpp |
| Modellalias | mistralai/Devstral-Small-2-24B-Instruct-2512 |
| Kontextlaenge | 131072 |
| Modellpfad | /home/godcore/models/devstral-small-2-24b-q8_0-gguf/Devstral-Small-2-24B-Instruct-2512-Q8_0.gguf |
| Parallel | 1 |
| Temperatur | 0.2 |
| Repeat-Penalty | 1.05 |
| Repeat-Last-N | 256 |
| GPU-Layer | 99 |
| Flash Attention | on |
| Jinja | aktiv |
| Chat-Template | /home/godcore/models/devstral-small-2-24b-q8_0-gguf/chat_template.jinja |
| Threads | 8 |
| Batch-Threads | 16 |
