Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Beigesteuert vonMarcel SommerMistral AI

Devstral-Small-2-24B-Instruct-2512

Performancebenchmark · gemessen am 03.08.2026 11:44

Benchmark-IDrun-20260804-052132-95df37
Timebench 3 - Kombi (Prefill + Generation)Dense24BRuntime: vLLMQuantisierung: AWQ
Generation55,98tok/s
Prefill2.071,44tok/s
Time to First Token1.037,50ms
Gesamtdauer37,30s
Concurrency1parallel
Einordnung im Feld
361von 609 Systemen

Performancebenchmark · Leitmetrik: Generation-Speed (tok/s) · 1× parallel

Dieser Lauf ist besser als 41 % aller vergleichbaren Systeme.
Generation 56,0 tok/s
-49 % vs Ø 110,8
Prefill 2.071,4 tok/s
-30 % vs Ø 2.959,0
Time to First Token 1.038 ms
-95 % vs Ø 21.670
Verteilung im Feld0 – 405 tok/s
Ø 111 Median Dieser Lauf

Wie schlägt sich dieser Benchmark mit anderen Modellen?

gpt-oss-20bNVIDIA GeForce RTX 5090 · run-20260724-004608-16af9b
404,6 tok/s
gpt-oss-20bNVIDIA RTX PRO 6000 Blackwell Workstation Edition · run-20260730-035052-9f766a
395,2 tok/s
NVIDIA-Nemotron-3-Nano-4BNVIDIA GeForce RTX 5090 · run-20260728-194135-d456e7
393,5 tok/s
NVIDIA-Nemotron-3-Nano-4BNVIDIA RTX PRO 6000 Blackwell Workstation Edition · run-20260727-181607-bffb11
393,5 tok/s
gpt-oss-20bNVIDIA GeForce RTX 5090 · run-20260724-004607-29bd16
388,9 tok/s
gpt-oss-20bNVIDIA GeForce RTX 5090 · run-20260729-032121-1c779f
388,2 tok/s
gemma-4-E2B-itNVIDIA RTX PRO 6000 Blackwell Workstation Edition · run-20260727-181606-6ea089
378,6 tok/s
gemma-4-E2B-itNVIDIA GeForce RTX 5090 · run-20260728-184455-e8b129
377,6 tok/s
NVIDIA-Nemotron-3-Nano-4B3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260728-194136-ac388e
362,3 tok/s
NVIDIA-Nemotron-3-Nano-4B3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260728-194136-5e5085
361,4 tok/s
NVIDIA-Nemotron-3-Nano-30B-A3BNVIDIA GeForce RTX 5090 · run-20260729-105335-653788
359,4 tok/s
Nemotron-3-Nano-Omni-30B-A3B-ReasoningNVIDIA GeForce RTX 5090 · run-20260729-105334-2c4905
359,3 tok/s
Nemotron-Cascade-2-30B-A3BNVIDIA GeForce RTX 5090 · run-20260729-105334-44d1e7
359,0 tok/s
Nemotron-3-Nano-Omni-30B-A3B-ReasoningNVIDIA RTX PRO 6000 Blackwell Workstation Edition · run-20260729-032119-4852bf
357,1 tok/s
Devstral-Small-2-24B-Instruct-2512 dieser LaufNVIDIA GeForce RTX 3090 Ti · run-20260804-052132-95df37
56,0 tok/s

Wie schlägt sich dieser Benchmark mit anderen GPUs?

Dasselbe Modell auf anderer Hardware · 1× parallel · Generation (tok/s)

Hardware

GPU: NVIDIA GeForce RTX 3090 Ti · 24 GB VRAM
CPU: AMD Ryzen 5 5600X 6-Core Processor
RAM: 30 GB
Mainboard: ASUSTeK COMPUTER INC. PRIME A520M-K

Setup

Runtime: vLLM
Quantisierung: AWQ
Modell: Devstral-Small-2-24B-Instruct-2512

Konfiguration

benchmark-konfiguration — run-20260804-052132-95df37
# LLM-Benchmark Konfiguration # Modell : Devstral-Small-2-24B-Instruct-2512 # Engine : vLLM # Run-ID : run-20260804-052132-95df37 # GPU : NVIDIA GeForce RTX 3090 Ti # CPU : AMD Ryzen 5 5600X 6-Core Processor # RAM : 30 GB bench@llm-benchmark:~$ /opt/vllm-gemma/venv/bin/python /opt/vllm-gemma/venv/bin/vllm serve /home/godcore/models/devstral24-awq \ --served-model-name Devstral-Small-2-24B-Instruct-2512 \ --host 192.168.41.116 \ --port 8000 \ --dtype half \ --max-model-len 32768 \ --gpu-memory-utilization 0.92 \ --enforce-eager \ --limit-mm-per-prompt '{"image":0}'
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.vllm
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.Devstral-Small-2-24B-Instruct-2512
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.32768
Alias?Anzeigename des Modells nach aussen (served model name), unabhaengig vom Dateinamen.Devstral-Small-2-24B-Instruct-2512
Dtype?Zahlenformat der Modellgewichte bei der Berechnung (z.B. auto, float16, bfloat16). 'auto' waehlt automatisch das vom Modell empfohlene Format.half
Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells.32768
GPU-Speicher?Anteil des GPU-Speichers (0 bis 1), den vLLM belegen darf. 0.92 = 92 %. Hoeher = mehr Platz fuer den KV-Cache (mehr/laengere parallele Anfragen), aber groesseres Risiko fuer 'Out of Memory'.0.92
Enforce-Eager?Schaltet die optimierte Graph-Ausfuehrung (CUDA-/HIP-Graphs) AB und rechnet Schritt fuer Schritt. Startet schneller und spart etwas VRAM, ist im laufenden Betrieb aber meist langsamer als mit Graphs.aktiv
limit-mm-per-prompt?Obergrenze fuer multimodale Eingaben pro Prompt (z.B. Anzahl Bilder). Nur fuer multimodale Modelle relevant.{"image":0}

Alle Benchmarks dieses Modells Zum Leaderboard

Anzeige
Modell-Vergleich

Devstral-Small-2-24B-Instruct-2512 auf verschiedener Hardware

Alle veröffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.

GPUnach Grafikkarte

9226914612300,003.3026.6049.906Prefill (tok/s)Generation (tok/s)NVIDIA RTX PRO 6000 Blackwell Workstation Edition - 725,6 tok/s Generation, 8.070 tok/s Prefill, TTFT 3.939 ms (6 Laufe)NVIDIA RTX PRO 6000 B...NVIDIA GeForce RTX 5090 - 620,3 tok/s Generation, 6.308 tok/s Prefill, TTFT 6.898 ms (3 Laufe)NVIDIA GeForce RTX 50...NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition - 569,7 tok/s Generation, 8.224 tok/s Prefill, TTFT 7.901 ms (9 Laufe)NVIDIA RTX PRO 6000 B...NVIDIA GeForce RTX 5070 Ti - 108,5 tok/s Generation, 1.619 tok/s Prefill, TTFT 37.385 ms (3 Laufe)NVIDIA GeForce RTX 50...NVIDIA GeForce RTX 3090 Ti - 355,4 tok/s Generation, 3.516 tok/s Prefill, TTFT 7.254 ms (9 Laufe) | DIESER LAUF★ NVIDIA GeForce RTX 30...
NVIDIA RTX PRO 6000 Blackwell Workstation Edition 725,6 tok/sNVIDIA GeForce RTX 5090 620,3 tok/sNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition 569,7 tok/s★ NVIDIA GeForce RTX 3090 Ti 355,4 tok/s dieser LaufNVIDIA GeForce RTX 5070 Ti 108,5 tok/s

CPUnach Prozessor

9226914612300,003.3026.6049.906Prefill (tok/s)Generation (tok/s)AMD Ryzen 9 9950X 16-Core Processor - 725,6 tok/s Generation, 8.070 tok/s Prefill, TTFT 3.939 ms (6 Laufe)AMD Ryzen 9 9950X 16-...AMD Ryzen 7 5800X3D 8-Core Processor - 620,3 tok/s Generation, 6.308 tok/s Prefill, TTFT 6.898 ms (3 Laufe)AMD Ryzen 7 5800X3D 8...AMD Ryzen Threadripper PRO 9965WX 24-Cores - 569,7 tok/s Generation, 8.224 tok/s Prefill, TTFT 7.901 ms (9 Laufe)AMD Ryzen Threadrippe...AMD Ryzen 9 8945HX with Radeon Graphics - 331,6 tok/s Generation, 3.668 tok/s Prefill, TTFT 14.010 ms (3 Laufe)AMD Ryzen 9 8945HX wi...AMD Ryzen Threadripper PRO 5975WX 32-Cores - 108,5 tok/s Generation, 1.619 tok/s Prefill, TTFT 37.385 ms (3 Laufe)AMD Ryzen Threadrippe...AMD Ryzen 5 5600X 6-Core Processor - 355,4 tok/s Generation, 3.440 tok/s Prefill, TTFT 3.876 ms (6 Laufe) | DIESER LAUF★ AMD Ryzen 5 5600X 6-C...
AMD Ryzen 9 9950X 16-Core Processor 725,6 tok/sAMD Ryzen 7 5800X3D 8-Core Processor 620,3 tok/sAMD Ryzen Threadripper PRO 9965WX 24-Cores 569,7 tok/s★ AMD Ryzen 5 5600X 6-Core Processor 355,4 tok/s dieser LaufAMD Ryzen 9 8945HX with Radeon Graphics 331,6 tok/sAMD Ryzen Threadripper PRO 5975WX 32-Cores 108,5 tok/s

MBnach Mainboard

9226914612300,003.3026.6049.906Prefill (tok/s)Generation (tok/s)ASUSTeK COMPUTER INC. ProArt X870E-CREATOR WIFI - 725,6 tok/s Generation, 8.070 tok/s Prefill, TTFT 3.939 ms (6 Laufe)ASUSTeK COMPUTER INC....ASUSTeK COMPUTER INC. ROG STRIX B550-A GAMING - 620,3 tok/s Generation, 6.308 tok/s Prefill, TTFT 6.898 ms (3 Laufe)ASUSTeK COMPUTER INC....ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE - 569,7 tok/s Generation, 8.224 tok/s Prefill, TTFT 7.901 ms (9 Laufe)ASUSTeK COMPUTER INC....Meigao Innovation Technology (Shen Zhen) Co., Ltd DRFXL (MotherBoard Series) - 331,6 tok/s Generation, 3.668 tok/s Prefill, TTFT 14.010 ms (3 Laufe)Meigao Innovation Tec...ASUSTeK COMPUTER INC. Pro WS WRX80E-SAGE SE WIFI - 108,5 tok/s Generation, 1.619 tok/s Prefill, TTFT 37.385 ms (3 Laufe)ASUSTeK COMPUTER INC....ASUSTeK COMPUTER INC. PRIME A520M-K - 355,4 tok/s Generation, 3.440 tok/s Prefill, TTFT 3.876 ms (6 Laufe) | DIESER LAUF★ ASUSTeK COMPUTER INC....
ASUSTeK COMPUTER INC. ProArt X870E-CREATOR WIFI 725,6 tok/sASUSTeK COMPUTER INC. ROG STRIX B550-A GAMING 620,3 tok/sASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE 569,7 tok/s★ ASUSTeK COMPUTER INC. PRIME A520M-K 355,4 tok/s dieser LaufMeigao Innovation Technology (Shen Zhen) Co., Ltd DRFXL (MotherBoard Series) 331,6 tok/sASUSTeK COMPUTER INC. Pro WS WRX80E-SAGE SE WIFI 108,5 tok/s

ENGnach Engine

89469048728379,63.8464.9215.9967.071Prefill (tok/s)Generation (tok/s)llama.cpp - 645,1 tok/s Generation, 6.363 tok/s Prefill, TTFT 12.610 ms (21 Laufe)llama.cppunbekannt - 247,7 tok/s Generation, 4.553 tok/s Prefill, TTFT 4.826 ms (2 Laufe)unbekanntvLLM - 725,6 tok/s Generation, 5.018 tok/s Prefill, TTFT 2.630 ms (7 Laufe) | DIESER LAUF★ vLLM
★ vLLM 725,6 tok/s dieser Laufllama.cpp 645,1 tok/sunbekannt 247,7 tok/s

DRVnach Treiber

7987627266896535.5735.8106.0476.284Prefill (tok/s)Generation (tok/s)unbekannt - 725,6 tok/s Generation, 5.929 tok/s Prefill, TTFT 9.762 ms (30 Laufe)unbekannt
unbekannt 725,6 tok/s
💰 Economics

Wirtschaftlichkeit dieses Laufs

Betriebskosten, TCO und Vergleich mit den nächstbesten Läufen desselben Modells bei identischer Concurrency (1× parallel). Methodik →

⚙️ KonfigurationAlle Kennzahlen und Diagramme unten folgen diesen Einstellungen – bezogen auf 24 Monate Laufzeit.In URL übernehmenZurücksetzen
⚡ Strompreis EUR/kWh
⚙️ System-Auslastung 100 %
🖥️ Anschaffung EUR
🔌 Idle 25 W
⚡ TDP 450 W
☁️ Externes LLM (API)
Strompreis0,30 EUR/kWh
Ø-Leistung (inkl. Idle)450 W geschätzt (TDP)GPU 450 W Volllast
Ø-Kosten / Stunde0,14 EUR
Strom / 1 Mio. Token0,67 EUR
Token / kWh447,84 Tsd.
Anschaffung (System)1.149 EUR TeilpreisGPU 999 EUR · Netzteil 150 EUR
Stromkosten (2 Jahre)
TCO (2 Jahre)3.514 EUR
Output-Token (2 Jahre)3,53 Mrd.
☁️ Externes LLM (API) – Vergleich
Externe LLM-Kosten (2 Jahre)
Ersparnis vs. extern (2 Jahre)

Alle Werte oben und die Diagramme unten berücksichtigen die eingestellte System-Auslastung: bei X % generiert das System nur X % der Zeit, die restliche Zeit läuft es im Idle (25 W). Kosten pro Stunde sinken dadurch (mehr Idle), Kosten je Token steigen.

Kosten über 2 Jahre – nur Strom

Kosten über 2 Jahre – inkl. Anschaffung (TCO)

Geschwindigkeit vs. Token pro Euro

Euro pro 1 Mio. Token

Vergleich zur API – Wirtschaftlichkeit je Benchmark

Devstral-Small-2-24B-Instruct-2512NVIDIA GeForce RTX 3090 TiDevstral-Small-2-24B-Instruct-2512NVIDIA RTX PRO 6000 Blackwell Workstation EditionDevstral-Small-2-24B-Instruct-2512NVIDIA GeForce RTX 5090Devstral-Small-2-24B-Instruct-2512NVIDIA RTX PRO 6000 Blackwell Workstation Edition
Kosten Strom (24 Mon.)
Kosten Anschaffung
Kosten Gesamt (TCO)
Generierte Token (24 Mon.)
Tokenpreis bei API
Break-Even-Point (Tage)
Ergebnis (Ersparnis / Ausgabe)

Vergleich mit bis zu 3 nächstbesten Läufen dieses Modells bei gleicher Concurrency (mind. einer auf anderer Hardware). Leistung = GPU-TDP + CPU (Idle + 15 %) + Board (geschätzt), Anschaffung = komplettes System (GPU + CPU + Board + RAM + Netzteil), Preise = hinterlegte Marktpreise.

Beigesteuert von

Marcel Sommer

@marcelsommer