Mario Alka
@marioalka · Administrator · Mitglied seit 07/2026
Ich bin Unternehmer, Softwareentwickler und KI-Enthusiast. Seit vielen Jahren entwickle ich Unternehmenssoftware und beschäftige mich inzwischen fast täglich mit lokalen LLMs, KI-Agenten und leistungsfähiger KI-Hardware.
Mit LLM-Benchmark.de möchte ich eine Plattform schaffen, auf der Modelle, GPUs und Agenten objektiv und reproduzierbar miteinander verglichen werden.
3.987Benchmarks beigesteuert
3.957Performance-Läufe
30Harness-Läufe
64Getestete Modelle
15Genutzte GPUs
2.491Bester Durchsatz · tok/s
90,6%Beste Erfolgsquote
Genutzte Hardware
NVIDIA RTX A6000992× · 1.568 tok/sAMD Radeon AI PRO R9700855× · 667 tok/sNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition524× · 2.144 tok/sNVIDIA RTX PRO 6000 Blackwell Workstation Edition244× · 2.414 tok/sAMD Radeon PRO W7900 Dual Slot241× · 344 tok/sNVIDIA GeForce RTX 5070 Ti222× · 1.744 tok/sNVIDIA GeForce RTX 3090 Ti222× · 1.493 tok/sNVIDIA GeForce RTX 5090218× · 2.491 tok/sAMD Radeon PRO W7800 48GB149× · 703 tok/sNVIDIA GB1087× · 903 tok/sNVIDIA GeForce RTX 206077× · 134 tok/sAMD Radeon 8060S Graphics60× · 327 tok/s
Getestete Modelle
Qwen3.6-35B-A3B148×gpt-oss-20b139×Qwen3-30B-A3B-Instruct-2507121×Laguna-XS-2.1118×Qwen3-Coder-30B-A3B-Instruct112×Ministral-3-14B-Reasoning-2512109×Qwen3-30B-A3B-Thinking-2507106×Qwen3.5-35B-A3B102×Ornith-1.0-9B97×MiniMax-M2.595×Qwen2.5-Coder-32B-Instruct93×Qwen3-VL-30B-A3B-Instruct93×Magistral-Small-250992×Devstral-Small-2-24B-Instruct-251292×
Top Performance-Läufe
| Modell | Hardware | tok/s | TTFT | Datum |
|---|---|---|---|---|
| gemma-4-E2B-it 10× | NVIDIA GeForce RTX 5090 llama.cpp | 2.491 | 4.382 ms | 28.07.2026 |
| gemma-4-E2B-it 10× | NVIDIA RTX PRO 6000 Blackwell Workstation Edition llama.cpp | 2.414 | 4.107 ms | 27.07.2026 |
| Nemotron-3-Nano-4B 10× | NVIDIA RTX PRO 6000 Blackwell Workstation Edition llama.cpp | 2.183 | 5.598 ms | 27.07.2026 |
| gemma-4-E2B-it 10× | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition llama.cpp | 2.144 | 4.819 ms | 28.07.2026 |
| gpt-oss-20b 10× | NVIDIA RTX PRO 6000 Blackwell Workstation Edition llama.cpp | 1.995 | 5.309 ms | 29.07.2026 |
| gpt-oss-20b 10× | NVIDIA RTX PRO 6000 Blackwell Workstation Edition llama.cpp | 1.994 | 5.323 ms | 28.07.2026 |
| Nemotron-3-Nano-4B 10× | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition llama.cpp | 1.938 | 6.288 ms | 28.07.2026 |
| Nemotron-3-Nano-4B 10× | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition llama.cpp | 1.912 | 6.245 ms | 28.07.2026 |
| Nemotron-3-Nano-4B 10× | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition llama.cpp | 1.897 | 6.227 ms | 27.07.2026 |
| gpt-oss-20b 10× | NVIDIA GeForce RTX 5090 llama.cpp | 1.891 | 5.489 ms | 28.07.2026 |
Harness-Ergebnisse
| Modell | Hardware | Erfolgsquote | Punkte | Datum |
|---|---|---|---|---|
| Gemma-4-26B-A4B-it | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition | 90,6% | 2.701/2.980 | 16.04.2026 |
| Devstral-Small-2-24B-Instruct-2512 | AMD Radeon 8060S Graphics | 87,1% | 2.597/2.980 | 16.07.2026 |
| Gemma-4-26B-A4B-it | AMD Radeon 8060S Graphics | 81,9% | 2.440/2.980 | 08.04.2026 |
| MiniMax-M2.5 | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition | 81,4% | 2.427/2.980 | 13.07.2026 |
| Gemma-4-26B-A4B-it | AMD Radeon 8060S Graphics | 80,0% | 2.383/2.980 | 08.04.2026 |
| MiniMax-M2.5 | NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition | 78,5% | 2.340/2.980 | 06.04.2026 |
| Gemma-4-26B-A4B-it | AMD Radeon 8060S Graphics | 76,1% | 2.268/2.980 | 16.07.2026 |
| Devstral-Small-2-24B-Instruct-2512 | AMD Radeon 8060S Graphics | 75,7% | 5.738/7.580 | 17.07.2026 |
| Gemma-4-26B-A4B-it | AMD Radeon 8060S Graphics | 73,7% | 2.197/2.980 | 13.04.2026 |
| MiniMax-M2.5 | NVIDIA GB10 | 70,7% | 1.245/1.760 | 04.04.2026 |
