⚡
Performance-Benchmark
Wie schnell ist das Modell?
Roher Durchsatz auf echter Hardware – wie viele Token ein Modell pro Sekunde erzeugt, wie schnell es den Prompt verarbeitet und wie kurz die Zeit bis zum ersten Token ausfällt. Je höher, desto besser.
⚡ Generation (tok/s)🔄 Prefill⏱️ TTFT👥 Concurrency
| # | Modell / Hersteller | Messwerte | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | gpt-oss-20bOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 14,47 tok/s TG Prefill 97 · TTFT 222.547 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 2 | gpt-oss-20bOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 9,77 tok/s TG Prefill 89 · TTFT 119.492 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 3 | Qwen3-30B-A3B-Thinking-2507Qwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 8,52 tok/s TG Prefill 71 · TTFT 152.830 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 4 | NVIDIA-Nemotron-3-Nano-4BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 7,97 tok/s TG Prefill 72 · TTFT 153.653 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 5 | Qwen3-30B-A3B-Instruct-2507Qwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 7,14 tok/s TG Prefill 69 · TTFT 35.318 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 6 | Qwen3-Coder-30B-A3B-InstructQwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 6,74 tok/s TG Prefill 74 · TTFT 32.942 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 7 | Qwen3-30B-A3B-Thinking-2507Qwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 6,64 tok/s TG Prefill 73 · TTFT 33.548 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 8 | gpt-oss-20bOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 6,46 tok/s TG Prefill 79 · TTFT 25.000 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 9 | Qwen3-30B-A3B-Instruct-2507Qwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 6,09 tok/s TG Prefill 100 · TTFT 121.223 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 10 | Qwen3-Coder-30B-A3B-InstructQwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 6,05 tok/s TG Prefill 104 · TTFT 116.729 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 11 | Nemotron-Cascade-2-30B-A3BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 5,86 tok/s TG Prefill 61 · TTFT 35.481 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 12 | Nemotron-Cascade-2-30B-A3BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 5,33 tok/s TG Prefill 74 · TTFT 150.609 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 13 | gpt-oss-120bOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 5,29 tok/s TG Prefill 56 · TTFT 189.966 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 14 | North-Mini-Code-1.0Cohere PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 5,05 tok/s TG Prefill 71 · TTFT 28.002 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 15 | NVIDIA-Nemotron-3-Nano-4BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 4,94 tok/s TG Prefill 41 · TTFT 62.079 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 16 | gpt-oss-120bOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 4,46 tok/s TG Prefill 50 · TTFT 39.304 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 17 | Qwen3.6-35B-A3BQwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 4,29 tok/s TG Prefill 62 · TTFT 31.435 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawUD-Q4_K_M | Details → | |
| 18 | North-Mini-Code-1.0Cohere PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 4,20 tok/s TG Prefill 86 · TTFT 127.307 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 19 | Meta-Llama-3.1-8B-InstructMeta PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 3,55 tok/s TG Prefill 36 · TTFT 59.044 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 20 | North-Mini-Code-1.0Cohere PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 3,16 tok/s TG Prefill 109 · TTFT 186.084 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 21 | MiniMax-M2.7MiniMax PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 2,62 tok/s TG Prefill 15 · TTFT 156.050 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawUD-Q4_K_M | Details → | |
| 22 | GLM-4.5-AirZ.ai (Zhipu) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 2,13 tok/s TG Prefill 18 · TTFT 117.963 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 23 | DeepSeek-V4-Flash-284B-A13BDeepSeek PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 1,20 tok/s TG Prefill 14 · TTFT 148.315 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawUD-Q4_K_XL | Details → | |
| 24 | OpenReasoning-Nemotron-32BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 1,10 tok/s TG Prefill 8 · TTFT 266.668 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 25 | Qwen3-30B-A3B-Instruct-2507Qwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 1,04 tok/s TG Prefill 137 · TTFT 171.473 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 26 | Qwen3-Coder-30B-A3B-InstructQwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,99 tok/s TG Prefill 130 · TTFT 172.354 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 27 | Seed-OSS-36B-InstructByteDance Seed PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,97 tok/s TG Prefill 8 · TTFT 240.790 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 28 | MiniMax-M2.5MiniMax PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,84 tok/s TG Prefill 22 · TTFT 98.716 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 29 | Qwen3-30B-A3B-Thinking-2507Qwen (Alibaba) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,58 tok/s TG Prefill 77 · TTFT 216.585 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 30 | Nemotron-Cascade-2-30B-A3BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,27 tok/s TG Prefill 82 · TTFT 204.776 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 31 | NVIDIA-Nemotron-3-Nano-4BNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,25 tok/s TG Prefill 75 · TTFT 202.135 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 32 | gpt-oss-120bOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,05 tok/s TG Prefill 20 · TTFT 267.436 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 33 | MiniMax-M2.7MiniMax PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,04 tok/s TG Prefill 29 · TTFT 211.132 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawUD-Q4_K_M | Details → | |
| 34 | MiniMax-M2.7MiniMax PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,03 tok/s TG Prefill 28 · TTFT 212.753 ms | 10× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawUD-Q4_K_M | Details → | |
| 35 | GLM-4.5-AirZ.ai (Zhipu) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,00 tok/s TG Prefill 6 · TTFT 299.591 ms | 5× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclawQ4_K_M | Details → |
