🏆
Rankings
LLM Leaderboard
Real measurements of every tested language model on real, named hardware – rated by raw speed (performance in tokens per second, prefill and time to first token) and by practical task quality in complete agent and chat runs (harness). Pick a benchmark type below or filter by model, maker and hardware to see exactly what is tested and how the results are produced.
⚡ Performance (tok/s)🤖 Harness quality👥 Concurrency🖥️ real hardware
| # | Model / Maker | Metrics | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1.593,10 tok/s TG Prefill 16.376 · TTFT 6.849 ms | 10× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cli | Details → | |
| 2 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1.532,95 tok/s TG Prefill 17.861 · TTFT 6.225 ms | 10× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclaw | Details → | |
| 3 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1.432,98 tok/s TG Prefill 21.012 · TTFT 6.892 ms | 10× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 4 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1.383,23 tok/s TG Prefill 17.796 · TTFT 7.072 ms | 10× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 5 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1.267,62 tok/s TG Prefill 13.497 · TTFT 8.310 ms | 10× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 6 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 913,39 tok/s TG Prefill 8.119 · TTFT 11.247 ms | 10× | NVIDIA GeForce RTX 5070 TiAMD Ryzen Threadripper PRO 5975WX 32-Cores · 247 GB RAM | llama.cppgodclaw | Details → | |
| 7 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 876,87 tok/s TG Prefill 11.325 · TTFT 2.242 ms | 5× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclaw | Details → | |
| 8 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 837,85 tok/s TG Prefill 9.559 · TTFT 12.952 ms | 10× | NVIDIA GeForce RTX 3090 TiAMD Ryzen 9 8945HX with Radeon Graphics · 92 GB RAM | llama.cppwebsocket | Details → | |
| 9 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 823,64 tok/s TG Prefill 12.521 · TTFT 2.492 ms | 5× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cli | Details → | |
| 10 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 774,67 tok/s TG Prefill 20.868 · TTFT 2.009 ms | 5× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 11 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 766,19 tok/s TG Prefill 15.268 · TTFT 2.352 ms | 5× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 12 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 699,71 tok/s TG Prefill 13.042 · TTFT 2.524 ms | 5× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 13 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 518,27 tok/s TG Prefill 13.775 · TTFT 18.702 ms | 10× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 14 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 508,08 tok/s TG Prefill 5.204 · TTFT 21.109 ms | 10× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 15 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 489,71 tok/s TG Prefill 8.631 · TTFT 3.252 ms | 5× | NVIDIA GeForce RTX 5070 TiAMD Ryzen Threadripper PRO 5975WX 32-Cores · 247 GB RAM | llama.cppgodclaw | Details → | |
| 16 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 489,43 tok/s TG Prefill 10.618 · TTFT 18.898 ms | 10× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 17 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 456,70 tok/s TG Prefill 8.966 · TTFT 3.773 ms | 5× | NVIDIA GeForce RTX 3090 TiAMD Ryzen 9 8945HX with Radeon Graphics · 92 GB RAM | llama.cppwebsocket | Details → | |
| 18 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 281,80 tok/s TG Prefill 10.273 · TTFT 5.323 ms | 5× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 19 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 275,72 tok/s TG Prefill 13.406 · TTFT 4.952 ms | 5× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 20 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 274,94 tok/s TG Prefill 6.188 · TTFT 6.209 ms | 5× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 21 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 246,17 tok/s TG Prefill 6.676 · TTFT 369 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cli | Details → | |
| 22 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 239,32 tok/s TG Prefill 11.230 · TTFT 219 ms | 1× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclaw | Details → | |
| 23 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 225,01 tok/s TG Prefill 9.669 · TTFT 257 ms | 1× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 24 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 222,93 tok/s TG Prefill 8.663 · TTFT 286 ms | 1× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 25 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 212,79 tok/s TG Prefill 8.116 · TTFT 304 ms | 1× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 26 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 148,21 tok/s TG Prefill 5.615 · TTFT 439 ms | 1× | NVIDIA GeForce RTX 3090 TiAMD Ryzen 9 8945HX with Radeon Graphics · 92 GB RAM | llama.cppwebsocket | Details → | |
| 27 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 140,90 tok/s TG Prefill 2.783 · TTFT 1.005 ms | 1× | NVIDIA GeForce RTX 5070 TiAMD Ryzen Threadripper PRO 5975WX 32-Cores · 247 GB RAM | llama.cppgodclaw | Details → | |
| 28 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 130,88 tok/s TG Prefill 4.122 · TTFT 7.946 ms | 10× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 29 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 90,37 tok/s TG Prefill 3.202 · TTFT 4.555 ms | 5× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 30 | Meta-Llama-3.1-8B-Instruct8BQ8_0Meta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 89,46 tok/s TG Prefill 3.210 · TTFT 4.511 ms | 5× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 31 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 87,92 tok/s TG Prefill 4.116 · TTFT 600 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 32 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 87,03 tok/s TG Prefill 3.930 · TTFT 629 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 33 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 85,98 tok/s TG Prefill 6.398 · TTFT 386 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 34 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 84,89 tok/s TG Prefill 8.039 · TTFT 307 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclaw | Details → | |
| 35 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 67,58 tok/s TG Prefill 888 · TTFT 15.224 ms | 5× | NVIDIA Tesla P100 PCIe 16GBAMD Ryzen 9 7945HX with Radeon Graphics · 60 GB RAM | llama.cppopenclaw_cli | Details → | |
| 36 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) i | 66,43 tok/s TG Prefill 898 · TTFT 2.781 ms | 1× | Intel Arc Pro B70AMD Ryzen 9 7945HX with Radeon Graphics · 29 GB RAM | llama.cppopenclaw_cli | Details → | |
| 37 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) i | 48,95 tok/s TG Prefill 1.278 · TTFT 1.932 ms | 1× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 38 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 47,41 tok/s TG Prefill 1.800 · TTFT 1.368 ms | 1× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 39 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) i | 45,73 tok/s TG Prefill 1.206 · TTFT 2.050 ms | 1× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 40 | Meta-Llama-3.1-8B-Instruct8BMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) i | 42,11 tok/s TG Prefill 821 · TTFT 2.298 ms | 1× | Intel Arc Pro B70AMD Ryzen 9 7945HX with Radeon Graphics · 29 GB RAM | openclaw_cli | Details → | |
| 41 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 37,29 tok/s TG Prefill 1.115 · TTFT 27.826 ms | 10× | NVIDIA Tesla P100 PCIe 16GBAMD Ryzen 9 7945HX with Radeon Graphics · 60 GB RAM | llama.cppopenclaw_cli | Details → | |
| 42 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 35,46 tok/s TG Prefill 589 · TTFT 4.189 ms | 1× | NVIDIA Tesla P100 PCIe 16GBAMD Ryzen 9 7945HX with Radeon Graphics · 60 GB RAM | llama.cppopenclaw_cli | Details → | |
| 43 | Meta-Llama-3.1-8B-Instruct8BQ8_0Meta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 31,83 tok/s TG Prefill 1.653 · TTFT 1.506 ms | 1× | 2x NVIDIA GeForce RTX 2060Intel(R) Core(TM) i5-7400 CPU @ 3.00GHz · 7 GB RAM | llama.cppopenclaw_cli | Details → | |
| 44 | Meta-Llama-3.1-8B-Instruct8BQ4_K_MMeta Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 3,55 tok/s TG Prefill 36 · TTFT 59.044 ms | 1× | Keine GPU (CPU-only)4x Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz · 504 GB RAM | llama.cppgodclaw | Details → |
