🏆
Rankings
LLM Leaderboard
Real measurements of every tested language model on real, named hardware – rated by raw speed (performance in tokens per second, prefill and time to first token) and by practical task quality in complete agent and chat runs (harness). Pick a benchmark type below or filter by model, maker and hardware to see exactly what is tested and how the results are produced.
⚡ Performance (tok/s)🤖 Harness quality👥 Concurrency🖥️ real hardware
| # | Model / Maker | Metrics | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 253,67 tok/s TG Prefill 1.397 · TTFT 48.511 ms | 10× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 2 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 250,66 tok/s TG Prefill 1.396 · TTFT 48.986 ms | 10× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 3 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 247,76 tok/s TG Prefill 1.399 · TTFT 49.349 ms | 10× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 4 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 142,76 tok/s TG Prefill 1.244 · TTFT 17.133 ms | 5× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 5 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 140,35 tok/s TG Prefill 1.237 · TTFT 17.315 ms | 5× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 6 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 139,82 tok/s TG Prefill 1.244 · TTFT 17.279 ms | 5× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 7 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 108,98 tok/s TG Prefill 1.446 · TTFT 66.475 ms | 10× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppopenclaw_cliQ4_K_M | Details → | |
| 8 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 90,05 tok/s TG Prefill 1.600 · TTFT 43.239 ms | 10× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppopenclaw_cliQ4_K_M | Details → | |
| 9 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 49,10 tok/s TG Prefill 1.157 · TTFT 10.523 ms | 5× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppopenclaw_cliQ4_K_M | Details → | |
| 10 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 48,48 tok/s TG Prefill 1.201 · TTFT 2.031 ms | 1× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 11 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 48,44 tok/s TG Prefill 1.189 · TTFT 2.051 ms | 1× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 12 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 47,20 tok/s TG Prefill 1.176 · TTFT 2.071 ms | 1× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 13 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 46,50 tok/s TG Prefill 1.156 · TTFT 10.550 ms | 5× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppopenclaw_cliQ4_K_M | Details → | |
| 14 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 33,12 tok/s TG Prefill 1.171 · TTFT 2.084 ms | 1× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppopenclaw_cliQ4_K_M | Details → | |
| 15 | Ling-3.0-flash127.5BinclusionAI Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 28,27 tok/s TG Prefill 1.151 · TTFT 2.118 ms | 1× | NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAM | llama.cppopenclaw_cliQ4_K_M | Details → |
