NVIDIA
Llama-3.1-Nemotron-Ultra-253B-v1253B
Benchmark profile and published results.
Dense253B
Position in the field
Best values compared
Best metrics of this model against the minimum, average and maximum of all published systems.
Generation62,1 tok/s
Min 0,0Ø 248,3Max 2.491,2
Unter dem Durchschnitt · 3969 Systeme im Feld
Prefill1.013 tok/s
Min 4Ø 4.741Max 55.260
Unter dem Durchschnitt · 3969 Systeme im Feld
Time to First Token3.793 ms
Min 20Ø 33.962Max 535.235
Ueber dem Durchschnitt · 3967 Systeme im Feld
Performance profile
Throughput by hardware & engine
Each bubble is a GPU, CPU or engine – position shows prompt processing (X) and output speed (Y), bubble size the number of runs.
GPUby graphics card
CPUby processor
Throughput & latency
Performance benchmark
| # | Model / Maker | Metrics | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 62,08 tok/s TG Prefill 1.013 · TTFT 161.953 ms | 10× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 2 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 61,28 tok/s TG Prefill 761 · TTFT 168.314 ms | 10× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 3 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 32,07 tok/s TG Prefill 958 · TTFT 47.870 ms | 5× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 4 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 31,63 tok/s TG Prefill 812 · TTFT 50.633 ms | 5× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 5 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 9,40 tok/s TG Prefill 644 · TTFT 3.793 ms | 1× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 6 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 9,40 tok/s TG Prefill 547 · TTFT 4.475 ms | 1× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 7 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 2,67 tok/s TG Prefill 78 · TTFT 65.710 ms | 10× | 4x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppopenclaw_cli batched-bench ROCmQ4_K_M | Details → | |
| 8 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 2,16 tok/s TG Prefill 78 · TTFT 32.868 ms | 5× | 4x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppopenclaw_cli batched-bench ROCmQ4_K_M | Details → | |
| 9 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1,68 tok/s TG Prefill 48 · TTFT 183.808 ms | 10× | NVIDIA GeForce RTX 5070 TiAMD Ryzen Threadripper PRO 5975WX 32-Cores · 247 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 10 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 1,63 tok/s TG Prefill 51 · TTFT 181.415 ms | 5× | NVIDIA GeForce RTX 5070 TiAMD Ryzen Threadripper PRO 5975WX 32-Cores · 247 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 11 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,96 tok/s TG Prefill 48 · TTFT 187.060 ms | 10× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 12 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,94 tok/s TG Prefill 51 · TTFT 180.358 ms | 5× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 13 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,93 tok/s TG Prefill 51 · TTFT 179.975 ms | 5× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 14 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,81 tok/s TG Prefill 4 · TTFT 535.235 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 15 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,81 tok/s TG Prefill 4 · TTFT 534.264 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 16 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,70 tok/s TG Prefill 75 · TTFT 6.811 ms | 1× | 4x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppopenclaw_cli batched-bench ROCmQ4_K_M | Details → | |
| 17 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,67 tok/s TG Prefill 35 · TTFT 60.617 ms | 1× | NVIDIA GeForce RTX 5070 TiAMD Ryzen Threadripper PRO 5975WX 32-Cores · 247 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 18 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,65 tok/s TG Prefill 4 · TTFT 485.276 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 19 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,65 tok/s TG Prefill 4 · TTFT 482.771 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 20 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,65 tok/s TG Prefill 4 · TTFT 488.087 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 21 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,63 tok/s TG Prefill 4 · TTFT 479.913 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 22 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,63 tok/s TG Prefill 4 · TTFT 477.862 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 23 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,63 tok/s TG Prefill 4 · TTFT 521.790 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 24 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,62 tok/s TG Prefill 4 · TTFT 481.185 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 25 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,61 tok/s TG Prefill 4 · TTFT 483.799 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 26 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,57 tok/s TG Prefill 4 · TTFT 531.701 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 27 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,55 tok/s TG Prefill 4 · TTFT 527.248 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 28 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,54 tok/s TG Prefill 4 · TTFT 531.922 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 29 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,51 tok/s TG Prefill 4 · TTFT 525.090 ms | 1× | 3x AMD Radeon AI PRO R9700AMD Ryzen Threadripper PRO 7955WX 16-Cores · 184 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 30 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,29 tok/s TG Prefill 36 · TTFT 58.861 ms | 1× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 31 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,28 tok/s TG Prefill 30 · TTFT 74.267 ms | 1× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 32 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,11 tok/s TG Prefill 8 · TTFT 281.154 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 33 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,10 tok/s TG Prefill 7 · TTFT 320.464 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 34 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,10 tok/s TG Prefill 9 · TTFT 247.886 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 35 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,10 tok/s TG Prefill 8 · TTFT 272.289 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 36 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,10 tok/s TG Prefill 7 · TTFT 257.748 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 37 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,10 tok/s TG Prefill 8 · TTFT 263.746 ms | 1× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 38 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 7 · TTFT 304.304 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 39 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 8 · TTFT 275.212 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 40 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 8 · TTFT 265.674 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 41 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 7 · TTFT 328.995 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 42 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 8 · TTFT 273.694 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 43 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 7 · TTFT 319.557 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 44 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 8 · TTFT 280.941 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 45 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 7 · TTFT 296.158 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 46 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 7 · TTFT 289.112 ms | 5× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 47 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 8 · TTFT 280.190 ms | 1× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 48 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,09 tok/s TG Prefill 8 · TTFT 260.023 ms | 1× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclawQ4_K_M | Details → | |
| 49 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,08 tok/s TG Prefill 8 · TTFT 280.103 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 50 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,08 tok/s TG Prefill 7 · TTFT 303.658 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 51 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,08 tok/s TG Prefill 7 · TTFT 309.703 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 52 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,08 tok/s TG Prefill 7 · TTFT 327.762 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → | |
| 53 | Llama-3.1-Nemotron-Ultra-253B-v1253BNVIDIA Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 0,05 tok/s TG Prefill 8 · TTFT 290.462 ms | 1× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cliQ4_K_M | Details → |
Agent & chat rating
Harness benchmark
Noch keine Harnessbenchmarks fuer dieses Modell.
