N
Hersteller
NVIDIA
Nemotron-Modellfamilie von NVIDIA.
Beste Token-Generierung
107,9 tok/s
Nemotron-Cascade-2-30B-A3B
Bester Prefill
3.141,4 tok/s
Nemotron-Cascade-2-30B-A3B
∅ Token-Generierung
53,5 tok/s
Schnitt aus 8 Laeufen
∅ Prefill
1.746,0 tok/s
Schnitt aus 8 Laeufen
Bester TTFT
690 ms
Nemotron-Cascade-2-30B-A3B
Beste Harness-Quote
0%
noch kein Harness-Lauf
🏆
Nemotron-Cascade-2-30B-A3B · schnellstes Modell mit 107,9 tok/s Token-Generierung
Bester Prefill des Herstellers: 3.141,4 tok/s (Nemotron-Cascade-2-30B-A3B)
Bester Prefill des Herstellers: 3.141,4 tok/s (Nemotron-Cascade-2-30B-A3B)
Top-Modelle nach Token-Generierung
Bester gemessener Generierungs-Durchsatz je Modell (tok/s), veroeffentlichte Performancebenchmarks.
Modelle
Alle Benchmarks →11 zugeordnet
NVIDIA
Llama-3_1-Nemotron-Ultra-253B-v1
Dense · 253B
TG –
Prefill –
0 Benchmarks →
NVIDIA
Llama-3_3-Nemotron-Super-49B-v1_5
Dense · 49B
TG 12,3 tok/s
Prefill 823,3 tok/s
1 Benchmarks →
NVIDIA
Nemotron-3-Nano-Omni-30B-A3B-Reasoning
MoE · 30B
TG 102,9 tok/s
Prefill 3.111,0 tok/s
1 Benchmarks →
NVIDIA
Nemotron-Cascade-2-30B-A3B
MoE · 30B
TG 107,9 tok/s
Prefill 3.141,4 tok/s
1 Benchmarks →
NVIDIA
Nemotron-H-47B-Reasoning-128K
Dense · 47B
TG 8,0 tok/s
Prefill 337,7 tok/s
1 Benchmarks →
NVIDIA
NVIDIA-Nemotron-3-Nano-30B-A3B
MoE · 30B
TG 78,3 tok/s
Prefill 2.524,7 tok/s
1 Benchmarks →
NVIDIA
NVIDIA-Nemotron-3-Nano-30B-A3B-BF16
Dense
TG –
Prefill –
0 Benchmarks →
NVIDIA
NVIDIA-Nemotron-3-Nano-4B
Dense · 4B
TG 93,4 tok/s
Prefill 2.629,9 tok/s
1 Benchmarks →
NVIDIA
NVIDIA-Nemotron-3-Super-120B-A12B
MoE · 120B
TG 2,0 tok/s
Prefill 203,7 tok/s
1 Benchmarks →
NVIDIA
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B
MoE · 75B
TG –
Prefill –
0 Benchmarks →
NVIDIA
OpenReasoning-Nemotron-32B
Dense · 32B
TG 23,3 tok/s
Prefill 1.196,3 tok/s
1 Benchmarks →
