Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Google

Gemma-4-26B-A4B26B

Benchmarkprofil und veröffentlichte Ergebnisse.

MoE26B
Einordnung im Feld

Bestwerte im Vergleich

Beste Messwerte dieses Modells gegen Minimum, Durchschnitt und Maximum aller veröffentlichten Systeme.

Generation47,1 tok/s
Min 11,4Ø 148,9Max 903,3
Unter dem Durchschnitt · 82 Systeme im Feld
Prefill4.378 tok/s
Min 503Ø 3.550Max 7.470
Ueber dem Durchschnitt · 82 Systeme im Feld
Time to First Token451 ms
Min 105Ø 8.759Max 66.475
Ueber dem Durchschnitt · 82 Systeme im Feld
Performanceprofil

Durchsatz nach Hardware & Engine

Jede Blase steht für eine GPU, CPU bzw. Engine – die Position zeigt Prompt-Verarbeitung (X) und Ausgabe-Geschwindigkeit (Y), die Blasengröße die Anzahl der Messläufe.

GPUnach Grafikkarte

51,849,447,144,742,44.1154.2904.4664.641Prefill (tok/s)Generation (tok/s)NVIDIA GB10 - 47,1 tok/s Generation, 4.378 tok/s Prefill, TTFT 451 ms (1 Lauf)NVIDIA GB10
NVIDIA GB10 47,1 tok/s

CPUnach Prozessor

51,849,447,144,742,44.1154.2904.4664.641Prefill (tok/s)Generation (tok/s)NVIDIA Grace - 47,1 tok/s Generation, 4.378 tok/s Prefill, TTFT 451 ms (1 Lauf)NVIDIA Grace
NVIDIA Grace 47,1 tok/s

ENGnach Engine

51,849,447,144,742,44.1154.2904.4664.641Prefill (tok/s)Generation (tok/s)vLLM - 47,1 tok/s Generation, 4.378 tok/s Prefill, TTFT 451 ms (1 Lauf)vLLM
vLLM 47,1 tok/s
Durchsatz & Latenz

Performancebenchmark

Messwert:
#Modell / HerstellerMesswerteParallelGPU / CPU / RAMRuntime
1Gemma-4-26B-A4B26BNVFP4Google PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation)
47,06 tok/s TG
Prefill 4.378 · TTFT 451 ms
1×NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMvLLMgodclaw
Agent- & Chat-Bewertung

Harnessbenchmark

Noch keine Harnessbenchmarks fuer dieses Modell.