Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Z.ai (Zhipu)

glm-4.7-flash

Benchmarkprofil und veröffentlichte Ergebnisse.

Einordnung im Feld

Bestwerte im Vergleich

Beste Messwerte dieses Modells gegen Minimum, Durchschnitt und Maximum aller veröffentlichten Systeme.

Generation48,9 tok/s
Min 0,0Ø 253,2Max 2.491,2
Unter dem Durchschnitt · 2823 Systeme im Feld
Prefill4.055 tok/s
Min 4Ø 3.470Max 39.029
Ueber dem Durchschnitt · 2823 Systeme im Feld
Time to First Token536 ms
Min 20Ø 45.698Max 535.235
Ueber dem Durchschnitt · 2821 Systeme im Feld
Performanceprofil

Durchsatz nach Hardware & Engine

Jede Blase steht für eine GPU, CPU bzw. Engine – die Position zeigt Prompt-Verarbeitung (X) und Ausgabe-Geschwindigkeit (Y), die Blasengröße die Anzahl der Messläufe.

GPUnach Grafikkarte

53,851,448,946,544,03.8123.9744.1364.298Prefill (tok/s)Generation (tok/s)NVIDIA GB10 - 48,9 tok/s Generation, 4.055 tok/s Prefill, TTFT 536 ms (1 Lauf)NVIDIA GB10
NVIDIA GB10 48,9 tok/s

CPUnach Prozessor

53,851,448,946,544,03.8123.9744.1364.298Prefill (tok/s)Generation (tok/s)NVIDIA Grace - 48,9 tok/s Generation, 4.055 tok/s Prefill, TTFT 536 ms (1 Lauf)NVIDIA Grace
NVIDIA Grace 48,9 tok/s

ENGnach Engine

53,851,448,946,544,03.8123.9744.1364.298Prefill (tok/s)Generation (tok/s)vLLM - 48,9 tok/s Generation, 4.055 tok/s Prefill, TTFT 536 ms (1 Lauf)vLLM
vLLM 48,9 tok/s
Durchsatz & Latenz

Performancebenchmark

Messwert:
#Modell / HerstellerMesswerteParallelGPU / CPU / RAMRuntime
1glm-4.7-flashAWQZ.ai (Zhipu) PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation)
48,92 tok/s TG
Prefill 4.055 · TTFT 536 ms
1×NVIDIA GB10 (DGX Spark)NVIDIA Grace · 120 GB RAMvLLMgodclaw
Agent- & Chat-Bewertung

Harnessbenchmark

Noch keine Harnessbenchmarks fuer dieses Modell.