Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
ll
Modellserver / Inferenz-Engine

llm

Alle Performance-Benchmarks, die mit diesem Modellserver gemessen wurden – Durchsatz, Prefill und Latenz.

1Benchmarks
1Models
Best generation
19,5 tok/s
gemma-4-31B-it
∅ Generation
19,5 tok/s
Schnitt aus 1 Läufen
Best prefill
339 tok/s
Prompt processing
Best TTFT
80.766 ms
Time to First Token

Top-Modelle auf llm

Bester Durchsatz je Modell – umschaltbar nach Generation, Prefill oder Kombiwert.

gemma-4-31B-it31B
19,5 tok/s

Auf welcher Hardware laeuft llm am schnellsten?

Bester Durchsatz je Grafikkarte mit diesem Modellserver.

NVIDIA GeForce RTX 3090 Ti
19,5 tok/s
Performance profile

Durchsatz mit llm

Jede Blase steht für eine CPU, GPU bzw. ein Modell – Position: Prompt-Verarbeitung (X) × Ausgabe (Y), Blasengröße: Anzahl Messläufe.

CPUnach Prozessor

21,520,519,518,517,6319333346360Prefill (tok/s)Generation (tok/s)AMD Ryzen 9 8945HX with Radeon Graphics - 19,5 tok/s Generation, 339 tok/s Prefill, TTFT 80.766 ms (1 Lauf)AMD Ryzen 9 8945HX wi...
AMD Ryzen 9 8945HX with Radeon Graphics 19,5 tok/s

GPUnach Grafikkarte

21,520,519,518,517,6319333346360Prefill (tok/s)Generation (tok/s)NVIDIA GeForce RTX 3090 Ti - 19,5 tok/s Generation, 339 tok/s Prefill, TTFT 80.766 ms (1 Lauf)NVIDIA GeForce RTX 30...
NVIDIA GeForce RTX 3090 Ti 19,5 tok/s

MODnach Modell

21,520,519,518,517,6319333346360Prefill (tok/s)Generation (tok/s)gemma-4-31B-it - 19,5 tok/s Generation, 339 tok/s Prefill, TTFT 80.766 ms (1 Lauf)gemma-4-31B-it
gemma-4-31B-it 19,5 tok/s
All measurements

1 Benchmark-Läufe

Jeder veroeffentlichte Lauf mit llm.

← Alle Engines
Metric:
#Model / MakerMetricsParallelGPU / CPU / RAMRuntime
1gemma-4-31B-it31BGoogle Performance benchmarkTimebench 3 - Kombi (Prefill + Generation)
19,50 tok/s TG
Prefill 339 · TTFT 80.766 ms
5×NVIDIA GeForce RTX 3090 TiAMD Ryzen 9 8945HX with Radeon Graphics · 92 GB RAMllmcodex_cli