ll
Modellserver / Inferenz-Engine
llm
Alle Performance-Benchmarks, die mit diesem Modellserver gemessen wurden – Durchsatz, Prefill und Latenz.
Best generation
19,5 tok/s
gemma-4-31B-it
∅ Generation
19,5 tok/s
Schnitt aus 1 Läufen
Best prefill
339 tok/s
Prompt processing
Best TTFT
80.766 ms
Time to First Token
Top-Modelle auf llm
Bester Durchsatz je Modell – umschaltbar nach Generation, Prefill oder Kombiwert.
Auf welcher Hardware laeuft llm am schnellsten?
Bester Durchsatz je Grafikkarte mit diesem Modellserver.
Performance profile
Durchsatz mit llm
Jede Blase steht für eine CPU, GPU bzw. ein Modell – Position: Prompt-Verarbeitung (X) × Ausgabe (Y), Blasengröße: Anzahl Messläufe.
All measurements
← Alle Engines1 Benchmark-Läufe
Jeder veroeffentlichte Lauf mit llm.
| # | Model / Maker | Metrics | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | gemma-4-31B-it31BGoogle Performance benchmarkTimebench 3 - Kombi (Prefill + Generation) | 19,50 tok/s TG Prefill 339 · TTFT 80.766 ms | 5× | NVIDIA GeForce RTX 3090 TiAMD Ryzen 9 8945HX with Radeon Graphics · 92 GB RAM | llmcodex_cli | Details → |
