ll
Modellserver / Inferenz-Engine
llm
Alle Performance-Benchmarks, die mit diesem Modellserver gemessen wurden – Durchsatz, Prefill und Latenz.
Beste Generation
19,5 tok/s
gemma-4-31B-it
∅ Generation
19,5 tok/s
Schnitt aus 1 Läufen
Bester Prefill
339 tok/s
Prompt-Verarbeitung
Bester TTFT
80.766 ms
Time to First Token
Top-Modelle auf llm
Bester Durchsatz je Modell – umschaltbar nach Generation, Prefill oder Kombiwert.
Auf welcher Hardware laeuft llm am schnellsten?
Bester Durchsatz je Grafikkarte mit diesem Modellserver.
Performanceprofil
Durchsatz mit llm
Jede Blase steht für eine CPU, GPU bzw. ein Modell – Position: Prompt-Verarbeitung (X) × Ausgabe (Y), Blasengröße: Anzahl Messläufe.
Alle Messungen
← Alle Engines1 Benchmark-Läufe
Jeder veroeffentlichte Lauf mit llm.
| # | Modell / Hersteller | Messwerte | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | gemma-4-31B-it31BGoogle PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 19,50 tok/s TG Prefill 339 · TTFT 80.766 ms | 5× | NVIDIA GeForce RTX 3090 TiAMD Ryzen 9 8945HX with Radeon Graphics · 92 GB RAM | llmcodex_cli | Details → |
