Echte Performance
TTFT, Prefill- und Generation-Token/s statt theoretischer Spitzenwerte.
Wir testen KI-Sprachmodelle auf echter Hardware: Tempo in Token pro Sekunde und Antwortzeit – plus Qualität in echten Agenten-Aufgaben. Transparent, reproduzierbar, direkt vergleichbar.
TTFT, Prefill- und Generation-Token/s statt theoretischer Spitzenwerte.
Punkte und Erfolgsquoten aus vollständigen Agent- und Chatabläufen.
Modell, Quantisierung, Runtime und Hardware bleiben an jedem Lauf sichtbar.
Tempo (Token/s) und Qualität (Harness) der meistgetesteten Modelle – direkt vergleichbar.
| # | Modell / Hersteller | Messwerte | Parallel | GPU / CPU / RAM | Runtime | ||
|---|---|---|---|---|---|---|---|
| 1 | gemma-4-E2B-it5BQ4_K_MGoogle PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 2.491,20 tok/s TG Prefill 15.814 · TTFT 4.382 ms | 10× | NVIDIA GeForce RTX 5090AMD Ryzen 7 5800X3D 8-Core Processor · 126 GB RAM | llama.cppcodex_cli | Details → | |
| 2 | gemma-4-E2B-it5BQ4_K_MGoogle PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 2.414,37 tok/s TG Prefill 20.277 · TTFT 4.107 ms | 10× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclaw | Details → | |
| 3 | Nemotron-3-Nano-4B4BQ4_K_MNVIDIA PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 2.182,67 tok/s TG Prefill 10.599 · TTFT 5.598 ms | 10× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclaw | Details → | |
| 4 | gemma-4-E2B-it5BQ4_K_MGoogle PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 2.143,55 tok/s TG Prefill 13.632 · TTFT 4.819 ms | 10× | 3x NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation EditionAMD Ryzen Threadripper PRO 9965WX 24-Cores · 125 GB RAM | llama.cppgodclaw | Details → | |
| 5 | gpt-oss-20b20BQ4_K_MOpenAI PerformancebenchmarkTimebench 3 - Kombi (Prefill + Generation) | 1.995,37 tok/s TG Prefill 16.158 · TTFT 5.309 ms | 10× | NVIDIA RTX PRO 6000 Blackwell Workstation EditionAMD Ryzen 9 9950X 16-Core Processor · 92 GB RAM | llama.cppgodclaw | Details → |
Generierungs-Durchsatz (Token/s) je GPU – Minimum, Durchschnitt und Maximum über alle Performance-Läufe.
Generierungs-Durchsatz (Token/s) je CPU – Minimum, Durchschnitt und Maximum über alle Performance-Läufe.
Wir verwenden technisch notwendige Cookies. Externe Inhalte (z. B. YouTube-Videos) werden nur mit deiner Zustimmung geladen und setzen dann Cookies von YouTube/Google. Mehr in der Datenschutzerklärung.