G
Manufacturer
Google
Gemma-Modellfamilie von Google DeepMind.
Best token generation
2.491,2 tok/s
gemma-4-E2B-it
Best prefill
55.259,6 tok/s
gemma-4-E2B-it
∅ Token generation
353,4 tok/s
Average of 343 runs
∅ Prefill
6.564,9 tok/s
Average of 343 runs
Best TTFT
91 ms
gemma-4-31B-it
Best harness rate
91%
Gemma-4-26B-A4B-it
🏆
gemma-4-E2B-it · fastest model at 2.491,2 tok/s token generation
Best prefill of this manufacturer: 55.259,6 tok/s (gemma-4-E2B-it)
Best prefill of this manufacturer: 55.259,6 tok/s (gemma-4-E2B-it)
Top models by token generation
Best measured generation throughput per model (tok/s), published performance benchmarks.
Models
All benchmarks →11 assigned
gemma-4-12B-it12B79 runs
276,2tok/s Ø
Min 22,3Max 1.104,3
gemma-4-12B-it-assistant12B0 runs
No performance data yet
Gemma-4-26B-A4B26B7 runs
155,4tok/s Ø
Min 47,1Max 264,1
Gemma-4-26B-A4B-it26B84 runs
388,8tok/s Ø
Min 32,4Max 1.589,1
gemma-4-26B-A4B-it-assistant26B3 runs
58,3tok/s Ø
Min 33,0Max 74,5
gemma-4-31B-it31B52 runs
79,0tok/s Ø
Min 10,5Max 251,1
gemma-4-31B-it-assistant31B0 runs
No performance data yet
gemma-4-E2B-it5B76 runs
557,2tok/s Ø
Min 6,8Max 2.491,2
gemma-4-E2B-it-assistant5B0 runs
No performance data yet
gemma-4-E4B-it8B50 runs
436,1tok/s Ø
Min 37,9Max 1.758,6
gemma-4-E4B-it-assistant8B0 runs
No performance data yet
