Qwen (Alibaba)
Qwen3.6-27B
Performancebenchmark · gemessen am 20.07.2026 15:01
Benchmark-ID
run-20260722-165905-7cc503Timebench 2 - Token-Generation / Output-DurchsatzDense27BRuntime: godclaw
Generation28,80tok/s
Prefill599,42tok/s
Time to First Token121,70ms
Gesamtdauer107,14s
Concurrency1parallel
Einordnung im Feld
87von 135 Systemen
Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)
Dieser Lauf ist besser als 36 % aller vergleichbaren Systeme.
Generation
28,8 tok/s
-32 % vs Ø 42,5
Prefill
599,4 tok/s
-79 % vs Ø 2.885,5
Time to First Token
122 ms
-93 % vs Ø 1.685
Verteilung im Feld2 – 148 tok/s
Wie schlägt sich dieser Benchmark?
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-85f64f
147,8 tok/s
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-637af7
143,9 tok/s
gpt-oss-20b3× AMD Radeon AI PRO R9700 · run-20260722-165909-65d35f
137,7 tok/s
Nemotron-Cascade-2-30B-A3B3× AMD Radeon AI PRO R9700 · run-20260722-181156-a273f2
107,9 tok/s
Nemotron-3-Nano-Omni-30B-A3B-Reasoning3× AMD Radeon AI PRO R9700 · run-20260722-182228-95c528
102,9 tok/s
gpt-oss-120b3× AMD Radeon AI PRO R9700 · run-20260722-165909-4e3ede
99,8 tok/s
Qwen3-30B-A3B-Instruct-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-cc8f3f
97,6 tok/s
NVIDIA-Nemotron-3-Nano-4B3× AMD Radeon AI PRO R9700 · run-20260722-190202-45dc8e
93,4 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165908-5712c8
91,4 tok/s
Qwen3-30B-A3B-Instruct-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-b20fe5
91,0 tok/s
Qwen3-VL-30B-A3B-Instruct3× AMD Radeon AI PRO R9700 · run-20260722-165908-4d91c3
89,8 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165908-40e052
88,6 tok/s
Qwen3-Coder-30B-A3B-Instruct3× AMD Radeon AI PRO R9700 · run-20260722-165907-0a4b43
88,2 tok/s
Qwen3-30B-A3B-Thinking-25073× AMD Radeon AI PRO R9700 · run-20260722-165907-83951d
87,8 tok/s
Qwen3.6-27B dieser LaufNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · run-20260722-165905-7cc503
28,8 tok/s
Hardware
GPU: NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition · 96 GB VRAM
CPU: 32x AMD Ryzen 9 9950X 16-Core Processor
RAM: 92 GB
Setup
Runtime: godclaw
Quantisierung: -
Modell: Qwen3.6-27B
Konfiguration
# LLM-Benchmark Konfiguration
# Modell : Qwen3.6-27B
# Engine : vLLM
# Run-ID : run-20260722-165905-7cc503
# GPU : NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition
# CPU : 32x AMD Ryzen 9 9950X 16-Core Processor
# RAM : 92 GB
bench@llm-benchmark:~$ python \
-m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen3.6-27B \
--served-model-name Qwen/Qwen3.6-27B \
--host 0.0.0.0 \
--port 8000 \
--gpu-memory-utilization 0.90 \
--max-model-len 65536 \
--generation-config vllm \
--language-model-only \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
| Engine | vllm |
| Modellalias | Qwen/Qwen3.6-27B |
| Kontextlaenge | 65536 |
| Python-Modul | vllm.entrypoints.openai.api_server |
| Modellpfad | Qwen/Qwen3.6-27B |
| Alias | Qwen/Qwen3.6-27B |
| GPU-Speicher | 0.90 |
| Kontext | 65536 |
| Generation-Config | vllm |
| Nur-Sprachmodell | aktiv |
| Reasoning-Parser | qwen3 |
| Auto-Tool-Choice | aktiv |
| Tool-Parser | qwen3_coder |
