Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Beigesteuert vonMario AlkaMiniMax

MiniMax-M2.7

Performancebenchmark · gemessen am 25.07.2026 23:06

Benchmark-IDrun-20260726-084121-190675
Timebench 3 - Kombi (Prefill + Generation)MoE230BRuntime: vLLMQuantisierung: AWQ
Zur Einordnung: Diese Plattform nutzt Unified Memory – die "VRAM" ist gemeinsamer System-RAM (APU/Superchip); das Modell teilt sich den Speicher mit dem System.
Generation103,25tok/s
Prefill6.619,78tok/s
Time to First Token5.066,00ms
Gesamtdauer209,15s
Concurrency10parallel
Einordnung im Feld
5von 18 Systemen

Performancebenchmark · Leitmetrik: Generation-Speed (tok/s)

Dieser Lauf ist besser als 76 % aller vergleichbaren Systeme.
Generation 103,3 tok/s
+56 % vs Ø 66,2
Prefill 6.619,8 tok/s
+52 % vs Ø 4.350,1
Time to First Token 5.066 ms
-18 % vs Ø 6.183
Verteilung im Feld24 – 174 tok/s
Ø 66 Median Dieser Lauf

Wie schlägt sich dieser Benchmark?

Hardware

GPU: NVIDIA GB10 · 128 GB VRAM
CPU: NVIDIA Grace
RAM: 120 GB
Mainboard: ASUSTeK COMPUTER INC. GX10

Setup

Runtime: vLLM
Quantisierung: AWQ
Treiber: NVIDIA 590.48.01 / CUDA 13.1
Modell: MiniMax-M2.7

Konfiguration

benchmark-konfiguration — run-20260726-084121-190675
# LLM-Benchmark Konfiguration # Modell : MiniMax-M2.7 # Engine : vLLM # Run-ID : run-20260726-084121-190675 # GPU : NVIDIA GB10 # CPU : NVIDIA Grace # RAM : 120 GB bench@llm-benchmark:~$ bash \ -lc HF_HUB_OFFLINE=1 VLLM_HOST_IP=10.200.0.1 vllm serve cyankiwi/MiniMax-M2.7-AWQ-4bit \ --served-model-name cyankiwi/MiniMax-M2.7-AWQ-4bit MiniMax-M2.7 \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 2 \ --distributed-executor-backend ray \ --gpu-memory-utilization 0.85 \ --max-model-len 8192 \ --trust-remote-code \ --enforce-eager '>/tmp/dgx_m27c.log' '2>&1'
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.vllm
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.cyankiwi/MiniMax-M2.7-AWQ-4bit
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.8192
lcHF_HUB_OFFLINE=1
Alias?Anzeigename des Modells nach aussen (served model name), unabhaengig vom Dateinamen.cyankiwi/MiniMax-M2.7-AWQ-4bit
Tensor-Parallel?Anzahl GPUs, auf die JEDER einzelne Modell-Layer aufgeteilt wird (Tensor-Parallelitaet). Mehr GPUs = mehr VRAM und meist mehr Speed, aber die Anzahl der Attention-Heads muss durch diesen Wert teilbar sein (z.B. 32 Heads -> nur 1, 2, 4, 8 ... moeglich, NICHT 3).2
Executor-Backend?Verfahren fuer Multi-GPU/Multi-Node: mp = Prozesse auf einer Maschine, ray = ueber Ray (auch ueber mehrere Knoten).ray
GPU-Speicher?Anteil des GPU-Speichers (0 bis 1), den vLLM belegen darf. 0.92 = 92 %. Hoeher = mehr Platz fuer den KV-Cache (mehr/laengere parallele Anfragen), aber groesseres Risiko fuer 'Out of Memory'.0.85
Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells.8192
Enforce-Eager?Schaltet die optimierte Graph-Ausfuehrung (CUDA-/HIP-Graphs) AB und rechnet Schritt fuer Schritt. Startet schneller und spart etwas VRAM, ist im laufenden Betrieb aber meist langsamer als mit Graphs.>/tmp/dgx_m27c.log

Alle Benchmarks dieses Modells Zum Leaderboard

Modell-Vergleich

MiniMax-M2.7 auf verschiedener Hardware

Alle veröffentlichten Performance-Läufe dieses Modells – jede Blase eine Variante: Position = Prefill (X) × Generation (Y), Blasengröße = Anzahl Läufe. Näher oben rechts = schneller. ★ Gold markiert = dieser Benchmark.

GPUnach Grafikkarte

14110670,335,20,001.9513.9015.852Prefill (tok/s)Generation (tok/s)AMD Radeon AI PRO R9700 - 16,9 tok/s Generation, 415 tok/s Prefill, TTFT 33.772 ms (6 Laufe)AMD Radeon AI PRO R97...CPU-only - 2,6 tok/s Generation, 24 tok/s Prefill, TTFT 193.311 ms (3 Laufe)CPU-onlyNVIDIA GB10 (DGX Spark) - 108,6 tok/s Generation, 4.723 tok/s Prefill, TTFT 4.111 ms (9 Laufe) | DIESER LAUF★ NVIDIA GB10 (DGX Spar...
★ NVIDIA GB10 (DGX Spark) 108,6 tok/s dieser LaufAMD Radeon AI PRO R9700 16,9 tok/sCPU-only 2,6 tok/s

CPUnach Prozessor

14110670,335,20,001.9513.9015.852Prefill (tok/s)Generation (tok/s)AMD Ryzen Threadripper PRO 7955WX 16-Cores - 16,9 tok/s Generation, 415 tok/s Prefill, TTFT 33.772 ms (6 Laufe)AMD Ryzen Threadrippe...Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz - 2,6 tok/s Generation, 24 tok/s Prefill, TTFT 193.311 ms (3 Laufe)Intel(R) Xeon(R) CPU ...NVIDIA Grace - 108,6 tok/s Generation, 4.723 tok/s Prefill, TTFT 4.111 ms (9 Laufe) | DIESER LAUF★ NVIDIA Grace
★ NVIDIA Grace 108,6 tok/s dieser LaufAMD Ryzen Threadripper PRO 7955WX 16-Cores 16,9 tok/sIntel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz 2,6 tok/s

MBnach Mainboard

14110670,335,20,001.9513.9015.852Prefill (tok/s)Generation (tok/s)ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE - 16,9 tok/s Generation, 415 tok/s Prefill, TTFT 33.772 ms (6 Laufe)ASUSTeK COMPUTER INC....Dell Inc. PowerEdge R820 - 2,6 tok/s Generation, 24 tok/s Prefill, TTFT 193.311 ms (3 Laufe)Dell Inc. PowerEdge R...ASUSTeK COMPUTER INC. GX10 - 108,6 tok/s Generation, 4.723 tok/s Prefill, TTFT 4.111 ms (9 Laufe) | DIESER LAUF★ ASUSTeK COMPUTER INC....
★ ASUSTeK COMPUTER INC. GX10 108,6 tok/s dieser LaufASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE 16,9 tok/sDell Inc. PowerEdge R820 2,6 tok/s

ENGnach Engine

13810368,934,50,001.5093.0184.527Prefill (tok/s)Generation (tok/s)llama.cpp - 16,9 tok/s Generation, 164 tok/s Prefill, TTFT 119.173 ms (6 Laufe)llama.cppvLLM - 108,6 tok/s Generation, 3.674 tok/s Prefill, TTFT 8.711 ms (12 Laufe) | DIESER LAUF★ vLLM
★ vLLM 108,6 tok/s dieser Laufllama.cpp 16,9 tok/s

DRVnach Treiber

13810368,934,50,001.9353.8705.805Prefill (tok/s)Generation (tok/s)unbekannt - 16,9 tok/s Generation, 285 tok/s Prefill, TTFT 86.952 ms (9 Laufe)unbekanntNVIDIA 590.48.01 / CUDA 13.1 - 108,6 tok/s Generation, 4.723 tok/s Prefill, TTFT 4.111 ms (9 Laufe) | DIESER LAUF★ NVIDIA 590.48.01 / CU...
★ NVIDIA 590.48.01 / CUDA 13.1 108,6 tok/s dieser Laufunbekannt 16,9 tok/s
💰 Economics

Wirtschaftlichkeit dieses Laufs

Betriebskosten, TCO und Vergleich mit den nächstbesten Läufen desselben Modells. Methodik →

⚡ Strompreis EUR/kWh In URL übernehmen
🖥️ Anschaffung EUR Zurücksetzen
Strompreis0,30 EUR/kWh
Leistung (System)300 W geschätzt (TDP)GPU 300 W
Kosten / Stunde0,090 EUR
Strom / 1 Mio. Token0,24 EUR
Token / kWh1,24 Mio.
Anschaffung (System)4.960 EUR TeilpreisGPU 4.000 EUR · RAM 840 EUR · Netzteil 120 EUR
TCO (2 Jahre)6.537 EUR
Output-Token (2 Jahre)6,51 Mrd.
☁️ Externes LLM (API) – Vergleich
Externe LLM-Kosten (2 Jahre)
Ersparnis vs. extern (2 Jahre)
⚙️ System-Auslastung 100 % Idle: 15 W
Ø-Leistung (inkl. Idle)
Stromkosten (2 Jahre)
Generierte Token (2 Jahre)
TCO (2 Jahre)
€ / 1 Mio. Token

Bei X % Auslastung generiert das System nur X % der Zeit; die restliche Zeit läuft es im Idle (15 W). Die Stromkosten enthalten den Idle-Verbrauch, die Tokenmenge sinkt mit der Auslastung. Strompreis/Anschaffung von oben werden übernommen.

Kosten über 2 Jahre – nur Strom

Kosten über 2 Jahre – inkl. Anschaffung (TCO)

Geschwindigkeit vs. Token pro Euro

Euro pro 1 Mio. Token

Vergleich mit bis zu 3 nächstbesten Läufen dieses Modells (mind. einer auf anderer Hardware). Leistung = GPU-TDP + CPU (Idle + 15 %) + Board (geschätzt), Anschaffung = komplettes System (GPU + CPU + Board + RAM + Netzteil), Preise = hinterlegte Marktpreise.

Beigesteuert von

Mario Alka Administrator

@marioalka

Ich bin Unternehmer, Softwareentwickler und KI-Enthusiast. Seit vielen Jahren entwickle ich Unternehmenssoftware und beschäftige mich inzwischen fast täglich mit lokalen LLMs, KI-Agenten und leistungsfähiger KI-Hardware.

Mit LLM-Benchmark.de möchte ich eine Plattform schaffen, auf der Modelle, GPUs und Agenten objektiv und reproduzierbar miteinander verglichen werden.