Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
Contributed byMario AlkaMiniMax

MiniMax-M2.7

Harness benchmark · measured on 19.07.2026 22:46

Benchmark-IDrun-20260722-165445-bc5ac0
Tool-Parcours Dossier 40 V1.0MoE230BRuntime: godclawQuantisierung: AWQ
Configuration note: This run used 2 devices in distributed inference (2× NVIDIA GB10 (DGX Spark), tensor/pipeline parallel via the vLLM config). Not a single machine – power & acquisition in the economics section are calculated for all 2 devices.
For context: Diese Plattform nutzt Unified Memory – die "VRAM" ist gemeinsamer System-RAM (APU/Superchip); das Modell teilt sich den Speicher mit dem System.
Points3.641,00von 5.960,00
Points rate61,09%
Tasks passed40von 40
Total duration8.209,00s
Ranking in the field
2of 5 systems

Harness benchmark · Primary metric: Score rate (%)

This run is better than 75 % of all comparable systems.
Score rate 61 %
+12 % vs Ø 54,3
Tasks passed 40
+96 % vs Ø 20,4
Total duration 8.209,0 s
+290 % vs Ø 2.103,8
Distribution in the field29 – 71 %
Ø 54 Median Dieser Lauf

Wie schlägt sich dieser Benchmark mit anderen Modellen?

Hardware

GPU: NVIDIA GB10 · 128 GB VRAM
CPU: NVIDIA Grace
RAM: 120 GB
Mainboard: ASUSTeK COMPUTER INC. GX10

Setup

Runtime: godclaw
Quantization: AWQ
Driver: NVIDIA 590.48.01 / CUDA 13.1
Model: MiniMax-M2.7

Aufgaben (40)

TaskStatusPointsDuration
Arbeitsstruktur anlegenpassed5 / 507.208,00 s
Startdatei schreibenpassed17 / 6016,00 s
Datei zuruecklesenpassed38 / 504,00 s
CSV mit Testdatenpassed56 / 8010,00 s
Struktur pruefenpassed49 / 604,00 s
Recherche RAGpassed125 / 15011,00 s
Recherche Herstellerpassed19 / 12042,00 s
Recherche sichernpassed58 / 10014,00 s
Webseite auswertenpassed41 / 14047,00 s
Seite im Browser oeffnenpassed160 / 18011,00 s
Modellvergleichpassed20 / 200145,00 s
Quellenlistepassed63 / 9010,00 s
Wissenskategorien sichtenpassed70 / 10010,00 s
Wissenseintrag anlegenpassed175 / 22017,00 s
Wissenseintrag pruefenpassed101 / 1207,00 s
Wissenseintrag ergaenzenpassed173 / 2009,00 s
Versionen zaehlenpassed92 / 14017,00 s
Wissen durchsuchenpassed104 / 13010,00 s
Firma erfassenpassed69 / 18041,00 s
Person verknuepfenpassed165 / 22021,00 s
Fakt hinterlegenpassed16 / 16056,00 s
Entitaet suchenpassed42 / 14035,00 s
Aufgabenliste anlegenpassed98 / 13011,00 s
Aufgaben ergaenzenpassed134 / 17014,00 s
Boards sichtenpassed80 / 12015,00 s
Board-Aufgabe anlegenpassed119 / 19025,00 s
CSV nach JSONpassed121 / 18022,00 s
JSON validierenpassed112 / 14010,00 s
Defektes JSON reparierenpassed178 / 22016,00 s
Pruefsummenpassed140 / 1607,00 s
Volltextsuchepassed117 / 15011,00 s
Archiv packenpassed157 / 1705,00 s
Bestandsaufnahmepassed88 / 12012,00 s
Titelbild erzeugenpassed25 / 250128,00 s
Bild pruefenpassed117 / 1305,00 s
Merkenpassed135 / 1505,00 s
Erinnernpassed39 / 12030,00 s
Fachfrage delegierenpassed25 / 23089,00 s
Gesamtberichtpassed134 / 24044,00 s
Abschlusspassed164 / 20015,00 s

Configuration

benchmark-konfiguration — run-20260722-165445-bc5ac0
# LLM-Benchmark Konfiguration # Modell : MiniMax-M2.7 # Engine : vLLM # Run-ID : run-20260722-165445-bc5ac0 # GPU : NVIDIA GB10 # CPU : NVIDIA Grace # RAM : 120 GB bench@llm-benchmark:~$ /usr/bin/python /usr/local/bin/vllm serve cyankiwi/MiniMax-M2.7-AWQ-4bit \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 2 \ --distributed-executor-backend ray \ --gpu-memory-utilization 0.8 \ --max-model-len 196608 \ --max-num-seqs 4 \ --load-format fastsafetensors \ --tool-call-parser minimax_m2 \ --reasoning-parser minimax_m2 \ --enable-auto-tool-choice \ --kv-cache-dtype fp8_e4m3 \ --enable-prefix-caching \ --trust-remote-code \ --enforce-eager \ --served-model-name cyankiwi/MiniMax-M2.7-AWQ-4bit
Engine?Die Inferenz-Software, die das Modell ausliefert (z.B. vLLM oder llama.cpp). Sie bestimmt Geschwindigkeit, unterstuetzte Modellformate und welche Parameter ueberhaupt verfuegbar sind.vllm
Modellalias?Der Name, unter dem das Modell ueber die API angesprochen wird. Genau dieser Wert muss im Request-Feld 'model' stehen.cyankiwi/MiniMax-M2.7-AWQ-4bit
Kontextlaenge?Maximale Anzahl Tokens (Eingabe + erzeugte Ausgabe zusammen), die das Modell pro Anfrage verarbeiten kann.196608
Tensor-Parallel?Anzahl GPUs, auf die JEDER einzelne Modell-Layer aufgeteilt wird (Tensor-Parallelitaet). Mehr GPUs = mehr VRAM und meist mehr Speed, aber die Anzahl der Attention-Heads muss durch diesen Wert teilbar sein (z.B. 32 Heads -> nur 1, 2, 4, 8 ... moeglich, NICHT 3).2
Executor-Backend?Verfahren fuer Multi-GPU/Multi-Node: mp = Prozesse auf einer Maschine, ray = ueber Ray (auch ueber mehrere Knoten).ray
GPU-Speicher?Anteil des GPU-Speichers (0 bis 1), den vLLM belegen darf. 0.92 = 92 %. Hoeher = mehr Platz fuer den KV-Cache (mehr/laengere parallele Anfragen), aber groesseres Risiko fuer 'Out of Memory'.0.8
Kontext?Groesse des Kontextfensters in Token. 0 = der beim Training verwendete Kontext des Modells.196608
Max-Sequenzen?Maximale Anzahl gleichzeitig bearbeiteter Anfragen (Batch-Groesse). Hoeher = mehr Durchsatz, braucht aber mehr KV-Cache-Speicher.4
Load-Format?Format, aus dem die Gewichte geladen werden (auto, safetensors, pt ...). 'auto' erkennt es selbst.fastsafetensors
Tool-Parser?Bestimmt, wie vLLM Tool-Aufrufe aus der Modellantwort ausliest (z.B. hermes, mistral, llama3_json). Muss zum Modell passen.minimax_m2
Reasoning-Parser?Trennt den Denk-/Reasoning-Teil der Antwort vom eigentlichen Inhalt (z.B. bei Modellen mit <think>-Bloecken).minimax_m2
Auto-Tool-Choice?Erlaubt dem Modell, Tools (Function-Calling) selbststaendig auszuwaehlen. MUSS aktiv sein, damit 'tools' im Request akzeptiert werden - sonst lehnt vLLM sie mit HTTP 400 ab.aktiv
KV-Cache-Dtype?Datentyp des KV-Cache (auto, fp8). fp8 halbiert etwa den Cache-Speicher -> mehr und laengere parallele Anfragen bei minimalem Qualitaetsverlust.fp8_e4m3
Prefix-Caching?Speichert bereits berechnete Prompt-Anfaenge und verwendet sie wieder. Beschleunigt Anfragen mit gemeinsamem Praefix (z.B. gleicher System-Prompt) deutlich.aktiv
Trust-Remote-Code?Erlaubt vLLM, mit dem Modell mitgelieferten Python-Code auszufuehren. Noetig fuer Architekturen, die vLLM nicht von Haus aus kennt. Nur bei vertrauenswuerdigen Modellen aktivieren.aktiv
Enforce-Eager?Schaltet die optimierte Graph-Ausfuehrung (CUDA-/HIP-Graphs) AB und rechnet Schritt fuer Schritt. Startet schneller und spart etwas VRAM, ist im laufenden Betrieb aber meist langsamer als mit Graphs.aktiv
Alias?Anzeigename des Modells nach aussen (served model name), unabhaengig vom Dateinamen.cyankiwi/MiniMax-M2.7-AWQ-4bit

All benchmarks of this model To leaderboard

Anzeige
Model comparison

MiniMax-M2.7 on various hardware

All published performance runs of this model – each bubble a variant: position = prefill (X) × generation (Y), bubble size = number of runs. Closer to the top right = faster. ★ Marked gold = this benchmark.

GPUby graphics card

7135353561780,001.7803.5615.341Prefill (tok/s)Generation (tok/s)NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition - 548,6 tok/s Generation, 3.645 tok/s Prefill, TTFT 9.650 ms (6 Laufe)NVIDIA RTX PRO 6000 B...AMD Radeon AI PRO R9700 - 14,5 tok/s Generation, 187 tok/s Prefill, TTFT 92.001 ms (14 Laufe)AMD Radeon AI PRO R97...NVIDIA RTX PRO 6000 Blackwell Workstation Edition - 7,0 tok/s Generation, 84 tok/s Prefill, TTFT 98.659 ms (5 Laufe)NVIDIA RTX PRO 6000 B...NVIDIA GeForce RTX 5090 - 6,0 tok/s Generation, 66 tok/s Prefill, TTFT 126.812 ms (5 Laufe)NVIDIA GeForce RTX 50...NVIDIA GeForce RTX 3090 Ti - 4,0 tok/s Generation, 10 tok/s Prefill, TTFT 346.143 ms (3 Laufe)NVIDIA GeForce RTX 30...NVIDIA GeForce RTX 2060 - 2,6 tok/s Generation, 24 tok/s Prefill, TTFT 193.311 ms (3 Laufe)NVIDIA GeForce RTX 20...NVIDIA GB10 (DGX Spark) - 174,2 tok/s Generation, 4.309 tok/s Prefill, TTFT 7.582 ms (13 Laufe) | DIESER LAUF★ NVIDIA GB10 (DGX Spar...
NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition 548,6 tok/s★ NVIDIA GB10 (DGX Spark) 174,2 tok/s this runAMD Radeon AI PRO R9700 14,5 tok/sNVIDIA RTX PRO 6000 Blackwell Workstation Edition 7,0 tok/sNVIDIA GeForce RTX 5090 6,0 tok/sNVIDIA GeForce RTX 3090 Ti 4,0 tok/sNVIDIA GeForce RTX 2060 2,6 tok/s

CPUby processor

7135353561780,001.7803.5615.341Prefill (tok/s)Generation (tok/s)AMD Ryzen Threadripper PRO 9965WX 24-Cores - 548,6 tok/s Generation, 3.645 tok/s Prefill, TTFT 9.650 ms (6 Laufe)AMD Ryzen Threadrippe...AMD Ryzen Threadripper PRO 7955WX 16-Cores - 14,5 tok/s Generation, 187 tok/s Prefill, TTFT 92.001 ms (14 Laufe)AMD Ryzen Threadrippe...AMD Ryzen 9 9950X 16-Core Processor - 7,0 tok/s Generation, 84 tok/s Prefill, TTFT 98.659 ms (5 Laufe)AMD Ryzen 9 9950X 16-...AMD Ryzen 7 5800X3D 8-Core Processor - 6,0 tok/s Generation, 66 tok/s Prefill, TTFT 126.812 ms (5 Laufe)AMD Ryzen 7 5800X3D 8...AMD Ryzen 9 8945HX with Radeon Graphics - 4,0 tok/s Generation, 10 tok/s Prefill, TTFT 346.143 ms (3 Laufe)AMD Ryzen 9 8945HX wi...Intel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz - 2,6 tok/s Generation, 24 tok/s Prefill, TTFT 193.311 ms (3 Laufe)Intel(R) Xeon(R) CPU ...NVIDIA Grace - 174,2 tok/s Generation, 4.309 tok/s Prefill, TTFT 7.582 ms (13 Laufe) | DIESER LAUF★ NVIDIA Grace
AMD Ryzen Threadripper PRO 9965WX 24-Cores 548,6 tok/s★ NVIDIA Grace 174,2 tok/s this runAMD Ryzen Threadripper PRO 7955WX 16-Cores 14,5 tok/sAMD Ryzen 9 9950X 16-Core Processor 7,0 tok/sAMD Ryzen 7 5800X3D 8-Core Processor 6,0 tok/sAMD Ryzen 9 8945HX with Radeon Graphics 4,0 tok/sIntel(R) Xeon(R) CPU E5-4620 v2 @ 2.60GHz 2,6 tok/s

MBby mainboard

7135353561780,001.7803.5615.341Prefill (tok/s)Generation (tok/s)ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE - 548,6 tok/s Generation, 1.224 tok/s Prefill, TTFT 67.296 ms (20 Laufe)ASUSTeK COMPUTER INC....ASUSTeK COMPUTER INC. ProArt X870E-CREATOR WIFI - 7,0 tok/s Generation, 84 tok/s Prefill, TTFT 98.659 ms (5 Laufe)ASUSTeK COMPUTER INC....ASUSTeK COMPUTER INC. ROG STRIX B550-A GAMING - 6,0 tok/s Generation, 66 tok/s Prefill, TTFT 126.812 ms (5 Laufe)ASUSTeK COMPUTER INC....Meigao Innovation Technology (Shen Zhen) Co., Ltd DRFXL (MotherBoard Series) - 4,0 tok/s Generation, 10 tok/s Prefill, TTFT 346.143 ms (3 Laufe)Meigao Innovation Tec...Dell Inc. PowerEdge R820 - 2,6 tok/s Generation, 24 tok/s Prefill, TTFT 193.311 ms (3 Laufe)Dell Inc. PowerEdge R...ASUSTeK COMPUTER INC. GX10 - 174,2 tok/s Generation, 4.309 tok/s Prefill, TTFT 7.582 ms (13 Laufe) | DIESER LAUF★ ASUSTeK COMPUTER INC....
ASUSTeK COMPUTER INC. Pro WS WRX90E-SAGE SE 548,6 tok/s★ ASUSTeK COMPUTER INC. GX10 174,2 tok/s this runASUSTeK COMPUTER INC. ProArt X870E-CREATOR WIFI 7,0 tok/sASUSTeK COMPUTER INC. ROG STRIX B550-A GAMING 6,0 tok/sMeigao Innovation Technology (Shen Zhen) Co., Ltd DRFXL (MotherBoard Series) 4,0 tok/sDell Inc. PowerEdge R820 2,6 tok/s

ENGby engine

7135343561780,001.4802.9594.439Prefill (tok/s)Generation (tok/s)llama.cpp - 548,6 tok/s Generation, 738 tok/s Prefill, TTFT 125.269 ms (32 Laufe)llama.cppunbekannt - 3,0 tok/s Generation, 139 tok/s Prefill, TTFT 15.493 ms (1 Lauf)unbekanntvLLM - 174,2 tok/s Generation, 3.600 tok/s Prefill, TTFT 10.381 ms (16 Laufe) | DIESER LAUF★ vLLM
llama.cpp 548,6 tok/s★ vLLM 174,2 tok/s this rununbekannt 3,0 tok/s

DRVby driver

7135343561780,001.7733.5455.318Prefill (tok/s)Generation (tok/s)unbekannt - 548,6 tok/s Generation, 720 tok/s Prefill, TTFT 116.461 ms (35 Laufe)unbekanntAMD 7.0.0-27-generic - 3,0 tok/s Generation, 139 tok/s Prefill, TTFT 15.493 ms (1 Lauf)AMD 7.0.0-27-genericNVIDIA 590.48.01 / CUDA 13.1 - 174,2 tok/s Generation, 4.309 tok/s Prefill, TTFT 7.582 ms (13 Laufe) | DIESER LAUF★ NVIDIA 590.48.01 / CU...
unbekannt 548,6 tok/s★ NVIDIA 590.48.01 / CUDA 13.1 174,2 tok/s this runAMD 7.0.0-27-generic 3,0 tok/s
Contributed by

Mario Alka Administrator

@marioalka

Ich bin Unternehmer, Softwareentwickler und KI-Enthusiast. Seit vielen Jahren entwickle ich Unternehmenssoftware und beschäftige mich inzwischen fast täglich mit lokalen LLMs, KI-Agenten und leistungsfähiger KI-Hardware.

Mit LLM-Benchmark.de möchte ich eine Plattform schaffen, auf der Modelle, GPUs und Agenten objektiv und reproduzierbar miteinander verglichen werden.