Created bymario-alka.dePowered bygodcore.denoob2claw.detricoma.de
💰
LLM Economics

LLM Economics

Vergleiche Hardware, Modelle und Inferenz-Setups nach Betriebskosten, Tokenleistung und Gesamtbetriebskosten.

💸 Betriebskosten🖥️ TCO⚡ Token / Euro🔋 Token / kWh
Zurücksetzen

Einstellungen werden im Browser gespeichert und in der URL geteilt. Leistungsaufnahme mangels Messwert geschätzt aus GPU-TDP + CPU (Idle + 15 %) + Board. Methodik →

GPU-Wirtschaftlichkeit

21 GPU-Konfigurationen

Aggregiert je Konfiguration (inkl. GPU-Anzahl) – Economics je Lauf berechnet, dann AVG/MIN/MAX. Zahl hinter der GPU = Läufe · Modelle.

GPU-Konfigurationen grafisch

Balken je Konfiguration – umschaltbar zwischen Kosten je 1 Mio. Token, Token pro Euro und Durchsatz sowie Bestwerte (bestes Modell) und AVG. Unter der GPU steht das Modell, das den Wert erreicht. Günstiger/schneller = längerer Balken.

Liste der Grafikkarten

#GPU-KonfigurationGen tok/s iKosten/h€ / 1 Mio. Tok iTok/€Tok/kWhTCO i
1 NVIDIA GB10 (DGX Spark)i128 GB VRAM · 4.000 EUR · 140 W GPU-TDP
903,3 tok/s
gemma-4-E2B-it
0,042 EUR 0,013 EUR 77,43 Mio. 23,23 Mio. 736 EUR
2 AMD Radeon PRO W7800 48GBi48 GB VRAM · 2.808 EUR · 260 W GPU-TDP
702,9 tok/s
gemma-4-E2B-it
0,081 EUR 0,032 EUR 31,24 Mio. 9,37 Mio. 1.419 EUR
3 AMD Radeon 8060S Graphicsi3.000 EUR · 120 W GPU-TDP
326,9 tok/s
Nemotron-Cascade-2-30B-A3B
0,036 EUR 0,031 EUR 32,69 Mio. 9,81 Mio. 631 EUR
4 NVIDIA RTX A6000i48 GB VRAM · 3.000 EUR · 300 W GPU-TDP
1.122,5 tok/s
gemma-4-E2B-it
0,11 EUR 0,028 EUR 36,31 Mio. 10,89 Mio. 1.950 EUR
5 3× NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Editioni288 GB VRAM · 39.000 EUR · 900 W GPU-TDP
2.143,6 tok/s
gemma-4-E2B-it
0,29 EUR 0,038 EUR 26,18 Mio. 7,85 Mio. 5.033 EUR
6 2× NVIDIA RTX A6000i96 GB VRAM · 6.000 EUR · 600 W GPU-TDP
1.568,0 tok/s
gemma-4-E2B-it
0,20 EUR 0,036 EUR 28,04 Mio. 8,41 Mio. 3.527 EUR
7 AMD Radeon PRO W7900 Dual Sloti48 GB VRAM · 3.911 EUR · 295 W GPU-TDP
343,9 tok/s
gpt-oss-20b
0,091 EUR 0,074 EUR 13,53 Mio. 4,06 Mio. 1.603 EUR
8 2× AMD Radeon PRO W7800 48GBi96 GB VRAM · 5.616 EUR · 520 W GPU-TDP
323,1 tok/s
Meta-Llama-3.1-8B-Instruct
0,16 EUR 0,14 EUR 7,32 Mio. 2,19 Mio. 2.786 EUR
9 NVIDIA Tesla P100 PCIe 16GBi16 GB VRAM · 70 EUR · 250 W GPU-TDP
111,1 tok/s
gpt-oss-20b
0,075 EUR 0,19 EUR 5,33 Mio. 1,60 Mio. 1.314 EUR
10 2× AMD Radeon PRO W7900 Dual Sloti96 GB VRAM · 7.822 EUR · 590 W GPU-TDP
344,1 tok/s
gpt-oss-20b
0,18 EUR 0,15 EUR 6,88 Mio. 2,06 Mio. 3.154 EUR
11 NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Editioni96 GB VRAM · 13.000 EUR · 300 W GPU-TDP
28,8 tok/s
Qwen3.6-27B
0,10 EUR 0,95 EUR 1,05 Mio. 315,38 Tsd. 1.728 EUR
12 NVIDIA GeForce RTX 5070 Tii16 GB VRAM · 994 EUR · 300 W GPU-TDP
1.744,0 tok/s
gemma-4-E2B-it
0,093 EUR 0,015 EUR 67,51 Mio. 20,25 Mio. 1.577 EUR
13 4× AMD Radeon AI PRO R9700i128 GB VRAM · 5.600 EUR · 1.200 W GPU-TDP
290,3 tok/s
Nemotron-3.5-Lightning-30B-A3B
0,38 EUR 0,36 EUR 2,74 Mio. 822,17 Tsd. 6.680 EUR
14 AMD Radeon AI PRO R9700i32 GB VRAM · 1.400 EUR · 300 W GPU-TDP
5,6 tok/s
Qwen2.5-Coder-32B-Instruct
0,11 EUR 5,55 EUR 180,16 Tsd. 54,05 Tsd. 1.950 EUR
15 Intel Arc Pro B70i32 GB VRAM · 1.258 EUR · 230 W GPU-TDP
826,2 tok/s
gemma-4-E2B-it
0,069 EUR 0,023 EUR 43,11 Mio. 12,93 Mio. 1.209 EUR
16 NVIDIA GeForce RTX 3090 Tii24 GB VRAM · 999 EUR · 450 W GPU-TDP
1.492,8 tok/s
gemma-4-E2B-it
0,14 EUR 0,027 EUR 37,53 Mio. 11,26 Mio. 2.365 EUR
17 2× NVIDIA GeForce RTX 2060i12 GB VRAM · 220 EUR · 320 W GPU-TDP
133,7 tok/s
gemma-4-E4B-it
0,10 EUR 0,20 EUR 5,01 Mio. 1,50 Mio. 1.682 EUR
18 3× AMD Radeon AI PRO R9700i96 GB VRAM · 4.200 EUR · 900 W GPU-TDP
667,0 tok/s
Nemotron-3-Nano-4B
0,29 EUR 0,12 EUR 8,24 Mio. 2,47 Mio. 5.104 EUR
19 NVIDIA GeForce RTX 5090i32 GB VRAM · 3.300 EUR · 575 W GPU-TDP
2.491,2 tok/s
gemma-4-E2B-it
0,19 EUR 0,021 EUR 48,10 Mio. 14,43 Mio. 3.267 EUR
20 NVIDIA RTX PRO 6000 Blackwell Workstation Editioni96 GB VRAM · 13.000 EUR · 600 W GPU-TDP
2.414,4 tok/s
gemma-4-E2B-it
0,19 EUR 0,022 EUR 45,01 Mio. 13,50 Mio. 3.384 EUR
21 Tesla V100-PCIE-32GBi32 GB VRAM · kein Preis · –
361,8 tok/s
gemma-4-E2B-it

MIN = niedrigste Kosten (höchste Leistung / niedrigste Aufnahme), MAX = höchste Kosten. Jede Kostenkennzahl ist an einen realen Lauf gebunden (erst je Lauf gerechnet, dann aggregiert). Preise = GPU-Anschaffung (Einzelpreis × Anzahl).

GPUnach Grafikkarte

3.1052.3421.57981653,103.5237.04710.570Prefill (tok/s)Generation (tok/s)NVIDIA GeForce RTX 5090 - 2.491,2 tok/s Generation, 4.548 tok/s Prefill, TTFT 65.147 ms (218 Laufe)NVIDIA GeForce RTX 50...NVIDIA RTX PRO 6000 Blackwell Workstation Edition - 2.414,4 tok/s Generation, 6.972 tok/s Prefill, TTFT 27.182 ms (244 Laufe)NVIDIA RTX PRO 6000 B...NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition - 2.143,6 tok/s Generation, 6.219 tok/s Prefill, TTFT 9.221 ms (512 Laufe)NVIDIA RTX PRO 6000 B...NVIDIA GeForce RTX 5070 Ti - 1.744,0 tok/s Generation, 1.933 tok/s Prefill, TTFT 57.650 ms (222 Laufe)NVIDIA GeForce RTX 50...NVIDIA RTX A6000 - 1.568,0 tok/s Generation, 8.649 tok/s Prefill, TTFT 4.699 ms (992 Laufe)NVIDIA RTX A6000NVIDIA GeForce RTX 3090 Ti - 1.492,8 tok/s Generation, 3.396 tok/s Prefill, TTFT 81.183 ms (264 Laufe)NVIDIA GeForce RTX 30...NVIDIA GB10 (DGX Spark) - 903,3 tok/s Generation, 3.550 tok/s Prefill, TTFT 8.759 ms (82 Laufe)NVIDIA GB10 (DGX Spar...Intel Arc Pro B70 - 826,2 tok/s Generation, 858 tok/s Prefill, TTFT 45.853 ms (32 Laufe)Intel Arc Pro B70AMD Radeon PRO W7800 48GB - 702,9 tok/s Generation, 2.969 tok/s Prefill, TTFT 5.830 ms (149 Laufe)AMD Radeon PRO W7800 ...AMD Radeon AI PRO R9700 - 667,0 tok/s Generation, 1.970 tok/s Prefill, TTFT 65.510 ms (855 Laufe)AMD Radeon AI PRO R97...
NVIDIA GeForce RTX 5090 2.491,2 tok/sNVIDIA RTX PRO 6000 Blackwell Workstation Edition 2.414,4 tok/sNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition 2.143,6 tok/sNVIDIA GeForce RTX 5070 Ti 1.744,0 tok/sNVIDIA RTX A6000 1.568,0 tok/sNVIDIA GeForce RTX 3090 Ti 1.492,8 tok/sNVIDIA GB10 (DGX Spark) 903,3 tok/sIntel Arc Pro B70 826,2 tok/sAMD Radeon PRO W7800 48GB 702,9 tok/sAMD Radeon AI PRO R9700 667,0 tok/s

Geschwindigkeit vs. Token pro Euro

Geschwindigkeit vs. Token pro Euro – Blasengröße = VRAM. Oben rechts = schnell und wirtschaftlich.

Auf 2 Jahre gerechnet

Hochrechnung je GPU-Konfiguration für den eingestellten Zeitraum: Kosten (Anschaffung + Strom je Kostenmodus) und generierte Output-Token (AVG je Lauf). X-Achse = Gesamtkosten über den Zeitraum. Zeitraum/Auslastung/Kostenmodus oben anpassbar.

Kosten vs. generierte Token (2 Jahre)

Kosten über 2 Jahre

Generierte Token über 2 Jahre

Kosten & Token wachsen linear mit der Laufzeit. Leistung = GPU-TDP + CPU (Idle + 15 %) + Board (geschätzt). Charts zeigen die Top 12 wirtschaftlichsten Konfigurationen.