Het draaien van eigen Large Language Models (LLM's) en beeldgeneratie-modellen op lokale hardware biedt enorme voordelen op het gebied van privacy, controle en aanpasbaarheid. Echter verandert uw computer zodra u lokaal een model initialiseert in een intensieve rekencluster. CPU's en dedicated GPU's worden tot hun uiterste limieten gedreven, wat direct zichtbaar is op uw energienota.
Veel ontwikkelaars en AI-enthousiastelingen vragen zich af hoe het stroomverbruik van lokale AI-inferentie zich verhoudt tot de maandelijkse kosten van een cloud-abonnement (zoals ChatGPT Plus of Claude Pro). In dit artikel ontleden we het daadwerkelijke energieverbruik tijdens piekbelasting en inactiviteit (idle/sluimerstand), leggen we uit hoe u dit nauwkeurig opmeet met een energiemeter, en presenteren we concrete rekenvoorbeelden per gebruiksprofiel.
1. Hoe AI-hardware stroom verbruikt: Het verschil tussen laden en inferentie
Om te begrijpen waar de energiekosten vandaan komen, moeten we het onderscheid maken tussen twee fases: de rustfase (waarin het model geladen in het geheugen staat) en de actieve fase (inferentie, oftewel het genereren van tekst of beelden).
Wanneer u een LLM start via bijvoorbeeld Ollama of LM Studio, wordt het gewicht van het model ingeladen in het VRAM van uw GPU of het RAM van uw systeem. Zodra het model geladen is en wacht op een prompt, is de verwerkingsbelasting minimaal. Het energieverbruik van de videokaart stijgt in deze fase slechts licht ten opzichte van het normale desktopverbruik.
Het werkelijke stroomverbruik vindt plaats tijdens de inferentie. Zodra de AI begint met het verwerken van uw prompt (de context-fase) en het token-voor-token gegenereerde antwoord (de generatie-fase), schiet de belasting van de rekenkern naar 100%. Bij het selecteren van geschikte hardware voor lokale LLM's is de *Thermal Design Power* (TDP) van uw componenten daarom de bepalende factor voor de piekbelasting.
Explicite aanname: In alle rekenvoorbeelden in dit artikel hanteren we een gemiddelde elektriciteitsprijs van € 0,30 per kWh. Uw werkelijke kosten hangen af van uw specifieke energiecontract en de eventuele opbrengst van zonnepanelen.
2. Typisch stroomverbruik per hardware-categorie
Het stroomverbruik verschilt sterk per type hardware. Hieronder vindt u een overzicht van veelgebruikte systemen en hun gematigde tot maximale opgenomen vermogen tijdens inferentie.
| Hardware Type | Systeem Idle (Sluimer) | Inferentie Piekverbruik | Typische Modellen |
|---|---|---|---|
| Apple Silicon (M1/M2/M3 Pro/Max) | 5 - 15 Watt | 40 - 90 Watt | 7B - 32B gekwantiseerd |
| Middenklasse PC (RTX 3060 / 4060) | 40 - 60 Watt | 180 - 250 Watt | 7B - 13B gekwantiseerd |
| High-end PC (RTX 4080 / 4090) | 60 - 90 Watt | 450 - 600 Watt | 14B - 70B gekwantiseerd |
| Dual GPU Workstation (2x RTX 3090) | 100 - 150 Watt | 800 - 950 Watt | 70B FP16 / Q8 |
Zoals uit de tabel blijkt, zijn Apple Silicon-chips extreem efficiënt door hun geïntegreerde Unified Memory-architectuur. Dedicated NVIDIA-videokaarten verbruiken aanzienlijk meer stroom, maar leveren doorgaans wel een hogere verwerkingssnelheid (meer tokens per seconde). Wanneer u overweegt om een LLM lokaal te draaien, bepaalt deze afweging tussen snelheid en efficiëntie uw uiteindelijke stroomrekening.
3. Zelf meten: Hoe brengt u uw verbruik exact in kaart?
Ingebouwde softwaretools zoals nvidia-smi op Linux/Windows of powermetrics op macOS geven een goede indicatie van het verbruik van de chip zelf. Ze meten echter niet het verlies van de voeding (PSU-efficiëntie) of het verbruik van overige componenten zoals het moederbord, de koeling en opslagschijven.
Stappenplan voor een nauwkeurige meting
- Schaf een fysieke energiemeter aan: Gebruik een slimme tussenstekker (bijvoorbeeld een Zigbee/Wi-Fi stekker met verbruiksmonitor) of een eenvoudige plug-in wattmeter tussen het stopcontact en uw pc.
- Meet de nulmeting (Idle): Laat het systeem opstarten zonder dat er AI-software actief is. Noteer het wattage.
- Meet de geladen status: Laad uw gewenste AI-model in het geheugen via Ollama of Docker. Raadpleeg eventueel onze gids over het draaien van LLM's in Docker voor een schone installatie. Controleer of het idle-verbruik verandert.
- Voer een stresstest uit: Stuur een lange prompt die een grote hoeveelheid tekst genereert (bijvoorbeeld een samenvatting van een lang document) en meet het constante wattage gedurende 2 tot 3 minuten.
# Softwarematige indicatie op Linux/Windows voor NVIDIA GPU's:
nvidia-smi --query-gpu=power.draw,utilization.gpu --format=csv -l 1
# Verwachte output tijdens inferentie:
# power.draw [W], utilization.gpu [%]
# 285.42 W, 99 %
4. Het sluimerverbruik van een altijd-aan thuisserver
Veel gebruikers richten een dedicated server of oude pc in om 24/7 AI-diensten aan te bieden binnen het lokale netwerk. Hier verschuift het financiële zwaartepunt van actief inferentieverbruik naar continu sluimerverbruik (idle consumption).
Stel dat u een krachtige desktop-pc (met een RTX 3090) continu aan laat staan om API-verzoeken op te vangen via diensten zoals Open-WebUI of LocalAI.
Aanname sluimer-rekenvoorbeeld:
- Idle verbruik van het complete systeem: 80 Watt constante stroomafname.
- Tijdduur: 24 uur per dag, 365 dagen per jaar = 8.760 uur.
- Stroomprijs: € 0,30 per kWh.
De berekening voor enkel het aanstaan van de server:
(80 Watt * 8.760 uur) / 1000 = 700,8 kWh per jaar
700,8 kWh * € 0,30 = € 210,24 per jaar (€ 17,52 per maand)
Enkel het nutteloos laten aanstaan van een krachtige pc als thuisserver kost u in dit scenario dus al ruim 17 euro per maand aan stroom, nog voordat er één enkel token is gegenereerd. Het is daarom cruciaal om energiebesparende maatregelen te nemen, zoals het instellen van automatische slaapstanden (Wake-on-LAN) of het selecteren van energiezuinige hardware voor uw server.
5. Rekenvoorbeelden per gebruiksprofiel
Om te bepalen wat lokaal AI draaien kost bij daadwerkelijk gebruik, kijken we naar drie verschillende gebruikersprofielen. In alle situaties gaan we uit van een stroomtarief van € 0,30 / kWh.
Profiel A: De Incidentele Hobbyist
Draait een paar keer per week een lokaal model op een laptop of bestaande pc voor korte vragen of experimenten.
- Hardware: Middenklasse PC (RTX 4060, inferentieverbruik: 200 Watt totaal).
- Gebruik: 30 minuten per dag actief inferentie. De pc wordt na gebruik uitgezet.
- Dagelijks verbruik: 0,5 uur * 0,2 kW = 0,1 kWh.
- Maandelijkse kosten: 3 kWh * € 0,30 = € 0,90 per maand.
Profiel B: De Intensive Developer / Power User
Gebruikt AI lokaal voor het schrijven van code, het verwerken van documenten (RAG) en dagelijkse ondersteuning tijdens het werk.
- Hardware: High-end Workstation (RTX 4090, inferentieverbruik: 500 Watt totaal).
- Gebruik: De pc staat 8 uur per dag aan (waarvan 6 uur idle op 70W en 2 uur actief inferentieverbruik op 500W).
- Dagelijks verbruik: (6 uur * 0,07 kW) + (2 uur * 0,5 kW) = 0,42 kWh + 1,0 kWh = 1,42 kWh.
- Maandelijkse kosten (22 werkdagen): 31,24 kWh * € 0,30 = € 9,37 per maand.
Profiel C: De Zelfgehoste 24/7 AI Server
Een thuisserver die continu aanstaat voor het gezin of een klein kantoor, inclusief geautomatiseerde taken op de achtergrond.
- Hardware: Dedicated server (RTX 3090, idle verbruik 80W, inferentieverbruik 400W).
- Gebruik: 21 uur per dag idle, 3 uur per dag actieve verwerking verspreid over de dag.
- Dagelijks verbruik: (21 uur * 0,08 kW) + (3 uur * 0,4 kW) = 1,68 kWh + 1,2 kWh = 2,88 kWh.
- Maandelijkse kosten (30 dagen): 86,4 kWh * € 0,30 = € 25,92 per maand.
6. Lokaal draaien versus een Cloud-abonnement
Wanneer we het stroomverbruik van een lokale opstelling vergelijken met commercial cloud-diensten (zoals ChatGPT Plus à $ 20 / ca. € 19 per maand of een API-abonnement), vallen een paar dingen op:
- Bestaande hardware: Gebruikt u uw huidige pc uitsluitend incidenteel of voor werk (Profiel A of B), dan zijn de energiekosten van lokaal draaien (€ 1 tot € 10 per maand) aanzienlijk lager dan een cloud-abonnement.
- Afschrijving hardware: Stroom is niet de enige kostenvactor. Een videokaart van € 1.000 tot € 2.000 die intensief belast wordt, schrijft af. Wie speciaal hardware aanschaft om geld te besparen op cloud-abonnementen, heeft vaak een lange terugverdientijd.
- Privacy en Onbeperkt Gebruik: Bij lokaal gebruik betaalt u per kilowattuur en niet per token. Voor het verwerken van gigabytes aan gevoelige documenten via een lokale RAG-pijplijn is lokaal draaien qua prijs-kwaliteitverhouding en privacy superieur, ongeacht het stroomverbruik. Meer hierover leest u in onze externe gids over RAG voor beginners op leren.llmnet.nl.
Conclusie & Praktische Tips voor Energiebesparing
Lokaal AI draaien is qua stroomverbruik minder duur dan veel mensen vrezen, mits u verstandig omgaat met de apparatuur. Het actieve inferentieverbruik kost doorgaans slechts enkele dubbeltjes per dag, omdat een GPU alleen tijdens het daadwerkelijke genereren van tekst op vol vermogen draait.
Drie tips om uw energiekosten laag te houden:
- Power Limiting: Schaal het maximale vermogen van uw GPU terug via tools zoals MSI Afterburner of
nvidia-smi -pl [wattage]. Het verlagen van de powerlimit met 20% kost vaak slechts 5% aan generatiesnelheid, maar scheelt enorm in warmte en stroomverbruik. - Voorkom onnodig idle-verbruik: Schakel servers uit wanneer ze niet gebruikt worden, of stel automatische stand-by modi in.
- Kies de juiste kwantisering: Lichtere, gekwantiseerde modellen vergen minder werkgeheugen en kortere rekentijd per token, wat direct resulteert in een kortere piekbelasting van uw hardware.