gids.llmnet.nl • Lokale AI Handleidingen

Wat kost het stroomverbruik van lokale AI? (GPU/CPU Rekensom & Metingen)

Gepubliceerd door Redactie LLMnet • Leestijd: ca. 8 minuten

Het draaien van eigen Large Language Models (LLM's) en beeldgeneratie-modellen op lokale hardware biedt enorme voordelen op het gebied van privacy, controle en aanpasbaarheid. Echter verandert uw computer zodra u lokaal een model initialiseert in een intensieve rekencluster. CPU's en dedicated GPU's worden tot hun uiterste limieten gedreven, wat direct zichtbaar is op uw energienota.

Veel ontwikkelaars en AI-enthousiastelingen vragen zich af hoe het stroomverbruik van lokale AI-inferentie zich verhoudt tot de maandelijkse kosten van een cloud-abonnement (zoals ChatGPT Plus of Claude Pro). In dit artikel ontleden we het daadwerkelijke energieverbruik tijdens piekbelasting en inactiviteit (idle/sluimerstand), leggen we uit hoe u dit nauwkeurig opmeet met een energiemeter, en presenteren we concrete rekenvoorbeelden per gebruiksprofiel.

1. Hoe AI-hardware stroom verbruikt: Het verschil tussen laden en inferentie

Om te begrijpen waar de energiekosten vandaan komen, moeten we het onderscheid maken tussen twee fases: de rustfase (waarin het model geladen in het geheugen staat) en de actieve fase (inferentie, oftewel het genereren van tekst of beelden).

Wanneer u een LLM start via bijvoorbeeld Ollama of LM Studio, wordt het gewicht van het model ingeladen in het VRAM van uw GPU of het RAM van uw systeem. Zodra het model geladen is en wacht op een prompt, is de verwerkingsbelasting minimaal. Het energieverbruik van de videokaart stijgt in deze fase slechts licht ten opzichte van het normale desktopverbruik.

Het werkelijke stroomverbruik vindt plaats tijdens de inferentie. Zodra de AI begint met het verwerken van uw prompt (de context-fase) en het token-voor-token gegenereerde antwoord (de generatie-fase), schiet de belasting van de rekenkern naar 100%. Bij het selecteren van geschikte hardware voor lokale LLM's is de *Thermal Design Power* (TDP) van uw componenten daarom de bepalende factor voor de piekbelasting.

Explicite aanname: In alle rekenvoorbeelden in dit artikel hanteren we een gemiddelde elektriciteitsprijs van € 0,30 per kWh. Uw werkelijke kosten hangen af van uw specifieke energiecontract en de eventuele opbrengst van zonnepanelen.

2. Typisch stroomverbruik per hardware-categorie

Het stroomverbruik verschilt sterk per type hardware. Hieronder vindt u een overzicht van veelgebruikte systemen en hun gematigde tot maximale opgenomen vermogen tijdens inferentie.

Hardware Type Systeem Idle (Sluimer) Inferentie Piekverbruik Typische Modellen
Apple Silicon (M1/M2/M3 Pro/Max) 5 - 15 Watt 40 - 90 Watt 7B - 32B gekwantiseerd
Middenklasse PC (RTX 3060 / 4060) 40 - 60 Watt 180 - 250 Watt 7B - 13B gekwantiseerd
High-end PC (RTX 4080 / 4090) 60 - 90 Watt 450 - 600 Watt 14B - 70B gekwantiseerd
Dual GPU Workstation (2x RTX 3090) 100 - 150 Watt 800 - 950 Watt 70B FP16 / Q8

Zoals uit de tabel blijkt, zijn Apple Silicon-chips extreem efficiënt door hun geïntegreerde Unified Memory-architectuur. Dedicated NVIDIA-videokaarten verbruiken aanzienlijk meer stroom, maar leveren doorgaans wel een hogere verwerkingssnelheid (meer tokens per seconde). Wanneer u overweegt om een LLM lokaal te draaien, bepaalt deze afweging tussen snelheid en efficiëntie uw uiteindelijke stroomrekening.

3. Zelf meten: Hoe brengt u uw verbruik exact in kaart?

Ingebouwde softwaretools zoals nvidia-smi op Linux/Windows of powermetrics op macOS geven een goede indicatie van het verbruik van de chip zelf. Ze meten echter niet het verlies van de voeding (PSU-efficiëntie) of het verbruik van overige componenten zoals het moederbord, de koeling en opslagschijven.

Stappenplan voor een nauwkeurige meting

  1. Schaf een fysieke energiemeter aan: Gebruik een slimme tussenstekker (bijvoorbeeld een Zigbee/Wi-Fi stekker met verbruiksmonitor) of een eenvoudige plug-in wattmeter tussen het stopcontact en uw pc.
  2. Meet de nulmeting (Idle): Laat het systeem opstarten zonder dat er AI-software actief is. Noteer het wattage.
  3. Meet de geladen status: Laad uw gewenste AI-model in het geheugen via Ollama of Docker. Raadpleeg eventueel onze gids over het draaien van LLM's in Docker voor een schone installatie. Controleer of het idle-verbruik verandert.
  4. Voer een stresstest uit: Stuur een lange prompt die een grote hoeveelheid tekst genereert (bijvoorbeeld een samenvatting van een lang document) en meet het constante wattage gedurende 2 tot 3 minuten.
# Softwarematige indicatie op Linux/Windows voor NVIDIA GPU's:
nvidia-smi --query-gpu=power.draw,utilization.gpu --format=csv -l 1

# Verwachte output tijdens inferentie:
# power.draw [W], utilization.gpu [%]
# 285.42 W, 99 %

4. Het sluimerverbruik van een altijd-aan thuisserver

Veel gebruikers richten een dedicated server of oude pc in om 24/7 AI-diensten aan te bieden binnen het lokale netwerk. Hier verschuift het financiële zwaartepunt van actief inferentieverbruik naar continu sluimerverbruik (idle consumption).

Stel dat u een krachtige desktop-pc (met een RTX 3090) continu aan laat staan om API-verzoeken op te vangen via diensten zoals Open-WebUI of LocalAI.

Aanname sluimer-rekenvoorbeeld:

  • Idle verbruik van het complete systeem: 80 Watt constante stroomafname.
  • Tijdduur: 24 uur per dag, 365 dagen per jaar = 8.760 uur.
  • Stroomprijs: € 0,30 per kWh.

De berekening voor enkel het aanstaan van de server:

(80 Watt * 8.760 uur) / 1000 = 700,8 kWh per jaar
700,8 kWh * € 0,30 = € 210,24 per jaar (€ 17,52 per maand)

Enkel het nutteloos laten aanstaan van een krachtige pc als thuisserver kost u in dit scenario dus al ruim 17 euro per maand aan stroom, nog voordat er één enkel token is gegenereerd. Het is daarom cruciaal om energiebesparende maatregelen te nemen, zoals het instellen van automatische slaapstanden (Wake-on-LAN) of het selecteren van energiezuinige hardware voor uw server.

5. Rekenvoorbeelden per gebruiksprofiel

Om te bepalen wat lokaal AI draaien kost bij daadwerkelijk gebruik, kijken we naar drie verschillende gebruikersprofielen. In alle situaties gaan we uit van een stroomtarief van € 0,30 / kWh.

Profiel A: De Incidentele Hobbyist

Draait een paar keer per week een lokaal model op een laptop of bestaande pc voor korte vragen of experimenten.

Profiel B: De Intensive Developer / Power User

Gebruikt AI lokaal voor het schrijven van code, het verwerken van documenten (RAG) en dagelijkse ondersteuning tijdens het werk.

Profiel C: De Zelfgehoste 24/7 AI Server

Een thuisserver die continu aanstaat voor het gezin of een klein kantoor, inclusief geautomatiseerde taken op de achtergrond.

6. Lokaal draaien versus een Cloud-abonnement

Wanneer we het stroomverbruik van een lokale opstelling vergelijken met commercial cloud-diensten (zoals ChatGPT Plus à $ 20 / ca. € 19 per maand of een API-abonnement), vallen een paar dingen op:

  1. Bestaande hardware: Gebruikt u uw huidige pc uitsluitend incidenteel of voor werk (Profiel A of B), dan zijn de energiekosten van lokaal draaien (€ 1 tot € 10 per maand) aanzienlijk lager dan een cloud-abonnement.
  2. Afschrijving hardware: Stroom is niet de enige kostenvactor. Een videokaart van € 1.000 tot € 2.000 die intensief belast wordt, schrijft af. Wie speciaal hardware aanschaft om geld te besparen op cloud-abonnementen, heeft vaak een lange terugverdientijd.
  3. Privacy en Onbeperkt Gebruik: Bij lokaal gebruik betaalt u per kilowattuur en niet per token. Voor het verwerken van gigabytes aan gevoelige documenten via een lokale RAG-pijplijn is lokaal draaien qua prijs-kwaliteitverhouding en privacy superieur, ongeacht het stroomverbruik. Meer hierover leest u in onze externe gids over RAG voor beginners op leren.llmnet.nl.

Conclusie & Praktische Tips voor Energiebesparing

Lokaal AI draaien is qua stroomverbruik minder duur dan veel mensen vrezen, mits u verstandig omgaat met de apparatuur. Het actieve inferentieverbruik kost doorgaans slechts enkele dubbeltjes per dag, omdat een GPU alleen tijdens het daadwerkelijke genereren van tekst op vol vermogen draait.

Drie tips om uw energiekosten laag te houden: