# Energieverbruik van je lokale LLM-opstelling meten

Deel:[𝕏](https://twitter.com/intent/tweet?url=https%3A//gids.llmnet.nl/lokale-llm-energieverbruik-meten&text=Energieverbruik%20van%20je%20lokale%20LLM-opstelling%20meten%20-%20gids.llmnet.nl)[LinkedIn](https://www.linkedin.com/sharing/share-offsite/?url=https%3A//gids.llmnet.nl/lokale-llm-energieverbruik-meten)[Reddit](https://www.reddit.com/submit?url=https%3A//gids.llmnet.nl/lokale-llm-energieverbruik-meten&title=Energieverbruik%20van%20je%20lokale%20LLM-opstelling%20meten%20-%20gids.llmnet.nl)[Facebook](https://www.facebook.com/sharer/sharer.php?u=https%3A//gids.llmnet.nl/lokale-llm-energieverbruik-meten)[Kopieer link](#)

 [gids.llmnet.nl](https://gids.llmnet.nl/)
 
# Energieverbruik van je lokale LLM-opstelling meten

 Door Ivo Donker - 6 augustus 2026

 
 
 Het lokaal draaien van Large Language Models (LLM's) biedt immense voordelen op het gebied van privacy, controle en latentie. Wie echter zware modellen laat infereren op krachtige videokaarten of professionele serverhardware, merkt al snel dat het stroomverbruik aanzienlijk kan oplopen. Het nauwkeurig meten van het energieverbruik is niet alleen nuttig om de stroomrekening te voorspellen, maar ook om te bepalen welke kwantisatie of welk modeltype de beste energie-efficiëntie per gegenereerde token levert.

 In deze gids nemen we alle manieren door om het energieverbruik van een lokale AI-opstelling in kaart te brengen: van hardwarematige metingen aan het stopcontact tot softwarematige telemetrie op GPU- en CPU-niveau.

 

 
 
## Waarom energieverbruik meten bij lokale LLM's?

 Bij traditionele CPU-workloads schommelt het stroomverbruik sterk afhankelijk van korte pieken. LLM-inferentie en -training leggen echter gedurende langere tijd een continue, zware belasting op de hardware. Verschillende factoren bepalen hoeveel energie er uiteindelijk verbruikt wordt:

 
 
- Idle vs. Aktief (Inferentie): Een systeem dat enkel wacht op opdrachten verbruikt aanzienlijk minder stroom dan een systeem dat actief tokens genereert. De verhouding tussen dit rustverbruik en piekverbruik is bepalend voor de efficiëntie.
 
- Modelgrootte en Kwantisatie: Een 70B parameter-model vereist meer geheugenbandbreedte en rekenkracht dan een 8B-model. Het slim kiezen van kwantisatie kan het energieverbruik per token drastisch verlagen. Raadpleeg onze gids over [kwantisatie uitgelegd](/kwantisatie-uitgelegd) voor meer achtergrond.
 
- Voedingsefficiëntie (PSU): Een computer voeding verliest energie in de vorm van warmte. De mate waarin wisselstroom (AC) uit het stopcontact wordt omgezet naar gelijkstroom (DC) beïnvloedt de totale vermogensvraag.
 
 

 
 
## Methode 1: Meten aan het stopcontact (Hardwareniveau)

 De meest betrouwbare methode om het totale stroomverbruik te meten is vanaf de muur. Softwarematige hulpprogramma's zien immers alleen de componenten zelf, en negeren de efficiëntieverliezen van de voeding, het stroomverbruik van koelventilatoren, waterkoeling en het moederbord.

 
### Tussenschakelmeters en Slimme Stekkers

 Voor een snelle meting volstaat een simpele plug-in energiemeter. Wil je het verbruik echter continu monitoren en linken aan je LLM-benchmarks, kies dan voor een slimme stekker met een open API of integratieopties (zoals Zigbee, Tasmota, of Home Assistant).

 
 
 
 Type meter | 
 Nauwkeurigheid | 
 Data-export | 
 Toepassing | 
 

 
 
 
 Basismeter (Plug-in) | 
 Matig tot Goed | 
 Geen (enkel scherm) | 
 Incidentele steekproef | 
 

 
 WiFi/Zigbee Slimme Stekker | 
 Goed | 
 Via API / Home Assistant | 
 Langdurige monitoring & automatisering | 
 

 
 Professionele PDU (Rack) | 
 Zeer hoog | 
 SNMP / Prometheus | 
 Multi-GPU servers & homelabs | 
 

 
 

 
 Let op: Zorg ervoor dat de slimme stekker het piekvermogen van je opstelling aankan. Een werkstation met twee High-End GPU's kan tijdens opstarten of zware belasting kortstondig een hoge stroompiek trekken.

 
 

 
 
## Methode 2: Softwarematige telemetrie via CLI

 Om exact te weten welk onderdeel van je opstelling (GPU, CPU of geheugen) het meeste stroom trekt, kun je gebruikmaken van ingebouwde command-line hulpprogramma's.

 
### NVIDIA GPU's meten met nvidia-smi

 Maak je gebruik van een NVIDIA videokaart, dan is nvidia-smi de standaardoplossing. Met onderstaand commando vraag je elke seconde het actuele stroomverbruik in Watt op:

 nvidia-smi --query-gpu=timestamp,name,power.draw,temperature.gpu --format=csv -l 1

 Wil je het stroomverbruik direct loggen naar een bestand voor latere analyse? Voer dan het volgende uit:

 nvidia-smi --query-gpu=timestamp,power.draw --format=csv -l 1 > gpu_power_log.csv

 
### AMD GPU's meten met rocm-smi

 Op Linux-systemen met AMD-hardware en de ROCm-stack gebruik je rocm-smi om het vermogen op te vragen:

 rocm-smi --showpower

 
### Apple Silicon (Mac) meten met powermetrics

 Draai je LLM's lokaal op een Mac met Apple Silicon (M1/M2/M3/M4)? Dan delen de CPU en GPU hetzelfde Unified Memory. Het stroomverbruik van de SoC (System on Chip) kan op macOS worden uitgelezen via de terminal met root-rechten:

 sudo powermetrics -i 1000 --samplers cpu_power

 Hiermee krijg je elke 1000 milliseconden een gedetailleerd overzicht van het verbruik van de CPU-cores en de GPU-cluster in milliwatts.

 

 
 
## Energie-efficiëntie berekenen: Joules per Token

 Enkel kijken naar het aantal Watts geeft een onvolledig beeld. Een model dat 300 Watt verbruikt maar 60 tokens per seconde genereert, is efficiënter dan een model dat 150 Watt verbruikt maar slechts 10 tokens per seconde haalt.

 Om de werkelijke efficiëntie te berekenen, gebruiken we de maatstaaf Joules per Token (J/tok). Eén Watt is gelijk aan één Joule per seconde ($1\text{ Watt} = 1\text{ Joule/seconde}$).

 De formule voor het energieverbruik per token is:

 Energie per token (J/tok) = Totaal vermogen (Watt) / Gegenereerde tokens per seconde (tok/s)

 
### Rekenvoorbeeld:

 
 
- Scenario A: Systeem verbruikt 250 Watt en haalt 50 tok/s. 
 $$\frac{250\text{ W}}{50\text{ tok/s}} = 5.0\text{ Joules per token}$$
 
- Scenario B: Systeem verbruikt 120 Watt en haalt 15 tok/s. 
 $$\frac{120\text{ W}}{15\text{ tok/s}} = 8.0\text{ Joules per token}$$
 

 Hoewel Scenario B minder vermogen trekt, is Scenario A per gegenereerde token 37,5% energie-efficiënter omdat de taak sneller is afgerond.

 

 
 
## Tips om het stroomverbruik van je LLM-opstelling te verlagen

 Zodra je het verbruik in kaart hebt gebracht, kun je gerichte optimalisaties toepassen om het energieverbruik te drukken zonder drastisch in te boeten op prestaties:

 
 
- Power Limiting instellen: NVIDIA GPU's laten zich heel efficiënt afknijpen. Vaak kun je het maximaal toegestane vermogen met 20-30% verlagen via nvidia-smi -pl [limiet_in_watts], terwijl het prestatieverlies bij LLM-inferentie beperkt blijft tot slechts enkele procenten.
 
- Kies de juiste kwantisatie: Overstappen van 8-bit naar 4-bit kwantisatie halveert het benodigde VRAM. Dit betekent minder geheugenbandbreedte-intensiviteit en daardoor een lager stroomverbruik. Lees meer op onze pagina over [stroomverbruik van lokale AI](/stroomverbruik-lokale-ai).
 
- Optimaliseer je hardwareconfiguratie: Zorg voor een efficiënte voeding (80 Plus Gold of Platinum rating) en controleer of je de juiste keuzes hebt gemaakt via onze gids voor [hardware voor lokale LLM's](/hardware-voor-lokale-llm).
 
- Voorkom onnodig idlen: Draai je modellen in containers? Zorg ervoor dat de GPU naar de laagste energieklasse terugschakelt wanneer er geen verzoeken binnenkomen. Bekijk hiervoor ook ons artikel over [LLM-optimalisatie op hardware](/llm-op-oude-hardware-optimaliseren).
 
 

 
 
## Verder praten en benchmarks vergelijken

 Wil je jouw meetresultaten vergelijken met de mienskip of ben je benieuwd welke hardware het best scoort op het gebied van Joules per Token? Sluit je aan bij de discussies op onze [llmnet community](https://community.llmnet.nl/) of bekijk onafhankelijke prestatietests op het kennisnetwerk.

 
 

 © 2026 llmnet.nl - Kennisnetwerk voor Lokale AI en LLM's
