Deel:𝕏LinkedInRedditFacebookKopieer link

LLM draaien op oudere hardware

Het lokaal uitvoeren van grote taalmodellen (LLM's) wordt vaak geassocieerd met kostbare werkstations, krachtige videokaarten en tientallen gigabytes aan dedicated VRAM. Wie echter beschikt over een oudere laptop, een traditionele kantoor-pc zonder losse GPU of een oudere Mac met Intel-processor hoeft niet per se aan de zijlijn te blijven staan. Met de juiste instellingen, een realistisch modelformaat en gerichte optimalisaties is het heel goed mogelijk om bruikbare prestaties uit bestaande hardware te persen.

Deze gids is geschreven als praktische handleiding voor het optimaliseren van uw huidige systeem. We richten ons niet op de aanschaf van nieuwe onderdelen, maar op het slim configureren van de middelen die u al in huis heeft. Voor een algemeen overzicht van de systeemvereisten voor nieuwe systemen kunt u onze gids over hardware voor lokale LLM's raadplegen.

1. Realistisch vaststellen wat uw machine aankan

Voor u begint met het downloaden van modelbestanden is het essentieel om te begrijpen welke onderdelen van uw computer de prestaties bepalen bij het uitvoeren van een lokaal taalmodel.

Werkgeheugen (RAM) als harde bovengrens

Bij het uitvoeren van een LLM op een computer zonder aparte videokaart wordt het model volledig geladen in het reguliere systeemgeheugen (RAM). Het beschikbare RAM bepaalt simpelweg welk model wel of niet op uw systeem past. Indien een modelbestand groter is dan het beschikbare geheugen, zal het besturingssysteem proberen data naar de harde schijf of SSD te schrijven (swapping), wat leidt tot een onwerkbaar trage interface.

Als vuistregel geldt dat u ten minste 2 tot 3 gigabyte RAM moet vrijhouden voor het besturingssysteem en achtergrondtaken. Op een systeem met 8 GB RAM heeft u effectief ongeveer 5 GB ruimte voor de AI-software en het model.

CPU versus GPU en de rol van geheugenbandbreedte

Veel mensen nemen aan dat de kloksnelheid of het aantal rekenkernen van de processor (CPU) de voornaamste vertragende factor is. Bij het genereren van tekst door een LLM is de werkelijke bottleneck echter bijna altijd de geheugenbandbreedte. Een taalmodel moet bij het genereren van elk afzonderlijk woord (token) de volledige dataset van alle gewichten uit het geheugen naar de processor streamen.

De geheugen-bottleneck in de praktijk: Ouder DDR3- of DDR4-werkgeheugen in traditionele pc's verplaatst data met typisch 20 tot 40 gigabyte per seconde. Ter vergelijking: moderne GPU's of Apple Silicon chips halen bandbreedtes van 150 tot meer dan 800 GB/s. Op oudere hardware is de verwerkingssnelheid daardoor voornamelijk een kwestie van de fysieke snelheid waarmee de RAM-chips gegevens naar de CPU kunnen sturen.

2. Een kleiner model kiezen in plaats van een groot model forceren

De meest effectieve manier om bruikbare prestaties te krijgen op beperkte hardware is het radicaal verkleinen van de modelomvang. Een veelgemaakte fout is het proberen te draaien van een model met 7 of 13 miljard parameters op een machine met 8 GB RAM.

Kies in plaats daarvan voor compacte modellen die specifiek ontworpen zijn om efficiënt te presteren bij een lager parameteraantal. In de categorieën van 0.5B, 1.5B en 3B parameters zijn de afgelopen jaren enorme kwaliteitsslagen gemaakt. Meer informatie over het selecteren van geschikte categorieën vindt u in onze gids over een lokaal model kiezen.

Beschikbaar RAM Aanbevolen parameteraantal Indicatieve geheugenruimte voor model
4 GB RAM 0.5B – 1.5B parameters 1,5 tot 2,5 GB
8 GB RAM 1.5B – 3B parameters 2,5 tot 5,0 GB
16 GB RAM (oudere CPU) 3B – 7B parameters (sterk gekwantiseerd) 5,0 tot 9,0 GB

3. Kwantisatie als belangrijkste knop

Kwantisatie is de techniek waarbij de numerieke precisie van de gewichten in het AI-model wordt verlaagd (bijvoorbeeld van 16-bit floating point naar 4-bit of 2-bit gehele getallen). Dit verkleint de bestandsgrootte van het model drastisch en vermindert de hoeveelheid data die per gegenereerde token over de geheugenbus moet worden gestuurd.

Voor verouderde hardware is kwantisatie geen optie maar een vereiste. Een uitgebreide uitleg over de technische achtergrond en verlieswaarden vindt u in onze gids over kwantisatie uitgelegd.

Wat u inlevert bij lage precisie

4. Contextlengte verkleinen om geheugen te besparen

Wanneer u een model start, neemt niet alleen de gewichtenmatrix geheugen in beslag, maar ook de zogenaamde Key-Value (KV) cache. Deze cache slaat de informatie van het lopende gesprek en de ingevoerde tekst op.

Standaard ondersteunen veel moderne modellen een contextvenster van 8.192 tot 32.768 tokens. Op een systeem met beperkt RAM veroorzaakt een groot contextvenster echter een gevaarlijke toename van het geheugengebruik. Naarmate het gesprek langer wordt, kan de KV-cache meerdere gigabytes aan extra geheugen opeisen, waardoor de computer onverwacht vastloopt.

Praktische instelling voor de context

Beperk de contextlengte in uw software (zoals Ollama of LM Studio) expliciet tot 2048 tokens of zelfs 1024 tokens op zeer oude machines. Als u ziet dat de software via een configuratieparameter zoals num_ctx op 4096 staat ingesteld, halveer deze waarde dan. Dit geeft de CPU direct ademruimte en voorkomt geheugenpieken tijdens lange prompts.

5. Swap en thermische throttling herkennen en voorkomen

Oudere laptophardware krijgt bij langdurige AI-taken te maken met twee fysieke obstakels: virtueel geheugen (swapping) en oververhitting (thermal throttling).

Swapping herkennen

Wanneer de computer te weinig fysiek RAM heeft, gebruikt het besturingssysteem de harde schijf of SSD als tijdelijke opslag. U herkent swapping aan de volgende symptomen:

Oplossing: Sluit de toepassing en kies een kleiner of zwaarder gekwantiseerd model. Blijf altijd ruim onder het fysieke RAM-limiet van de machine.

Thermische throttling

Processoren in oudere laptops zijn niet ontworpen om minutenlang op 100% belasting van alle kernen te draaien. Wanneer de temperatuur te hoog oploopt, zal de processor automatisch zijn kloksnelheid verlagen om schade te voorkomen. Hierdoor wordt de reactietijd van het model na verloop van tijd merkbaar trager.

Zorg voor goede ventilatie door de laptop op een harde, vlakke ondergrond te plaatsen en stof uit de ventilatieroosters te verwijderen. Beperk eventueel het aantal toegewezen CPU-threads in de instellingen van de AI-runner tot $N-1$ of $N-2$ (waarbij $N$ het totale aantal processorkernen is) zodat het systeem niet voortdurend op maximale capaciteit draait.

6. Systeembronnen vrijmaken en achtergrondprocessen stopzetten

Op een krachtige moderne pc maakt een openstaande webbrowser met dertig tabbladen weinig verschil. Op een oude machine met 8 GB RAM kan een webbrowser echter al 2 tot 3 GB aan geheugen opeisen.

Laptops van Apple met een ouder besturingssysteem vereisen een specifieke aanpak; bekijk hiervoor onze handleiding over Ollama op macOS installeren.

7. Verwachtingen bijstellen: wat is wel en niet realistisch?

Het is belangrijk om heldere verwachtingen te hebben over wat haalbaar is wanneer u een lokaal model draait op een oudere machine. De prestaties moeten altijd worden afgewogen tegen de wens om data volledig privé te verwerken.

Realistische en geschikte taken

Onrealistische taken voor oudere hardware

Om te controleren hoe de prestaties van uw specifieke hardware zich verhouden tot andere configuraties, kunt u de benchmarkresultaten raadplegen op onze externe testomgeving op LLMnet Benchmark.

8. Wanneer lokaal draaien niet meer loont

Hoewel optimaliseren ver kan gaan, heeft elke hardwaregeneratie zijn grenzen. Het is verstandig om over te stappen op alternatieven wanneer:

In die gevallen kan het verstandiger zijn om privacyvriendelijke API-diensten te overwegen of de AI-taken uit te voeren op een ander, krachtiger apparaat in uw lokale netwerk.

Optimalisatie-checklist voor oudere hardware

Gebruik deze stappen als een snelle controlekaart bij het instellen van uw lokale model:

  1. Controleer vrij RAM: Open de Taakbeheerder of Activiteitenweergave en bepaal hoeveel geheugen daadwerkelijk vrij is.
  2. Kies een passend model: Selecteer een 1.5B of 3B model (bijvoorbeeld Qwen2.5-1.5B of Llama-3.2-3B).
  3. Selecteer sterke kwantisatie: Download een Q4_K_M of Q3_K_M variant van het model.
  4. Beperk de context: Stel de contextlengte in de instellingen handmatig in op 1024 of 2048 tokens.
  5. Sluit overige software: Sluit alle browservensters en zware achtergrondprogramma's.
  6. Meet zelf de prestaties: Test het model met een korte prompt en controleer de generatiesnelheid en het temperatuurverloop van uw machine.