Het lokaal uitvoeren van grote taalmodellen (LLM's) wordt vaak geassocieerd met kostbare werkstations, krachtige videokaarten en tientallen gigabytes aan dedicated VRAM. Wie echter beschikt over een oudere laptop, een traditionele kantoor-pc zonder losse GPU of een oudere Mac met Intel-processor hoeft niet per se aan de zijlijn te blijven staan. Met de juiste instellingen, een realistisch modelformaat en gerichte optimalisaties is het heel goed mogelijk om bruikbare prestaties uit bestaande hardware te persen.
Deze gids is geschreven als praktische handleiding voor het optimaliseren van uw huidige systeem. We richten ons niet op de aanschaf van nieuwe onderdelen, maar op het slim configureren van de middelen die u al in huis heeft. Voor een algemeen overzicht van de systeemvereisten voor nieuwe systemen kunt u onze gids over hardware voor lokale LLM's raadplegen.
1. Realistisch vaststellen wat uw machine aankan
Voor u begint met het downloaden van modelbestanden is het essentieel om te begrijpen welke onderdelen van uw computer de prestaties bepalen bij het uitvoeren van een lokaal taalmodel.
Werkgeheugen (RAM) als harde bovengrens
Bij het uitvoeren van een LLM op een computer zonder aparte videokaart wordt het model volledig geladen in het reguliere systeemgeheugen (RAM). Het beschikbare RAM bepaalt simpelweg welk model wel of niet op uw systeem past. Indien een modelbestand groter is dan het beschikbare geheugen, zal het besturingssysteem proberen data naar de harde schijf of SSD te schrijven (swapping), wat leidt tot een onwerkbaar trage interface.
Als vuistregel geldt dat u ten minste 2 tot 3 gigabyte RAM moet vrijhouden voor het besturingssysteem en achtergrondtaken. Op een systeem met 8 GB RAM heeft u effectief ongeveer 5 GB ruimte voor de AI-software en het model.
CPU versus GPU en de rol van geheugenbandbreedte
Veel mensen nemen aan dat de kloksnelheid of het aantal rekenkernen van de processor (CPU) de voornaamste vertragende factor is. Bij het genereren van tekst door een LLM is de werkelijke bottleneck echter bijna altijd de geheugenbandbreedte. Een taalmodel moet bij het genereren van elk afzonderlijk woord (token) de volledige dataset van alle gewichten uit het geheugen naar de processor streamen.
De geheugen-bottleneck in de praktijk: Ouder DDR3- of DDR4-werkgeheugen in traditionele pc's verplaatst data met typisch 20 tot 40 gigabyte per seconde. Ter vergelijking: moderne GPU's of Apple Silicon chips halen bandbreedtes van 150 tot meer dan 800 GB/s. Op oudere hardware is de verwerkingssnelheid daardoor voornamelijk een kwestie van de fysieke snelheid waarmee de RAM-chips gegevens naar de CPU kunnen sturen.
2. Een kleiner model kiezen in plaats van een groot model forceren
De meest effectieve manier om bruikbare prestaties te krijgen op beperkte hardware is het radicaal verkleinen van de modelomvang. Een veelgemaakte fout is het proberen te draaien van een model met 7 of 13 miljard parameters op een machine met 8 GB RAM.
Kies in plaats daarvan voor compacte modellen die specifiek ontworpen zijn om efficiënt te presteren bij een lager parameteraantal. In de categorieën van 0.5B, 1.5B en 3B parameters zijn de afgelopen jaren enorme kwaliteitsslagen gemaakt. Meer informatie over het selecteren van geschikte categorieën vindt u in onze gids over een lokaal model kiezen.
| Beschikbaar RAM | Aanbevolen parameteraantal | Indicatieve geheugenruimte voor model |
|---|---|---|
| 4 GB RAM | 0.5B – 1.5B parameters | 1,5 tot 2,5 GB |
| 8 GB RAM | 1.5B – 3B parameters | 2,5 tot 5,0 GB |
| 16 GB RAM (oudere CPU) | 3B – 7B parameters (sterk gekwantiseerd) | 5,0 tot 9,0 GB |
3. Kwantisatie als belangrijkste knop
Kwantisatie is de techniek waarbij de numerieke precisie van de gewichten in het AI-model wordt verlaagd (bijvoorbeeld van 16-bit floating point naar 4-bit of 2-bit gehele getallen). Dit verkleint de bestandsgrootte van het model drastisch en vermindert de hoeveelheid data die per gegenereerde token over de geheugenbus moet worden gestuurd.
Voor verouderde hardware is kwantisatie geen optie maar een vereiste. Een uitgebreide uitleg over de technische achtergrond en verlieswaarden vindt u in onze gids over kwantisatie uitgelegd.
Wat u inlevert bij lage precisie
- Q4_K_M (4-bit): De gouden standaard voor balanceren tussen kwaliteit en geheugengebruik. Biedt nauwelijks merkbaar kwaliteitsverlies ten opzichte van het originele model.
- Q3_K_M (3-bit): Biedt extra ruimte op krappe systemen. Er treedt lichte achteruitgang op in logisch redeneren en het opvolgen van ingewikkelde instructies.
- Q2_K (2-bit): Zorgt voor een extreem klein geheugenbeslag, maar het model kan meer fouten gaan maken, feiten verdraaien of in herhalingen vervallen. Gebruik dit alleen als u anders helemaal geen model kunt draaien.
4. Contextlengte verkleinen om geheugen te besparen
Wanneer u een model start, neemt niet alleen de gewichtenmatrix geheugen in beslag, maar ook de zogenaamde Key-Value (KV) cache. Deze cache slaat de informatie van het lopende gesprek en de ingevoerde tekst op.
Standaard ondersteunen veel moderne modellen een contextvenster van 8.192 tot 32.768 tokens. Op een systeem met beperkt RAM veroorzaakt een groot contextvenster echter een gevaarlijke toename van het geheugengebruik. Naarmate het gesprek langer wordt, kan de KV-cache meerdere gigabytes aan extra geheugen opeisen, waardoor de computer onverwacht vastloopt.
Praktische instelling voor de context
Beperk de contextlengte in uw software (zoals Ollama of LM Studio) expliciet tot 2048 tokens of zelfs 1024 tokens op zeer oude machines. Als u ziet dat de software via een configuratieparameter zoals num_ctx op 4096 staat ingesteld, halveer deze waarde dan. Dit geeft de CPU direct ademruimte en voorkomt geheugenpieken tijdens lange prompts.
5. Swap en thermische throttling herkennen en voorkomen
Oudere laptophardware krijgt bij langdurige AI-taken te maken met twee fysieke obstakels: virtueel geheugen (swapping) en oververhitting (thermal throttling).
Swapping herkennen
Wanneer de computer te weinig fysiek RAM heeft, gebruikt het besturingssysteem de harde schijf of SSD als tijdelijke opslag. U herkent swapping aan de volgende symptomen:
- De ventilator slaat aan, de harde-schijfindicator knippert continu en de muisaanwijzer reageert schokkerig.
- Het genereren van de eerste letters duurt minutenlang.
- De verwerkingssnelheid stort in tot minder dan 1 token per seconde.
Oplossing: Sluit de toepassing en kies een kleiner of zwaarder gekwantiseerd model. Blijf altijd ruim onder het fysieke RAM-limiet van de machine.
Thermische throttling
Processoren in oudere laptops zijn niet ontworpen om minutenlang op 100% belasting van alle kernen te draaien. Wanneer de temperatuur te hoog oploopt, zal de processor automatisch zijn kloksnelheid verlagen om schade te voorkomen. Hierdoor wordt de reactietijd van het model na verloop van tijd merkbaar trager.
Zorg voor goede ventilatie door de laptop op een harde, vlakke ondergrond te plaatsen en stof uit de ventilatieroosters te verwijderen. Beperk eventueel het aantal toegewezen CPU-threads in de instellingen van de AI-runner tot $N-1$ of $N-2$ (waarbij $N$ het totale aantal processorkernen is) zodat het systeem niet voortdurend op maximale capaciteit draait.
6. Systeembronnen vrijmaken en achtergrondprocessen stopzetten
Op een krachtige moderne pc maakt een openstaande webbrowser met dertig tabbladen weinig verschil. Op een oude machine met 8 GB RAM kan een webbrowser echter al 2 tot 3 GB aan geheugen opeisen.
- Sluit zware applicaties: Sluit webbrowsers, communicatie-apps, videospelers en fotobewerkingsprogramma's volledig af voordat u de AI-omgeving opstart.
- Voorkom automatisch geladen modellen: Veel lokale AI-tools laten het model na gebruik in het geheugen gedurende een ingestelde time-out (bijvoorbeeld 5 minuten). Als u meerdere modellen uitprobeert, zorg er dan voor dat het oude model expliciet uit het geheugen wordt ontladen voordat u een nieuw model start.
- Maak gebruik van lichte besturingssystemen: Op verouderde pc's kan het draaien van een lichtgewicht Linux-distributie tot 1 tot 2 GB extra werkgeheugen vrijmaken in vergelijking met een zware Windows-installatie.
Laptops van Apple met een ouder besturingssysteem vereisen een specifieke aanpak; bekijk hiervoor onze handleiding over Ollama op macOS installeren.
7. Verwachtingen bijstellen: wat is wel en niet realistisch?
Het is belangrijk om heldere verwachtingen te hebben over wat haalbaar is wanneer u een lokaal model draait op een oudere machine. De prestaties moeten altijd worden afgewogen tegen de wens om data volledig privé te verwerken.
Realistische en geschikte taken
- Korte tekstherstructurering: E-mails herschrijven, grammatica controleren en formuleringen verbeteren.
- Beknopte samenvattingen: Korte artikelen of losse paragrafen samenvatten.
- Eenvoudige vragen en antwoorden: Vragen stellen over specifieke onderwerpen waarvoor het model geen ingewikkelde redeneerstappen hoeft uit te voeren.
- Code-assistentie bij korte functies: Hulp bij eenvoudige scripts of het uitleggen van een regel code.
Onrealistische taken voor oudere hardware
- Lange documenten of boeken verwerken: Doordat het contextvenster klein gehouden moet worden, past er simpelweg geen lang document in het geheugen.
- Agentische ketens en complexe RAG-systemen: Systemen die tientallen tussentijdse zoekacties en stappen achter elkaar uitvoeren duren op trage hardware onacceptabel lang.
- Zware programmeertaken: Modellen van 14B of 33B parameters die uitblinken in programmeren zijn te groot voor deze categorie apparaten.
Om te controleren hoe de prestaties van uw specifieke hardware zich verhouden tot andere configuraties, kunt u de benchmarkresultaten raadplegen op onze externe testomgeving op LLMnet Benchmark.
8. Wanneer lokaal draaien niet meer loont
Hoewel optimaliseren ver kan gaan, heeft elke hardwaregeneratie zijn grenzen. Het is verstandig om over te stappen op alternatieven wanneer:
- De generatiesnelheid zakt onder de 1 à 2 tokens per seconde. Dit is trager dan de gemiddelde leessnelheid, wat het werken met het model vermoeiend maakt.
- Het systeem door oververhitting instabiel wordt of spontaan uitvalt.
- De benodigde taken een groter model vereisen dan uw geheugen fysiek kan bevatten.
In die gevallen kan het verstandiger zijn om privacyvriendelijke API-diensten te overwegen of de AI-taken uit te voeren op een ander, krachtiger apparaat in uw lokale netwerk.
Optimalisatie-checklist voor oudere hardware
Gebruik deze stappen als een snelle controlekaart bij het instellen van uw lokale model:
- Controleer vrij RAM: Open de Taakbeheerder of Activiteitenweergave en bepaal hoeveel geheugen daadwerkelijk vrij is.
- Kies een passend model: Selecteer een 1.5B of 3B model (bijvoorbeeld Qwen2.5-1.5B of Llama-3.2-3B).
- Selecteer sterke kwantisatie: Download een Q4_K_M of Q3_K_M variant van het model.
- Beperk de context: Stel de contextlengte in de instellingen handmatig in op 1024 of 2048 tokens.
- Sluit overige software: Sluit alle browservensters en zware achtergrondprogramma's.
- Meet zelf de prestaties: Test het model met een korte prompt en controleer de generatiesnelheid en het temperatuurverloop van uw machine.


