Lokale LLM's Draaien op Windows: De Complete Gids voor Thuisgebruikers
Grote taalmodellen (Large Language Models of LLM's) domineren de technologiewereld. Waar je voorheen afhankelijk was van betaalde cloud-abonnementen of complexe Linux-servers, is het landschap drastisch veranderd. Tegenwoordig kun je krachtige AI-modellen, zoals Llama 3 van Meta of Mistral, volledig lokaal op je eigen Windows-pc draaien. Dit is niet alleen goed voor je privacy, maar het bespaart ook kosten en vereist geen actieve internetverbinding.
In deze uitgebreide gids bespreken we stap-voor-stap hoe je als Windows-gebruiker lokale LLM's kunt installeren, configureren en optimaliseren. We kijken naar de twee meest populaire tools van dit moment: LM Studio en Ollama. Ook duiken we in de hardware-eisen en leggen we uit hoe je de juiste modellen kiest die je computer daadwerkelijk aankan.
Waarom een Lokale LLM op Windows?
Het lokaal draaien van AI-modellen biedt diverse voordelen ten opzichte van clouddiensten zoals ChatGPT of Claude:
- Absolute privacy: Jouw prompts en documenten verlaten je computer nooit. Dit is essentieel bij het verwerken van persoonlijke gegevens of bedrijfsgevoelige informatie.
- Geen abonnementskosten: Je betaalt geen maandelijks bedrag of kosten per 'token'. Je gebruikt enkel de elektriciteit van je eigen pc.
- Offline beschikbaarheid: Lokale modellen werken altijd, zelfs zonder internetverbinding.
- Ongecensureerd experimenteren: Veel open-source modellen hebben minder strenge 'guardrails' dan commerciële modellen, wat je meer vrijheid geeft voor creatieve en technische taken.
Wat heb je nodig? Begrijp je (V)RAM
Voordat we software gaan installeren, is het cruciaal om te begrijpen of je computer de modellen aankan. De belangrijkste bottleneck voor het draaien van een LLM is het geheugen, en dan specifiek het videogeheugen (VRAM) van je grafische kaart (GPU). Als een model niet in het geheugen past, kan het niet snel antwoorden genereren.
Heb je geen sterke grafische kaart? Geen probleem. Zowel LM Studio als Ollama kunnen terugvallen op je reguliere werkgeheugen (RAM) en je processor (CPU). Dit is wel aanzienlijk trager, maar het werkt. Voor een diepgaande analyse van computeronderdelen kun je onze gids over hardware voor lokale LLM's raadplegen.
Modellen en Kwantisatie
Een standaard model met 8 miljard parameters (8B) heeft onbewerkt ongeveer 16 GB aan geheugen nodig. Dankzij een techniek genaamd kwantisatie (quantization), worden deze modellen gecomprimeerd. Door de precisie van de getallen in het model te verlagen, past een 8B model opeens in 4 GB tot 6 GB RAM, zonder al te veel kwaliteitsverlies. Het bestandsformaat dat hiervoor gebruikt wordt heet GGUF. Wil je de wiskunde hierachter begrijpen? Lees dan ons artikel waarin kwantisatie in detail wordt uitgelegd.
Methode 1: LM Studio (De visuele en makkelijke weg)
Als je nieuw bent in de wereld van lokale AI, is LM Studio de absolute aanrader. Het is een programma met een mooie grafische interface dat erg lijkt op applicaties die je al kent. Je kunt er modellen mee zoeken, downloaden en direct mee chatten.
Stap 1: Installatie
- Ga naar de officiële website van LM Studio en download de Windows-versie.
- Voer het
.exebestand uit en volg de standaard installatie-instructies. - Open LM Studio. Je ziet direct een zoekbalk op het startscherm.
Stap 2: Een model vinden en downloaden
LM Studio is gekoppeld aan Hugging Face (een platform voor open-source AI). Typ in de zoekbalk bijvoorbeeld Llama-3-8B-Instruct GGUF. Let erop dat je altijd een GGUF-versie zoekt, anders werkt het niet goed op een standaard Windows-pc.
In de zoekresultaten zie je verschillende versies met aanduidingen zoals Q4_K_M of Q8_0. Dit geeft de mate van kwantisatie aan. Een veilige keuze voor een gemiddelde computer met 8GB tot 16GB RAM is de Q4_K_M (4-bit). Klik op de downloadknop naast het bestand. Heb je hulp nodig bij deze keuze? Bekijk dan onze tips voor een lokaal model kiezen.
Stap 3: Chatten en GPU-acceleratie aanzetten
Klik in de linker menubalk op het chat-icoon (het spraakwolkje). Bovenin het scherm kun je nu het zojuist gedownloade model selecteren. Wacht een paar seconden tot het model in het geheugen is geladen.
max (of een specifiek getal, zoals 33). Hierdoor neemt je videokaart het zware rekenwerk over van je processor, wat de generatiesnelheid van het model enorm versnelt.
Typ een bericht in het chatvenster onderaan en druk op Enter. Je draait nu je eerste lokale AI op Windows!
Methode 2: Ollama op Windows (Voor integraties en de terminal)
Waar LM Studio uitblinkt in gebruiksvriendelijkheid, is Ollama dé tool voor efficiëntie en integratie. Ollama draait als een achtergrondproces (een lokale server) op je Windows-pc. Het heeft standaard geen eigen grafische interface (GUI), maar je bestuurt het via de Command Prompt of PowerShell. Het grote voordeel van Ollama is dat het razendsnel is en perfect samenwerkt met andere applicaties.
Stap 1: Ollama Installeren
Sinds begin 2024 is er een native (inheemse) Windows-versie van Ollama beschikbaar. Je hebt hiervoor geen complexe Linux-emulatie meer nodig.
- Download de Windows installer van de Ollama website.
- Installeer het programma. Na installatie zie je het kleine lama-icoontje rechtsonder in je Windows-systeemvak (system tray) staan. Dit betekent dat de Ollama-server draait.
Stap 2: Modellen downloaden via de terminal
Ollama werkt met simpele commando's. Open de Windows Command Prompt (druk op de Start-knop, typ cmd en druk op Enter) of PowerShell. Typ het volgende commando om het populaire en compacte Phi-3 model van Microsoft te downloaden en direct uit te voeren:
ollama run phi3
De eerste keer dat je dit commando typt, zal Ollama het model downloaden (dit bestand is ongeveer 2.3 GB groot). Zodra de download voltooid is, verschijnt er een prompt in je terminal: >>>. Je kunt nu direct je vragen typen in de command prompt.
Wil je het gesprek beëindigen? Typ dan /bye of gebruik de toetsencombinatie Ctrl + D.
Stap 3: Een grafische schil toevoegen (Open WebUI)
Hoewel de terminal leuk is voor een snelle test, wil je waarschijnlijk een echte chat-interface zoals je die van ChatGPT gewend bent. Omdat Ollama een server is, kun je er interfaces van derden aan koppelen. De meest populaire hiervoor is Open WebUI. Je kunt de uitgebreide stappen lezen in ons artikel over Open WebUI opzetten. Zodra je dit hebt geïnstalleerd, draait er een prachtige interface in je webbrowser die feilloos communiceert met de Ollama-server op de achtergrond.
Heb je WSL (Windows Subsystem for Linux) nodig?
Een veelgestelde vraag is of je WSL moet installeren om AI op Windows te draaien. Het korte antwoord is: Nee, voor basisgebruik niet meer. Zowel LM Studio als Ollama draaien tegenwoordig 'native' als standaard Windows-applicaties (.exe). Dit maakt het installatieproces veel eenvoudiger dan een jaar geleden.
Het lange antwoord is: Ja, als je geavanceerde projecten wilt bouwen. Ben je een ontwikkelaar die eigen Python-scripts schrijft om documenten te analyseren (Retrieval-Augmented Generation), of wil je complexe Docker-containers draaien voor AI-ontwikkeling? Dan is WSL vaak de betere keuze, omdat de meeste open-source AI bibliotheken geoptimaliseerd zijn voor Linux-omgevingen. Meer hierover lees je in onze externe gids over RAG voor beginners, waar we dieper ingaan op het programmeren met deze modellen.
Veelvoorkomende Problemen Oplossen (Troubleshooting)
Het draaien van complexe modellen op consumentenhardware kan soms uitdagingen met zich meebrengen. Hier zijn de meest voorkomende problemen en hun oplossingen:
| Probleem | Mogelijke Oorzaak | Oplossing |
|---|---|---|
| Het model is extreem traag (minder dan 2 tokens/sec). | Het model wordt uitsluitend op de CPU berekend, of het model is te groot en de computer is data aan het verplaatsen naar de tragere harde schijf (swapping). | Controleer of 'GPU Offload' aan staat in LM Studio. Als dit aan staat, kies dan een kleiner model (bijv. 7B in plaats van 13B) of een hogere kwantisatie (bijv. Q3 in plaats van Q8) zodat het volledig in je VRAM past. |
| Out of Memory (OOM) Error / Crash tijdens het laden. | Het geselecteerde model vereist meer (V)RAM dan fysiek aanwezig is op je systeem. Je probeert te veel 'layers' naar de GPU te sturen. | Verlaag het aantal GPU-layers stapsgewijs in LM Studio tot het model laadt. Sluit andere programma's (vooral grafisch zware programma's zoals browsers met veel tabbladen of games). |
| NVIDIA GPU wordt niet herkend. | De benodigde CUDA-drivers ontbreken of zijn verouderd op je Windows-installatie. | Download en installeer de nieuwste 'Game Ready' of 'Studio' drivers via NVIDIA GeForce Experience. Herstart je computer en probeer het opnieuw. |
Conclusie
Lokale LLM's draaien op Windows is niet langer voorbehouden aan hackers of academici. Met de komst van tools zoals LM Studio en Ollama is het proces gereduceerd tot het downloaden en uitvoeren van een installatiebestand. Zolang je rekening houdt met de beperkingen van je hardware, specifiek je werkgeheugen en videogeheugen, kun je genieten van snelle, private en gratis AI-assistentie, rechtstreeks vanaf je eigen bureaublad.