Handleidingen · Ollama

Ollama instellen op je eigen server: gratis AI zonder API-kosten

Ollama installeren op je eigen server: lokale LLM zonder API-kosten. Modellen kiezen, API openen, koppelen aan n8n. Voor privacy-bewust MKB.

🟡 Gevorderd — beetje technisch ⏱ 60 minuten
Tools: OllamaLinux/macOS serverDocker (optioneel)Open WebUI
Ollama instellen op je eigen server: gratis AI zonder API-kosten

Wat je leert in deze handleiding

  • Ollama installeren op Linux en macOS
  • Llama 4 en Mistral draaien
  • Open WebUI instellen als chat interface
  • Ollama API gebruiken vanuit Python en n8n
  • Modellen vergelijken en wisselen

API-kosten voor AI kunnen snel oplopen. Een team van 10 medewerkers dat dagelijks ChatGPT of Claude gebruikt betaalt al snel honderden euro's per maand. Maar er is een alternatief: open-source AI-modellen draaien op je eigen hardware. Met Ollama is dat verrassend eenvoudig geworden, ook zonder diepe technische kennis.

In 2026 zijn open-source modellen zoals Llama 4 Scout en Mistral Large volwassen genoeg voor serieus zakelijk gebruik. Ze halen in veel benchmarks resultaten die dicht bij de commerciele topmodellen liggen, en voor veel MKB-toepassingen zijn ze meer dan voldoende. Het grote voordeel: je betaalt eenmalig voor hardware (of een VPS), en daarna zijn de inferentie-kosten nul.

Nog een argument voor lokale AI: privacy. Als je met vertrouwelijke bedrijfsinformatie werkt, wil je misschien niet dat die informatie de servers van OpenAI of Anthropic bereikt. Met Ollama blijft alles op jouw hardware.

In deze handleiding installeer je Ollama stap voor stap, zet je een chat-interface op met Open WebUI, leer je de API gebruiken vanuit Python en n8n, en vergelijk je de beschikbare modellen.

Stap 1: Systeemvereisten

Ollama draait op macOS, Linux en Windows (via WSL). De minimale vereisten hangen af van het model dat je wilt draaien. Kleine modellen (3-7 miljard parameters) draaien op vrijwel elke moderne computer. Grotere modellen hebben meer RAM of VRAM.

Voor de 7B modellen (Mistral 7B, Llama 3.2 7B): minimaal 8 GB RAM, aanbevolen 16 GB. Voor 13-17B modellen (Llama 4 Scout, Mistral Large): minimaal 16 GB RAM, aanbevolen 32 GB. Voor 70B+ modellen: 64+ GB RAM of een GPU met 24+ GB VRAM.

GPU-ondersteuning maakt een groot verschil in snelheid. Op een Apple Silicon Mac (M3, M4) maakt Ollama automatisch gebruik van de gedeelde CPU/GPU-geheugenarchitectuur, wat uitstekende prestaties geeft zelfs zonder discrete GPU. Op Linux met een NVIDIA-GPU (CUDA) is de inferentiesnelheid met grote modellen 5-10x hoger dan CPU-only.

Schijfruimte: modellen zijn 4-40 GB per stuk. Zorg voor minimaal 50 GB vrije schijfruimte als je meerdere modellen wilt testen.

Stap 2: Ollama installeren op macOS

Op macOS zijn er twee opties: de eenvoudige GUI-installer of de command-line installatie. Voor servergebruik zonder scherm kies je de command-line variant.

Na de installatie start de Ollama-daemon automatisch op de achtergrond (op poort 11434). Je kunt dit controleren via:

Stap 3: Ollama installeren op Linux (Ubuntu/Debian)

Op Ubuntu 22.04 of 24.04 LTS (en Debian-varianten) is de installatie ook eenvoudig. Het installatiescript regelt alles automatisch, inclusief CUDA-ondersteuning als je een NVIDIA-GPU hebt.

Voor NVIDIA GPU-ondersteuning: zorg dat je NVIDIA drivers en CUDA toolkit geinstalleerd zijn voordat je Ollama installeert. Het installatiescript detecteert dit automatisch.

Stap 4: Eerste model downloaden en starten

Met Ollama geinstalleerd kun je modellen downloaden via 'ollama pull'. De eerste download duurt even (4-20 GB afhankelijk van het model), maar daarna starten modellen in seconden.

Llama 4 Scout is in 2026 de aanbevolen keuze voor de meeste MKB-toepassingen. Met 17 miljard parameters en een context-window van 10 miljoen tokens combineert het goede kwaliteit met relatief lage hardwarevereisten. Het kan lange documenten verwerken dankzij het enorme context-window.

Stap 5: Open WebUI installeren als chat interface

Via de terminal met Ollama chatten werkt, maar voor dagelijks gebruik is een visuele interface fijner. Open WebUI biedt een ChatGPT-achtige interface die lokaal draait en verbinding maakt met je Ollama-installatie.

De eenvoudigste manier om Open WebUI te installeren is via Docker. Zorg dat Docker Desktop geinstalleerd is op je machine.

Na het opstarten van de container ga je naar http://localhost:3000 in je browser. Bij het eerste gebruik maak je een admin-account aan. Vervolgens zie je alle Ollama-modellen die je hebt geinstalleerd direct beschikbaar in de model-selector.

Stap 6: Ollama API gebruiken

Ollama biedt een REST API op localhost:11434. Je kunt deze API direct aanspreken vanuit Python, n8n, Flowise, of vrijwel elke andere tool die HTTP-requests ondersteunt.

Stap 7: Ollama integreren in n8n

n8n is populair bij MKB'ers voor automatiseringsworkflows. Je kunt Ollama eenvoudig integreren via de HTTP Request node, of via de ingebouwde Ollama-node als die beschikbaar is in jouw n8n-versie.

Een praktische workflow: formulier invullen op je website, gegevens naar n8n sturen, n8n stuurt de vraag naar Ollama, en het antwoord wordt teruggestuurd naar de gebruiker via e-mail of een ander kanaal. Alles draait lokaal op je eigen server.

Stap 8: Ollama integreren in Flowise

Flowise is een visuele tool voor het bouwen van AI-workflows, vergelijkbaar met n8n maar specifiek gericht op LLM-toepassingen zoals chatbots en RAG-systemen. Flowise heeft native ondersteuning voor Ollama via de ChatOllama node.

Installeer Flowise via npm of Docker, en voeg een ChatOllama node toe aan je workflow. Stel de base URL in op http://host.docker.internal:11434 (als Flowise in Docker draait) of http://localhost:11434 (als het direct op de host draait). Kies het gewenste model in de dropdown.

Met Flowise kun je een volledige RAG-pipeline bouwen: upload je bedrijfsdocumenten (productcatalogus, handleidingen, procedures), maak er een vector database van, en verbind die met Llama 4 via Ollama. Het resultaat is een chatbot die vragen beantwoordt op basis van je eigen documentatie, zonder dat enige data jouw server verlaat.

Stap 9: Modellen vergelijken en kiezen

In 2026 zijn er tientallen open-source modellen beschikbaar via Ollama. Hier is een praktisch overzicht van de meest relevante voor MKB-gebruik:

Llama 4 Scout (17B). Beste keuze voor algemeen gebruik. Sterk in redeneren, schrijven en instructies opvolgen. Groot context-window (10M tokens). Werkt goed op 32 GB RAM. Vereiste schijfruimte: circa 10 GB.

Mistral Large (123B kwantisatie). Uitstekend voor schrijven, vertalen en analyse. Europeese herkomst (Frans bedrijf), wat relevant kan zijn voor GDPR-afwegingen. Vereist meer geheugen, maar kwantisatie-versies (Q4) draaien op 32-64 GB.

Phi-4 Mini (3.8B). Microsofts efficiënte kleine model. Ideaal voor snelle taken op beperkte hardware. Verrassend capabel voor zijn grootte. Perfect als je snel responses nodig hebt zonder veel rekenkracht.

Gemma 3 (27B). Googles open model, sterk in meertalige taken. Goede keuze als je veel in meerdere talen werkt. Vergelijkbare kwaliteit met Llama 4 Scout op de meeste taken.

Wanneer welk model? Gebruik Phi-4 Mini voor snelle eenvoudige taken (samenvatten, classificeren). Gebruik Llama 4 Scout voor de meeste zakelijke toepassingen. Gebruik Mistral Large wanneer kwaliteit van schrijven en nuance cruciaal zijn.

Stap 10: Ollama op een VPS draaien

Als je geen krachtige lokale hardware hebt, kun je Ollama draaien op een Virtual Private Server (VPS). Providers zoals Hetzner (Duits, GDPR-friendly) en DigitalOcean bieden krachtige servers voor redelijke prijzen.

Kosten vergelijking: een Hetzner CCX33 server (8 vCPU, 32 GB RAM) kost circa 50-60 euro per maand. Vergelijk dit met OpenAI API-kosten: bij intensief gebruik van GPT-4 Turbo kun je snel 100-300 euro per maand kwijt zijn. De break-even is snel bereikt als je team het model regelmatig gebruikt.

Met Nginx als reverse proxy en Basic Auth is je Ollama-server van buiten bereikbaar maar beveiligd. Combineer dit met een SSL-certificaat via Let's Encrypt (certbot) voor HTTPS. Zo kunnen medewerkers ook buiten kantoor de lokale AI gebruiken.

Troubleshooting: 5 veelvoorkomende problemen

Probleem 1: Out of memory error. Symptoom: 'not enough memory to load model'. Oplossing: kies een kleiner model of een sterker gekwantiseerde versie (bijv. Q4 i.p.v. Q8). Controleer je RAM met 'free -h' op Linux. Sluit andere programma's.

Probleem 2: Trage inference. Symptoom: model geeft antwoorden maar heel langzaam. Oorzaak: model draait op CPU in plaats van GPU. Controleer met 'ollama run [model]' of je 'GPU layers' ziet in de output. Installeer CUDA drivers als je een NVIDIA GPU hebt.

Probleem 3: Poort al in gebruik. Symptoom: 'address already in use: 11434'. Oplossing: 'sudo lsof -i :11434' om te zien wat de poort bezet houdt. Start Ollama opnieuw: 'sudo systemctl restart ollama'.

Probleem 4: Model corrupt of onvolledig. Symptoom: model start niet of geeft rare output na een onderbroken download. Oplossing: verwijder het model ('ollama rm [model]') en download opnieuw ('ollama pull [model]').

Probleem 5: GPU niet herkend op Linux. Symptoom: Ollama gebruikt CPU ondanks aanwezige GPU. Controleer: 'nvidia-smi' voor GPU-status. Zorg dat de Ollama service als de juiste gebruiker draait met GPU-toegang. Voeg de ollama gebruiker toe aan de video-groep: 'sudo usermod -aG video ollama'.

Uitbreidingen en volgende stappen

Als Ollama eenmaal draait, zijn er interessante uitbreidingen:

Open WebUI functies: de interface ondersteunt ook RAG via file uploads, gesprekgeschiedenis, meerdere gebruikers en model-parameters instellen. Verken de instellingen voor meer controle.

Model fine-tuning via Modelfile: je kunt een Modelfile aanmaken om een bestaand model aan te passen aan je specifieke use case. Denk aan een bedrijfsspecifieke persona, toon of context.

Ollama op Raspberry Pi: voor lichtgewicht toepassingen (kleine modellen, lage belasting) kun je Ollama ook draaien op een Raspberry Pi 5 (8 GB RAM). De snelheid is beperkt, maar het biedt een extreem goedkope manier om een permanente lokale AI-server te draaien voor eenvoudige automatisering.

Conclusie: lokale AI is klaar voor MKB-gebruik in 2026

Ollama heeft de drempel voor lokale AI enorm verlaagd. Wat vroeger een complexe DevOps-operatie was, is nu met een paar terminal-commando's geregeld. De open-source modellen zijn volwassen genoeg voor de meeste zakelijke toepassingen.

De investering loont als je team regelmatig met AI werkt. Bereken je huidige API-kosten per maand, vergelijk die met de kosten van een geschikte VPS of server, en de business case maakt zichzelf. Bovendien heb je volledige controle over je data.

Start met de gratis tier: installeer Ollama op je eigen laptop, test met Llama 4 Scout, en bouw een eerste workflow in n8n of Flowise. Als dat werkt, scale je op naar een dedicated server of VPS.

Gerelateerd

Nieuwsbrief

Meer handleidingen en tips?

Elke week de beste agentic AI inzichten en nieuwe handleidingen in je inbox.

Gratis aanmelden →