Inleiding: waarom automatische transcriptie tijdbesparend is
Stel je voor: je hebt net een uurgesprek gehad met een klant. Normaal gesproken moet je daarna zelf een samenvatting typen, actiepunten noteren en die via e-mail versturen. Dat kost je minstens 20 tot 30 minuten extra. Maal 5 gesprekken per week is dat al 2 uur verloren werktijd.
Met OpenAI Whisper hoef je dat niet meer handmatig te doen. Whisper is een open-source speech-to-text model dat audio omzet naar accurate teksttranscripties, ook in het Nederlands. Je kunt het lokaal draaien op je eigen computer (gratis, privacy-vriendelijk) of via de OpenAI API (pay-per-use, geen GPU nodig).
In deze handleiding leer je hoe je Whisper installeert, instelt en koppelt aan een automatische workflow die je vergaderingen transcribeert, samenvat en de actiepunten extraheert, en dat allemaal zonder handmatige tussenkomst.
Stap 1: Whisper lokaal installeren
Whisper draaien op je eigen computer vereist Python 3.8 of hoger en ffmpeg. ffmpeg is een open-source tool voor audio- en videoconversie die Whisper gebruikt om audiobestanden voor te verwerken. Installeer eerst ffmpeg, daarna Whisper.
Let op: het eerste keer laden van een Whisper-model duurt even omdat het model gedownload wordt (van 75 MB voor het tiny-model tot 2.9 GB voor het large-model). Na de eerste download is het model lokaal beschikbaar.
Stap 2: Eerste transcriptie uitvoeren
Zodra Whisper geinstalleerd is, kun je direct een audiobestand transcriberen via de command line. Whisper ondersteunt MP3, MP4, WAV, M4A, FLAC en meer. Geef altijd de taal mee voor betere resultaten.
Whisper maakt automatisch een bestand met dezelfde naam als je audiobestand, met de extensie .txt (of .srt voor ondertiteling met tijdstempels). De transcriptie bevat interpunctie maar nog geen sprekeridentificatie, dat komt aan bod in de uitbreidingen aan het einde van deze handleiding.
Stap 3: Whisper modellen vergelijken
Whisper heeft vijf modelgroottes met elk een ander evenwicht tussen snelheid en nauwkeurigheid. Kies het model dat past bij je hardware en vereisten.
Tiny (75 MB): ultrasnelle transcriptie, voldoende voor duidelijke audio, ideaal voor tests en snelle verwerking op trage computers.
Base (145 MB): goede balans voor eenvoudige audio. Verwerkt een uur audio in 5 tot 10 minuten op een moderne CPU.
Small (465 MB): aanbevolen voor dagelijks gebruik. Goede nauwkeurigheid voor vergaderingen, acceptabele snelheid zonder GPU.
Medium (1.5 GB): uitstekende nauwkeurigheid voor technisch jargon of meerdere sprekers. Vereist meer RAM en tijd.
Large (2.9 GB): maximale nauwkeurigheid. Aanbevolen voor professionele transcripties of wanneer kwaliteit cruciaal is. Vereist idealiter een GPU.
Praktisch advies: begin met small voor dagelijkse vergaderingen. Upgrade naar medium of large alleen als de kwaliteit onvoldoende is of als je technisch jargon en meerdere sprekers moet verwerken.
Stap 4: Whisper API gebruiken
Geen lokale GPU of te weinig RAM? Gebruik de Whisper API van OpenAI. Je betaalt per minuut audio (circa 0,006 dollar per minuut in 2026), geen installatie van grote modellen nodig, en je krijgt altijd de beste kwaliteit.
Kosten voorbeeld: een vergadering van 60 minuten kost via de API circa 0,36 dollar. Bij 20 vergaderingen per maand is dat zo'n 7,20 dollar, ver onder de kostprijs van handmatig uittypen.
Stap 5: Vergaderingsopname verwerken
Microsoft Teams, Zoom en Google Meet exporteren opnames als MP4-videobestand. Voor Whisper heb je alleen het audiogedeelte nodig. ffmpeg converteert het videobestand snel naar een compact MP3-audiobestand.
Na conversie transcribeer je het MP3-bestand via Whisper lokaal of via de API. Een uur vergadering levert doorgaans een transcriptie van 6.000 tot 10.000 woorden op, afhankelijk van hoeveel er gepraat werd.
Stap 6: Transcriptie samenvatten met Claude API
Een ruwe transcriptie van een uur vergadering is 8.000 woorden lang en nauwelijks leesbaar. Claude AI is uitstekend in het samenvatten van lange teksten en het extraheren van actiepunten. Combineer Whisper en Claude voor een volledig automatische vergaderings-workflow.
Stap 7: Automatisering met n8n
De echte tijdsbesparing zit in volledige automatisering. Met n8n bouw je een workflow die automatisch getriggerd wordt als er een nieuw vergaderingsbestand in Google Drive verschijnt, de transcriptie en samenvatting aanmaakt, en het resultaat naar Notion of Slack stuurt.
Stel de workflow in als volgt: Google Drive trigger op de map 'Vergaderingen'. Zodra er een MP4-bestand verschijnt, stuurt n8n het naar Whisper, vervolgens naar Claude voor de samenvatting, en stuurt het resultaat als bericht naar Slack of als nieuwe pagina naar Notion.
Stap 8: Whisper lokaal vs API, kosten vergelijking
Lokaal draaien is gratis maar vereist een computer met voldoende RAM en optioneel een GPU. Via de API betaal je per minuut maar heb je geen hardware-vereisten.
Lokaal (small model, moderne laptop zonder GPU): gratis na installatie. Verwerking van 60 minuten audio duurt 15 tot 25 minuten op een CPU. Geschikt voor sporadisch gebruik of wanneer privacy vereist is.
Lokaal (large model, met GPU): gratis na installatie. Verwerking van 60 minuten audio duurt 3 tot 5 minuten. Hoogste kwaliteit, maximale privacy.
Via API (whisper-1): 0,006 dollar per minuut audio. Een uur vergadering kost 0,36 dollar. 20 vergaderingen per maand: 7,20 dollar. Geen hardware-investering, altijd beschikbaar, sneller dan lokale CPU.
Aanbeveling: gebruik de API voor dagelijks gebruik in een MKB-context. De kosten zijn verwaarloosbaar in vergelijking met de tijdsbesparing. Gebruik lokale verwerking alleen als privacy een harde eis is.
Stap 9: Privacy overwegingen
Bij vertrouwelijke vergaderingen, gesprekken met klanten of strategische sessies wil je misschien niet dat audio naar OpenAI-servers gaat. In dat geval is lokale verwerking de juiste keuze.
Whisper lokaal draaien betekent dat je audio nooit de computer verlaat. Het model draait volledig offline, geen internetverbinding vereist na installatie. Dit is de juiste keuze voor medische, juridische of financieel-gevoelige gesprekken.
Wil je toch de API gebruiken maar moet het GDPR-compliant zijn? OpenAI verwijdert API-ingevoerde data na 30 dagen en gebruikt die niet voor model-training. Controleer wel of je bewerkersovereenkomst (DPA) met OpenAI is afgesloten, dit is verplicht onder de AVG voor zakelijk gebruik.
Praktische regel: voor interne teamvergaderingen mag de API. Voor gesprekken met klanten of gesprekken over gevoelige bedrijfsinfo: gebruik lokale verwerking of zorg dat je DPA op orde is.
Stap 10: Batch-verwerking van meerdere bestanden
Heb je een archief van oude vergaderingen of wil je meerdere bestanden in een keer verwerken? Gebruik dit Python script voor batch-verwerking via de Whisper API.
Troubleshooting
Probleem 1: 'ffmpeg not found'. Oplossing: ffmpeg is niet geinstalleerd of staat niet in je PATH. Op macOS: brew install ffmpeg. Op Windows: download ffmpeg.exe en voeg de bin-map toe aan je systeem PATH-variabele. Herstart daarna je terminal.
Probleem 2: Taal wordt niet herkend of uitkomst is in het Engels. Oplossing: voeg altijd --language nl toe aan je Whisper-commando. Zonder taalspecificatie detecteert Whisper de taal automatisch, wat bij korte fragmenten minder betrouwbaar is.
Probleem 3: 'CUDA out of memory' of model te groot voor RAM. Oplossing: gebruik een kleiner model. Vervang --model large door --model small of --model base. Alternatief: gebruik de Whisper API in plaats van lokale verwerking.
Probleem 4: API quota overschreden of 429-fout. Oplossing: de Whisper API heeft een limiet op gelijktijdige verzoeken. Voeg een time.sleep(1) toe tussen API-calls in je batch-script, of vraag OpenAI om een hogere ratelimit-tier.
Uitbreidingen en vervolgstappen
Whisper met Diarization (sprekers onderscheiden): combineer Whisper met pyannote-audio voor sprekeridentificatie. De output toont dan 'Spreker A: ...' en 'Spreker B: ...' in plaats van een ongesorteerde tekststroom. Dit is bijzonder nuttig voor klantgesprekken of sales calls.
Real-time transcriptie: voor live vergaderingen kun je Whisper combineren met een streaming-setup via de sounddevice Python library. Je transcribeert dan in chunks van 5 seconden terwijl de vergadering bezig is.
Integratie met CRM: koppel de transcriptie en samenvatting via n8n of Make direct aan je CRM. Na een klantgesprek verschijnt de samenvatting automatisch in het klantdossier in Pipedrive, HubSpot of Salesforce.