Text-to-speech zonder abonnement, zonder latency naar een cloudserver en zonder dat je spraakdata bij een derde partij belandt — dat is begin 2026 eindelijk realistisch. Kokoro, Dia, F5-TTS en een handvol concurrenten laten zien dat open-source TTS de kwaliteitskloof met ElevenLabs en OpenAI TTS nagenoeg heeft gedicht. Maar "realistisch" verschilt per model, per taal en per hardware. Dit is waar het nu echt staat.
Wat open TTS in 2026 kan
Tot twee jaar geleden was het onderscheid tussen commerciële en open-source spraakmodellen duidelijk hoorbaar: zo'n 1,0 MOS-punt verschil op standaardbenchmarks. Eind 2025 is dat gat geslonken naar 0,1 à 0,2 MOS. Niet dankzij één doorbraak, maar door een combinatie van betere architecturen (flow matching, diffusie), grotere open trainingssets en de toegankelijkheid van GPU's via Hugging Face ZeroGPU-grants.
De generatie modellen die nu beschikbaar is, kan ruwweg in drie groepen worden ingedeeld:
- Lichte, snelle modellen (50–150 M parameters) — Kokoro-82M, Piper TTS — draaien real-time of sneller op CPU, ideaal voor ingebedde toepassingen, home automation of een Raspberry Pi 5.
- Middelzware zero-shot kloners (300–400 M parameters) — F5-TTS, E2-TTS — hebben een GPU nodig voor real-time, maar leveren indrukwekkende stemimitatie met slechts enkele seconden referentieaudio.
- Expressieve dialoogmodellen (1,5–2 B parameters) — Dia van Nari Labs — mikken op naturalistische dialoog met emotie, lachen en non-verbale klanken, maar vereisen een mid-range GPU en zijn trager.
Wat alle drie gemeen hebben: Apache 2.0-licentie, volledig offline gebruik en actieve communities op GitHub en Hugging Face. Voor wie productie-TTS draait, is de keuze niet meer "open-source of commercieel" maar "welk open model past bij mijn use case".
"De kwaliteitskloof met ElevenLabs is nagenoeg gedicht — het verschil zit nu in taalondersteuning en uitvoeringsgemak, niet meer in klankkleur."
Kokoro: klein, snel, goed
Kokoro-82M is het model dat in discussies over efficiënte TTS steeds terugkomt, en niet zonder reden. Met slechts 82 miljoen parameters — vergelijkbaar in gewicht met een compact taalmodel van een paar jaar geleden — levert het kwaliteit die vroeger alleen bij modellen met 10× zoveel parameters verwacht werd. De architectuur is gebaseerd op StyleTTS2, aangevuld met eigen training op gecurateerde multilinguistische data.
Op snelheid is het verhaal indrukwekkend: op een RTX 4090 haalt Kokoro-82M ruwweg 210× real-time, wat betekent dat één minuut audio in minder dan een derde van een seconde gegenereerd wordt. Op een RTX 3090 Ti blijf je op circa 90× real-time. Zelfs op CPU-only-instanties draait Kokoro snel genoeg voor batch-gebruik, al is real-time streaming op een zwakke CPU krap. Via ONNX-export en de Kokoro-FastAPI-wrapper van de community draai je het als een lokale API-server die OpenAI's TTS-endpoint nabootst — handig als je bestaande code wil hergebruiken.
De v1.0-release van januari 2025 bracht 54 stemmen over 8 talen, waaronder Engels (Amerikaans en Brits), Frans, Spaans, Italiaans, Japans en Mandarijn. Nederlands staat er helaas niet bij — meer daarover verderop. De Rust-implementatie Kokoros verlaagt de afhankelijkheden verder en haalt op moderne hardware dezelfde RTF met een kleinere binary.
Nadelen: Kokoro is geen zero-shot kloner. Je kiest uit de meegeleverde stemmen of je traint fine-tunes bij; een willekeurige referentiestem meegeven werkt niet out-of-the-box. Voor wie dat nodig heeft, is F5-TTS de betere keuze.
Open-source TTS modellen vergeleken — begin 2026
| Model | Parameters | RTF op RTX 4090 | Zero-shot klonen | Nederlands | Licentie |
|---|---|---|---|---|---|
| Kokoro-82M | 82 M | ~210× real-time | Nee | Nee (8 talen) | Apache 2.0 |
| F5-TTS v1 | 335 M | ~15–30× real-time | Ja (paar seconden ref.) | Beperkt (EN/ZH focus) | MIT |
| Dia-1.6B | 1,6 B | ~1–3× real-time | Ja (audio-conditioning) | Nee (Engels) | Apache 2.0 |
| Parler-TTS Mini Multilingual | ~400 M | <1× real-time op CPU | Nee (descriptor-prompt) | Ja (8 EU-talen) | Apache 2.0 |
| Parkiet (NL) | 1,6 B | ~1–2× real-time | Ja | Ja (primair) | Apache 2.0 |
F5-TTS: zero-shot klonen dat écht werkt
F5-TTS staat voor "Fairytaler that Fakes Fluent and Faithful speech with Flow Matching" — de naam is wat gezocht, maar het model is dat niet. Met 335 M parameters en getraind op 95.000 uur audio is het de huidige standaard voor open-source zero-shot stemkloning. Je geeft het model een referentiefragment van een paar seconden mee en het genereert tekst in die stem, inclusief spreektempo en ritmische eigenaardighedenheden van de spreker.
De v1-release van maart 2025 bracht verbeterde training en snellere inferentie. Op een moderne GPU haal je 15 tot 30× real-time — niet zo snel als Kokoro, maar snel genoeg voor de meeste productietoepassingen. De focus ligt op Engels en Chinees; andere talen werken in beperkte mate via transfer, maar voor consistent Nederlands is het niet de aangewezen route.
Praktisch gebruik: je draait F5-TTS via de Hugging Face Space voor snelle tests, of installeert het lokaal via pip. De community heeft integraties gebouwd voor Oobabooga, SillyTavern en lokale RAG-pipelines. Als je wil dat een assistentiesysteem jouw eigen stem gebruikt, is dit het makkelijkste startpunt.
Dia: expressief maar tricky
Dia van het Zuid-Koreaanse Nari Labs is het meest ambitieuze model van dit rijtje. Het 1,6 miljard parameter-model genereert dialoog die klinkt als een echte conversatie — inclusief aarzeling, lachen, kuchen en andere non-verbale klanken die andere modellen simpelweg weglaten. Je schrijft de transcript met speakers-tags ([S1], [S2]) en het model genereert de volledige dialoog in één pass. Audio-conditioning maakt zero-shot kloning mogelijk: geef een referentiefragment mee en Dia past er de stem op aan.
Uitgebracht op 21 april 2025 — gebouwd door twee studenten, gefinancierd via Google's TPU Research Cloud en Hugging Face's ZeroGPU-grant, nul externe funding — is het een opmerkelijk project. De kwaliteit in het Engels is indrukwekkend en staat op gelijke voet met early-access versies van ElevenLabs' dialoog-API.
De beperkingen zijn even reëel. Dia draait alleen in het Engels. De RTF ligt op 1 tot 3× real-time op een mid-range GPU (RTX 3080 of beter), wat betekent dat een minuut dialoog 20 tot 60 seconden generatietijd kost — acceptabel voor batchgebruik, maar te langzaam voor echte real-time toepassingen zoals spraakassistenten. Op CPU is het nauwelijks bruikbaar. De installatie vraagt wat geduld: CUDA-versies moeten kloppen, het model weegt ~6 GB en de parameters zijn gevoelig voor afwijkende hardware-setups. Verwacht een halve middag debugging als je het voor het eerst lokaal draait.
Wanneer kies je Dia? Als je podcastfragmenten, audioboeken met meerdere personages of interactieve narratieve ervaringen wil genereren in het Engels, en je hebt een GPU ter beschikking. Voor alles wat real-time of meertalig moet zijn, kijk je beter naar Kokoro of Parler.
Nederlands en de meertalen-puzzel
De meeste hoogwaardige open TTS-modellen zijn primair op Engels getraind. Dat is geen verrassing — het merendeel van de beschikbare spraakdata is Engelstalig — maar het is een reëel probleem voor wie Nederlandse spraak wil genereren.
De interessantste opties voor Nederlands begin 2026:
- Parler-TTS Mini Multilingual ondersteunt acht Europese talen waaronder Nederlands, via training op CML-TTS en Multilingual LibriSpeech. Je stuurt een tekst mee plus een vrije beschrijving van de gewenste stem ("een rustige vrouwenstem met een laag tempo") en het model genereert. De kwaliteit voor Nederlands is functioneel maar niet indrukwekkend — het accent klinkt soms generisch Europees en de prosodie mist nuance. Voor zakelijke voice-overs voldoet het; voor content waar klankkleur ertoe doet, niet.
- Facebook MMS-TTS (NLD) is onderdeel van het Massively Multilingual Speech-project en genereert basis-Nederlands. De stem klinkt synthetisch, vergelijkbaar met oudere eSpeak-achtige modellen. Handig voor accessibility-toepassingen of voice readers waar naturalisme secundair is.
- Parkiet, een 1,6B-parameter Nederlandstalig TTS-model gebaseerd op de Dia-architectuur, verscheen september 2025 op GitHub. Het ondersteunt meerdere sprekers, stemkloning en nonverbale klanken — specifiek gebouwd voor Nederlands. Vroege evaluaties zijn veelbelovend. De community is klein, maar actief.
- Kokoro fine-tune via community: er zijn experimentele fine-tunes van Kokoro-82M op Nederlandse data in omloop. Kwaliteit varieert, maar de snelheidsvoordelen van de basisarchitectuur blijven behouden.
De eerlijke conclusie: voor professioneel Nederlandstalig TTS wijs je vandaag de dag nog steeds naar commerciële diensten (ElevenLabs biedt goede NL-stemmen, Microsoft Azure TTS doet het solide). Open-source NL-TTS staat op het punt te verbeteren — Parkiet is daar het duidelijkste teken van — maar het is begin 2026 nog geen productierijpe keuze voor wie kwaliteit eist.
FAQ
- Kan ik Kokoro-82M draaien op een gewone laptop zonder GPU?
- Ja. Via ONNX-export draait Kokoro op CPU-only hardware. Real-time spraak genereren is krap op trage machines, maar voor batch-gebruik of korte fragmenten werkt het prima. Verwacht op een moderne Core i7 of Ryzen 7 een RTF van 1 tot 2× — dus een zin van 5 seconden duurt 3 tot 8 seconden om te genereren.
- Wat is het verschil tussen RTF en tokens per seconde bij TTS?
- RTF (Real-Time Factor) is specifiek voor audio: een RTF van 0,1 betekent dat het model 10× sneller dan real-time genereert. Tokens per seconde is een LLM-metriek; sommige TTS-pipelines rapporteren ook mel-frames per seconde of samples per seconde. Voor de eindgebruiker is RTF de meest intuïtieve maatstaf: RTF < 1,0 = sneller dan real-time, RTF > 1,0 = trager dan real-time.
- Is zero-shot stemkloning legaal?
- De technologie zelf is legaal, het gebruik ervan niet altijd. In België en Nederland geldt dat je de stem van een levend persoon niet zonder toestemming mag nabootsen voor commerciële doeleinden of op een misleidende manier. Voor eigen stem, fictieve personages of met expliciete toestemming is er geen probleem. Check altijd de licentievoorwaarden van het bronmodel én de toepasselijke privacywetgeving (AVG/GDPR) bij verwerking van biometrische geluidsdata.
- Welk model raad je aan voor een lokale spraakassistent?
- Kokoro-82M voor Engelstalige assistenten: klein, snel, kwaliteitsvol, makkelijk via FastAPI te integreren. Parler-TTS Mini Multilingual als je Nederlands nodig hebt en bereid bent kwaliteitsverlies te accepteren. Voor productie-NL: wacht op verdere Parkiet-ontwikkeling of gebruik ElevenLabs met een eigen stem ingecached voor latency-reductie.
- Hoe verschilt Dia van een gewone TTS-pipeline?
- Klassieke TTS-modellen genereren één sprekersstem per run. Dia genereert volledige dialoogscènes met meerdere sprekers in één pass, inclusief interactie-artefacten zoals overlappend spreken en non-verbale reacties. Dat maakt het uniek voor narratieve content, maar overbodig voor de meeste assistentie- of voice-over-toepassingen.