Op 24 februari 2026 stelde Alibaba Cloud's Qwen-team rustig een model live dat de open-source AI-gemeenschap meteen op zijn kop zette: Qwen3.5 27B. Geen MoE-truc, geen gehype launch event. Gewoon een solide dense transformer met 27 miljard parameters, Apache 2.0 licentie, 256K context en benchmark-scores die commerciële modellen met kippenvel geven.
Dit artikel is voor iedereen die écht wil weten wat dit model kan, hoe het zich verhoudt tot GPT-5, Claude Sonnet en Gemini, en of het zinvol is om het in te zetten voor jouw project of bedrijf — lokaal, via API of in een agentic workflow.
Wat is Qwen3.5 27B?
Qwen3.5 27B is een dense language model van Alibaba's AI-divisie. 'Dense' betekent: geen sparse mixture-of-experts waarbij slechts een deel van het netwerk actief is. Alle 27 miljard parameters worden bij elke inference volledig gebruikt — wat leidt tot een hogere redeneernauwkeurigheid per token.
De architectuur combineert een Gated DeltaNet hybride aandachtsmechanisme (lineaire en volledige aandacht in een 3:1 verhouding over 64 lagen) met een early-fusion multimodale vision encoder. Dat laatste maakt het model native multimodaal: het begrijpt tekst, afbeeldingen én video zonder externe modules.
De kernspecificaties op een rij
Parameters: 27 miljard (volledig actief). Architectuur: Dense Transformer met Gated DeltaNet hybride aandacht, 64 lagen. Context: 256K tokens native, uitbreidbaar tot 1M tokens via YaRN RoPE scaling. Multimodaal: native (tekst, afbeeldingen, video). Talen: 201 talen en dialecten. Licentie: Apache 2.0 — volledig vrij voor commercieel gebruik. Releasedatum: 24 februari 2026. GitHub: github.com/QwenLM/Qwen3.5.
Benchmarks: hoe sterk is het écht?
De benchmarks zijn het punt waar Qwen3.5 27B echt imponeer. Op de Artificial Analysis Intelligence Index scoort het model 42.1 — beter dan 89% van vergelijkbare modellen. Dat is indrukwekkend voor een open-source model van 'slechts' 27B parameters.
Overzicht van de belangrijkste benchmarks (Qwen3.5 27B):
BENCHMARK OVERZICHT — Qwen3.5 27B
Artificial Analysis Intelligence Index: 42.1 (beter dan 89% van alle modellen)
Artificial Analysis Coding Index: 34.9 (beter dan 86%)
Artificial Analysis Agentic Index: 54.6 (beter dan 91%!)
SWE-bench Verified (code/agents): 72.4% ← matcht GPT-5 mini
MMlu-Pro (brede kennis): 86.1%
GPQA Diamond (wetenschappelijk redeneren): 85.5%
IFEval (instructieopvolging): 95.0% ← uitzonderlijk hoog
Humanity's Last Exam: 48.5%
Terminal-Bench 2.0: 41.6%
Die IFEval-score van 95.0% springt eruit. Het model is exceptioneel goed in het precies volgen van structurele instructies en het extraheren van data uit documenten — cruciaal voor enterprise-toepassingen en agentic workflows.
Qwen3.5 27B vs Claude Sonnet 4.6 vs GPT-5
Om eerlijk te zijn: Qwen3.5 27B verslaat Claude Sonnet 4.6 en GPT-5 niet overall. Maar het verschil is verrassend klein — en als je bedenkt dat je het gratis kunt draaien, verandert die vergelijking volledig.
VERGELIJKING: Qwen3.5 27B vs Claude Sonnet 4.6 vs Claude Opus 4.6
Benchmark Qwen3.5 27B Sonnet 4.6 Opus 4.6
─────────────────────────────────────────────────────────
SWE-bench Verified 72.4% 79.6% 80.8%
GPQA Diamond 85.5% 89.9% 91.3%
Humanity's Last Exam 48.5% 49.0% 53.1%
MMMU-Pro 75.0% 75.6% 77.3%
BrowseComp 61.0% 74.7% 84.0%
Terminal-Bench 2.0 41.6% 59.1% 65.4%
→ Qwen3.5 27B presteert sterk, maar Sonnet/Opus winnen op redeneren en agents
→ CharXiv-R: Qwen3.5 27B wint van Claude Opus 4.6 (visuele analyse)
→ Prijs: Qwen = $0.195/M input tokens, Sonnet 4.6 = $3/M, Opus 4.6 = $15/M
Kosten: de echte gamechanger
Dit is waar Qwen3.5 27B zijn grootste kracht toont. Via API is het model beschikbaar voor $0.195 per miljoen input-tokens en $0.90 per miljoen output-tokens (via diverse providers zoals OpenRouter, DeepInfra, Alibaba Cloud). Dat is 15x goedkoper dan Claude Sonnet 4.6 en 75x goedkoper dan Claude Opus 4.6.
KOSTENVERGELIJKING — API per 1 miljoen tokens
Model Input Output
────────────────────────────────────────────────
Qwen3.5 27B $0.195 $0.90
Qwen3.5 27B Reasoning $0.30 $2.40
GPT-5 mini $0.15 $0.60
GPT-5 $2.00 $8.00
Claude Sonnet 4.6 $3.00 $15.00
Claude Opus 4.6 $15.00 $75.00
Gemini 2.5 Pro $1.25 $10.00
→ Voor 10M tokens output per maand bespaart u $135 vs Sonnet 4.6
→ Ollama lokaal: $0,00 (alleen hardware + stroom)
En dan is er nog de lokale optie. Via Ollama kun je Qwen3.5 27B volledig offline draaien op je eigen hardware. Op een RTX 4090 draait het model op circa 25-35 tokens/seconde. Op een M3 Max MacBook Pro met 64GB RAM ook prima. Geen API-kosten, geen datalek-risico, geen afhankelijkheid van externe servers.
Lokaal draaien via Ollama: zo doe je het
Ollama maakt het verrassend eenvoudig om Qwen3.5 27B lokaal te deployen. Je hebt minimaal 20GB VRAM of 32GB unified RAM nodig (gecomprimeerde GGUF-versie). Installatie duurt letterlijk 2 minuten.
# Stap 1: Installeer Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Stap 2: Download en start Qwen3.5 27B
ollama run qwen3.5:27b
# Stap 3: Of de reasoning-variant voor complexe taken
ollama run qwen3.5:27b-reasoning
# Stap 4: Gebruik via OpenAI-compatibele API (voor integraties)
curl http://localhost:11434/api/chat -d '{
"model": "qwen3.5:27b",
"messages": [
{"role": "user", "content": "Analyseer deze balans en geef 3 verbeterpunten"}
]
}'
Eén kanttekening: er zijn gemelde bugs in Ollama die Qwen3.5 27B's agentic tool-calling kunnen beïnvloeden, met name repetition-penalty issues. Voor RAG-applicaties en directe chat werkt het stabiel. Voor productie agentic workflows raad ik aan de API te gebruiken via OpenRouter of DeepInfra tot Ollama dit heeft opgelost.
De multimodale mogelijkheden
Qwen3.5 27B is native multimodaal via zijn early-fusion vision encoder. Dat betekent dat het model tekst, afbeeldingen en video begrijpt zonder externe pipeline. Praktisch: je kunt een productfoto uploaden en het model vraagt het catalogusformaat te genereren. Of een screenshot van een spreadsheet sturen voor analyse.
# Voorbeeld: multimodale input via OpenRouter API
import openai
import base64
client = openai.OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# Laad afbeelding
with open("factuur.png", "rb") as f:
img_b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="qwen/qwen3.5-27b",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extraheer alle bedragen en datums uit deze factuur als JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{img_b64}"}}
]
}]
)
print(response.choices[0].message.content)
1 miljoen tokens context: wat kun je daarmee?
256K tokens native, 1M via YaRN RoPE scaling. Om dat concreet te maken: 1 miljoen tokens is ruwweg 750.000 woorden — equivalent aan het volledige oeuvre van Tolkien's Lord of the Rings-trilogie. In praktische termen: je kunt een complete codebase van 100.000 regels analyseren, een volledige juridische contractenmap doorzoeken, of een jaarrapport van 500 pagina's analyseren zonder te chunken.
# Voorbeeld: RAG-vrije documentanalyse met lange context
# Geen chunking nodig voor documenten tot ~750K woorden
def analyse_volledig_document(bestandspad: str, vraag: str) -> str:
with open(bestandspad, 'r', encoding='utf-8') as f:
document = f.read()
response = client.chat.completions.create(
model="qwen/qwen3.5-27b",
messages=[
{
"role": "system",
"content": "Je bent een expert documentanalist. Geef precieze, bronvermeldende antwoorden."
},
{
"role": "user",
"content": f"Document:\n\n{document}\n\nVraag: {vraag}"
}
],
max_tokens=4096
)
return response.choices[0].message.content
# Analyseer een volledig jaarrapport in één API-call
resultaat = analyse_volledig_document("jaarrapport-2025.txt",
"Welke 3 risicofactoren worden het meest benadrukt en wat is de financiële impact?")
print(resultaat)
Praktische use cases: waar schittert Qwen3.5 27B?
Op basis van de benchmarks en architectuur zijn dit de sterkste toepassingsgebieden:
1. Agentic workflows (Agentic Index: 54.6 — beter dan 91% van modellen): ideaal voor n8n/Flowise agents die documenten verwerken, data extraheren en systemen aansturen. De IFEval-score van 95.0% betekent dat het model instructies extreem precies opvolgt — cruciaal voor geautomatiseerde pipelines. 2. Documentintelligentie: factuurverwerking, contractanalyse, rapportgeneratie. De combinatie van lange context + multimodaal + hoge instructieopvolging maakt dit een sterke kandidaat voor document-AI. 3. Meertalige applicaties: 201 talen en dialecten, inclusief Nederlandse dialecten. Voor NL MKB: klantenservice chatbots in correct Nederlands én eventueel Fries, Limburgs of Surinaams Nederlands. 4. Private RAG-systemen: lokaal draaien via Ollama betekent dat bedrijfsdocumenten nooit het pand verlaten. Geen AVG-zorgen over gevoelige klantdata in externe API's. 5. Kostenefficiënte productie-AI: voor volume-toepassingen (duizenden API-calls per dag) is de kostenreductie vs. Claude/GPT dramatisch.
Integratie in n8n of Flowise: quickstart
// n8n: HTTP Request node configuratie voor Qwen3.5 27B via OpenRouter
{
"method": "POST",
"url": "https://openrouter.ai/api/v1/chat/completions",
"headers": {
"Authorization": "Bearer {{ $env.OPENROUTER_API_KEY }}",
"Content-Type": "application/json",
"HTTP-Referer": "https://jouwbedrijf.nl",
"X-Title": "MijnApp"
},
"body": {
"model": "qwen/qwen3.5-27b",
"messages": [
{
"role": "system",
"content": "Je bent een behulpzame assistent voor {{ $env.BEDRIJFSNAAM }}. Antwoord altijd in het Nederlands."
},
{
"role": "user",
"content": "{{ $json.vraag }}"
}
],
"max_tokens": 2048,
"temperature": 0.3
}
}
Voor Flowise: voeg een 'ChatOpenAI' node toe, zet de Base URL op https://openrouter.ai/api/v1 en het model op qwen/qwen3.5-27b. Dat is alles. De OpenAI-compatibele API maakt integratie in elk bestaand framework trivial.
Beperkingen: eerlijk zijn
Qwen3.5 27B is sterk, maar niet perfect. De belangrijkste beperkingen: 1. Verbosity in reasoning-modus: de reasoning-variant denkt soms uitgebreid na over triviale vragen. Voor eenvoudige productie-queries gebruik je beter de non-reasoning variant. 2. Ollama tool-calling bugs: er zijn openstaande issues in Ollama waarbij agentic tool-calls kunnen falen door repetition-penalty-conflicten. Check github.com/ollama/ollama/issues/14493 voor de actuele status. 3. Benchmark vs. praktijk: in real-world coding-sessies (complexe langere conversaties) presteren modellen als DeepSeek V3 en GPT-4.1 soms iets beter. Qwen3.5 27B is een allround-model, geen pure coding-specialist. 4. Hardware-vereisten: voor volledige 27B in float16 heb je 54GB VRAM nodig. De gecomprimeerde Q4-GGUF versie is ~17GB en draait op een RTX 3090/4080 of M2 Max Mac.
# Hardware-eisen voor lokale deployment
# Optie 1: Maximale kwaliteit (float16)
# Vereist: 54GB VRAM (2x RTX 4090, H100, of A100)
ollama run qwen3.5:27b-fp16
# Optie 2: Gecomprimeerd Q4_K_M (aanbevolen voor consumenterhardware)
# Vereist: ~17GB VRAM of 32GB unified RAM
# RTX 3090, RTX 4080, RTX 4090, M2 Max/M3 Max Mac
ollama run qwen3.5:27b # standaard = Q4_K_M
# Optie 3: Sterk gecomprimeerd Q2 (minimale hardware)
# Vereist: ~10GB VRAM, iets lagere kwaliteit
# RTX 3080, M2 Pro Mac, goede gaming-PC
ollama run qwen3.5:27b-q2_k
Eindoordeel: wanneer kies je voor Qwen3.5 27B?
Qwen3.5 27B is het beste open-source model van dit moment voor de meeste zakelijke toepassingen. De combinatie van Apache 2.0 licentie, scherpe API-prijzen, 1M-token context, native multimodaliteit en sterke instructieopvolging maakt het uniek.
Kies voor Qwen3.5 27B als: je budget beperkt is maar je wel slimme AI wilt, je data on-premise moet blijven (lokale deployment), je meertalige of multimodale toepassingen bouwt, je volume-API-gebruik hebt waarbij kosten tellen, of je agentic workflows bouwt met veel instructieopvolging.
Blijf bij Claude Sonnet/Opus of GPT-5 als: je de absolute top-performance nodig hebt voor complexe redeneer- of coderingstaken, je zwaar leunt op browsing-agents (BrowseComp-verschil is significant), of je productie-tools al geoptimaliseerd zijn voor Anthropic/OpenAI API's.
Eindcijfer: 8.5/10. Intelligentie: 8/10. Kostprijs: 10/10. Multimodaliteit: 9/10. Lokale deployment: 9/10. Agentic capabilities: 8.5/10. Instructieopvolging: 9.5/10. Bronnen: github.com/QwenLM/Qwen3.5 · artificialanalysis.ai/models/qwen3-5-27b · openrouter.ai/qwen/qwen3.5-27b · ollama.com/library/qwen3.5:27b · huggingface.co/Qwen/Qwen3.5-27B