Het artikel introduceert Qwen3.8-27B, de meest capabele generatie in de Qwen open-model familie tot nu toe. Dit compacte dense model is beschikbaar als FP8-gekwantiseerde versie, wat zorgt voor efficiënte deployment zonder significant prestatieverlies.
De belangrijkste kenmerken zijn:
- Multimodaliteit: Het is een native vision-language model dat afbeeldingen en video's (tot een uur lang) kan analyseren.
- Redeneervermogen: Het model beschikt over een 'denkmodus' waarbij redeneerstappen worden gegenereerd. De intensiteit hiervan kan worden aangepast via de parameter
reasoning_effort.
- Prestaties: Benchmarks tonen sterke verbeteringen in coderen, professioneel onderzoek en autonome agent-taken ten opzichte van voorgaande versies (zoals Qwen3.6).
- Technische Specificaties: Met 27 miljard parameters ondersteunt het model native een contextlengte van 262.144 tokens, uitbreidbaar tot 1 miljoen via technieken als YaRN.
Het artikel biedt daarnaast praktische implementatievoorbeelden voor populaire frameworks zoals Hugging Face Transformers, vLLM en SGLang, inclusief specifieke sampling-parameters voor optimale resultaten in zowel de denkmodus als de instruct-modus.
Qwen/Qwen3.8-27B-FP8: Overzicht en Gebruikershandleiding
De gebruikte kwantisatiemethode is fijnmazige FP8-kwantisatie met een blokgrootte van 128; de prestatiegegevens hiervan zijn vrijwel identiek aan die van het originele model. Voor gebruikers die op zoek zijn naar beheerde, schaalbare inferentie zonder onderhoud van de infrastructuur, is de officiële Qwen API-service beschikbaar via Qwen Cloud. In het bijzonder zal Qwen3.8-27B beschikbaar komen als een hosted versie met meer productiefuncties, zoals standaard een contextlengte van 1 miljoen tokens en officiële ingebouwde tools.
Introductie tot Qwen3.8
Na de brede adoptie van de Qwen3.5- en Qwen3.6-series introduceren we Qwen3.8, de meest capabele generatie in de Qwen open-model familie tot nu toe. Gebouwd op het architecturale fundament van Qwen3.5, levert Qwen3.8 aanzienlijke verbeteringen op het gebied van coderen, professioneel werk, onderzoek en complexe agentische taken met een lange horizon.
Qwen3.8-27B brengt deze vooruitgang naar een compact, deployment-vriendelijk dense model: een native vision-language model dat afbeeldingen en video's begrijpt, beschikt over flexibele controle over het denkproces ('thinking control') en is ontworpen om complexe, meerstaps taken met grotere betrouwbaarheid te voltooien.
Belangrijkste kenmerken van Qwen3.8-27B
- Kerncapaciteiten: Omvattende verbeteringen in coderen, professioneel werk, onderzoek en langdurige agentische taken.
- Agent-executie: Sterkere autonome planning en betere afhandeling van feedback uit de omgeving, wat leidt tot een betrouwbaardere end-to-end taakvoltooiing.
- Downstream Compatibiliteit: Bredere ondersteuning voor populaire harnesses en ontwikkeltools, waardoor integratie in bestaande stacks eenvoudiger wordt.
- Flexibele Controle over Denkproces: De denkmodus is standaard ingeschakeld en kan per verzoek worden uitgeschakeld. De redeneerdiepte kan worden afgestemd met
reasoningeffort, en de redeneringscontext uit historische berichten wordt behouden via preservethinking.
- Vision-Language Begrip: Native ondersteuning voor het begrijpen van afbeeldingen en video's, variërend van STEM-diagrammen en documenten tot video's van een uur lang.
Modeloverzicht
- Type: Causaal taalmodel met Vision Encoder
- Trainingsfase: Pre-training & Post-training
Taalmodel Specificaties
- Aantal parameters: 27B
- Hidden Dimension: 5120
- Token Embedding: 248.320 (gepadded)
- Aantal lagen: 64
- Hidden Layout: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
- Gated DeltaNet:
- Aantal Linear Attention Heads: 48 voor V en 16 voor QK
- Head Dimension: 128
- Gated Attention:
- Aantal Attention Heads: 24 voor Q en 4 voor KV
- Head Dimension: 256
- Rotary Position Embedding Dimension: 64
- Feed Forward Network (FFN):
- Intermediate Dimension: 17.408
- LM Output: 248.320 (gepadded)
- MTP (Multi-Token Prediction): Getraind met meerdere stappen
- Contextlengte: Native 262.144 tokens, uitbreidbaar tot 1.000.000 tokens.
Benchmarkresultaten
Tekstprestaties
| Categorie | Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
| Coding | Terminal Bench 2.1 (Terminus) | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | -- | 47.6 |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | -- | -- |
| QwenSWEBench | 79.0 | 49.3 | 59.2 | -- | 63.8 |
| Agent | CoWorkBench | 70.7 | 61.0 | 65.1 | -- | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | -- | -- |
| Agents' Last Exam (Pass@1 / Score) | 20.4 / 42.9 | 10.6 / 27.3 | 13.2 / 33.6 | -- | -- |
| General | IFBench | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
| HLE | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | -- | 88.8 |
Opmerkingen bij tekstprestaties:
- SWE-bench Pro: Behalve Opus4.6 Max (officieel gerapporteerd), zijn alle modellen geëvalueerd met de Claude Code harness (temp=1.0, top_p=0.95, 256K context window).
- NL2Repo-Bench: Geëvalueerd met de Claude Code harness; Bash-commando's die toegang proberen te krijgen tot specifieke repositories zijn uitgeschakeld om reward hacking te voorkomen.
- DeepSWE 1.1: Geëvalueerd met de Claude Code harness (temp=1.0, top_p=0.95, 256K context window).
- QwenSWEBench: Interne benchmark voor software engineering; avg@3 met 8 uur timeout, max_tokens=32.768, temp=1.0, 256K context window.
- CoWorkBench: Interne benchmark voor langdurige taken in CS, finance, law en medical.
VL (Vision-Language) Prestaties
| Categorie | Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
| Agentic Intelligence | OSWorld-Verified | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
| WebArena-Verified | 64.8 | 48.8 | 55.3 | -- | -- |
| AndroidWorld | 81.9 | 70.3 | 81.0 | -- | 62.0 |
| RecreationBench | 47.1 | 29.8 | 30.2 | -- | -- |
| ClawEval-MM (Pass@3 / Avg) | 57.4 / 56.9 | 42.6 / 50.4 | 57.4 / 60.1 | -- | 52.5 / 54.7 |
| SWE-MM | 38.6 | 25.7 | 30.0 | -- | 27.1 |
| Vision2Web | 62.9 | 45.0 | 42.1 | -- | -- |
| General Intelligence | MathVision (Without/With CI) | 90.0 / 94.6 | 85.1 / -- | 90.3 / -- | -- | 65.5 / -- |
| BabyVision (Without/With CI) | 65.7 / 85.6 | 28.9 / -- | 64.7 / 70.4 | -- | 12.6 / -- |
| CharXiv RQ (Without/With CI) | 83.7 / 90.2 | 78.4 / -- | 85.8 / 85.9 | 78.8 / -- | 66.0 / -- |
| OmniDocBench 1.5 | 91.1 | 89.4 | 91.4 | 75.8 | 86.6 |
| RealWorldQA | 85.9 | 84.1 | 86.9 | -- | 73.9 |
| ERQA | 65.5 | 62.5 | 69.8 | -- | 40.8 |
Opmerkingen bij VL-prestaties:
- MathVision, BabyVision, CharXiv (RQ): Waar beschikbaar zijn "Without CI" en "With CI" apart gerapporteerd. Fouten in ground-truth annotaties zijn handmatig gecorrigeerd.
- RecreationBench: Interne benchmark voor applicatie-recreatie over desktop (Ubuntu, macOS, Windows), mobiel (Android) en web.
- ClawEval-MM: Pass@3 is het percentage taken dat in ten minste één van de drie pogingen geslaagd is.
Snelstart en Implementatie
Voor een gestroomlijnde integratie raden we aan om Qwen3.8 via API's te gebruiken. Voor productieomgevingen met een hoge doorvoer zijn dedicated serving engines zoals SGLang, vLLM of TokenSpeed aanbevolen.
Gebruik met Libraries en Frameworks
Transformers
# Gebruik van pipeline als high-level helper
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-27B-FP8")
messages = [
{
"role": "user",
"content": [
{"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"},
{"type": "text", "text": "Welk dier staat er op het snoepje?"}
]
},
]
pipe(text=messages)
# Direct laden van het model
from transformers import AutoProcessor, AutoModelForMultimodalLM
processor = AutoProcessor.from_pretrained("Qwen/Qwen3.8-27B-FP8")
model = AutoModelForMultimodalLM.from_pretrained("Qwen/Qwen3.8-27B-FP8", device_map="auto")
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt"
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=40)
print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
vLLM
Installatie en serverstart:
pip install vllm
vllm serve "Qwen/Qwen3.8-27B-FP8"
Aanroep via curl (OpenAI-compatibele API):
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "Qwen/Qwen3.8-27B-FP8",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Beschrijf deze afbeelding in één zin."},
{"type": "image_url", "image_url": {"url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg"}}
]
}
]
}'
SGLang
Installatie en serverstart:
pip install sglang
python3 -m sglang.launch_server \
--model-path "Qwen/Qwen3.8-27B-FP8" \
--host 0.0.0.0 \
--port 30000
API Gebruik en Configuratie
Qwen3.8 modellen werken standaard in de denkmodus (thinking mode), waarbij ze denkstappen genereren tussen <think>\n...</think>\n\n voordat het uiteindelijke antwoord volgt.
Sampling Parameters
We raden de volgende parameters aan:
- Denkmodus:
temperature=1.0, topp=0.95, topk=20, minp=0.0, presencepenalty=0.0, repetition_penalty=1.0
- Instruct-modus (zonder denken):
temperature=0.7, topp=0.80, topk=20, minp=0.0, presencepenalty=1.5, repetition_penalty=1.0
Redeneerinstellingen
Qwen3.8 ondersteunt reasoning_effort om de diepte van het redeneren en de kosten te beheren:
- xhigh (standaard): Voor complexe taken die grondige analyse vereisen.
- medium: Balans tussen nauwkeurigheid en snelheid.
- low: Efficiënt redeneren, geoptimaliseerd voor snelheid en kosten.
Daarnaast is preserve_thinking standaard ingeschakeld. Dit behoudt de denkblokken van alle historische berichten in het gesprek, wat essentieel is voor consistentie bij agent-scenario's.
API Voorbeelden (OpenAI SDK)
Tekst-input met Denkmodus
from openai import OpenAI
client = OpenAI()
messages = [{"role": "user", "content": "Schrijf een Python-functie om twee gesorteerde linked lists samen te voegen."}]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-27B-FP8",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True,
"preserve_thinking": True,
},
},
reasoning_effort="xhigh",
stream=True,
)
# (Verdere logica voor het printen van reasoning_content en answer_content)
Afbeelding-input
messages = [
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"}},
{"type": "text", "text": "Bereken de factor waarmee de radii van de kleine cirkels vermenigvuldigd moeten worden..."}
]
}
]
chat_response = client.chat.completions.create(model="Qwen/Qwen3.8-27B-FP8", messages=messages)
Video-input
messages = [
{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"}},
{"type": "text", "text": "Hoeveel porseleinen potten werden ontdekt in de nissen?"}
]
}
]
chat_response = client.chat.completions.create(model="Qwen/Qwen3.8-27B", messages=messages)
Best Practices
Optimalisatie van Prestaties
- Sampling Parameters: Pas de
presence_penalty aan tussen 0 en 2 om oneindige herhaling te verminderen. Let op dat een te hoge waarde kan leiden tot taalmixing.
- Output Lengte: Voor agentische taken is voldoende outputlengte cruciaal. Aanbevolen configuratie binnen de 1M context:
- Reasoning Content: Maximaal 262.144 tokens.
- Final Response: Maximaal 131.072 tokens.
Verwerking van Ultra-Lange Teksten
Qwen3.8-27B ondersteunt native contexten tot 262.144 tokens. Voor taken die deze limiet overschrijden, raden we RoPE scaling technieken aan (bijv. YaRN), ondersteund door vLLM, SGLang en TokenSpeed.
Voor het activeren van YaRN in config.json, wijzig de rope_parameters naar:
{
"mrope_interleaved": true,
"mrope_section": [11, 11, 10],
"rope_type": "yarn",
"rope_theta": 10000000,
"partial_rotary_factor": 0.25,
"factor": 4.0,
"original_max_position_embeddings": 262144
}
Begrip van Lange Video's
Om hogere framerate-sampling voor video's van een uur mogelijk te maken, wordt aangeraden de parameter longestedge in het videopreprocessor_config bestand in te stellen op 469762048 (overeenkomstig 224k video tokens).
Citatie
Indien u dit werk gebruikt, kunt u refereren via:
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}
Qwen/Qwen3.8-27B-FP8: Overzicht en Gebruikershandleiding
De gebruikte kwantisatiemethode is fijnmazige FP8-kwantisatie met een blokgrootte van 128; de prestatiegegevens hiervan zijn vrijwel identiek aan die van het originele model. Voor gebruikers die op zoek zijn naar beheerde, schaalbare inferentie zonder onderhoud van de infrastructuur, is de officiële Qwen API-service beschikbaar via Qwen Cloud. In het bijzonder zal Qwen3.8-27B beschikbaar komen als een hosted versie met meer productiefuncties, zoals standaard een contextlengte van 1 miljoen tokens en officiële ingebouwde tools.
Introductie tot Qwen3.8
Na de brede adoptie van de Qwen3.5- en Qwen3.6-series introduceren we Qwen3.8, de meest capabele generatie in de Qwen open-model familie tot nu toe. Gebouwd op het architecturale fundament van Qwen3.5, levert Qwen3.8 aanzienlijke verbeteringen op het gebied van coderen, professioneel werk, onderzoek en complexe agentische taken met een lange horizon.
Qwen3.8-27B brengt deze vooruitgang naar een compact, deployment-vriendelijk dense model: een native vision-language model dat afbeeldingen en video's begrijpt, beschikt over flexibele controle over het denkproces ('thinking control') en is ontworpen om complexe, meerstaps taken met grotere betrouwbaarheid te voltooien.
Belangrijkste kenmerken van Qwen3.8-27B
- Kerncapaciteiten: Omvattende verbeteringen in coderen, professioneel werk, onderzoek en langdurige agentische taken.
- Agent-executie: Sterkere autonome planning en betere afhandeling van feedback uit de omgeving, wat leidt tot een betrouwbaardere end-to-end taakvoltooiing.
- Downstream Compatibiliteit: Bredere ondersteuning voor populaire harnesses en ontwikkeltools, waardoor integratie in bestaande stacks eenvoudiger wordt.
- Flexibele Controle over Denkproces: De denkmodus is standaard ingeschakeld en kan per verzoek worden uitgeschakeld. De redeneerdiepte kan worden afgestemd met
reasoningeffort, en de redeneringscontext uit historische berichten wordt behouden via preservethinking.
- Vision-Language Begrip: Native ondersteuning voor het begrijpen van afbeeldingen en video's, variërend van STEM-diagrammen en documenten tot video's van een uur lang.
Modeloverzicht
- Type: Causaal taalmodel met Vision Encoder
- Trainingsfase: Pre-training & Post-training
Taalmodel Specificaties
- Aantal parameters: 27B
- Hidden Dimension: 5120
- Token Embedding: 248.320 (gepadded)
- Aantal lagen: 64
- Hidden Layout: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
- Gated DeltaNet:
- Aantal Linear Attention Heads: 48 voor V en 16 voor QK
- Head Dimension: 128
- Gated Attention:
- Aantal Attention Heads: 24 voor Q en 4 voor KV
- Head Dimension: 256
- Rotary Position Embedding Dimension: 64
- Feed Forward Network (FFN):
- Intermediate Dimension: 17.408
- LM Output: 248.320 (gepadded)
- MTP (Multi-Token Prediction): Getraind met meerdere stappen
- Contextlengte: Native 262.144 tokens, uitbreidbaar tot 1.000.000 tokens.
Benchmarkresultaten
Tekstprestaties
| Categorie | Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
| Coding | Terminal Bench 2.1 (Terminus) | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | -- | 47.6 |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | -- | -- |
| QwenSWEBench | 79.0 | 49.3 | 59.2 | -- | 63.8 |
| Agent | CoWorkBench | 70.7 | 61.0 | 65.1 | -- | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | -- | -- |
| Agents' Last Exam (Pass@1 / Score) | 20.4 / 42.9 | 10.6 / 27.3 | 13.2 / 33.6 | -- | -- |
| General | IFBench | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
| HLE | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | -- | 88.8 |
Opmerkingen bij tekstprestaties:
- SWE-bench Pro: Behalve Opus4.6 Max (officieel gerapporteerd), zijn alle modellen geëvalueerd met de Claude Code harness (temp=1.0, top_p=0.95, 256K context window).
- NL2Repo-Bench: Geëvalueerd met de Claude Code harness; Bash-commando's die toegang proberen te krijgen tot specifieke repositories zijn uitgeschakeld om reward hacking te voorkomen.
- DeepSWE 1.1: Geëvalueerd met de Claude Code harness (temp=1.0, top_p=0.95, 256K context window).
- QwenSWEBench: Interne benchmark voor software engineering; avg@3 met 8 uur timeout, max_tokens=32.768, temp=1.0, 256K context window.
- CoWorkBench: Interne benchmark voor langdurige taken in CS, finance, law en medical.
VL (Vision-Language) Prestaties
| Categorie | Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus4.6 Max |
| Agentic Intelligence | OSWorld-Verified | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
| WebArena-Verified | 64.8 | 48.8 | 55.3 | -- | -- |
| AndroidWorld | 81.9 | 70.3 | 81.0 | -- | 62.0 |
| RecreationBench | 47.1 | 29.8 | 30.2 | -- | -- |
| ClawEval-MM (Pass@3 / Avg) | 57.4 / 56.9 | 42.6 / 50.4 | 57.4 / 60.1 | -- | 52.5 / 54.7 |
| SWE-MM | 38.6 | 25.7 | 30.0 | -- | 27.1 |
| Vision2Web | 62.9 | 45.0 | 42.1 | -- | -- |
| General Intelligence | MathVision (Without/With CI) | 90.0 / 94.6 | 85.1 / -- | 90.3 / -- | -- | 65.5 / -- |
| BabyVision (Without/With CI) | 65.7 / 85.6 | 28.9 / -- | 64.7 / 70.4 | -- | 12.6 / -- |
| CharXiv RQ (Without/With CI) | 83.7 / 90.2 | 78.4 / -- | 85.8 / 85.9 | 78.8 / -- | 66.0 / -- |
| OmniDocBench 1.5 | 91.1 | 89.4 | 91.4 | 75.8 | 86.6 |
| RealWorldQA | 85.9 | 84.1 | 86.9 | -- | 73.9 |
| ERQA | 65.5 | 62.5 | 69.8 | -- | 40.8 |
Opmerkingen bij VL-prestaties:
- MathVision, BabyVision, CharXiv (RQ): Waar beschikbaar zijn "Without CI" en "With CI" apart gerapporteerd. Fouten in ground-truth annotaties zijn handmatig gecorrigeerd.
- RecreationBench: Interne benchmark voor applicatie-recreatie over desktop (Ubuntu, macOS, Windows), mobiel (Android) en web.
- ClawEval-MM: Pass@3 is het percentage taken dat in ten minste één van de drie pogingen geslaagd is.
Snelstart en Implementatie
Voor een gestroomlijnde integratie raden we aan om Qwen3.8 via API's te gebruiken. Voor productieomgevingen met een hoge doorvoer zijn dedicated serving engines zoals SGLang, vLLM of TokenSpeed aanbevolen.
Gebruik met Libraries en Frameworks
Transformers
# Gebruik van pipeline als high-level helper
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-27B-FP8")
messages = [
{
"role": "user",
"content": [
{"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"},
{"type": "text", "text": "Welk dier staat er op het snoepje?"}
]
},
]
pipe(text=messages)
# Direct laden van het model
from transformers import AutoProcessor, AutoModelForMultimodalLM
processor = AutoProcessor.from_pretrained("Qwen/Qwen3.8-27B-FP8")
model = AutoModelForMultimodalLM.from_pretrained("Qwen/Qwen3.8-27B-FP8", device_map="auto")
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt"
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=40)
print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:]))
vLLM
Installatie en serverstart:
pip install vllm
vllm serve "Qwen/Qwen3.8-27B-FP8"
Aanroep via curl (OpenAI-compatibele API):
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "Qwen/Qwen3.8-27B-FP8",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "Beschrijf deze afbeelding in één zin."},
{"type": "image_url", "image_url": {"url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg"}}
]
}
]
}'
SGLang
Installatie en serverstart:
pip install sglang
python3 -m sglang.launch_server \
--model-path "Qwen/Qwen3.8-27B-FP8" \
--host 0.0.0.0 \
--port 30000
API Gebruik en Configuratie
Qwen3.8 modellen werken standaard in de denkmodus (thinking mode), waarbij ze denkstappen genereren tussen <think>\n...</think>\n\n voordat het uiteindelijke antwoord volgt.
Sampling Parameters
We raden de volgende parameters aan:
- Denkmodus:
temperature=1.0, topp=0.95, topk=20, minp=0.0, presencepenalty=0.0, repetition_penalty=1.0
- Instruct-modus (zonder denken):
temperature=0.7, topp=0.80, topk=20, minp=0.0, presencepenalty=1.5, repetition_penalty=1.0
Redeneerinstellingen
Qwen3.8 ondersteunt reasoning_effort om de diepte van het redeneren en de kosten te beheren:
- xhigh (standaard): Voor complexe taken die grondige analyse vereisen.
- medium: Balans tussen nauwkeurigheid en snelheid.
- low: Efficiënt redeneren, geoptimaliseerd voor snelheid en kosten.
Daarnaast is preserve_thinking standaard ingeschakeld. Dit behoudt de denkblokken van alle historische berichten in het gesprek, wat essentieel is voor consistentie bij agent-scenario's.
API Voorbeelden (OpenAI SDK)
Tekst-input met Denkmodus
from openai import OpenAI
client = OpenAI()
messages = [{"role": "user", "content": "Schrijf een Python-functie om twee gesorteerde linked lists samen te voegen."}]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-27B-FP8",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True,
"preserve_thinking": True,
},
},
reasoning_effort="xhigh",
stream=True,
)
# (Verdere logica voor het printen van reasoning_content en answer_content)
Afbeelding-input
messages = [
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"}},
{"type": "text", "text": "Bereken de factor waarmee de radii van de kleine cirkels vermenigvuldigd moeten worden..."}
]
}
]
chat_response = client.chat.completions.create(model="Qwen/Qwen3.8-27B-FP8", messages=messages)
Video-input
messages = [
{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"}},
{"type": "text", "text": "Hoeveel porseleinen potten werden ontdekt in de nissen?"}
]
}
]
chat_response = client.chat.completions.create(model="Qwen/Qwen3.8-27B", messages=messages)
Best Practices
Optimalisatie van Prestaties
- Sampling Parameters: Pas de
presence_penalty aan tussen 0 en 2 om oneindige herhaling te verminderen. Let op dat een te hoge waarde kan leiden tot taalmixing.
- Output Lengte: Voor agentische taken is voldoende outputlengte cruciaal. Aanbevolen configuratie binnen de 1M context:
- Reasoning Content: Maximaal 262.144 tokens.
- Final Response: Maximaal 131.072 tokens.
Verwerking van Ultra-Lange Teksten
Qwen3.8-27B ondersteunt native contexten tot 262.144 tokens. Voor taken die deze limiet overschrijden, raden we RoPE scaling technieken aan (bijv. YaRN), ondersteund door vLLM, SGLang en TokenSpeed.
Voor het activeren van YaRN in config.json, wijzig de rope_parameters naar:
{
"mrope_interleaved": true,
"mrope_section": [11, 11, 10],
"rope_type": "yarn",
"rope_theta": 10000000,
"partial_rotary_factor": 0.25,
"factor": 4.0,
"original_max_position_embeddings": 262144
}
Begrip van Lange Video's
Om hogere framerate-sampling voor video's van een uur mogelijk te maken, wordt aangeraden de parameter longestedge in het videopreprocessor_config bestand in te stellen op 469762048 (overeenkomstig 224k video tokens).
Citatie
Indien u dit werk gebruikt, kunt u refereren via:
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}