Qwen/Qwen3.8-27B-FP8: Overzicht en Gebruikershandleiding

De gebruikte kwantisatiemethode is fijnmazige FP8-kwantisatie met een blokgrootte van 128; de prestatiegegevens hiervan zijn vrijwel identiek aan die van het originele model. Voor gebruikers die op zoek zijn naar beheerde, schaalbare inferentie zonder onderhoud van de infrastructuur, is de officiële Qwen API-service beschikbaar via Qwen Cloud. In het bijzonder zal Qwen3.8-27B beschikbaar komen als een hosted versie met meer productiefuncties, zoals standaard een contextlengte van 1 miljoen tokens en officiële ingebouwde tools.

Introductie tot Qwen3.8

Na de brede adoptie van de Qwen3.5- en Qwen3.6-series introduceren we Qwen3.8, de meest capabele generatie in de Qwen open-model familie tot nu toe. Gebouwd op het architecturale fundament van Qwen3.5, levert Qwen3.8 aanzienlijke verbeteringen op het gebied van coderen, professioneel werk, onderzoek en complexe agentische taken met een lange horizon.

Qwen3.8-27B brengt deze vooruitgang naar een compact, deployment-vriendelijk dense model: een native vision-language model dat afbeeldingen en video's begrijpt, beschikt over flexibele controle over het denkproces ('thinking control') en is ontworpen om complexe, meerstaps taken met grotere betrouwbaarheid te voltooien.

Belangrijkste kenmerken van Qwen3.8-27B

  • Kerncapaciteiten: Omvattende verbeteringen in coderen, professioneel werk, onderzoek en langdurige agentische taken.
  • Agent-executie: Sterkere autonome planning en betere afhandeling van feedback uit de omgeving, wat leidt tot een betrouwbaardere end-to-end taakvoltooiing.
  • Downstream Compatibiliteit: Bredere ondersteuning voor populaire harnesses en ontwikkeltools, waardoor integratie in bestaande stacks eenvoudiger wordt.
  • Flexibele Controle over Denkproces: De denkmodus is standaard ingeschakeld en kan per verzoek worden uitgeschakeld. De redeneerdiepte kan worden afgestemd met reasoningeffort, en de redeneringscontext uit historische berichten wordt behouden via preservethinking.
  • Vision-Language Begrip: Native ondersteuning voor het begrijpen van afbeeldingen en video's, variërend van STEM-diagrammen en documenten tot video's van een uur lang.

Modeloverzicht

  • Type: Causaal taalmodel met Vision Encoder
  • Trainingsfase: Pre-training & Post-training

Taalmodel Specificaties

  • Aantal parameters: 27B
  • Hidden Dimension: 5120
  • Token Embedding: 248.320 (gepadded)
  • Aantal lagen: 64
  • Hidden Layout: 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
  • Gated DeltaNet:
  • Aantal Linear Attention Heads: 48 voor V en 16 voor QK
  • Head Dimension: 128
  • Gated Attention:
  • Aantal Attention Heads: 24 voor Q en 4 voor KV
  • Head Dimension: 256
  • Rotary Position Embedding Dimension: 64
  • Feed Forward Network (FFN):
  • Intermediate Dimension: 17.408
  • LM Output: 248.320 (gepadded)
  • MTP (Multi-Token Prediction): Getraind met meerdere stappen
  • Contextlengte: Native 262.144 tokens, uitbreidbaar tot 1.000.000 tokens.

Benchmarkresultaten

Tekstprestaties

CategorieBenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
CodingTerminal Bench 2.1 (Terminus)73.063.464.051.778.2
SWE-bench Pro61.753.557.651.253.4
NL2Repo-Bench42.336.241.1--47.6
DeepSWE 1.142.213.314.2----
QwenSWEBench79.049.359.2--63.8
AgentCoWorkBench70.761.065.1--68.2
JobBench33.421.827.6----
Agents' Last Exam (Pass@1 / Score)20.4 / 42.910.6 / 27.313.2 / 33.6----
GeneralIFBench79.569.179.177.062.5
GPQA Diamond89.287.890.383.591.3
HLE30.824.034.722.040.0
LiveCodeBench v690.383.989.6--88.8

Opmerkingen bij tekstprestaties:

  • SWE-bench Pro: Behalve Opus4.6 Max (officieel gerapporteerd), zijn alle modellen geëvalueerd met de Claude Code harness (temp=1.0, top_p=0.95, 256K context window).
  • NL2Repo-Bench: Geëvalueerd met de Claude Code harness; Bash-commando's die toegang proberen te krijgen tot specifieke repositories zijn uitgeschakeld om reward hacking te voorkomen.
  • DeepSWE 1.1: Geëvalueerd met de Claude Code harness (temp=1.0, top_p=0.95, 256K context window).
  • QwenSWEBench: Interne benchmark voor software engineering; avg@3 met 8 uur timeout, max_tokens=32.768, temp=1.0, 256K context window.
  • CoWorkBench: Interne benchmark voor langdurige taken in CS, finance, law en medical.

VL (Vision-Language) Prestaties

CategorieBenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30BOpus4.6 Max
Agentic IntelligenceOSWorld-Verified84.363.973.365.972.7
WebArena-Verified64.848.855.3----
AndroidWorld81.970.381.0--62.0
RecreationBench47.129.830.2----
ClawEval-MM (Pass@3 / Avg)57.4 / 56.942.6 / 50.457.4 / 60.1--52.5 / 54.7
SWE-MM38.625.730.0--27.1
Vision2Web62.945.042.1----
General IntelligenceMathVision (Without/With CI)90.0 / 94.685.1 / --90.3 / ----65.5 / --
BabyVision (Without/With CI)65.7 / 85.628.9 / --64.7 / 70.4--12.6 / --
CharXiv RQ (Without/With CI)83.7 / 90.278.4 / --85.8 / 85.978.8 / --66.0 / --
OmniDocBench 1.591.189.491.475.886.6
RealWorldQA85.984.186.9--73.9
ERQA65.562.569.8--40.8

Opmerkingen bij VL-prestaties:

  • MathVision, BabyVision, CharXiv (RQ): Waar beschikbaar zijn "Without CI" en "With CI" apart gerapporteerd. Fouten in ground-truth annotaties zijn handmatig gecorrigeerd.
  • RecreationBench: Interne benchmark voor applicatie-recreatie over desktop (Ubuntu, macOS, Windows), mobiel (Android) en web.
  • ClawEval-MM: Pass@3 is het percentage taken dat in ten minste één van de drie pogingen geslaagd is.

Snelstart en Implementatie

Voor een gestroomlijnde integratie raden we aan om Qwen3.8 via API's te gebruiken. Voor productieomgevingen met een hoge doorvoer zijn dedicated serving engines zoals SGLang, vLLM of TokenSpeed aanbevolen.

Gebruik met Libraries en Frameworks

Transformers

# Gebruik van pipeline als high-level helper
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-27B-FP8")
messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"},
            {"type": "text", "text": "Welk dier staat er op het snoepje?"}
        ]
    },
]
pipe(text=messages)

# Direct laden van het model
from transformers import AutoProcessor, AutoModelForMultimodalLM
processor = AutoProcessor.from_pretrained("Qwen/Qwen3.8-27B-FP8")
model = AutoModelForMultimodalLM.from_pretrained("Qwen/Qwen3.8-27B-FP8", device_map="auto")

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt"
).to(model.device)

outputs = model.generate(**inputs, max_new_tokens=40)
print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:]))

vLLM

Installatie en serverstart:

pip install vllm
vllm serve "Qwen/Qwen3.8-27B-FP8"

Aanroep via curl (OpenAI-compatibele API):

curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
  "model": "Qwen/Qwen3.8-27B-FP8",
  "messages": [
    {
      "role": "user",
      "content": [
        {"type": "text", "text": "Beschrijf deze afbeelding in één zin."},
        {"type": "image_url", "image_url": {"url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg"}}
      ]
    }
  ]
}'

SGLang

Installatie en serverstart:

pip install sglang
python3 -m sglang.launch_server \
--model-path "Qwen/Qwen3.8-27B-FP8" \
--host 0.0.0.0 \
--port 30000

API Gebruik en Configuratie

Qwen3.8 modellen werken standaard in de denkmodus (thinking mode), waarbij ze denkstappen genereren tussen <think>\n...</think>\n\n voordat het uiteindelijke antwoord volgt.

Sampling Parameters

We raden de volgende parameters aan:

  • Denkmodus: temperature=1.0, topp=0.95, topk=20, minp=0.0, presencepenalty=0.0, repetition_penalty=1.0
  • Instruct-modus (zonder denken): temperature=0.7, topp=0.80, topk=20, minp=0.0, presencepenalty=1.5, repetition_penalty=1.0

Redeneerinstellingen

Qwen3.8 ondersteunt reasoning_effort om de diepte van het redeneren en de kosten te beheren:

  • xhigh (standaard): Voor complexe taken die grondige analyse vereisen.
  • medium: Balans tussen nauwkeurigheid en snelheid.
  • low: Efficiënt redeneren, geoptimaliseerd voor snelheid en kosten.

Daarnaast is preserve_thinking standaard ingeschakeld. Dit behoudt de denkblokken van alle historische berichten in het gesprek, wat essentieel is voor consistentie bij agent-scenario's.

API Voorbeelden (OpenAI SDK)

Tekst-input met Denkmodus

from openai import OpenAI
client = OpenAI()

messages = [{"role": "user", "content": "Schrijf een Python-functie om twee gesorteerde linked lists samen te voegen."}]
completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B-FP8",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,
            "preserve_thinking": True,
        },
    },
    reasoning_effort="xhigh",
    stream=True,
)
# (Verdere logica voor het printen van reasoning_content en answer_content)

Afbeelding-input

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image_url", "image_url": {"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"}},
            {"type": "text", "text": "Bereken de factor waarmee de radii van de kleine cirkels vermenigvuldigd moeten worden..."}
        ]
    }
]
chat_response = client.chat.completions.create(model="Qwen/Qwen3.8-27B-FP8", messages=messages)

Video-input

messages = [
    {
        "role": "user",
        "content": [
            {"type": "video_url", "video_url": {"url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"}},
            {"type": "text", "text": "Hoeveel porseleinen potten werden ontdekt in de nissen?"}
        ]
    }
]
chat_response = client.chat.completions.create(model="Qwen/Qwen3.8-27B", messages=messages)

Best Practices

Optimalisatie van Prestaties

  • Sampling Parameters: Pas de presence_penalty aan tussen 0 en 2 om oneindige herhaling te verminderen. Let op dat een te hoge waarde kan leiden tot taalmixing.
  • Output Lengte: Voor agentische taken is voldoende outputlengte cruciaal. Aanbevolen configuratie binnen de 1M context:
  • Reasoning Content: Maximaal 262.144 tokens.
  • Final Response: Maximaal 131.072 tokens.

Verwerking van Ultra-Lange Teksten

Qwen3.8-27B ondersteunt native contexten tot 262.144 tokens. Voor taken die deze limiet overschrijden, raden we RoPE scaling technieken aan (bijv. YaRN), ondersteund door vLLM, SGLang en TokenSpeed.

Voor het activeren van YaRN in config.json, wijzig de rope_parameters naar:

{
  "mrope_interleaved": true,
  "mrope_section": [11, 11, 10],
  "rope_type": "yarn",
  "rope_theta": 10000000,
  "partial_rotary_factor": 0.25,
  "factor": 4.0,
  "original_max_position_embeddings": 262144
}

Begrip van Lange Video's

Om hogere framerate-sampling voor video's van een uur mogelijk te maken, wordt aangeraden de parameter longestedge in het videopreprocessor_config bestand in te stellen op 469762048 (overeenkomstig 224k video tokens).

Citatie

Indien u dit werk gebruikt, kunt u refereren via:

@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}