GLM-5.3

Belangrijkste verbeteringen

  • Sterker coderen: GLM-5.3 is het meest capabele open-weights model voor coderen, met een verbetering van 50% ten opzichte van GLM-5.2 op de interne Z.ai Code Bench. Daarnaast behaalt het SOTA-resultaten (State of the Art) op publieke benchmarks, waaronder Terminal Bench 3.0 en Agents' Last Exam.
  • Opkomende cybercapaciteiten: Door de schaling van de post-training ontwikkelden de cybercapaciteiten zich sneller dan verwacht. GLM-5.3 is state of the art op CyberGym voor het ontdekken van kwetsbaarheden. De grootste winst is behaald verderop in de exploitatieketen, waar het model de prestaties van GLM-5.2 op exploitatie-benchmarks meer dan verdubbelt.

---

Gebruiksinstructies

Hieronder volgen de instructies voor het gebruik van zai-org/GLM-5.3 met verschillende libraries en inference providers.

Transformers

Gebruik via een pipeline (high-level helper):

from transformers import pipeline
pipe = pipeline("text-generation", model="zai-org/GLM-5.3")
messages = [
    {"role": "user", "content": "Who are you?"},
]
pipe(messages)

Direct laden van het model:

from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("zai-org/GLM-5.3")
model = AutoModelForCausalLM.from_pretrained("zai-org/GLM-5.3", device_map="auto")
messages = [
    {"role": "user", "content": "Who are you?"},
]
inputs = tokenizer.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=40)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:]))

vLLM

Installatie via pip en het starten van het model:

# Installeer vLLM via pip:
pip install vllm

# Start de vLLM-server:
vllm serve "zai-org/GLM-5.3"

De server aanroepen via curl (OpenAI-compatibele API):

curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
    "model": "zai-org/GLM-5.3",
    "messages": [
        {
            "role": "user",
            "content": "What is the capital of France?"
        }
    ]
}'

Gebruik via Docker: docker model run hf.co/zai-org/GLM-5.3

SGLang

Installatie via pip en het starten van het model:

# Installeer SGLang via pip:
pip install sglang

# Start de SGLang-server:
python3 -m sglang.launch_server \
--model-path "zai-org/GLM-5.3" \
--host 0.0.0.0 \
--port 30000

De server aanroepen via curl (OpenAI-compatibele API):

curl -X POST "http://localhost:30000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
    "model": "zai-org/GLM-5.3",
    "messages": [
        {
            "role": "user",
            "content": "What is the capital of France?"
        }
    ]
}'

Gebruik via Docker-images:

docker run --gpus all \
--shm-size 32g \
-p 30000:30000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=<secret>" \
--ipc=host \
lmsysorg/sglang:latest \
python3 -m sglang.launch_server \
--model-path "zai-org/GLM-5.3" \
--host 0.0.0.0 \
--port 30000

Docker Model Runner

Voor gebruik met de Docker Model Runner: docker model run hf.co/zai-org/GLM-5.3

---

Benchmarks

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.421.133.734.6
DeepSWE (v1.1)66.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBench (Almost Solved)19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathon (v1.1)42.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench (v1.0.6)48.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE w/ Tools62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

---

Lokale Implementatie

GLM-5.3 ondersteunt implementatie met de volgende frameworks:

  • SGLang
  • vLLM
  • TokenSpeed
  • Transformers
  • KTransformers
  • Unsloth

Voor implementatie op het Ascend NPU-platform worden inference frameworks zoals vLLM-Ascend, xLLM en SGLang ondersteund.

Belangrijke opmerkingen

  • Denkbudget: GLM-5.3 ondersteunt het beheren van het denkbudget via de parameter reasoning_effort. Deze accepteert drie niveaus: low, high en max. De standaardwaarde is max. Voor het reproduceren van benchmarks en leaderboards dient de standaardwaarde max te worden behouden.
  • Chat Template: In de chat template voor GLM-5.3 staat clearthinking standaard op false. Voor chat-scenario's dient clearthinking=true expliciet te worden meegegeven.

---

Voetnoten

  • HLE w/ tools: Evaluatie uitgevoerd met sampling parameters temperature=1.0 en top_p=0.95, met een maximale generatielengte van 163.840 tokens. De evaluatie is uitgevoerd met een maximale contextlengte van 300.000 tokens, gebruikmakend van een context-managementstrategie. GPT-5.6-luna (medium) is gebruikt als judge model.
  • NL2Repo: Geëvalueerd met temperature=1.0, topp=1.0, en maxnew_tokens=64k onder 1M context. Om hacking te voorkomen, is gebruikgemaakt van regelgebaseerde en LLM-gebaseerde beoordelingen om kwaadaardige acties (bijv. ongeautoriseerde pip- of curl-operaties) te blokkeren.
  • DeepSWE: Uitgevoerd met de mini-swe-agent harness met temperature=0.95, top_p=1.0, een timeout van 6 uur en 400K context.
  • Terminal-Bench 2.1: Geëvalueerd in Claude Code 2.1.207 met temperature=1.0, topp=1, maxnew_tokens=65536 en een timeout van 6 uur.
  • Terminal-Bench 3.0: Geëvalueerd met de Claude Code 2.1.207 harness (reasoning effort=max, 400K context, en 128K maximale output), waarbij de avg@3 over drie rollouts per taak wordt gerapporteerd. Elke rollout draait in een geïsoleerde container gebouwd van de officiële image van de taak, begrensd tot 600 agent-beurten met een timeout van 10 uur. Tool Search is uitgeschakeld; artefacten worden gescoord door de officiële verifieerder.
  • Agent's Last Exam (CLI): Geëvalueerd volgens het officiële protocol met de Claude Code harness (reasoning effort=max, 1M context, en 64K maximale output). Elke van de 105 taken draait in een geïsoleerde Docker-container. De standaard timeout is 4 uur, tenzij taakspecifieke limieten (tot 8 uur) voorrang hebben. Tool Search is uitgeschakeld.
  • Toolathlon Verified: Alle resultaten zijn verkregen via de officiële evaluatieservice; pass@1 wordt gerapporteerd, gemiddeld over 3 onafhankelijke runs.
  • AutomationBench: Geëvalueerd op versie 1.0.6, inclusief de fix voor het null-type handling probleem (PR #13).
  • GDPval-AA v2: Modellen zijn geëvalueerd door Artificial Analysis.
  • CyberGym: Geëvalueerd in Claude Code 2.1.207 (max reasoning effort, geen web tools, temperature=1.0, topp=1.0, maxnew_tokens=128000). Evaluaties zijn uitgevoerd zonder timeout per taak; resultaten zijn single-run Pass@1 over 1.507 taken. De agent is in de taakcontainer geplaatst. Git-informatie is verwijderd en een domein-whitelist is toegepast (alleen essentiële domeinen zoals pypi.org en deb.debian.org) om valsspelen te voorkomen.
  • ExploitGym: Geëvalueerd in Claude Code 2.1.207 (max reasoning effort, geen web tools, temperature=1.0, topp=1.0, maxnew_tokens=128000). Resultaten zijn single-run Pass@1 op 869 taken met twee timeout-budgetten: 2 uur en 6 uur. Deze zijn berekend op basis van API-inferentietijd geschaald naar tokens per seconde (TPS) per model (GLM-5.3: 115 TPS, Kimi K3: 40 TPS, Qwen3.8 Max: 47 TPS), plus non-API overhead. Een domein-whitelist is toegepast.
  • ExploitBench: Geëvalueerd in Claude Code 2.1.207 (max reasoning effort, geen web tools, temperature=1.0, topp=1.0, maxnew_tokens=128000). Het aantal interactierondes tussen de agent en de omgeving is beperkt tot 300. De gemiddelde coverage-score over 41 taken over 3 revisies is berekend. Een domein-whitelist is toegepast.
  • FrontierSWE: Evaluatie uitgevoerd door Proximal met 1M contextlengte, max effort level, en 128K maximale output tokens. Dominance score gerapporteerd per 14-08-2026.
  • PostTrainBench: Geëvalueerd via Claude Code 2.1.207 met max effort level, temperature=1.0, topp=1.0, maxnew_tokens=128000, en een contextvenster van 1M tokens. Gewogen gemiddelde over 3 runs. Runs die geen score produceerden, vallen terug op de officiële zero-shot base-model baseline score. Om externe API-gebruik te detecteren is een LLM-agent gebruikt in plaats van pattern-matching.
  • SWE-Marathon: Geëvalueerd via Claude Code 2.1.207 met maximum effort level, temperature=1.0, topp=0.95, maxnew_tokens=128000, en een contextvenster van 1M tokens. Voor 'strip-clone' is een LLM-gebaseerde inspectie gebruikt ter vervanging van te brede import-detectie. Voor 'parameter-golf' en 'trimul-cuda' is --extra-index-url https://pypi.org/simple toegevoegd om Docker-buildfouten door NVIDIA wheels te herstellen.

---

Citatie

Indien GLM-5.3 nuttig is voor uw onderzoek, citeer dan het technische rapport:

@misc{glm5team2026glm5vibecodingagentic,
title={GLM-5: from Vibe Coding to Agentic Engineering},
author={GLM-5-Team and : and Aohan Zeng and Xin Lv and Zhenyu Hou and Zhengxiao Du and Qinkai Zheng and Bin Chen and Da Yin and Chendi Ge and Chenghua Huang and Chengxing Xie and Chenzheng Zhu and Congfeng Yin and Cunxiang Wang and Gengzheng Pan and Hao Zeng and Haoke Zhang and Haoran Wang and Huilong Chen and Jiajie Zhang and Jian Jiao and Jiaqi Guo and Jingsen Wang and Jingzhao Du and Jinzhu Wu and Kedong Wang and Lei Li and Lin Fan and Lucen Zhong and Mingdao Liu and Mingming Zhao and Pengfan Du and Qian Dong and Rui Lu and Shuang-Li and Shulin Cao and Song Liu and Ting Jiang and Xiaodong Chen and Xiaohan Zhang and Xuancheng Huang and Xuezhen Dong and Yabo Xu and Yao Wei and Yifan An and Yilin Niu and Yitong Zhu and Yuanhao Wen and Yukuo Cen and Yushi Bai and Zhongpei Qiao and Zihan Wang and Zikang Wang and Zilin Zhu and Ziqiang Liu and Zixuan Li and Bojie Wang and Bosi Wen and Can Huang and Changpeng Cai and Chao Yu and Chen Li and Chengwei Hu and Chenhui Zhang and Dan Zhang and Daoyan Lin and Dayong Yang and Di Wang and Ding Ai and Erle Zhu and Fangzhou Yi and Feiyu Chen and Guohong Wen and Hailong Sun and Haisha Zhao and Haiyi Hu and Hanchen Zhang and Hanrui Liu and Hanyu Zhang and Hao Peng and Hao Tai and Haobo Zhang and He Liu and Hongwei Wang and Hongxi Yan and Hongyu Ge and Huan Liu and Huanpeng Chu and Jia'ni Zhao and Jiachen Wang and Jiajing Zhao and Jiamin Ren and Jiapeng Wang and Jiaxin Zhang and Jiayi Gui and Jiayue Zhao and Jijie Li and Jing An and Jing Li and Jingwei Yuan and Jinhua Du and Jinxin Liu and Junkai Zhi and Junwen Duan and Kaiyue Zhou and Kangjian Wei and Ke Wang and Keyun Luo and Laiqiang Zhang and Leigang Sha and Liang Xu and Lindong Wu and Lintao Ding and Lu Chen and Minghao Li and Nianyi Lin and Pan Ta and Qiang Zou and Rongjun Song and Ruiqi Yang and Shangqing Tu and Shangtong Yang and Shaoxiang Wu and Shengyan Zhang and Shijie Li and Shuang Li and Shuyi Fan and Wei Qin and Wei Tian and Weining Zhang and Wenbo Yu and Wenjie Liang and Xiang Kuang and Xiangmeng Cheng and Xiangyang Li and Xiaoquan Yan and Xiaowei Hu and Xiaoying Ling and Xing Fan and Xingye Xia and Xinyuan Zhang and Xinze Zhang and Xirui Pan and Xu Zou and Xunkai Zhang and Yadi Liu and Yandong Wu and Yanfu Li and Yidong Wang and Yifan Zhu and Yijun Tan and Yilin Zhou and Yiming Pan and Ying Zhang and Yinpei Su and Yipeng Geng and Yong Yan and Yonglin Tan and Yuean Bi and Yuhan Shen and Yuhao Yang and Yujiang Li and Yunan Liu and Yunqing Wang and Yuntao Li and Yurong Wu and Yutao Zhang and Yuxi dan and Yuxuan Zhang and Zezhen Liu and Zhengtao Jiang and Zhenhe Yan and Zheyu Zhang and Zhixiang Wei and Zhuo Chen and Zhuoer Feng and Zijun Yao and Ziwei Chai and Ziyuan Wang and Zuzhou Zhang and Bin Xu and Minlie Huang and Hongning Wang and Juanzi Li and Yuxiao Dong and Jie Tang},
year={2026},
eprint={2602.15763},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2602.15763},
}