GLM-5.3 (max): Analyse van Intelligentie, Prestaties en Prijs

Prestatieanalyse

Intelligentie

GLM-5.3 (max) scoort 60 op de Artificial Analysis Intelligence Index, wat aanzienlijk boven het gemiddelde van vergelijkbare modellen ligt (mediaan: 35). Tijdens de evaluatie van de Intelligence Index genereerde het model 170 miljoen tokens, wat zeer uitgebreid is in vergelijking met de mediaan van 72 miljoen tokens.

Snelheid en Latentie

Met een snelheid van 84,7 tokens per seconde is GLM-5.3 (max) sneller dan het gemiddelde van 74 tokens per seconde. De latentie, gemeten als de tijd tot het eerste token (TTFT), bedraagt 1,88 seconden, wat beter is dan het gemiddelde van 2,81 seconden voor redeneermodellen in een vergelijkbare prijsklasse.

Kosten

De prijsstelling voor GLM-5.3 (max) is als volgt:

  • Input: $1,40 per 1 miljoen tokens (mediaan: $1,75).
  • Output: $4,40 per 1 miljoen tokens (mediaan: $10,00).

Voor een geblende rate (gebaseerd op een verhouding van 7:2:1 voor cache hit/input/output) bedragen de kosten $0,90 per 1 miljoen tokens. De totale kosten voor het evalueren van GLM-5.3 (max) op de Intelligence Index bedroegen $1238,50.

Technische Specificaties

  • Ontwikkelaar: Z AI
  • Releasedatum: 18 augustus 2026
  • Type model: Proprietary (niet open source)
  • Aantal parameters: 753 miljard
  • Redeneervermogen: Ja; het model is een redeneermodel dat gebruikmaakt van extended thinking of chain-of-thought redenering om complexe problemen op te lossen voordat er een antwoord wordt gegeven.
  • Inputmodaliteit: Tekst
  • Outputmodaliteit: Tekst
  • Multimodaal: Nee, het model ondersteunt geen afbeeldingen.
  • Contextvenster: 1,0 miljoen tokens (vergelijkbaar met circa 1500 A4-pagina's in Arial lettertype 12).

Benchmarks en Evaluaties

Artificial Analysis Intelligence Index

De Intelligence Index v4.1.1 is een samengestelde benchmark die modellen evalueert op basis van redenering, kennis, wiskunde en coderen. De index omvat de volgende negen evaluaties:

  • GDPval-AA v2: Agentische real-world werkzaamheden.
  • $\tau^3$-Banking: Agentisch toolgebruik.
  • Terminal-Bench v2.1: Agentisch coderen en terminalgebruik.
  • SciCode: Coderen.
  • Humanity's Last Exam: Redenering en kennis.
  • GPQA Diamond: Wetenschappelijke redenering.
  • CritPt: Natuurkundige redenering.
  • AA-Omniscience: Kennisbetrouwbaarheid en hallucinaties (meet nauwkeurigheid en het percentage hallucinaties).
  • AA-LCR: Redenering bij lange contexten (Long Context Reasoning).

AA-Omniscience Index

De AA-Omniscience Index meet de betrouwbaarheid van kennis en het voorkomen van hallucinaties. Correcte antwoorden worden beloond en hallucinaties worden bestraft, terwijl het weigeren om te antwoorden neutraal wordt gescoord. De scores variëren van -100 tot 100, waarbij 0 staat voor een gelijk aantal correcte en incorrecte antwoorden.