Benchmarking van inference op zakformaat

Inleiding

Definities en scope

"Kleine" modellen Onder "kleine" modellen verstaan we alle modellen die na kwantisatie in 8 GB geheugen passen, inclusief de KV-cache bij een context van 8K.

Reikwijdte van de benchmark De prestaties worden gemeten met llama.cpp op builds die zijn gekwantiseerd naar 4-bit of kleiner. Meer modellen, kwantisaties, apparaten, inference-frameworks en andere varianten zullen binnenkort worden toegevoegd.

Geteste hardware

  • iPhone 17 Pro (12 GB)
  • Galaxy S26 Ultra (12 GB)

Hardware-spectrum (Energieverbruik)

  • Mobiele telefoons: 2–20W
  • Laptops & workstations: 15W–2kW
  • Datacentersystemen: 700W–600kW

---

Samenvatting van Intelligentie en Inference-prestaties

Intelligentie versus generatietijd

Er wordt gekeken naar de gemiddelde score (bij een maximale context van 16K) tegenover de end-to-end generatietijd.

  • Gemiddelde score (Mobile Device Benchmark Set): Een eenvoudig gemiddelde van vijf evaluaties die representatief zijn voor echt mobiel gebruik. Deze worden uitgevoerd op modellen die klein genoeg zijn om op draagbare hardware te passen en zijn onafhankelijk gemeten door Artificial Analysis.
  • End-to-end generatietijd: De totale tijd (wall-clock time) om een prompt van 1.024 tokens te verwerken en een respons van 256 tokens te genereren. Dit is fundamenteel afhankelijk van de gebruikte hardware en de architectuur van het model; het effect van de verbose aard van een model (de neiging om meer of minder tokens te gebruiken) is hierbij niet inbegrepen.

Intelligentie versus piekgeheugen

De analyse vergelijkt de gemiddelde score met het maximale geheugengebruik.

---

Gedetailleerde Inference-prestaties

Generatietijd en snelheid

De focus ligt op de tijd die nodig is om een prompt van 1.024 tokens te verwerken en een respons van 256 tokens te genereren (waarbij een lagere tijd beter is).

Modelintelligentie

De intelligentie wordt gemeten via de gemiddelde score van de Mobile Device Benchmark Set met verschillende contextlimieten:

  • Gemiddelde score bij 16K maximale context (hoger is beter).
  • Gemiddelde score bij 64K maximale context.
  • Gemiddelde score bij een maximale tijd van 1 minuut.

Let op: Voor sommige modellen zijn metingen weggelaten omdat het model niet op het apparaat paste of de tijdslimiet overschreed.

Aanvullende Intelligence Index-scores

Voor de volgende modellen zijn de volledige scores van de Artificial Analysis Intelligence Index beschikbaar op hun respectievelijke modelpagina's:

  • Gemma 4 31B (Reasoning)
  • LFM2.5-2.6B
  • Ling 3.0 Tiny
  • Ministral 3 3B
  • Ministral 3 8B
  • Qwen3.5 9B (Reasoning)
  • Qwen3.6 27B (Reasoning)
  • Qwen3.6 35B A3B (Reasoning)

---

Token-efficiëntie

Context Budget Overruns

Dit betreft de generaties die stopten bij de limiet van 16K-tokens in plaats van het antwoord volledig af te maken, over alle evaluatierondes van het model. Een lager aantal overruns is beter.

---

Analyse van de Evaluaties

De intelligentie-evaluaties voor mobiele apparaten (bij een maximale context van 16K) worden onafhankelijk gemeten door Artificial Analysis. De gebruikte benchmarks zijn:

  • BFCL (subset): Tool calling.
  • IFBench: Instructieopvolging (Instruction following).
  • AA-Omniscience Accuracy: Kennis.
  • AA-Omniscience Non-Hallucination Rate: 1 minus de hallucinatiegraad.
  • GPQA Diamond: Wetenschappelijk redeneren.
  • MATH-500: Kwantitatief redeneren.