Dit artikel beschrijft een benchmark-onderzoek naar de prestaties van kleine taalmodellen op mobiele apparaten, uitgevoerd in samenwerking tussen Artificial Analysis en Liquid AI.
Kernpunten van het onderzoek:
- Scope: Er is gekeken naar 'kleine' modellen die na kwantisatie in 8 GB geheugen passen. De tests zijn uitgevoerd met
llama.cpp (4-bit kwantisatie of kleiner) op de iPhone 17 Pro en Galaxy S26 Ultra.
- Meetmethoden: De focus ligt op de balans tussen modelintelligentie en generatietijd (end-to-end). Er wordt specifiek gekeken naar de tijd om een prompt van 1.024 tokens te verwerken en 256 tokens te genereren.
- Intelligentie-meting: De intelligentie wordt bepaald via de Mobile Device Benchmark Set, bestaande uit tests voor tool calling (BFCL), instructieopvolging (IFBench), algemene kennis, hallucinatiegraad, en wetenschappelijk en kwantitatief redeneren (GPQA Diamond en MATH-500).
- Efficiëntie: Daarnaast wordt de token-efficiëntie gemeten aan de hand van 'context budget overruns', waarbij gekeken wordt of modellen antwoorden volledig kunnen afmaken binnen een limiet van 16K tokens.
Benchmarking van inference op zakformaat
Inleiding
Definities en scope
"Kleine" modellen Onder "kleine" modellen verstaan we alle modellen die na kwantisatie in 8 GB geheugen passen, inclusief de KV-cache bij een context van 8K.
Reikwijdte van de benchmark De prestaties worden gemeten met llama.cpp op builds die zijn gekwantiseerd naar 4-bit of kleiner. Meer modellen, kwantisaties, apparaten, inference-frameworks en andere varianten zullen binnenkort worden toegevoegd.
Geteste hardware
- iPhone 17 Pro (12 GB)
- Galaxy S26 Ultra (12 GB)
Hardware-spectrum (Energieverbruik)
- Mobiele telefoons: 2–20W
- Laptops & workstations: 15W–2kW
- Datacentersystemen: 700W–600kW
---
Samenvatting van Intelligentie en Inference-prestaties
Intelligentie versus generatietijd
Er wordt gekeken naar de gemiddelde score (bij een maximale context van 16K) tegenover de end-to-end generatietijd.
- Gemiddelde score (Mobile Device Benchmark Set): Een eenvoudig gemiddelde van vijf evaluaties die representatief zijn voor echt mobiel gebruik. Deze worden uitgevoerd op modellen die klein genoeg zijn om op draagbare hardware te passen en zijn onafhankelijk gemeten door Artificial Analysis.
- End-to-end generatietijd: De totale tijd (wall-clock time) om een prompt van 1.024 tokens te verwerken en een respons van 256 tokens te genereren. Dit is fundamenteel afhankelijk van de gebruikte hardware en de architectuur van het model; het effect van de verbose aard van een model (de neiging om meer of minder tokens te gebruiken) is hierbij niet inbegrepen.
Intelligentie versus piekgeheugen
De analyse vergelijkt de gemiddelde score met het maximale geheugengebruik.
---
Gedetailleerde Inference-prestaties
Generatietijd en snelheid
De focus ligt op de tijd die nodig is om een prompt van 1.024 tokens te verwerken en een respons van 256 tokens te genereren (waarbij een lagere tijd beter is).
Modelintelligentie
De intelligentie wordt gemeten via de gemiddelde score van de Mobile Device Benchmark Set met verschillende contextlimieten:
- Gemiddelde score bij 16K maximale context (hoger is beter).
- Gemiddelde score bij 64K maximale context.
- Gemiddelde score bij een maximale tijd van 1 minuut.
Let op: Voor sommige modellen zijn metingen weggelaten omdat het model niet op het apparaat paste of de tijdslimiet overschreed.
Aanvullende Intelligence Index-scores
Voor de volgende modellen zijn de volledige scores van de Artificial Analysis Intelligence Index beschikbaar op hun respectievelijke modelpagina's:
- Gemma 4 31B (Reasoning)
- LFM2.5-2.6B
- Ling 3.0 Tiny
- Ministral 3 3B
- Ministral 3 8B
- Qwen3.5 9B (Reasoning)
- Qwen3.6 27B (Reasoning)
- Qwen3.6 35B A3B (Reasoning)
---
Token-efficiëntie
Context Budget Overruns
Dit betreft de generaties die stopten bij de limiet van 16K-tokens in plaats van het antwoord volledig af te maken, over alle evaluatierondes van het model. Een lager aantal overruns is beter.
---
Analyse van de Evaluaties
De intelligentie-evaluaties voor mobiele apparaten (bij een maximale context van 16K) worden onafhankelijk gemeten door Artificial Analysis. De gebruikte benchmarks zijn:
- BFCL (subset): Tool calling.
- IFBench: Instructieopvolging (Instruction following).
- AA-Omniscience Accuracy: Kennis.
- AA-Omniscience Non-Hallucination Rate: 1 minus de hallucinatiegraad.
- GPQA Diamond: Wetenschappelijk redeneren.
- MATH-500: Kwantitatief redeneren.
Benchmarking van inference op zakformaat
Inleiding
Definities en scope
"Kleine" modellen Onder "kleine" modellen verstaan we alle modellen die na kwantisatie in 8 GB geheugen passen, inclusief de KV-cache bij een context van 8K.
Reikwijdte van de benchmark De prestaties worden gemeten met llama.cpp op builds die zijn gekwantiseerd naar 4-bit of kleiner. Meer modellen, kwantisaties, apparaten, inference-frameworks en andere varianten zullen binnenkort worden toegevoegd.
Geteste hardware
- iPhone 17 Pro (12 GB)
- Galaxy S26 Ultra (12 GB)
Hardware-spectrum (Energieverbruik)
- Mobiele telefoons: 2–20W
- Laptops & workstations: 15W–2kW
- Datacentersystemen: 700W–600kW
---
Samenvatting van Intelligentie en Inference-prestaties
Intelligentie versus generatietijd
Er wordt gekeken naar de gemiddelde score (bij een maximale context van 16K) tegenover de end-to-end generatietijd.
- Gemiddelde score (Mobile Device Benchmark Set): Een eenvoudig gemiddelde van vijf evaluaties die representatief zijn voor echt mobiel gebruik. Deze worden uitgevoerd op modellen die klein genoeg zijn om op draagbare hardware te passen en zijn onafhankelijk gemeten door Artificial Analysis.
- End-to-end generatietijd: De totale tijd (wall-clock time) om een prompt van 1.024 tokens te verwerken en een respons van 256 tokens te genereren. Dit is fundamenteel afhankelijk van de gebruikte hardware en de architectuur van het model; het effect van de verbose aard van een model (de neiging om meer of minder tokens te gebruiken) is hierbij niet inbegrepen.
Intelligentie versus piekgeheugen
De analyse vergelijkt de gemiddelde score met het maximale geheugengebruik.
---
Gedetailleerde Inference-prestaties
Generatietijd en snelheid
De focus ligt op de tijd die nodig is om een prompt van 1.024 tokens te verwerken en een respons van 256 tokens te genereren (waarbij een lagere tijd beter is).
Modelintelligentie
De intelligentie wordt gemeten via de gemiddelde score van de Mobile Device Benchmark Set met verschillende contextlimieten:
- Gemiddelde score bij 16K maximale context (hoger is beter).
- Gemiddelde score bij 64K maximale context.
- Gemiddelde score bij een maximale tijd van 1 minuut.
Let op: Voor sommige modellen zijn metingen weggelaten omdat het model niet op het apparaat paste of de tijdslimiet overschreed.
Aanvullende Intelligence Index-scores
Voor de volgende modellen zijn de volledige scores van de Artificial Analysis Intelligence Index beschikbaar op hun respectievelijke modelpagina's:
- Gemma 4 31B (Reasoning)
- LFM2.5-2.6B
- Ling 3.0 Tiny
- Ministral 3 3B
- Ministral 3 8B
- Qwen3.5 9B (Reasoning)
- Qwen3.6 27B (Reasoning)
- Qwen3.6 35B A3B (Reasoning)
---
Token-efficiëntie
Context Budget Overruns
Dit betreft de generaties die stopten bij de limiet van 16K-tokens in plaats van het antwoord volledig af te maken, over alle evaluatierondes van het model. Een lager aantal overruns is beter.
---
Analyse van de Evaluaties
De intelligentie-evaluaties voor mobiele apparaten (bij een maximale context van 16K) worden onafhankelijk gemeten door Artificial Analysis. De gebruikte benchmarks zijn:
- BFCL (subset): Tool calling.
- IFBench: Instructieopvolging (Instruction following).
- AA-Omniscience Accuracy: Kennis.
- AA-Omniscience Non-Hallucination Rate: 1 minus de hallucinatiegraad.
- GPQA Diamond: Wetenschappelijk redeneren.
- MATH-500: Kwantitatief redeneren.