Grok 4.6 (high) - Analyse van Intelligentie, Prestaties en Prijs
Modeloverzicht
Op basis van de Artificial Analysis-metingen scoort het model als volgt:
- Intelligentie: Score 61 (plaats #6 van de 183 modellen). Dit plaatst het model ruim boven het gemiddelde van vergelijkbare modellen (mediaan: 34).
- Snelheid: 69,3 tokens per seconde (plaats #72 van de 183 modellen), wat lager is dan het gemiddelde.
- Verbositeit: Tijdens de evaluatie genereerde het model 72 miljoen tokens, wat iets hoger is dan de mediaan van 71 miljoen.
Technische Specificaties
Mogelijkheden en Modaliteiten
- Redeneervermogen: Ja, dit is een redeneermodel dat gebruikmaakt van uitgebreid nadenken (extended thinking) of chain-of-thought redenering om complexe problemen op te lossen voordat er een antwoord wordt gegeven.
- Input-modaliteit: Ondersteunt tekst en afbeeldingen (multimodaal). Het model kan afbeeldingen analyseren, beschrijven en vragen over deze beelden beantwoorden.
- Output-modaliteit: Ondersteunt tekst.
- Contextvenster: 500k tokens (vergelijkbaar met ongeveer 750 A4-pagina's in Arial lettertype 12).
Prestaties en Latentie
- Snelheid: De output-snelheid bedraagt 69,3 tokens per seconde via de API van SpaceXAI.
- Latentie (TTFT): De Time To First Token (TTFT) is 51,87 seconden. Dit bevindt zich aan de hoge kant vergeleken met andere redeneermodellen in een vergelijkbare prijsklasse (mediaan: 2,85s). Deze tijd is inclusief de 'denktijd' van het model.
Prijsstelling
De prijzen zijn gebaseerd op de API-provider SpaceXAI:
- Input: $2,00 per 1 miljoen tokens (iets duurder dan gemiddeld; mediaan: $1,75).
- Output: $6,00 per 1 miljoen tokens (gunstiger dan gemiddeld; mediaan: $10,00).
- Cache Hit: $0,50 per 1 miljoen tokens (een korting van 75% ten opzichte van de normale inputprijs).
- Blended Rate: Bij een verhouding van 7:2:1 (cache hit/input/output) is het tarief $1,35 per 1 miljoen tokens.
De totale kosten voor het evalueren van Grok 4.6 (high) op de Intelligence Index bedroegen $1068,47.
Intelligentie-index en Benchmarks
Grok 4.6 (high) behaalde een score van 61 op de Artificial Analysis Intelligence Index v4.1.1. Deze samengestelde benchmark evalueert modellen op het gebied van redeneren, kennis, wiskunde en programmeren.
De index is gebaseerd op negen evaluaties:
- GDPval-AA v2 (agentische taken in de echte wereld)
- $\tau^3$-Banking (agentisch gebruik van tools)
- Terminal-Bench v2.1 (agentisch coderen en terminalgebruik)
- SciCode (programmeren)
- Humanity's Last Exam (redeneren & kennis)
- GPQA Diamond (wetenschappelijk redeneren)
- CritPt (natuurkundig redeneren)
- AA-Omniscience (kennis en hallucinatiegraad)
- AA-LCR (redeneren met lange context)
Aanvullende Metrieken
- AA-Omniscience Index: Meet de betrouwbaarheid van kennis en het voorkomen van hallucinaties.
- AA-Briefcase Elo: Een gecombineerde metriek voor agentisch kennisonderzoek, gebaseerd op rubric-passrate, analytische kwaliteit en presentatie.
Groetjes,