Grok 4.6 brengt SpaceXAI terug naar de intelligentie-frontier en loopt voorop in kostenefficiëntie

Grok 4.6 van SpaceXAI scoort 61 op de Artificial Analysis Intelligence Index, waarmee het zich aansluit bij de frontier in lijn met GPT-5.6 Sol, met name door uitmuntende agentische prestaties tegen lagere kosten.

Grok 4.6 behaalt een stijging van 5 punten ten opzichte van Grok 4.5 op de Intelligence Index, slechts een maand na de release, en een stijging van 23 punten vergeleken met Grok 4.3. Hiermee keert SpaceXAI terug naar de intelligentie-frontier naast OpenAI, en wordt het alleen nog gevolgd door Anthropic.

Belangrijkste punten:

  • Grok 4.6 sluit aan bij de frontier van de Artificial Analysis Intelligence Index: Met een score van 61 presteert het model in lijn met GPT-5.6 Sol (max), achter Claude Opus 5 (max, 63) en Claude Fable 5 (max met fallback, 62), maar net voor Kimi K3.
  • Sterke agentische prestaties: Grok 4.6 behaalt een GDPval-AA v2 Elo van 1753, waar alleen Claude Opus 5 voor staat; de betrouwbaarheidsintervallen overlappen met die van Claude Fable 5 en Qwen3.8 Max. Het model scoort 50,7% op $\tau^3$-Banking (een van de twee hoogste scores naast Qwen3.8 Max met 51,3%) en 88,4% op Terminal-Bench v2.1, wat in lijn is met de leidende modellen.
  • Frontier-intelligentie tegen lagere kosten: De basisprijs is ongewijzigd gebleven ten opzichte van Grok 4.5 op $2/$6 per 1 miljoen input/output tokens. Dit is meer dan 60% lager dan Claude Opus 5 ($5/$25) en GPT-5.6 Sol ($5/$30). De kosten per taak bedragen $0,84, wat gelijk is aan Kimi K3 (die een iets hogere intelligentie heeft), waardoor Grok 4.6 zich op de Pareto-frontier van 'Intelligentie versus Kosten per Taak' bevindt.
  • Prestaties in complexe kennistaken: Op AA-Briefcase, onze private benchmark voor agentische kennistaken op de lange termijn, bevindt Grok 4.6 zich op het niveau van Fable 5 met een Elo van 1577 (achter de Claude Opus 5-familie). Het model is opvallend efficiënt in termen van interacties: taken worden gemiddeld voltooid in ongeveer 53 beurten en ~0,5 miljard input tokens, vergeleken met ~103 beurten en ~2,0 miljard input tokens voor Claude Opus 5 (max).

Overige modeldetails:

  • Context window: 500k tokens (ongewijzigd ten opzichte van Grok 4.5).
  • Prijsstelling: $2/$6 per 1 miljoen tokens voor input/output; cache-hits zijn afgeprijsd naar $0,5 per 1 miljoen tokens, een verhoging ten opzichte van de $0,3 per 1 miljoen tokens bij Grok 4.5.

Agentische prestaties

De sterkste resultaten van Grok 4.6 liggen bij agentisch werk in plaats van statisch redeneren. Op GDPval-AA v2, onze leidende maatstaf voor real-world agentisch kenniswerk, behaalt het een Elo van 1753. Hiermee staat het model enkel achter Claude Opus 5 en is het statistisch niet te onderscheiden van Claude Fable 5 en Qwen3.8 Max, gezien de overlappende betrouwbaarheidsintervallen.

Dit patroon zet zich voort over verschillende soorten taken. $\tau^3$-Banking (50,7%) test multi-turn klantenservice met tool-gebruik en plaatst Grok 4.6 in de top twee, terwijl Terminal-Bench v2.1 (88,4%) het model op hetzelfde niveau brengt als de koplopers voor softwaretaken via de terminal. Weinig modellen zijn gelijktijdig competitief in kenniswerk, klantenservice en terminalgebruik; gecombineerd met de prijsstelling plaatst dit Grok 4.6 op de kosten-prestatie Pareto-frontier voor elke agentische evaluatie in de Intelligence Index.

Kosten

Het gelijk houden van de basisprijs over een generatie heen is ongebruikelijk aan de frontier, waar intelligentiewinst doorgaans gepaard gaat met prijsverhogingen. Grok 4.6 levert een winst van 5 punten op de Intelligence Index tegen dezelfde prijs van $2/$6. Onze gemeten kosten per taak van $0,84 weerspiegelen zowel deze prijsstelling als een redelijke token-efficiëntie.

Voor kopers is de vergelijking met modellen die binnen twee punten van dit model scoren het meest relevant: Claude Opus 5 op $5/$25 en GPT-5.6 Sol op $5/$30. Grok 4.6 biedt effectief dezelfde Intelligence Index-score als GPT-5.6 Sol tegen een fractie van de prijs voor output tokens, wat de bepalende factor is voor kosten bij workloads waar veel redeneren voor nodig is.

Kennistaken op de lange termijn

Grok 4.6 maakt zijn debuut op AA-Briefcase, onze private benchmark voor agentische kennistaken op de lange termijn, met een Elo van 1577. Dit plaatst het model in de Fable 5-categorie, achter de Claude Opus 5-familie. Het vertoont consistent sterke prestaties over rubric grading, presentatiekwaliteit en analytische kwaliteit, zonder dat kracht in één dimensie zwakte in een andere compenseert.

Het efficiëntieprofiel is net zo opvallend als de score. Grok 4.6 lost taken gemiddeld op in ~53 beurten en ~0,5 miljard input tokens, tegenover ~103 beurten en ~2,0 miljard input tokens voor Claude Opus 5 (max). Agentisch werk op de lange termijn bouwt snel context op; een model dat een vergelijkbaar antwoord bereikt in de helft van de beurten en met een kwart van de input tokens, heeft dus een kostenvoordeel dat veel verder gaat dan alleen de prijs per token.