Grok 4.6 is de nieuwste iteratie van het Grok-model, met een specifieke focus op 'agentic' capaciteiten en complex kenniswerk. Het model blinkt uit in het uitvoeren van taken die over meerdere stappen verspreid zijn, zoals software engineering, het analyseren van informatie en het ontwikkelen van applicaties.
De belangrijkste aspecten van de update zijn:
- Training & Prestaties: Door een langere aanvullende trainingsronde en het gebruik van gecureerde data voor redenering behaalt Grok 4.6 'frontier intelligence'. In benchmarks scoort het model vergelijkbaar met GPT-5.6 Sol.
- Projectontwikkeling: Het model is bijzonder sterk in het omzetten van brede productideeën naar werkende versies, waarbij het vaker gebruikmaakt van zelf-testen en verificatie tijdens het proces.
- Veiligheid: De veiligheidsstack is verbeterd om maximale behulpzaamheid te bieden bij legitieme technische taken, zoals het patchen van kwetsbaarheden en AI-onderzoek.
- Beschikbaarheid: Grok 4.6 is direct beschikbaar in Cursor en Grok Build, evenals via API's van partners zoals OpenRouter, Vercel en Cloudflare.
Introductie van Grok 4.6
Grok 4.6 bouwt voort op Grok 4.5 met een specifieke focus op langlopende agenten en ambitieuzer interactief en visueel werk. Het model blijft consistent bij complexe taken die over vele stappen verspreid zijn, of het nu gaat om het onderzoeken van een onderwerp, het analyseren van informatie, het werken in een codebase of het omzetten van een idee in een gepolijste applicatie of werkproduct.
Grok 4.6 behaalt 'frontier intelligence' op verschillende benchmarks voor agentisch coderen en kenniswerk. Het model is gelijkwaardig aan GPT-5.6 Sol op de Artificial Analysis Intelligence Index, wat een gecombineerde score is van negen benchmarks.
(Bijschrift bij grafieken: Benchmark-staafdiagrammen waarin Grok 4.6 wordt vergeleken met andere toonaangevende modellen over AA Intelligence, GDPVal-AA, DeepSWE 1.1, CursorBench 3.2 en FrontierCode 1.1. Cijfers van concurrenten zijn afkomstig uit de gepubliceerde systeemkaarten of benchmark-ranglijsten van de respectievelijke ontwikkelaars.)
Grok 4.6 is vandaag beschikbaar in Cursor en Grok Build. Voor de eerste week bieden we 2x het normale verbruik aan binnen Grok Build en Cursor, zodat gebruikers direct met versie 4.6 aan de slag kunnen.
Het trainen van Grok 4.6
Grok 4.6 heeft een langere aanvullende trainingsronde ondergaan dan Grok 4.5. Hierbij is gebruikgemaakt van gecureerde, door het model gegenereerde data voor redenering en geavanceerde technische concepten, hoogwaardige engineeringdata en een verbeterde optimizer en trainingsmethode. Dit zorgde voor een sterker fundament voor de daaropvolgende SFT- (Supervised Fine Tuning) en RL-fasen (Reinforcement Learning).
Vervolgens is Grok 4.5 gebruikt om de SFT-trajecten te regenereren voor redeneerinspanningen, agent-harnesses en domeinen zoals STEM, software engineering en kenniswerk. Problematische sporen zijn gefilterd met behulp van modelgebaseerde controles. Het resulterende SFT-checkpoint vertoont sterke prestaties en verbeterd gedrag.
Grok 4.6 is getraind op een breed scala aan agentische RL-taken, waaronder kenniswerk, algemeen coderen en domeinspecifieke omgevingen voor onder andere kerneloptimalisatie, webontwikkeling en computergestuurd ontwerp (CAD).
Ambitieuze ideeën omzetten in werkende projecten
We hebben Grok 4.6 getest met projecten die bedoeld waren om de reikwijdte en het vermogen van het model om werk over vele stappen vol te houden, op de proef te stellen. We stelden vast dat het model bijzonder sterk is in het omzetten van een breed productidee in een eerste werkende versie. Het kan onbekende domeinen onderzoeken, de applicatie structureren, de kerninteracties implementeren en het resultaat blijven verfijnen via verschillende feedbackrondes.
Bij langere trajecten zagen we bovendien meer zelf-testen en verificatie, waarbij het model het eigen werk controleert voordat het verdergaat.
Grok 4.6 produceert sterkere eerste versies van visuele en interactieve projecten dan we gewoonlijk zagen bij Grok 4.5. Uitgaande van een concreet productidee is het model in staat om in één pass de structuur en visuele taal voor een applicatie vast te stellen. Dit maakt het bijzonder nuttig voor projecten waarbij de snelste route naar een goed resultaat is om met iets substantieels te beginnen en vervolgens iteratief te verbeteren.
Veiligheid en capaciteiten
De waarborgen van Grok 4.6 zijn verbeterd en gekalibreerd in lijn met de mogelijkheden van het model. Onze veiligheidsstack is ontworpen om het nut en de beveiliging bij legitieme gebruiksscenario's te maximaliseren. Hierdoor kan Grok 4.6 behulpzaam en veilig zijn in domeinen zoals het patchen van kwetsbaarheden, het versnellen van de engineering-ontwerpcyclus en het ondersteunen van AI-onderzoek.
Ons werk aan de evaluatie van waarborgen weerspiegelt de uitgebreide capaciteiten van Grok 4.6, met onze grootste suite ooit van pre-deployment tests voor capaciteiten en kalibratie van waarborgen, evenals uitgebreide post-deployment tests en tests door derden.
Evaluaties (Evals)
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
De beste score per evaluatie is vetgedrukt. Scores van modellen van derden zijn de beste uit zelfgerapporteerde of publiekelijk beschikbare resultaten.
Aan de slag met Grok 4.6
Grok 4.6 is vandaag beschikbaar in Cursor en Grok Build. Het is ook beschikbaar via de API en andere partners zoals OpenRouter, Vercel en Cloudflare.
De prijzen beginnen bij $2 per miljoen input-tokens en $6 per miljoen output-tokens. Daarnaast is er een 'fast' variant die twee keer zo duur is.
We bieden 2x het inbegrepen verbruik aan binnen Grok Build en Cursor voor de eerste week, zodat je direct met 4.6 kunt beginnen.
Voor ontwikkelaars is het model beschikbaar via de SpaceXAI API en de bijbehorende documentatie. Je kunt ook gratis starten in Grok Build via x.ai/build.
Installatie via CLI: $ curl -fsSL https://x.ai/cli/install.sh | bash
Introductie van Grok 4.6
Grok 4.6 bouwt voort op Grok 4.5 met een specifieke focus op langlopende agenten en ambitieuzer interactief en visueel werk. Het model blijft consistent bij complexe taken die over vele stappen verspreid zijn, of het nu gaat om het onderzoeken van een onderwerp, het analyseren van informatie, het werken in een codebase of het omzetten van een idee in een gepolijste applicatie of werkproduct.
Grok 4.6 behaalt 'frontier intelligence' op verschillende benchmarks voor agentisch coderen en kenniswerk. Het model is gelijkwaardig aan GPT-5.6 Sol op de Artificial Analysis Intelligence Index, wat een gecombineerde score is van negen benchmarks.
(Bijschrift bij grafieken: Benchmark-staafdiagrammen waarin Grok 4.6 wordt vergeleken met andere toonaangevende modellen over AA Intelligence, GDPVal-AA, DeepSWE 1.1, CursorBench 3.2 en FrontierCode 1.1. Cijfers van concurrenten zijn afkomstig uit de gepubliceerde systeemkaarten of benchmark-ranglijsten van de respectievelijke ontwikkelaars.)
Grok 4.6 is vandaag beschikbaar in Cursor en Grok Build. Voor de eerste week bieden we 2x het normale verbruik aan binnen Grok Build en Cursor, zodat gebruikers direct met versie 4.6 aan de slag kunnen.
Het trainen van Grok 4.6
Grok 4.6 heeft een langere aanvullende trainingsronde ondergaan dan Grok 4.5. Hierbij is gebruikgemaakt van gecureerde, door het model gegenereerde data voor redenering en geavanceerde technische concepten, hoogwaardige engineeringdata en een verbeterde optimizer en trainingsmethode. Dit zorgde voor een sterker fundament voor de daaropvolgende SFT- (Supervised Fine Tuning) en RL-fasen (Reinforcement Learning).
Vervolgens is Grok 4.5 gebruikt om de SFT-trajecten te regenereren voor redeneerinspanningen, agent-harnesses en domeinen zoals STEM, software engineering en kenniswerk. Problematische sporen zijn gefilterd met behulp van modelgebaseerde controles. Het resulterende SFT-checkpoint vertoont sterke prestaties en verbeterd gedrag.
Grok 4.6 is getraind op een breed scala aan agentische RL-taken, waaronder kenniswerk, algemeen coderen en domeinspecifieke omgevingen voor onder andere kerneloptimalisatie, webontwikkeling en computergestuurd ontwerp (CAD).
Ambitieuze ideeën omzetten in werkende projecten
We hebben Grok 4.6 getest met projecten die bedoeld waren om de reikwijdte en het vermogen van het model om werk over vele stappen vol te houden, op de proef te stellen. We stelden vast dat het model bijzonder sterk is in het omzetten van een breed productidee in een eerste werkende versie. Het kan onbekende domeinen onderzoeken, de applicatie structureren, de kerninteracties implementeren en het resultaat blijven verfijnen via verschillende feedbackrondes.
Bij langere trajecten zagen we bovendien meer zelf-testen en verificatie, waarbij het model het eigen werk controleert voordat het verdergaat.
Grok 4.6 produceert sterkere eerste versies van visuele en interactieve projecten dan we gewoonlijk zagen bij Grok 4.5. Uitgaande van een concreet productidee is het model in staat om in één pass de structuur en visuele taal voor een applicatie vast te stellen. Dit maakt het bijzonder nuttig voor projecten waarbij de snelste route naar een goed resultaat is om met iets substantieels te beginnen en vervolgens iteratief te verbeteren.
Veiligheid en capaciteiten
De waarborgen van Grok 4.6 zijn verbeterd en gekalibreerd in lijn met de mogelijkheden van het model. Onze veiligheidsstack is ontworpen om het nut en de beveiliging bij legitieme gebruiksscenario's te maximaliseren. Hierdoor kan Grok 4.6 behulpzaam en veilig zijn in domeinen zoals het patchen van kwetsbaarheden, het versnellen van de engineering-ontwerpcyclus en het ondersteunen van AI-onderzoek.
Ons werk aan de evaluatie van waarborgen weerspiegelt de uitgebreide capaciteiten van Grok 4.6, met onze grootste suite ooit van pre-deployment tests voor capaciteiten en kalibratie van waarborgen, evenals uitgebreide post-deployment tests en tests door derden.
Evaluaties (Evals)
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
De beste score per evaluatie is vetgedrukt. Scores van modellen van derden zijn de beste uit zelfgerapporteerde of publiekelijk beschikbare resultaten.
Aan de slag met Grok 4.6
Grok 4.6 is vandaag beschikbaar in Cursor en Grok Build. Het is ook beschikbaar via de API en andere partners zoals OpenRouter, Vercel en Cloudflare.
De prijzen beginnen bij $2 per miljoen input-tokens en $6 per miljoen output-tokens. Daarnaast is er een 'fast' variant die twee keer zo duur is.
We bieden 2x het inbegrepen verbruik aan binnen Grok Build en Cursor voor de eerste week, zodat je direct met 4.6 kunt beginnen.
Voor ontwikkelaars is het model beschikbaar via de SpaceXAI API en de bijbehorende documentatie. Je kunt ook gratis starten in Grok Build via x.ai/build.
Installatie via CLI: $ curl -fsSL https://x.ai/cli/install.sh | bash