Aankondiging Artificial Analysis Intelligence Index v4.2

We versnellen bepaalde elementen van onze komende v5-release met interim-updates om het tempo van de frontier-modellen bij te houden. Index v4.2 bevat complexere en realistischere taken, en meer private testsets om manipulatie (gaming) te voorkomen.

Changelog van de Intelligence Index v4.2:

  • + AA-Briefcase: onze evaluatie voor agentisch kenniswerk met een private testset.
  • + Surge’s GDP.pdf: redeneren over documenten met een lange context over 4.592 PDF-pagina's.
  • - GPQA Diamond: een uitzonderlijke evaluatie voor wetenschappelijk redeneren die inmiddels verzadigd is.
  • Overig: een grotere weging van niet-gepubliceerde (held-out) testsets om manipulatie te voorkomen en upgrades aan de graderingsinfrastructuur om de robuustheid te verhogen.

Deze update brengt de Index dichter bij real-world use cases door meer uitdagende, complexe en realistischere taken en private testsets te introduceren. We zijn al maanden bezig met het plannen en bouwen van elementen voor Index v5; het is inmiddels acht maanden geleden dat we Index v4 in januari hebben gelanceerd.

We hebben updates bewust tegengehouden om de Index stabiel te houden tijdens recente grote modellanceringen. Gezien de snelheid waarmee de frontier de afgelopen weken is bewogen, achten we het echter belangrijk om direct een interim-update te leveren, zodat onze Index relevant en nuttig blijft voor gebruikers.

Naast deze interim-update werkt ons team hard aan v5 van de Index. We plannen in de nabije toekomst meer incrementele releases.

---

Details van de wijzigingen in Intelligence Index v4.2

Toevoeging van AA-Briefcase Onze eigen evaluatie met een private, niet-gepubliceerde testset. AA-Briefcase test modellen op realistisch agentisch kenniswerk binnen complexe projecten die zijn gebouwd door experts uit de industrie. Modellen worden geëvalueerd op kenniswerkprojecten die meerdere weken beslaan, elk met veel gekoppelde taken en duizenden inputbestanden. AA-Briefcase combineert rubric-gradering en pairwise-gradering om verifieerbaar succes van taken, analytische kwaliteit en presentatiekwaliteit te evalueren, wat een holistisch beeld geeft van de algehele agentische capaciteiten bij kenniswerk.

Toevoeging van GDP.pdf Ontwikkeld door Surge AI; GDP.pdf evalueert professioneel documentredenering in een enkele turn over 100 PDF's en tien domeinen. Modellen moeten bewijsmateriaal synthetiseren dat verspreid is over 4.592 pagina's, inclusief tekst, tabellen, grafieken, voetnoten en uitsluitingen. Antwoorden worden getoetst aan 1.275 door experts geschreven atomaire criteria; de headline All-pass Rate kent een taak alleen als elke criterion is vervuld.

Weging ter voorkoming van manipulatie 40% van de weging van onze Index bestaat nu uit private, niet-gepubliceerde testsets — een verdubbeling ten opzichte van v4.1. Deze data omvatten AA-Briefcase, AA-Omniscience en oplossingen voor CritPt. Dit vermindert de mogelijkheid voor labs om evaluaties te manipuleren. Het percentage niet-gepubliceerde data zal in Index v5 verder toenemen.

Verbetering van de graderingsinfrastructuur In AA-LCR v1.1 hebben we een systeemprompt voor gradering toegevoegd en fouten en ambiguïteiten in antwoordsleutels gecorrigeerd, wat de nauwkeurigheid van de scoring verbetert. Voor GDPval-AA v2 en AA-Briefcase hebben we de sampling verbeterd en de Elo-schaal opnieuw verankerd, waardoor ratings stabieler worden wanneer er nieuwe modellen worden toegevoegd. Voor SciCode hebben we de robuustheid van de graderings-sandboxes verbeterd om ervoor te zorgen dat trage, maar correcte code niet als een fout wordt geteld.

---

Belangrijkste resultaten

Anthropic en OpenAI leiden de Index Anthropic’s Claude Fable 5.1 voert de Index aan, gevolgd door OpenAI’s GPT-6 Astra, die een winst van 4 punten laat zien ten opzichte van GPT-5.6 Sol. Meta is het derde gelijkt ranked lab op de leaderboard, gevolgd door SpaceXAI, Moonshot/Kimi, Z.AI en Google.

Pareto-front voor kosten per taak Vier labs delen het bijgewerkte Cost per Task Pareto-front: Anthropic, OpenAI, Meta en Z.AI.

GPT-6 Astra domineert het output-token-front GPT-6 Astra is efficiënter met tokens dan bijna elk ander model nabij de intelligence-frontier. Claude Fable 5.1, Grok 4.5 en Gemini 3.5 Flash-Lite bevinden zich aan de uiteinden van de curve (modellen onder de 25 op de Index zijn uitgesloten).

Resultaten AA-Briefcase Anthropic’s Claude Fable 5.1 en Opus 5 leiden AA-Briefcase, gevolgd door GPT-6 Astra en Muse Spark 1.3. GPT-6 Astra laat een aanzienlijke winst zien ten opzichte van GPT-5.6 Sol van ongeveer 85 Elo-punten.

Resultaten GDP.pdf OpenAI leidt GDP.pdf met GPT-6 Astra op 33,2% en GPT-5.6 Sol op 28,2%, gevolgd door Claude Fable 5.1 op 26,2%.