AI Model & API Provider Analyse | Artificial Analysis

De Intelligence Index v4.1.1

De Artificial Analysis Intelligence Index (v4.1.1) is een onafhankelijke evaluatie van de intelligentie van vooraanstaande AI-modellen. Deze index is gebaseerd op negen verschillende evaluaties:

  • GDPval-AA v2
  • $\tau^3$-Banking
  • Terminal-Bench v2.1
  • SciCode
  • Humanity's Last Exam
  • GPQA Diamond
  • CritPt
  • AA-Omniscience
  • AA-LCR

Kosten per taak (Cost per Task)

De "Cost per Task" is het gewogen gemiddelde van de kosten (in USD) per Intelligence Index-taak, onderverdeeld naar tokentype. Een lagere waarde is hierbij gunstiger. De kosten per taak worden berekend op basis van:

  • Input-tokens
  • Cache hits
  • Cache writes
  • Reasoning-tokens
  • Answer-tokens

Deze kosten worden gedeeld door het aantal taken en gewogen volgens het gewicht van de betreffende evaluatie binnen de Intelligence Index.

Gespecialiseerde Indices

Coding Agent Index

Deze index meet de prestaties, kosten en uitvoeringstijd van vooraanstaande coding agents bij end-to-end software engineering-taken. De score is een composiet gemiddelde van pass@1 over DeepSWE, Terminal-Bench v2 en SWE-Atlas-QnA.

Image & Video Arena

De ranglijsten voor tekst-naar-beeld, beeldbewerking, tekst-naar-video, beeld-naar-video en videobewerking zijn gebaseerd op Elo-scores uit blinde voorkeurstemmen in de Image Arena en Video Arena.

Speech Arena

Voor spraaktechnologie worden modellen geëvalueerd op:

  • Text to Speech (Elo-scores via blinde voorkeurstemmen)
  • Speech to Text (AA-WER Index, zowel streaming als non-streaming)
  • Speech to Speech Index

Capability Indices

Deze indices meten de prestaties van modellen binnen specifieke domeinen en industrieën:

  • Agentic Index: Meet prestaties in agentische workflows, met focus op toolgebruik, planning, autonomie en complex probleemoplossend vermogen.
  • Overige domeinen: Financiën & Accounting, Strategie & Ops, Juridisch, Gezondheidszorg & Medisch, Engineering en Economie.

Gedetailleerde Benchmarks

AA-Briefcase

AA-Briefcase is een evaluatie voor agentische kenniswerkzaamheden met een lange horizon. Het test agents op realistische zakelijke workflows waarbij deliverables zoals spreadsheets, presentaties en memo's vereist zijn. De AA-Briefcase Elo is een gecombineerde metriek van de rubric pass rate, analytische kwaliteit (Elo) en presentatiekwaliteit (Elo).

AA-Omniscience

Dit is een benchmark voor kennis en hallucinaties die accuratesse beloont en foutieve gissingen bestraft.

  • AA-Omniscience Index: Meet betrouwbaarheid van kennis en hallucinaties. Correcte antwoorden worden beloond, hallucinaties worden bestraft; het weigeren om te antwoorden levert geen strafpunten op. Scores lopen van -100 tot 100.

GDPval-AA v2

GDPval-AA v2 evalueert AI-modellen op basis van economisch waardevolle taken uit de echte wereld over een breed scala aan beroepen. De Elo-rating is verankerd aan een menselijke baseline van 1.000.

Openness Index

De Artificial Analysis Openness Index beoordeelt hoe 'open' modellen zijn op basis van beschikbaarheid en transparantie. De score (maximaal 18) wordt bepaald door:

  • Transparantie van pre-training data
  • Transparantie van post-training data
  • Transparantie van de methodologie
  • Modelbeschikbaarheid

Technische Metrieken en Prestaties

Output Tokens

De index meet het gewogen gemiddelde aantal output-tokens dat nodig is om één taak in de Intelligence Index uit te voeren. Dit wordt berekend door de output-tokens per evaluatie te vermenigvuldigen met het relatieve gewicht van die benchmark, gedeeld door het aantal taken (exclusief herhalingen).

Snelheid en Latentie

  • Output Speed: Het aantal tokens per seconde dat wordt ontvangen terwijl het model tokens genereert (na ontvangst van het eerste fragment bij streaming-ondersteuning).
  • Time per Intelligence Index Task: De gewogen gemiddelde decode-tijd (in minuten) per taak, exclusief TTFT (Time To First Token) en overhead. Dit wordt berekend door de output-tokens per taak te delen door de outputsnelheid.

Pricing

De prijsanalyse kijkt naar:

  • Cache Hit: De prijs per token voor gecachte prompts (reeds verwerkte data), wat doorgaans een aanzienlijke korting biedt ten opzichte van de reguliere inputprijs.
  • Blended Price: Een gecombineerde prijsmetriek.

Provider Analyse

Endpoint Accuracy Index

Deze index meet in hoeverre een specifieke provider-endpoint de accuratesse van het referentiemodel behoudt. De score is een composiet van BFCL v4-500, HLE-250 en AA-LCR-25.

  • Een score van 100% betekent dat de endpoint overeenkomt met de referentie.
  • Lagere scores wijzen op accuratesseverlies door quantisatie, sampling-defaults of andere configuraties aan de zijde van de endpoint.

Concurrentie tussen Providers

Er is een trend waarbij kleinere, opkomende providers hoge outputsnelheden bieden tegen competitieve prijzen in vergelijking met grotere partijen. In deze analyse worden providers zoals Amazon, Azure, Cerebras, Cloudflare, Groq en anderen vergeleken op basis van de balans tussen snelheid en prijs.