Dit artikel beschrijft de evaluatiemethodieken van Artificial Analysis voor het beoordelen van AI-modellen en API-providers. Centraal staat de Intelligence Index v4.1.1, die intelligentie meet via negen verschillende evaluaties en de kosten per taak analyseert. Daarnaast worden gespecialiseerde indices besproken voor coding agents, beeld-, video- en spraaktechnologie, evenals domeinspecifieke capability indices (zoals medisch en juridisch). Specifieke benchmarks zoals AA-Briefcase en AA-Omniscience testen respectievelijk complexe zakelijke workflows en de mate van hallucinaties. De analyse omvat ook een Openness Index voor transparantie en technische metrieken zoals tokensnelheid, latentie en prijsstelling. Tot slot wordt deaccuratesse van provider-endpoints onderzocht en de concurrentiestrijd tussen grote partijen en opkomende providers belicht.
AI Model & API Provider Analyse | Artificial Analysis
De Intelligence Index v4.1.1
De Artificial Analysis Intelligence Index (v4.1.1) is een onafhankelijke evaluatie van de intelligentie van vooraanstaande AI-modellen. Deze index is gebaseerd op negen verschillende evaluaties:
- GDPval-AA v2
- $\tau^3$-Banking
- Terminal-Bench v2.1
- SciCode
- Humanity's Last Exam
- GPQA Diamond
- CritPt
- AA-Omniscience
- AA-LCR
Kosten per taak (Cost per Task)
De "Cost per Task" is het gewogen gemiddelde van de kosten (in USD) per Intelligence Index-taak, onderverdeeld naar tokentype. Een lagere waarde is hierbij gunstiger. De kosten per taak worden berekend op basis van:
- Input-tokens
- Cache hits
- Cache writes
- Reasoning-tokens
- Answer-tokens
Deze kosten worden gedeeld door het aantal taken en gewogen volgens het gewicht van de betreffende evaluatie binnen de Intelligence Index.
Gespecialiseerde Indices
Coding Agent Index
Deze index meet de prestaties, kosten en uitvoeringstijd van vooraanstaande coding agents bij end-to-end software engineering-taken. De score is een composiet gemiddelde van pass@1 over DeepSWE, Terminal-Bench v2 en SWE-Atlas-QnA.
Image & Video Arena
De ranglijsten voor tekst-naar-beeld, beeldbewerking, tekst-naar-video, beeld-naar-video en videobewerking zijn gebaseerd op Elo-scores uit blinde voorkeurstemmen in de Image Arena en Video Arena.
Speech Arena
Voor spraaktechnologie worden modellen geëvalueerd op:
- Text to Speech (Elo-scores via blinde voorkeurstemmen)
- Speech to Text (AA-WER Index, zowel streaming als non-streaming)
- Speech to Speech Index
Capability Indices
Deze indices meten de prestaties van modellen binnen specifieke domeinen en industrieën:
- Agentic Index: Meet prestaties in agentische workflows, met focus op toolgebruik, planning, autonomie en complex probleemoplossend vermogen.
- Overige domeinen: Financiën & Accounting, Strategie & Ops, Juridisch, Gezondheidszorg & Medisch, Engineering en Economie.
Gedetailleerde Benchmarks
AA-Briefcase
AA-Briefcase is een evaluatie voor agentische kenniswerkzaamheden met een lange horizon. Het test agents op realistische zakelijke workflows waarbij deliverables zoals spreadsheets, presentaties en memo's vereist zijn. De AA-Briefcase Elo is een gecombineerde metriek van de rubric pass rate, analytische kwaliteit (Elo) en presentatiekwaliteit (Elo).
AA-Omniscience
Dit is een benchmark voor kennis en hallucinaties die accuratesse beloont en foutieve gissingen bestraft.
- AA-Omniscience Index: Meet betrouwbaarheid van kennis en hallucinaties. Correcte antwoorden worden beloond, hallucinaties worden bestraft; het weigeren om te antwoorden levert geen strafpunten op. Scores lopen van -100 tot 100.
GDPval-AA v2
GDPval-AA v2 evalueert AI-modellen op basis van economisch waardevolle taken uit de echte wereld over een breed scala aan beroepen. De Elo-rating is verankerd aan een menselijke baseline van 1.000.
Openness Index
De Artificial Analysis Openness Index beoordeelt hoe 'open' modellen zijn op basis van beschikbaarheid en transparantie. De score (maximaal 18) wordt bepaald door:
- Transparantie van pre-training data
- Transparantie van post-training data
- Transparantie van de methodologie
- Modelbeschikbaarheid
Technische Metrieken en Prestaties
Output Tokens
De index meet het gewogen gemiddelde aantal output-tokens dat nodig is om één taak in de Intelligence Index uit te voeren. Dit wordt berekend door de output-tokens per evaluatie te vermenigvuldigen met het relatieve gewicht van die benchmark, gedeeld door het aantal taken (exclusief herhalingen).
Snelheid en Latentie
- Output Speed: Het aantal tokens per seconde dat wordt ontvangen terwijl het model tokens genereert (na ontvangst van het eerste fragment bij streaming-ondersteuning).
- Time per Intelligence Index Task: De gewogen gemiddelde decode-tijd (in minuten) per taak, exclusief TTFT (Time To First Token) en overhead. Dit wordt berekend door de output-tokens per taak te delen door de outputsnelheid.
Pricing
De prijsanalyse kijkt naar:
- Cache Hit: De prijs per token voor gecachte prompts (reeds verwerkte data), wat doorgaans een aanzienlijke korting biedt ten opzichte van de reguliere inputprijs.
- Blended Price: Een gecombineerde prijsmetriek.
Provider Analyse
Endpoint Accuracy Index
Deze index meet in hoeverre een specifieke provider-endpoint de accuratesse van het referentiemodel behoudt. De score is een composiet van BFCL v4-500, HLE-250 en AA-LCR-25.
- Een score van 100% betekent dat de endpoint overeenkomt met de referentie.
- Lagere scores wijzen op accuratesseverlies door quantisatie, sampling-defaults of andere configuraties aan de zijde van de endpoint.
Concurrentie tussen Providers
Er is een trend waarbij kleinere, opkomende providers hoge outputsnelheden bieden tegen competitieve prijzen in vergelijking met grotere partijen. In deze analyse worden providers zoals Amazon, Azure, Cerebras, Cloudflare, Groq en anderen vergeleken op basis van de balans tussen snelheid en prijs.
AI Model & API Provider Analyse | Artificial Analysis
De Intelligence Index v4.1.1
De Artificial Analysis Intelligence Index (v4.1.1) is een onafhankelijke evaluatie van de intelligentie van vooraanstaande AI-modellen. Deze index is gebaseerd op negen verschillende evaluaties:
- GDPval-AA v2
- $\tau^3$-Banking
- Terminal-Bench v2.1
- SciCode
- Humanity's Last Exam
- GPQA Diamond
- CritPt
- AA-Omniscience
- AA-LCR
Kosten per taak (Cost per Task)
De "Cost per Task" is het gewogen gemiddelde van de kosten (in USD) per Intelligence Index-taak, onderverdeeld naar tokentype. Een lagere waarde is hierbij gunstiger. De kosten per taak worden berekend op basis van:
- Input-tokens
- Cache hits
- Cache writes
- Reasoning-tokens
- Answer-tokens
Deze kosten worden gedeeld door het aantal taken en gewogen volgens het gewicht van de betreffende evaluatie binnen de Intelligence Index.
Gespecialiseerde Indices
Coding Agent Index
Deze index meet de prestaties, kosten en uitvoeringstijd van vooraanstaande coding agents bij end-to-end software engineering-taken. De score is een composiet gemiddelde van pass@1 over DeepSWE, Terminal-Bench v2 en SWE-Atlas-QnA.
Image & Video Arena
De ranglijsten voor tekst-naar-beeld, beeldbewerking, tekst-naar-video, beeld-naar-video en videobewerking zijn gebaseerd op Elo-scores uit blinde voorkeurstemmen in de Image Arena en Video Arena.
Speech Arena
Voor spraaktechnologie worden modellen geëvalueerd op:
- Text to Speech (Elo-scores via blinde voorkeurstemmen)
- Speech to Text (AA-WER Index, zowel streaming als non-streaming)
- Speech to Speech Index
Capability Indices
Deze indices meten de prestaties van modellen binnen specifieke domeinen en industrieën:
- Agentic Index: Meet prestaties in agentische workflows, met focus op toolgebruik, planning, autonomie en complex probleemoplossend vermogen.
- Overige domeinen: Financiën & Accounting, Strategie & Ops, Juridisch, Gezondheidszorg & Medisch, Engineering en Economie.
Gedetailleerde Benchmarks
AA-Briefcase
AA-Briefcase is een evaluatie voor agentische kenniswerkzaamheden met een lange horizon. Het test agents op realistische zakelijke workflows waarbij deliverables zoals spreadsheets, presentaties en memo's vereist zijn. De AA-Briefcase Elo is een gecombineerde metriek van de rubric pass rate, analytische kwaliteit (Elo) en presentatiekwaliteit (Elo).
AA-Omniscience
Dit is een benchmark voor kennis en hallucinaties die accuratesse beloont en foutieve gissingen bestraft.
- AA-Omniscience Index: Meet betrouwbaarheid van kennis en hallucinaties. Correcte antwoorden worden beloond, hallucinaties worden bestraft; het weigeren om te antwoorden levert geen strafpunten op. Scores lopen van -100 tot 100.
GDPval-AA v2
GDPval-AA v2 evalueert AI-modellen op basis van economisch waardevolle taken uit de echte wereld over een breed scala aan beroepen. De Elo-rating is verankerd aan een menselijke baseline van 1.000.
Openness Index
De Artificial Analysis Openness Index beoordeelt hoe 'open' modellen zijn op basis van beschikbaarheid en transparantie. De score (maximaal 18) wordt bepaald door:
- Transparantie van pre-training data
- Transparantie van post-training data
- Transparantie van de methodologie
- Modelbeschikbaarheid
Technische Metrieken en Prestaties
Output Tokens
De index meet het gewogen gemiddelde aantal output-tokens dat nodig is om één taak in de Intelligence Index uit te voeren. Dit wordt berekend door de output-tokens per evaluatie te vermenigvuldigen met het relatieve gewicht van die benchmark, gedeeld door het aantal taken (exclusief herhalingen).
Snelheid en Latentie
- Output Speed: Het aantal tokens per seconde dat wordt ontvangen terwijl het model tokens genereert (na ontvangst van het eerste fragment bij streaming-ondersteuning).
- Time per Intelligence Index Task: De gewogen gemiddelde decode-tijd (in minuten) per taak, exclusief TTFT (Time To First Token) en overhead. Dit wordt berekend door de output-tokens per taak te delen door de outputsnelheid.
Pricing
De prijsanalyse kijkt naar:
- Cache Hit: De prijs per token voor gecachte prompts (reeds verwerkte data), wat doorgaans een aanzienlijke korting biedt ten opzichte van de reguliere inputprijs.
- Blended Price: Een gecombineerde prijsmetriek.
Provider Analyse
Endpoint Accuracy Index
Deze index meet in hoeverre een specifieke provider-endpoint de accuratesse van het referentiemodel behoudt. De score is een composiet van BFCL v4-500, HLE-250 en AA-LCR-25.
- Een score van 100% betekent dat de endpoint overeenkomt met de referentie.
- Lagere scores wijzen op accuratesseverlies door quantisatie, sampling-defaults of andere configuraties aan de zijde van de endpoint.
Concurrentie tussen Providers
Er is een trend waarbij kleinere, opkomende providers hoge outputsnelheden bieden tegen competitieve prijzen in vergelijking met grotere partijen. In deze analyse worden providers zoals Amazon, Azure, Cerebras, Cloudflare, Groq en anderen vergeleken op basis van de balans tussen snelheid en prijs.