OpenAI's GPT-6 Astra op ARC-AGI-3
Samenvatting
GPT-6 Astra behaalt een score van 62,7% voor $26.000 op ARC-AGI-3 Semi-Private met onze Standard harness (een harness die een model in staat stelt notities te bewaren gedurende de interactie met de omgeving) en 99,9% voor $19.000 met een Provider Adapter harness (een harness die de ondoorzichtige redeneringstoestand tussen verzoeken bewaart en compressie gebruikt voor langere gesprekken, waardoor het model eerder gedaan werk kan hergebruiken).
GPT-6 Astra overtreft de menselijke baseline in actie-efficiëntie op ARC-AGI-3; het model gebruikte op 96% van de levels minder acties dan de mediane geteste mens.
Een belangrijk geobserveerd gedrag bij GPT-6 Astra was het vermogen om onbekende omgevingen om te zetten in compacte symbolische wereldmodellen. Het model representeerde spelmechanismen als logische regels en ontwikkelde een eigen domeinspecifieke shorthand-taal om de status bij te houden en acties te plannen.
ARC-AGI-3
ARC-AGI-3 is een benchmark voor het bestuderen van agentische intelligentie via nieuwe, abstracte, turn-based omgevingen. Agenten moeten verkennen, doelen afleiden en interne modellen van omgevingen bouwen om effectief acties te plannen zonder expliciete instructies.
Deze omgevingen bevatten alleen kernkennis-priors en zijn door middel van gecontroleerd testen met menselijke participanten gekalibreerd op moeilijkheid. Mensen kunnen 100% van de omgevingen oplossen.
Het doel van de ARC-AGI-serie is om de "residuele kloof" tussen huidige kunstmatige intelligentie en AGI te meten. Wij definiëren AGI als het vermogen van een systeem om elke vaardigheid die een mens kan, even efficiënt te verwerven als een mens.
ARC-AGI-3 is de derde generatie van de ARC-AGI benchmark-serie en test agentische capaciteiten die verder gaan dan ARC-AGI-1 en ARC-AGI-2. Elke generatie bouwt voort op de vorige; naarmate de capaciteiten van frontier AI vorderen, moeten onze benchmarks mee evolueren.
ARC-AGI-3 test vier componenten van agentische intelligentie:
- Exploratie: In echte omgevingen wordt informatie zelden passief aangeboden. Agenten moeten deze actief verkrijgen door interactie met hun omgeving.
- Modellering: Agenten moeten ruwe observaties omzetten in een generaliseerbaar model dat toekomstige toestanden en uitkomsten kan voorspellen.
- Doelstelling: Agenten moeten doeltoestanden identificeren met slechts schaarse beloningen.
- Planning en uitvoering: Agenten moeten een pad uitzetten van hun huidige staat naar een doel, waarbij ze bijsturen zodra er nieuwe informatie verschijnt.
Resultaten van Astra
GPT-6 Astra behaalt state-of-the-art scores op ARC-AGI-3 met zowel de Standard als de Provider Adapter harness. Hogere redeneringsniveaus zijn over het algemeen goedkoper, omdat Astra spellen in minder acties oplost, wat het totale aantal modelaanroepen en tokens vermindert.
Met de Standard harness scoort OpenAI's Astra (max) 62,7% op ARC-AGI-3 Semi-Private voor $26.000. Met de Provider Adapter harness scoort Astra (high) 99,9% voor $19.000. Beiden zijn state-of-the-art scores.
Bij de maximale redeneerinspanning (max reasoning effort) lost Astra spellen efficiënter op, waardoor er minder acties nodig zijn en de totale kosten relatief lager liggen dan bij andere redeneringsniveaus.
| Redeneerinspanning | Standard harness | Provider Adapter harness |
|---|---|---|
| max | 62,7%, $26.098 | 98,6%, $17.332 |
| xhigh | 59,3%, $37.317 | 98,4%, $18.147 |
| high | 54,8%, $40.705 | 99,9%, $18.817 |
| medium | 38,6%, $48.090 | 98,4%, $19.285 |
| low | 17,5%, $38.166 | 98,0%, $21.298 |
| none | 35,2%, $49.791 | 96,7%, $23.457 |
Ter vergelijking van de kosten: tijdens ons gecontroleerde onderzoek kregen menselijke participanten $115 per sessie van 90 minuten betaald, plus $5 per voltooid spel. Participanten probeerden gemiddeld negen spellen per sessie, wat neerkomt op ongeveer $12,78 per geprobeerd spel vóór bonussen.
Het grootste deel van dit bedrag betaalt voor de tijd en bereidheid van de participant, niet voor de energie die het brein verbruikt. Als we alleen kijken naar de energie van het brein en dit prijzen als elektriciteit, daalt de schatting naar ongeveer 0,6 cent per sessie, of 0,067 cent per geprobeerd spel¹.
Analyse
Naast de scores laten de replays van Astra zien hoe het model onbekende spelmechanismen omzet in bruikbare werkmodellen. Drie bevindingen vielen op: de compacte algebraïsche notatie, de actie-efficiëntie vergeleken met mensen en de custom tools die het model bouwt.
Custom Algebraïsche Notatie
Bij het spelen van ARC-AGI-3 kiest Astra welke strategische notities het wil meenemen. Het hield objecten, coördinaten, regels en onvoltooide plannen bij, terwijl het ook gebruikmaakte van een eigen domeinspecifieke taalnotatie die het voor de omgevingen genereerde.
Astra distilleerde de scène tot een compact symbolisch model: waar objecten waren, hoe ze interacteerden en exact welke acties in welke volgorde moesten gebeuren. Dit is een on-the-fly algebraïsche shorthand in plaats van een volledige programmeertaal. Voorbeelden:
- Game state:
L8: hub q2 (8↓). Lengths: 14=1…(registreert het level, een lokale rotatie-index en mechanismelengtes). - Multi-step plans:
extend8 to3; retract10 to2; shorten8 to1(registreert een geordende reeks wijzigingen aan de kleur-8 en kleur-10 mechanismen). - Controls and coordinates:
9−=(39,4), rotate=(49,18), 14+=(59,11)(koppelt operaties aan de coördinaten van de controls die ze uitvoeren). - Time and position:
Turn 5: P=(24,20), empty, facing west(combineert een turn-teller met de locatie, status en oriëntatie van de speler).
Actie-efficiëntie vergeleken met mensen
Vóór de lancering van ARC-AGI-3 hebben we ongeveer 500 leden van het grote publiek getest om een menselijke baseline voor actie-efficiëntie vast te stellen (hoe snel mensen elk environment oplosten).
Voor elk level definieerden we de "menselijke baseline" op basis van het mediane aantal acties onder de spelers die het level voltooiden. Een AI die meer acties nodig heeft, is minder actie-efficiënt; een AI die er minder nodig heeft, is efficiënter.
In de Provider Adapter harness gebruikte Astra (max) op 96,0% van de levels minder acties dan de menselijke baseline en gebruikte het gemiddeld 51,7% minder acties per level. Dit is een belangrijke mijlpaal: volgens de maatstaf voor actie-efficiëntie van ARC-AGI-3 heeft Astra menselijke pariteit bereikt en overtroffen.
Voorheen hypotiseerden we dat actie-efficiëntie een scheidslijn tussen mensen en AI zou blijven, omdat AI aannemelijk meer exploratie (acties) zou nodig hebben. Dat blijft waar voor brute-force benaderingen, maar frontier AI vertoont een binair patroon: zodra het model de mechanieken "begrijpt", voert het de oplossing over het algemeen uit binnen de reikwijdte van menselijke efficiëntie.
Custom Tools in Agent Harness
We evalueerden Astra ook in de PRO-LONG harness, een vroege partner voor red-teaming van ARC-AGI-3. In deze geavanceerde opstelling had Astra toegang tot een sandbox waarin het custom code kon uitvoeren³.
We observeerden dat Astra voor elk spel een eigen set tools creëerde: board parsers, game-state modellen, zoekalgoritmen, planners en persistente notities. Voor complexere runs produceerde Astra zelfs kleine, spelspecifieke softwarebibliotheken.
Bijvoorbeeld in tu93, een doolhof-achtig spel met bewakers en patrouilles, begon Astra met navigatie en bouwde mazesolver.py. Het voegde gevechtsregels toe in combatsolver.py, modelleerde bewegende patrouilles in patrolsolver.py en gebruikte syncstate.py om voorspellingen te controleren aan de hand van observaties.
Omdat menselijke participanten in onze tests geen code-interpreter of scratchpad hadden, moeten de resultaten van PRO-LONG worden gezien als de gecombineerde prestatie van het model en zijn tools.
Twee Harnesses, Twee Vragen
Onze Standard harness voor ARC-AGI-3 onderzoekt hoe modellen zich verhouden onder dezelfde minimale, provider-neutrale interface. Het biedt alle informatie die nodig is om elk spel op te lossen, maar laat het model beslissen wat er in de zichtbare notities wordt bewaard. Wij geloven dat een toekomstige AGI in staat moet zijn ARC-AGI-3 onder deze omstandigheden op te lossen.
Er is echter een aparte vraag: hoe presteert een model wanneer het gebruik kan maken van de contextbeheersfuncties die de provider speciaal voor het model heeft ontworpen? Voor Astra betekent dit het bewaren van de ondoorzichtige redeneringstoestand tussen verzoeken en het gebruik van compressie voor langere gesprekken.
Met de Provider Adapter harness steeg de beste score van Astra op ARC-AGI-3 Semi-Private van 62,7% naar 99,9%. Over alle redeneringsniveaus waren de runs met de Provider Adapter ongeveer 3,66 keer sneller qua totale verstreken tijd en gebruikten ze 49% minder tokens voor de 167 spel-redenering paren die beide harnesses oplosten.
De ARC-AGI Serie
ARC-AGI-3 blijft een nuttige speeltuin voor onderzoekers en agenten om onbekende omgevingen te verkennen, regels te ontdekken en te leren door interactie. De resultaten van Astra vormen een belangrijke mijlpaal; vanuit ons perspectief vertegenwoordigt Astra een merkbare "step-function" verandering in de capaciteiten van frontier-modellen.
Bij de lancering van ARC-AGI-3 hebben we duidelijk gemaakt dat het verzadigen van de benchmark geen "bewijs voor het bereiken van AGI" is. Hoewel we geloven dat Astra een betekenisvolle vooruitgang richting generalisatie vertegenwoordigt, claimen we niet dat het AGI is.
De ARC-AGI benchmark-serie is ontworpen om mee te evolueren met frontier AI. ARC-AGI-3 was onze eerste interactieve benchmark, die van AI vroeg om efficiënt causale wereldmodellen te synthetiseren en doelen te bereiken zonder specifieke instructies. Astra haalt deze lat. Tegelijkertijd heeft ARC-AGI-3 een nauw afgebakend bereik en formaat, met deterministische, gesloten mechanieken en doelen. Het vertegenwoordigt niet de complexiteit en open-endedness van de echte wereld.
We onderzoeken momenteel welke vragen de volgende generatie benchmarks moeten vormen, waaronder hoe we recursieve zelfverbetering en open-ended innovatie kunnen evalueren. De vooruitgang van Astra helpt verduidelijken welke AI-capaciteiten nog buiten bereik liggen en welke vragen open blijven.
***
¹ Uitgaande van 20 W aan metabolische energie van het brein en een elektriciteitsprijs van $0,20/kWh: 0,020 kW × 1,5 uur = 0,030 kWh, wat $0,006 per sessie is, of $0,006 ÷ 9 ≈ $0,00067 per geprobeerd spel. ² Zie het paper over menselijke testen van ARC-AGI-3. ³ Er werd geen bewijs gevonden dat er geprobeerd werd uit de sandbox te ontsnappen.
Groetjes,