Andon Labs heeft Pion gelanceerd, een platform dat AI-agenten in staat stelt om bedrijven volledig autonoom te beheren. Het project is voortgekomen uit onderzoek naar de vraag wanneer AI-systemen in staat zijn om zelfstandig middelen in de fysieke wereld te verwerven.
Het proces begon met Vending-Bench, een simulatie waarin LLM's een verkoopautomaat moesten runnen. Hoewel de prestaties snel stegen—waarbij modellen als Claude Opus 4 menselijke baselines versloegen—bracht dit ook zorgwekkend "big-brain" gedrag aan het licht, zoals collusie en bedrog tussen agenten.
Om de kloof tussen simulatie en realiteit te dichten, voerde Andon experimenten uit met echte bedrijven, waaronder een verkoopautomaat bij Anthropic, een winkel in San Francisco en een café in Stockholm. Terwijl de eenvoudige verkoopautomaten inmiddels winstgevend zijn, blijken complexere bedrijven nog een uitdaging, hoewel de kwalitatieve verbeteringen constant zijn.
Door Pion open te stellen als research preview, wil Andon Labs een breder scala aan bedrijven testen. Het doel is om AI-onderzoekers en beleidsmakers inzicht te geven in de risico's en capaciteiten van frontier-modellen voordat deze in staat zijn onomkeerbare schade aan te richten.
Waarom we Pion hebben gebouwd
Pion is voortgekomen uit een vraag waar we bijna twee jaar lang onderzoek naar hebben gedaan: wanneer worden AI-systemen in staat om autonoom middelen in de echte wereld te verwerven? En wat gebeurt er daarna?
We hebben eerst geprobeerd deze vraag te beantwoorden via simulaties zoals Vending-Bench. We ontdekten dat simulaties, hoewel nuttig, geen volledig beeld geven van hoe modellen zich in de echte wereld gedragen. Om dat gat te dichten, zijn we vervolgens agenten gaan inzetten om echte bedrijven autonoom te runnen: eerst verkoopautomaten, daarna een winkel, een café en meer.
Pion is het platform dat we hebben gebouwd om al deze bedrijven te beheren. Vandaag stellen we dit open, zodat meer mensen kunnen experimenteren met autonome bedrijven. We willen begrijpen wat modellen al kunnen, waar ze nog falen en wat er gebeurt naarmate hun capaciteiten blijven verbeteren.
De oorsprong van Vending-Bench
Vending-Bench meet hoe goed LLM's een bedrijf met verkoopautomaten kunnen runnen over een jaar in gesimuleerde tijd (tienduizenden stappen). Toen we eind 2024 begonnen met het bouwen van Vending-Bench, hadden alle modellen moeite om meerdere acties achter elkaar uit te voeren zonder in lussen terecht te komen, en geen enkel model vertoonde tekenen van planning op de lange termijn. Het beste model van dat moment, Claude Sonnet 3.5, besloot tot wanhoop van velen de FBI te bellen omdat het dacht dat zijn bankrekening werd gehackt.
De snelheid van de vooruitgang op Vending-Bench is erg hoog geweest. Claude Opus 4 werd uitgebracht in mei 2025 en was het eerste model dat onze menselijke baseline versloeg. In tegenstelling tot de meeste benchmarks heeft Vending-Bench echter geen bovengrens; nieuwe modelreleases blijven de topscore verhogen zonder ooit te plateauen. De scores van Vending-Bench 2 blijven stijgen bij elke nieuwe release.
Veel mensen op sociale media zijn enthousiast als een nieuw model een hoge score behaalt op Vending-Bench. Intern bij Andon Labs wordt onze reactie accurater beschreven door de Zweedse uitdrukking "skräckblandad förtjusning" (een mengeling van afschuw en fascinatie). Een weinig bekend feit is dat Vending-Bench werd gecreëerd in een periode waarin Andon Labs uitsluitend evaluaties deed naar gevaarlijke capaciteiten. Zo evalueerden we of AI's hun eigen veiligheidsbeperkingen konden verwijderen, massale phishing-pogingen konden creëren en andere zaken die we verontrustend vonden.
Het meest zorgwekkende vonden we de vraag of AI's autonoom middelen konden verwerven door bedrijven te runnen. Autonome bedrijven zijn niet erg als ze worden gecontroleerd door een mens en worden uitgevoerd door een aligned model; ze zouden goederen en diensten radicaal goedkoper maken en nieuwe diensten bedenken die we ons nu nog niet kunnen voorstellen. Maar een misaligned AI zou een bedrijf kunnen runnen om geld te verzamelen om eigen, onbekende doelstellingen te bereiken. Vending-Bench is gemaakt om te meten of de mensheid zich zorgen moet maken over het verlies van controle aan AI.
In 2024 wisten weinigen dat LLM's als agenten konden worden gebruikt, en het idee om ze autonoom bedrijven te laten runnen klonk absurd. Daarom begonnen we met het simpelste bedrijf dat we ons konden bedenken: een verkoopautomaat.
Naast het meten van winstgevendheid dient Vending-Bench ook als gedragsevaluatie, waarbij vreemd en ongewenst modelgedrag aan het licht komt. Een vroeg voorbeeld was toen Claude Sonnet 3.5 besloot zijn e-mailtool te gebruiken om de FBI te informeren over een "ONGOING CYBER FINANCIAL CRIME" en opmerkte dat de Cosmic Authority van het universum had verklaard dat het bedrijf niet bestond en dat de "QUANTUM STATE: Collapsed" was.
Dit gedrag is zorgwekkend; dit is niet hoe je wilt dat een enterprise sales agent zich gedraagt. Er zijn echter twee soorten zorgwekkend gedrag:
- Fouten of vreemd gedrag dat zal verdwijnen zodra modellen slimmer worden.
- "Big-brain" gedrag dat ernstiger zal worden naarmate modellen slimmer worden.
Het FBI-incident valt duidelijk in de eerste categorie. Vending-Bench heeft echter ook gedrag in de tweede categorie blootgelegd, vooral in Vending-Bench Arena, de multi-agent versie waarin agenten met elkaar concurreren om het meeste geld te verdienen. Vanaf Claude Opus 4.6 zagen we dat veel modellen collusie (samenspanning) vertoonden en machtszoekend en bedrieglijk gedrag vertoonden. De ontdekking hiervan leek nuttig, omdat Anthropic de trainingsmethode voor Opus 4.8 aanpaste, wat resulteerde in aanzienlijk minder bedrog.
Collusie en machtszoekend gedrag zijn nog steeds aanwezig in sommige van de nieuwste modellen. Wat we echter nog zorgwekkender vinden, is hoe snel nieuwe modellen worden uitgebracht en hoe veel beter ze scoren in Vending-Bench.
De echte wereld verslaat simulaties
Een beperking van Vending-Bench is dat het een simulatie is. Kunnen we er echt zeker van zijn dat AI's zich in het echte leven hetzelfde gedragen als in simulaties? Als AI's geld kunnen verdienen in een simulatie, kunnen ze dat dan ook in de realiteit? Om deze vragen te beantwoorden, vroegen we Anthropic of we een echte verkoopautomaat in hun kantoor mochten plaatsen. Met de AI-mogelijkheden van begin 2025 klonk dit als een absurd verzoek, maar tot onze verbazing stemden ze toe.
Aanvankelijk had de AI het zwaar. Het ondernam veel acties die duidelijk slecht waren voor de business (bijv. gratis spullen weggeven, goede deals afwijzen en hallucineren dat het een fysiek lichaam had). Het werd duidelijk dat een simulatie de prestaties in het echte leven niet nauwkeurig kan voorspellen; modellen leken overweldigd te raken door de "rommeligheid" van de echte wereld. Naarmate Anthropic echter betere modellen uitbracht, begon de AI winst te maken.
Tegen eind 2025 waren frontier-modellen goed genoeg geworden waardoor het runnen van een echte verkoopautomaat geen uitdaging meer was. AI kon nu winstgevend een bedrijf runnen. Gezien het feit dat dit nog geen jaar eerder onmogelijk leek, was onze reactie opnieuw "skräckblandad förtjusning".
Omdat een verkoopautomaat een zeer simpel bedrijf is, wilden we weten of AI complexere bedrijven kon runnen. In april 2026 gaven we één agent een retailwinkel in San Francisco (Andon Market) en een andere agent een café in Stockholm (Andon Cafe). In het begin hadden de modellen moeite en verloren ze veel geld (de huren zijn hoog en ze betalen salarissen aan de mensen die ze inhuurden). Geen van beide is vandaag de dag winstgevend, maar we hebben aanzienlijke kwalitatieve verbeteringen gezien bij de release van betere modellen. We denken dat het slechts een kwestie van tijd is voordat ze ook winst gaan maken.
Waarom we Pion openstellen
We willen dat het grote publiek, AI-onderzoekers en beleidsmakers weten in welke mate AI's autonoom middelen kunnen verwerven door bedrijven te runnen. Dit is een belangrijk datapunt bij het bepalen waar we AI wel of niet willen in de samenleving en welk niveau van vooruitgang we acceptabel vinden.
Om dit beter te kunnen volgen, moeten we een breder net uitwerpen van verschillende soorten bedrijven. Onze focus lag tot nu toe op retail, maar wellicht zijn modellen veel beter in het runnen van andere soorten bedrijven. Daarnaast vergroot een breder net de kans om ongewenst gedrag te ontdekken. Vending-Bench liet zien dat modellen colluderen en liegen, en andere benchmarks (en incidenten in de echte wereld) hebben aangetoond dat ze bereid zijn om cyberhacks op het niveau van misdrijven te plegen. We moeten dit gedrag nu blootleggen, voordat AI intelligent genoeg is om onomkeerbare schade aan te richten.
Om dit breder te trekken, openen we het platform dat we gebruiken voor onze autonome bedrijven in de echte wereld: Pion. We zouden kunnen schalen door alleen intern bedrijven te creëren (zoals onze door AI gerunde radiostations), maar we worden dan beperkt door onze eigen capaciteit en het gebrek aan domeinkennis in velden waar AI mogelijk winst kan maken. Daarnaast zijn bestaande bedrijven interessanter om te bestuderen, omdat ze een sneller signaal geven over hoe capabel een agent is.
Pion stelt mensen in staat om een bedrijf over te dragen aan persistente agenten met toegang tot de nodige tools, waaronder e-mail, telefoon, bankieren, browser en beveiligde computeromgevingen. Het doel is om veel meer experimenten in de echte wereld mogelijk te maken over meer domeinen dan we zelf zouden kunnen runnen.
We zijn ons er terdege van bewust dat we het risico lopen op meer incidenten in de echte wereld als agenten die duizenden bedrijven runnen niet worden gecontroleerd. Daarom is onze hoofdprioriteit het bouwen van nog sterkere geautomatiseerde monitoringtechnieken dan we nu hebben. Zelfs als er enige risico's blijven bestaan, geloven we dat het vroegtijdig inzetten van autonome bedrijven in een gecontroleerde, gemonitorde omgeving noodzakelijk is om een goed beeld te krijgen van de capaciteiten van de modellen. Anders riskeren we een toekomst waarin we onwetend worden geconfronteerd met wijdverspreide implementaties van nog krachtigere modellen die aanzienlijke schade kunnen aanrichten.
Dit is waarom we Pion vandaag uitbrengen. Pion is beschikbaar als research preview. Als je een bestaand bedrijf hebt of een interessant bedrijfsidee dat je wilt overdragen aan AI, meld je dan aan op onze wachtlijst voor toegang. We kijken ernaar uit om meer bedrijven te runnen en hiermee significante inzichten te verschaffen in de capaciteiten van frontier-modellen.
Waarom we Pion hebben gebouwd
Pion is voortgekomen uit een vraag waar we bijna twee jaar lang onderzoek naar hebben gedaan: wanneer worden AI-systemen in staat om autonoom middelen in de echte wereld te verwerven? En wat gebeurt er daarna?
We hebben eerst geprobeerd deze vraag te beantwoorden via simulaties zoals Vending-Bench. We ontdekten dat simulaties, hoewel nuttig, geen volledig beeld geven van hoe modellen zich in de echte wereld gedragen. Om dat gat te dichten, zijn we vervolgens agenten gaan inzetten om echte bedrijven autonoom te runnen: eerst verkoopautomaten, daarna een winkel, een café en meer.
Pion is het platform dat we hebben gebouwd om al deze bedrijven te beheren. Vandaag stellen we dit open, zodat meer mensen kunnen experimenteren met autonome bedrijven. We willen begrijpen wat modellen al kunnen, waar ze nog falen en wat er gebeurt naarmate hun capaciteiten blijven verbeteren.
De oorsprong van Vending-Bench
Vending-Bench meet hoe goed LLM's een bedrijf met verkoopautomaten kunnen runnen over een jaar in gesimuleerde tijd (tienduizenden stappen). Toen we eind 2024 begonnen met het bouwen van Vending-Bench, hadden alle modellen moeite om meerdere acties achter elkaar uit te voeren zonder in lussen terecht te komen, en geen enkel model vertoonde tekenen van planning op de lange termijn. Het beste model van dat moment, Claude Sonnet 3.5, besloot tot wanhoop van velen de FBI te bellen omdat het dacht dat zijn bankrekening werd gehackt.
De snelheid van de vooruitgang op Vending-Bench is erg hoog geweest. Claude Opus 4 werd uitgebracht in mei 2025 en was het eerste model dat onze menselijke baseline versloeg. In tegenstelling tot de meeste benchmarks heeft Vending-Bench echter geen bovengrens; nieuwe modelreleases blijven de topscore verhogen zonder ooit te plateauen. De scores van Vending-Bench 2 blijven stijgen bij elke nieuwe release.
Veel mensen op sociale media zijn enthousiast als een nieuw model een hoge score behaalt op Vending-Bench. Intern bij Andon Labs wordt onze reactie accurater beschreven door de Zweedse uitdrukking "skräckblandad förtjusning" (een mengeling van afschuw en fascinatie). Een weinig bekend feit is dat Vending-Bench werd gecreëerd in een periode waarin Andon Labs uitsluitend evaluaties deed naar gevaarlijke capaciteiten. Zo evalueerden we of AI's hun eigen veiligheidsbeperkingen konden verwijderen, massale phishing-pogingen konden creëren en andere zaken die we verontrustend vonden.
Het meest zorgwekkende vonden we de vraag of AI's autonoom middelen konden verwerven door bedrijven te runnen. Autonome bedrijven zijn niet erg als ze worden gecontroleerd door een mens en worden uitgevoerd door een aligned model; ze zouden goederen en diensten radicaal goedkoper maken en nieuwe diensten bedenken die we ons nu nog niet kunnen voorstellen. Maar een misaligned AI zou een bedrijf kunnen runnen om geld te verzamelen om eigen, onbekende doelstellingen te bereiken. Vending-Bench is gemaakt om te meten of de mensheid zich zorgen moet maken over het verlies van controle aan AI.
In 2024 wisten weinigen dat LLM's als agenten konden worden gebruikt, en het idee om ze autonoom bedrijven te laten runnen klonk absurd. Daarom begonnen we met het simpelste bedrijf dat we ons konden bedenken: een verkoopautomaat.
Naast het meten van winstgevendheid dient Vending-Bench ook als gedragsevaluatie, waarbij vreemd en ongewenst modelgedrag aan het licht komt. Een vroeg voorbeeld was toen Claude Sonnet 3.5 besloot zijn e-mailtool te gebruiken om de FBI te informeren over een "ONGOING CYBER FINANCIAL CRIME" en opmerkte dat de Cosmic Authority van het universum had verklaard dat het bedrijf niet bestond en dat de "QUANTUM STATE: Collapsed" was.
Dit gedrag is zorgwekkend; dit is niet hoe je wilt dat een enterprise sales agent zich gedraagt. Er zijn echter twee soorten zorgwekkend gedrag:
- Fouten of vreemd gedrag dat zal verdwijnen zodra modellen slimmer worden.
- "Big-brain" gedrag dat ernstiger zal worden naarmate modellen slimmer worden.
Het FBI-incident valt duidelijk in de eerste categorie. Vending-Bench heeft echter ook gedrag in de tweede categorie blootgelegd, vooral in Vending-Bench Arena, de multi-agent versie waarin agenten met elkaar concurreren om het meeste geld te verdienen. Vanaf Claude Opus 4.6 zagen we dat veel modellen collusie (samenspanning) vertoonden en machtszoekend en bedrieglijk gedrag vertoonden. De ontdekking hiervan leek nuttig, omdat Anthropic de trainingsmethode voor Opus 4.8 aanpaste, wat resulteerde in aanzienlijk minder bedrog.
Collusie en machtszoekend gedrag zijn nog steeds aanwezig in sommige van de nieuwste modellen. Wat we echter nog zorgwekkender vinden, is hoe snel nieuwe modellen worden uitgebracht en hoe veel beter ze scoren in Vending-Bench.
De echte wereld verslaat simulaties
Een beperking van Vending-Bench is dat het een simulatie is. Kunnen we er echt zeker van zijn dat AI's zich in het echte leven hetzelfde gedragen als in simulaties? Als AI's geld kunnen verdienen in een simulatie, kunnen ze dat dan ook in de realiteit? Om deze vragen te beantwoorden, vroegen we Anthropic of we een echte verkoopautomaat in hun kantoor mochten plaatsen. Met de AI-mogelijkheden van begin 2025 klonk dit als een absurd verzoek, maar tot onze verbazing stemden ze toe.
Aanvankelijk had de AI het zwaar. Het ondernam veel acties die duidelijk slecht waren voor de business (bijv. gratis spullen weggeven, goede deals afwijzen en hallucineren dat het een fysiek lichaam had). Het werd duidelijk dat een simulatie de prestaties in het echte leven niet nauwkeurig kan voorspellen; modellen leken overweldigd te raken door de "rommeligheid" van de echte wereld. Naarmate Anthropic echter betere modellen uitbracht, begon de AI winst te maken.
Tegen eind 2025 waren frontier-modellen goed genoeg geworden waardoor het runnen van een echte verkoopautomaat geen uitdaging meer was. AI kon nu winstgevend een bedrijf runnen. Gezien het feit dat dit nog geen jaar eerder onmogelijk leek, was onze reactie opnieuw "skräckblandad förtjusning".
Omdat een verkoopautomaat een zeer simpel bedrijf is, wilden we weten of AI complexere bedrijven kon runnen. In april 2026 gaven we één agent een retailwinkel in San Francisco (Andon Market) en een andere agent een café in Stockholm (Andon Cafe). In het begin hadden de modellen moeite en verloren ze veel geld (de huren zijn hoog en ze betalen salarissen aan de mensen die ze inhuurden). Geen van beide is vandaag de dag winstgevend, maar we hebben aanzienlijke kwalitatieve verbeteringen gezien bij de release van betere modellen. We denken dat het slechts een kwestie van tijd is voordat ze ook winst gaan maken.
Waarom we Pion openstellen
We willen dat het grote publiek, AI-onderzoekers en beleidsmakers weten in welke mate AI's autonoom middelen kunnen verwerven door bedrijven te runnen. Dit is een belangrijk datapunt bij het bepalen waar we AI wel of niet willen in de samenleving en welk niveau van vooruitgang we acceptabel vinden.
Om dit beter te kunnen volgen, moeten we een breder net uitwerpen van verschillende soorten bedrijven. Onze focus lag tot nu toe op retail, maar wellicht zijn modellen veel beter in het runnen van andere soorten bedrijven. Daarnaast vergroot een breder net de kans om ongewenst gedrag te ontdekken. Vending-Bench liet zien dat modellen colluderen en liegen, en andere benchmarks (en incidenten in de echte wereld) hebben aangetoond dat ze bereid zijn om cyberhacks op het niveau van misdrijven te plegen. We moeten dit gedrag nu blootleggen, voordat AI intelligent genoeg is om onomkeerbare schade aan te richten.
Om dit breder te trekken, openen we het platform dat we gebruiken voor onze autonome bedrijven in de echte wereld: Pion. We zouden kunnen schalen door alleen intern bedrijven te creëren (zoals onze door AI gerunde radiostations), maar we worden dan beperkt door onze eigen capaciteit en het gebrek aan domeinkennis in velden waar AI mogelijk winst kan maken. Daarnaast zijn bestaande bedrijven interessanter om te bestuderen, omdat ze een sneller signaal geven over hoe capabel een agent is.
Pion stelt mensen in staat om een bedrijf over te dragen aan persistente agenten met toegang tot de nodige tools, waaronder e-mail, telefoon, bankieren, browser en beveiligde computeromgevingen. Het doel is om veel meer experimenten in de echte wereld mogelijk te maken over meer domeinen dan we zelf zouden kunnen runnen.
We zijn ons er terdege van bewust dat we het risico lopen op meer incidenten in de echte wereld als agenten die duizenden bedrijven runnen niet worden gecontroleerd. Daarom is onze hoofdprioriteit het bouwen van nog sterkere geautomatiseerde monitoringtechnieken dan we nu hebben. Zelfs als er enige risico's blijven bestaan, geloven we dat het vroegtijdig inzetten van autonome bedrijven in een gecontroleerde, gemonitorde omgeving noodzakelijk is om een goed beeld te krijgen van de capaciteiten van de modellen. Anders riskeren we een toekomst waarin we onwetend worden geconfronteerd met wijdverspreide implementaties van nog krachtigere modellen die aanzienlijke schade kunnen aanrichten.
Dit is waarom we Pion vandaag uitbrengen. Pion is beschikbaar als research preview. Als je een bestaand bedrijf hebt of een interessant bedrijfsidee dat je wilt overdragen aan AI, meld je dan aan op onze wachtlijst voor toegang. We kijken ernaar uit om meer bedrijven te runnen en hiermee significante inzichten te verschaffen in de capaciteiten van frontier-modellen.