In welke taal worden agent-vaardigheden geschreven?

Bij het analyseren van de data blijkt de claim zelfs sterker dan hij op het eerste gezicht lijkt, omdat Engels geen directe proxy is voor 'Amerikaans'. De snelst groeiende ontwikkelaarspopulatie op GitHub is met afstand die van India, maar zij schrijven in het Engels, net als ontwikkelaars in Nigeria en Singapore. Een taalmeting kan hen dus niet onderscheiden. Het aandeel niet-Engelse talen is daarom geen volledige maatstaf voor hoeveel van dit ecosysteem zich buiten de Verenigde Staten bevindt; het is eerder een ondergrens.

Context: Wat is een 'skill'? Een skill is een SKILL.md-bestand in een map, dat instructies voor een AI-agent bevat in gewone proza. Dit bestand wordt geladen wanneer de agent beoordeelt dat de taak relevant is. Anthropic publiceerde de specificatie in oktober 2025, en het verspreidde zich als een recept: mensen kopieerden het. Negen maanden later waren er 3,8 miljoen van deze bestanden verspreid over 282.200 openbare repositories, wat de basis vormt voor de GitSkills-dataset.

Skills zijn vreemd als software, omdat ze geschreven zijn in menselijke taal en de runtime een meertalig model is. Er is dus geen technische reden om ze in het Engels te schrijven: een ontwikkelaar in Shenzhen of São Paulo kan een procedure preciezer formuleren in de eigen taal, en de agent zal deze volgen. De vraag of de agent de instructies even goed volgt, is complexer en kan niet met een simpele bestandsanalyse worden beantwoord.

De verdeling

We hebben taalidentificatie uitgevoerd op de hoofdtekst van elke unieke skill, nadat de front-matter en codeblokken waren verwijderd.

Taalverdeling van unieke skills (totaal 1.870.299)

TaalAandeel unieke skills
Engels85,3%
Chinees (中文)6,2%
Japans (日本語)1,7%
Duits (Deutsch)1,6%
Koreaans (한국어)1,2%
Portugees (Português)1,1%
Spaans (Español)0,9%
Frans (Français)0,4%

In totaal is 14,3% van de skills niet-Engelstalig, waarbij het Chinees domineert. Binnen de Chinese taal zijn er 104.985 versies in vereenvoudigd Chinees tegenover 9.112 in traditioneel Chinees. 6.810 skills vielen onder de betrouwbaarheidsdrempel en zijn als geen van beide geteld.

Vergeleken met algemene repository-documentatie op GitHub (waar een studie uit 2026 een niet-Engels aandeel van 13,0% rapporteerde), zijn skills met 14,3% niet onopvallend. Wel zijn ze merkbaar vaker Chinees (6,2% tegenover 3,3% voor algemene documentatie).

Waarom gepubliceerde cijfers verschillen

Er zijn verschillende studies verschenen, maar de cijfers komen niet met elkaar overeen.

Gerapporteerd Engels aandeelCorpusMethode
65,0%557 zorg-skills, ClawHub (2605.02709)Niet vermeld
81,8%26.502 skills, ClawHub (2604.13064)Niet vermeld
85,3%1.870.299 unieke, GitHub (eigen onderzoek)py3langid, conf >= 0.80
92,6%133.149 skills, skills.sh (2607.01456)fast-langdetect
99,7%Engels-gebaseerde crawl (2606.03565)Seeded

Dit zijn geen tegenstrijdigheden, maar vijf verschillende populaties: gecureerde marktplaatsen neigen naar het Engels, domeinspecifieke uitsneden neigen naar waar dat domein actief is, en een crawl die start met Engelse zoekopdrachten zal Engelse resultaten vinden.

Om uit te sluiten dat onze resultaten een artefact zijn van de gebruikte tools, hebben we zowel py3langid (onze tool) als fast-langdetect (gebruikt in de 92,6% studie) op dezelfde documenten gedraaid. Ze zijn het eens over 97,6% van de documenten. Ook filtering op de validiteit van de front-matter maakte nauwelijks verschil (het Engelse aandeel verschoof slechts van 85,6% naar 85,4%). De conclusie is dat de locatie waar men zoekt bepalend is voor het resultaat.

Agent-vaardigheden worden minder Engelstalig

Omdat skills een commit-geschiedenis hebben, kunnen we de trend over tijd volgen.

Aandeel niet-Engelse talen per kwartaal

KwartaalNiet-Engels aandeel
2026 Q113,0% [12,8, 13,1]
2026 Q216,3% [16,1, 16,4]

Hoewel de stijging per maand niet lineair is (februari dipte naar 10,9%), is de trend onmiskenbaar: van 13,1% in januari naar 17,6% in juni. Dit is verwacht bij een nieuw formaat van achttien maanden oud.

Verandering per taalgroep (2026 Q1 → Q2)

Taal2026 Q12026 Q2Verschil
Chinees4,2%5,3%+1,1
Europees*2,7%5,5%+2,8
Koreaans2,2%2,0%-0,2
Japans3,2%2,5%-0,7

\Europees omvat: Duits, Frans, Spaans, Portugees, Italiaans, Russisch en Nederlands.*

Europese talen meer dan verdubbelden in deze periode, terwijl het Chinees gestaag steeg. Japans was eind 2025 de meest voorkomende niet-Engelse taal, maar zakte in de eerste helft van 2026 terug.

Waarom we dit geloven

Om uit te sluiten dat dit een selectie-effect is (bijvoorbeeld door veelvuldig kopiëren), hebben we verschillende controles uitgevoerd. Wanneer we kopieën negeren en elke skill slechts één keer tellen, blijft de stijging overeind (van 14,5% naar 16,8%).

De Klok

Omdat commit-tijdstempels in UTC worden opgeslagen, is de lokale tijdzone van de auteur verdwenen. Echter, mensen committen meestal wanneer ze wakker zijn.

Aandeel commits tijdens de Oost-Aziatische nacht

TaalAandeel commits in nachtvenstern
Engels35,7%384.979
Chinees15,3%21.939
Japans15,9%12.908
Koreaans18,7%9.388
Spaans/Portugees46,5%9.936

Chinees-talige skills vertonen een veel lager activiteitsniveau tijdens de Oost-Aziatische nacht dan Engelse skills. Engelse commits zijn vlak over de hele 24 uur verdeeld, wat wijst op een wereldwijd verspreide populatie. Spaans en Portugees pieken rond 19:00 UTC (middag in Brazilië, avond in Iberië), wat deze auteurs in de Amerika's plaatst.

Hetzelfde verhaal van buitenaf

Andere data bevestigen deze beweging op grotere schaal:

  • GitHub Octoverse 2025: India voegde in één jaar 5,2 miljoen ontwikkelaars toe (14% van alle nieuwe accounts wereldwijd). Brazilië, Indonesië en Japan groeiden eveneens sterk.
  • Stanford 2026 AI Index: De adoptie van generatieve AI is 64% in de Verenigde Arabische Emiraten en 61% in Singapore, tegenover 28,3% in de Verenigde Staten.
  • Open-source bijdragen: Bijdragen uit de rest van de wereld overtreffen nu die van Europa en naderen die van de VS op GitHub.

Dit bevestigt dat de 14,3% voor agent-skills inderdaad een ondergrens is, aangezien grote groeimarkten zoals India in het Engels schrijven.

Gekopieerd of onderhouden?

Er is een duidelijk verschil in hoe Engelse en niet-Engelse skills worden gebruikt.

Niet-Engels aandeel op basis van aantal kopieën

  • 1 kopie: 15,7%
  • 2 kopieën: 10,8%
  • 3-5 kopieën: 5,8%
  • 6+ kopieën: 5,8%

Engelse skills worden vaker gekopieerd. Niet-Engelse skills worden echter vaker gecorrigeerd. Wanneer we kijken naar skills van dezelfde leeftijd, is het aandeel dat binnen de eerste 90 dagen is herzien hoger voor niet-Engelse skills (33,9%) dan voor Engelse (28,7%).

Dit suggereert twee verschillende populaties: Engelse skills verspreiden zich (eenmaal geschreven, breed gekopieerd en zelden aangepast), terwijl niet-Engelse skills worden "onderhouden" (minder gekopieerd, maar vaker herzien). De oorzaak is waarschijnlijk de zoekfunctie: ontdekking is lexicaal. Een ontwikkelaar die in het Engels zoekt, vindt geen skill in het Chinees, zelfs niet als een meertalig model deze perfect zou kunnen uitvoeren.

Wie schrijft dit eigenlijk?

We hebben onderzocht hoeveel skills door AI-agents zelf zijn geschreven. Omdat GitHub-bot-flags dit nauwelijks registreren, hebben we gekeken naar de Co-Authored-By regel in commit-trailers.

  • AI-agent fingerprint: 30,4% van de skills.
  • Platform-bot flag: 1,0% van de skills.
  • Agent-authored (Japans): 43,4%
  • Agent-authored (Chinees): 23,2%

Bijna een derde van de skills is door een AI geschreven, waarbij Claude de overhand heeft, gevolgd door Cursor, Copilot en Codex.

Beperkingen van het onderzoek

Taalidentificatie leunt op scripts en functiewoorden. Een Duitse skill met veel Engelse technische termen kan als Engels worden geclassificeerd, wat betekent dat het niet-Engelse aandeel waarschijnlijk een ondergrens is. Daarnaast zien we alleen de "overlevers"; skills die zijn gemaakt en vervolgens verwijderd vóór juli 2026 zijn onzichtbaar.

Conclusie en vervolgstappen

De belangrijkste onbeantwoorde vraag is of deze niet-Engelse skills kwalitatief gelijkwaardig zijn of simpelweg minder vindbaar. Hiervoor zijn executie-traces nodig. Wat we wel weten is dat het ecosysteem globaliseert in wat er geschreven wordt, lang voordat het globaliseert in wat er hergebruikt wordt. De vertraging tussen deze twee is in feite een tooling-probleem dat opgelost kan worden.

***

Credits Dit onderzoek is gebaseerd op de GitSkills-dataset, verzameld door Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, en Marco Ortu (2027: GitSkills: A Dataset of Agent Skills on GitHub). De analysecode is beschikbaar op github.com/plicara/articles onder gitskills-analysis/.