Terminal-Bench-Science 0.1

Terminal-Bench-Science is een benchmark onder leiding van onderzoekers aan de Stanford University, gebouwd door het team achter Terminal-Bench in samenwerking met domeinexperts uit diverse wetenschappelijke disciplines en onderzoeksinstellingen wereldwijd. Het meet de capaciteiten van AI-agenten via een diverse set uitdagende, door experts samengestelde workflows die zijn afgeleid van wetenschappelijk onderzoek.

Terminal-Bench-Science is een continue benchmark die meevolueert met de nieuwste AI-ontwikkelingen, waardoor er een feedbackloop ontstaat tussen wetenschappelijke behoeften en AI-ontwikkeling. De eerste release bevat 70 taken uit de levenswetenschappen, fysische wetenschappen, aardwetenschappen, wiskunde en engineering. Het best presterende geëvalueerde model, Claude Opus 5, behaalt een resolutiegraad van 30% op Terminal-Bench-Science 0.1.

Leaderboard Terminal-Bench-Science 0.1

ModelResolutiegraad
Claude Opus 5 (Claude Code)30.0%
GPT-5.6 Sol (Codex)22.4%
Claude Fable 5 (Claude Code)21.4%
Claude Opus 4.8 (Claude Code)10.5%
GPT-5.6 Terra (Codex)8.6%
GLM 5.3 (Claude Code)8.1%
Kimi K3 (Claude Code)7.1%
Grok 4.6 (Grok Build)7.1%
GPT-5.6 Luna (Codex)3.3%

Resolutiegraden over 70 wetenschappelijke workflow-taken in Terminal-Bench-Science 0.1.

Overzicht

Waar Terminal-Bench vooruitgang heeft gestimuleerd in AI-agenten voor software engineering, brengt Terminal-Bench-Science dezelfde ambitie naar de wetenschap. Ons doel is om de ontwikkeling van agenten met wetenschappelijke capaciteiten te stimuleren, zodat ze nuttige onderzoeksassistenten worden. Deze agenten moeten technisch veeleisende en tijdrovende workflows kunnen uitvoeren, waardoor wetenschappers meer tijd kunnen besteden aan de aspecten van wetenschap waar menselijk oordeel het meest cruciaal is: het definiëren van onderzoeksvragen, het vormen van hypothesen, het interpreteren en valideren van resultaten en het communiceren van bevindingen. In deze rol kunnen AI-agenten de prestaties van onderzoekers uitbreiden en wetenschappelijke ontdekkingen versnellen.

Om dit te bereiken zijn benchmarks nodig die de werkelijke wetenschappelijke praktijk weerspiegelen, verifieerbaar bewijs van capaciteit leveren en meegroeien met de AI-frontier.

Behoefte aan benchmarks uit echte wetenschappelijke workflows

Wetenschappelijke capaciteit moet worden geëvalueerd op basis van de werkelijke onderzoekspraktijk, niet op basis van vragen uit tekstboeken of gestandaardiseerde oefeningen. Terminal-Bench-Science geeft wetenschappers uit verschillende domeinen een directe stem en een gedeeld platform om de lat te leggen voor AI-vooruitgang op de problemen die voor hen belangrijk zijn. De belangen in de wetenschap zijn te groot, en benchmarks moeten de prioriteiten van de wetenschappelijke gemeenschap weerspiegelen in plaats van externe belangen.

Behoefte aan verifieerbaar bewijs van wetenschappelijke capaciteit

Zonder betrouwbare evaluatie kunnen we niet vaststellen of de capaciteiten van agenten verbeteren of waar de beperkingen blijven bestaan. Terminal-Bench-Science evalueert agenten in realistische omgevingen en beoordeelt concrete artefacten, zoals analyses, simulaties, bewijzen, code en dataproducten, met reproduceerbare, taakspecifieke tests.

Behoefte aan een benchmark die het tempo van de frontier bijhoudt

Te vaak worden wetenschappelijke benchmarks behandeld als publicaties in plaats van mechanismen om vooruitgang te stimuleren. Ze worden één keer uitgebracht en daarna verlaten terwijl modellen vorderen en bekende beperkingen blijven bestaan. Terminal-Bench-Science is een continue benchmark die meevolueert met de AI-frontier. Door regelmatige releases kunnen wetenschappers nieuwe workflows bijdragen, bestaande taken verbeteren en een feedbackloop creëren tussen wetenschappelijke behoeften en AI-ontwikkeling.

De Terminal-Bench-Science Feedbackloop: Wetenschappelijke Gemeenschap → (draagt workflows bij) → Terminal-Bench-Science → (evalueert & verbetert) → Frontier AI Agenten & Modellen → (versnelt ontdekkingen) → Wetenschappelijke Gemeenschap.

Taken

Terminal-Bench-Science 0.1 bevat 70 taken verspreid over de levenswetenschappen, fysische wetenschappen, aardwetenschappen, wiskunde en engineering. De taken omvatten wetenschappelijke data-analyse, statistische inferentie, simulatie, optimalisatie, stellingbewijzen, beeldreconstructie, signaalverwerking, inverse problemen, sensorkalibratie, model-fitting, classificatie en wetenschappelijk machine learning.

Verdeling van taken per domein

  • Levenswetenschappen (19):
  • Biologie (8)
  • Geneeskunde & Gezondheidszorg (6)
  • Neurowetenschappen (4)
  • Ecologie & Evolutie (1)
  • Fysische wetenschappen (17):
  • Astronomie & Cosmologie (6)
  • Fysica (5)
  • Materiaalkunde (4)
  • Chemie (2)
  • Aardwetenschappen (8):
  • Geowetenschappen (5)
  • Atmosfeer & Klimaat (1)
  • Oceaan & Mariene wetenschappen (1)
  • Milieu & Duurzaamheid (1)
  • Wiskundige wetenschappen (17):
  • Toegepaste Wiskunde & Scientific Computing (6)
  • Operations Research & Optimalisatie (5)
  • Formele Wiskunde & Stellingbewijzen (3)
  • Statistiek (3)
  • Engineering wetenschappen (9):
  • Werktuigbouwkunde & Lucht- en Ruimtevaarttechniek (5)
  • Elektrotechniek & Computertechniek (2)
  • Chemische & Procestechniek (1)
  • Civiele & Constructietechniek (1)

Totaal: 70 expert-curated taken over vijf wetenschappelijke domeinen.

Bijdrageproces

Taken worden bijgedragen door onderzoekers via een open proces op GitHub, met discussies en feedback in het #tb-science kanaal op Discord. Bijdragen beginnen als voorstellen, waarbij reviewers elk idee bespreken, feedback geven en die goedkeuren die passen als wetenschappelijk onderbouwde workflows die de moeite waard zijn om in de benchmark te meten.

Goedgekeurde voorstellen worden geïmplementeerd als pull requests. Reviewers controleren of elke taak objectief verifieerbaar is, echt uitdagend is voor AI-agenten en niet iets is wat huidige frontier-systemen al eenvoudig oplossen. Voor de uiteindelijke merge beoordelen domeinreviewers de wetenschappelijke validiteit en het realisme, inspecteren technische reviewers de constructie en verificatie van de taak, en voert een 'bar raiser' een laatste kwaliteitscontrole uit.

Van de 920 voorstellen werden er 464 goedgekeurd voor implementatie en werden er 386 pull requests geopend, maar slechts 70 taken zijn opgenomen in Terminal-Bench-Science 0.1. Deze selectiviteit weerspiegelt hoe moeilijk het is om taken te creëren die wetenschappelijk interessant zijn, uitdagend voor frontier-agenten en voldoende goed gespecificeerd voor een rigoureuze evaluatie. De voortgang van voorstellen, pull requests en reviews wordt bijgehouden op het openbare task-dashboard.

Statistieken van bijdragen:

  • Taakvoorstellen: 920 (100%)
  • Goedgekeurde voorstellen: 464 (50.4%)
  • Taak Pull Requests: 386 (42.0%)
  • Geaccepteerde taken: 70 (7.6%)
  • Totaal aantal bijdragers: 376 uit 22 landen.

Resultaten

Terminal-Bench-Science 0.1 laat aanzienlijke ruimte voor verbetering zien voor AI-agenten in wetenschappelijk onderzoek. Elk geëvalueerd model heeft drie onafhankelijke pogingen per taak gedaan voor alle 70 taken.

Claude Opus 5 met Claude Code behaalt de hoogste resolutiegraad van 30.0%, gevolgd door GPT-5.6 Sol met Codex (22.4%) en Claude Fable 5 met Claude Code (21.4%). Claude Opus 4.8 bevindt zich in het midden met 10.5%. GPT-5.6 Terra, Kimi K3 en Grok 4.6 lossen allen minder dan 10% van de taken op. GLM 5.3 is het sterkste open model met 8.1%, en GPT-5.6 Luna staat laatst met 3.3%.

Terminal-Bench-Science maakt onderscheid tussen systemen ongeveer net zo goed als Terminal-Bench 3.0, maar de resolutiegraden liggen voor elk model dat op beide is geëvalueerd meer dan 10 procentpunt lager. Dit verschil is opzettelijk: tijdens de review werden taken gekalibreerd om de nieuwste frontier-modellen uit te dagen.

Vergelijking: Terminal-Bench vs. Terminal-Bench-Science

ModelTerminal-Bench 2.1Terminal-Bench 3.0Terminal-Bench-Science 0.1
Opus 542.7%34.4%30.0%
GPT-5.6 Sol33.8%21.1%22.4%
Fable 583.8%78.9%21.4%
Opus 4.820.8%78.4%10.5%
GPT-5.6 Terra20.8%78.4%8.6%
GPT-5.6 Luna14.3%75.7%3.3%

Kosten en Efficiëntie

Prestaties zijn slechts één dimensie van vooruitgang. De kosten-resolutieplot toont de totale evaluatiekosten over alle 70 taken tegenover de resolutiegraad. GPT-5.6 Luna, Kimi K3 en GPT-5.6 Terra bevinden zich aan het goedkope uiteinde van de frontier. GPT-5.6 Sol en Claude Opus 5 bereiken de hoogste resolutiegraden tegen hogere kosten, waarbij Opus 5 op $7.0k uitkomt. GPT-5.6 Sol benadert de prestaties van Claude Fable 5 voor minder dan een derde van de kosten ($4.2k tegenover $14.2k).

Tokengebruik toont een andere frontier. Claude Fable 5 evenaart de prestaties van GPT-5.6 Sol terwijl het ongeveer een kwart minder tokens gebruikt (6.4B tegenover 8.4B). Kimi K3 vormt het anker aan de kant van het laagste tokengebruik en Claude Opus 5 aan de kant van de hoogste resolutie. Alleen Kimi K3 en Claude Opus 5 verschijnen op beide Pareto-frontiers.

Resolutiegraden per wetenschappelijk domein

De resolutiegraden variëren per wetenschappelijk domein. Modellen van Anthropic en OpenAI bezetten de top twee posities in elk domein, behalve in de engineering wetenschappen, waar Grok 4.6 gelijk staat aan GPT-5.6 Sol voor de tweede plaats (14.8%) tegen lagere kosten en tokengebruik. Claude Opus 5 leidt zowel GPT-5.6 Sol als Claude Fable 5 in elk domein, behalve in de wiskundige wetenschappen, waar Claude Fable 5 (33.3%) en GPT-5.6 Sol (31.4%) de top twee posities innemen.

Conclusie en Roadmap

Terminal-Bench-Science 0.1 is een gemeenschapsinspanning van onderzoekers uit de levenswetenschappen, fysische wetenschappen, aardwetenschappen, wiskunde en engineering, samen met het Terminal-Bench en Harbor team. Het is de meest rigoureuze benchmark van wetenschappelijke agent-capaciteiten die we in het openbaar konden bouwen, en we staan pas aan het begin.

Regelmatige releases zullen taken toevoegen, de dekking over de vijf wetenschappelijke domeinen verbreden, taken uitfaseren die door agenten zijn verzadigd of die als onvoldoende gespecificeerd worden beschouwd, en het leaderboard actueel houden wanneer nieuwe frontier-modellen worden uitgebracht. Elke release wordt gekalibreerd tegen de frontier van dat moment. Voor Terminal-Bench-Science 0.1 waren dit Claude Opus 5 en GPT-5.6 Sol. Naarmate sterkere modellen verschijnen, zullen we deze gebruiken om nieuwe en verbeterde taken te evalueren en te kalibreren. Taken zijn geversioneerd, zodat trials kunnen worden hergebruikt, opnieuw kunnen worden beoordeeld of kunnen worden uitgevoerd met één enkel Harbor-commando.

Het werk aan Terminal-Bench-Science 0.2 is al in volle gang, met een deadline voor pull requests op 5 oktober 2026. De bijdrageflow is: VoorstellenBouwenReviewen.

Citatie

Indien dit werk nuttig is, verzoeken wij u dit te citeren. U kunt de knop "Cite this repository" op GitHub gebruiken of handmatig citeren met de onderstaande informatie:

@software{Terminal-Bench-Science_Team_Terminal-Bench-Science_Evaluating_AI_2026,
author = {{Terminal-Bench-Science Team}},
doi = {10.5281/zenodo.22110254},
license = {Apache-2.0},
month = aug,
title = {{Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains}},
url = {https://github.com/harbor-framework/terminal-bench-science},
version = {v0.1.0},
year = {2026}
}

Erkenningen

Dank aan alle taakbijdragers, reviewers en adviseurs achter Terminal-Bench-Science.

Speciale dank aan projectleiders/adviseurs Ludwig Schmidt en Sanmi Koyejo; senior reviewers Allen Hart, Ivan Bercovich, Joseph Janssen, Jiaming Hu, Steffen Bollmann en Sergey Aganezov; AI-onderzoeksadviseurs Ryan Marten, Alex Shaw, Lin Shi, Benjamin Feuer, Mike A. Merrill, Alex Dimakis, Jenia Jitsev, Bodhisattwa Majumder, Peter Clark, Thomas Wolf, Braden Hancock en Andy Konwinski; en wetenschappelijke adviseurs Sara Beery, Jo Dunkley, J. Nathan Kutz, Ching-Yao Lai, Scott Linderman, Emma Lundberg, Russ Poldrack, Aviv Regev en Risa Wechsler.

Terminal-Bench-Science is een open academische samenwerking gehost door Stanford University en het Laude Institute, in partnerschap met het Stanford AI Lab (SAIL), het Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford AI Measurement Science (AIMS), het NSF AI Institute for Foundations of Machine Learning (IFML), het Allen Institute en het Allen Institute for AI (Ai2). Als onderdeel van de Terminal-Bench franchise is het gebouwd door het Terminal-Bench en Harbor team samen met een gemeenschap van wetenschappelijke bijdragers.

Wij danken het Laude Institute voor steun via het Slingshots programma, Snorkel AI voor steun via het Open Benchmarks Grants programma, de 2077AI Open Source Foundation voor PP API-credits, en UniPat AI en Modal voor hun steun. Tevens danken wij Bespoke Labs, Anthropic, Google, Moonshot AI, SpaceXAI en Z.ai voor de API-credits die de leaderboard-evaluaties ondersteunen.

Geschreven door: Steven Dillmann