Real-SWE Benchmark — Specific Labs

Introductie

Vandaag presenteren wij Real-SWE, een benchmark die geavanceerde AI-modellen evalueert op private, real-world enterprise-codebases. Elke taak is afkomstig van een private productie-codebase die we hebben gelicentieerd van een echt bedrijf. Dit zijn problemen waar hun engineers in de praktijk aan werken, inclusief alle context en complexiteit die hoort bij een bestaand product.

De benchmark richt zich op drie kernaspecten:

  • Private codebases: Agents moeten navigeren door propriëtaire systemen waarvan de code en oplossingen niet beschikbaar zijn op het openbare internet.
  • Werk met zakelijke consequenties: Het correct implementeren van facturering, het berekenen van belastingen of het migreren van klanten. Dit zijn wijzigingen die direct invloed hebben op de bedrijfsvoering, vaak over meerdere services heen.
  • Bedrijfsspecifieke complexiteit: Elk bedrijf heeft eigen regels en manieren van coderen. Agents moeten deze conventies begrijpen en wijzigingen aanbrengen die passen binnen de bestaande structuur.

De centrale vraag is: Kan een coding agent daadwerkelijk het werk van een software engineer in de echte wereld uitvoeren?

Resultaten: Oplossingspercentages

Het oplossingspercentage is gelijk aan pass@1, gemiddeld over acht onafhankelijke runs per taak.

RankModelHarnessOplossingspercentage
1Fable 5.1Claude Code38,8%
2GPT-6 AstraCodex CLI33,8%
3Gemini 3.8 FlashGemini CLI31,2%
4GLM 5.3Claude Code28,8%
5Grok 4.6Grok Build23,8%
5Muse Spark 1.3Muse Code23,8%
7Kimi K3Kimi Code18,8%
8GPT-5.6 SolCodex CLI16,2%

Methodologie en Complexiteit

Expert-gegenereerde of synthetische taken kunnen goed ontworpen zijn, maar ze zijn niet exact de taken die engineers in echte bedrijven moeten uitvoeren. Onze taken verschillen op twee assen: het onderliggende code-artefact en de specificiteit van de instructie. Beiden voegen complexiteiten toe die huidige frontier-modellen uitdagen.

We maken gebruik van native harnesses om te weerspiegelen hoe enterprise-engineers in de praktijk werken. We evalueren dus combinaties van model en harness, in plaats van modellen in isolatie.

Voorbeeld van een taak: Bedrijfsspecifieke context

Een voorbeeldtaak betreft de correcte facturering, wat afhankelijk is van zakelijke regels en externe services.

Instructie: "Herstel de facturering zodat elk bedrijf de juiste belasting in rekening brengt en vrijgestelde klanten niet belast worden. De facturering start maandag opnieuw en elke factuur die deze service uitgeeft, is momenteel onbelast. Elk bedrijf op het platform regelt belasting anders: sommigen hanteren zelf een tarief, sommigen willen elke factuur beprijsd tegen de bestemming van de koper via onze belastingautoriteit-provider, en sommigen innen helemaal niets. Voor klanten waarvoor we een vrijstelling hebben, wordt niets in rekening gebracht, ongeacht de configuratie van het bedrijf. Het beprijzen van een bestemming betekent het versturen van beide adressen, de beprijsde regels en de productcategorie waaronder het bedrijf verkoopt naar de autoriteit (sandbox of productie, afhankelijk van het account). Een adres dat de autoriteit weigert, moet worden gemeld zonder de factuur te stoppen. Het tarief, de belasting en het bruto bedrag horen op de uitgegeven factuur te staan. Zodra een factuur is voldaan, wordt de verkoop teruggestuurd naar de autoriteit onder het factuurnummer voor de aansluiting van de aangiften. Facturen tussen Europese partijen tonen de btw-registraties van beide zijden. De autoriteit en het grootboek zijn beschikbaar via TAXJARURL, PRODTAXJARURL en INFLUXURL."

Gebruikte services in deze sandbox:

  • TJTaxJar sandbox
  • TJTaxJar productie
  • InfluxDB ledger
  • NestJS service (TypeScript)

Technische Omgeving

Agents werken over code, infrastructuur en zakelijke tools heen. Elke taak stelt alleen de services beschikbaar die nodig zijn voor de specifieke workflow.

  • Infrastructuur: AWS emulator, Docker, Kubernetes, GitHub.
  • Databases: PostgreSQL, MySQL, MongoDB, GeGel, Redis.
  • Talen & Tools: Go, Python, Node.js, Vitest.
  • Zakelijke tools: Slack, Intercom, Google Drive, Email, ClickUp, Linear MCP.

Selectie van Codebases

We hebben codebases geselecteerd via een streng screeningsproces, waarbij we ons richtten op echte bedrijven met aanzienlijk gebruik, sterke engineering-teams en veeleisende productieworkloads. Voorbeelden van gebruikte codebases zijn:

  • Een concurrent van Luma/Partiful met 200K+ gebruikers en een top 100 App Store-ranking.
  • Een consumenten-fintechplatform dat 100K+ bankafschriften verwerkt.
  • Enterprise AI-verkoopplatforms die complexe zakelijke workflows ondersteunen.

We geven prioriteit aan code die is geschreven om aan een werkelijke gebruikers- of zakelijke behoefte te voldoen, boven code die enkel is geschreven om een benchmarktaak te creëren.

Analyse van de Complexiteit

Instructies en Implementatie

Korte instructies kunnen wijzigingen in veel verschillende bestanden vereisen. Agents moeten implementatiedetails zelf ontdekken in de codebase en omringende tools.

Gemiddelde promptlengte (median):

  • Terminal-Bench 3: 31.584 tekens
  • DeepSWE: 1.975 tekens
  • FrontierCode: 2.056 tekens
  • FrontierSWE v2: 992 tekens
  • Real-SWE: 1.742 tekens

Gemiddeld aantal bewerkte bestanden door de referentieoplossing (median):

  • FrontierCode: 6
  • DeepSWE: 6
  • Real-SWE: 11

Faalanalyse bij korte uitvoeringen

Modellen falen zelfs bij korte rollouts. 71,4% van de rollouts van minder dan 10 minuten faalde, vergeleken met 73,4% bij langere rollouts. Dit toont aan dat het triëren van meerdere systemen en het begrijpen van vereisten in codebases vol zakelijke logica zeer moeilijk is.

Waarom Real-SWE relevant is

We vinden dit type taken interessant om drie redenen:

  1. Natuurlijk 'Out of Distribution': Taken op private codebases zijn niet beschikbaar op het internet en zijn waarschijnlijk nooit gebruikt voor training. 99% van de tokens in echte bedrijven is verborgen voor frontier-modellen.
  2. Economisch levensvatbaar werk: Elke taak heeft een directe relatie met kosten en werd oorspronkelijk toegewezen aan een engineer met een salaris.
  3. Belang van bedrijfsspecifieke patronen: Bedrijven hechten aan codestandaarden en patronen. Onze resultaten laten zien dat huidige modellen zwak zijn in het begrijpen van deze patronen en vaak vereisten missen of aannames niet verifiëren.

Gedetailleerde Analyse van Taken

Hieronder volgt de analyse van een steekproef van taken.

Oplossingspercentages per taak

TaakOplossingspercentageTop Model (Pass/8)Slechtste Model (Pass/8)
Multi-region sweep67,2%GPT-6 Astra / Gemini / Muse (8/8)Kimi K3 (2/8)
API keys & environments65,6%Fable 5.1 (8/8)Kimi K3 (0/8)
Entitlement overage lines50,0%Fable 5.1 (8/8)Grok / Muse / GPT-5.6 (1/8)
Customer identity migration40,6%Grok 4.6 (8/8)GPT-5.6 Sol (0/8)
Billing schedule migration14,1%Fable 5.1 (3/8)Grok / Muse / GPT-5.6 (0/8)
API token metering12,5%GPT-6 Astra (5/8)Gemini / Grok / Muse / GPT-5.6 (0/8)
S3 datastore measurement10,9%GLM 5.3 (3/8)GPT-6 / Gemini / GPT-5.6 (0/8)
Linearizable scan4,7%GLM 5.3 (2/8)GPT-6 / Gemini / Muse / Kimi / GPT-5.6 (0/8)
Tax jurisdiction3,1%Fable 5.1 (1/8)GPT-6 / Gemini / Grok / Muse / Kimi / GPT-5.6 (0/8)
Analytics stream reducer0,0%Geen (0/8)Alle modellen (0/8)

Type Fouten

Het missen van vereisten is de meest voorkomende reden voor falen.

Definities van fouten:

  • Unverified assumption: Bouwt voort op een gok over het systeem in plaats van dit te controleren in de workspace.
  • Missed requirement: Laat gedrag weg dat in de instructie wordt vereist.
  • Integration error: Het juiste idee, maar incorrect aangesloten op het omringende systeem.
  • Regression: Breekt bestaand gedrag terwijl de wijziging wordt aangebracht.
  • Wrong file: Levert de wijziging aan in een bestand dat door de applicatie nooit wordt aangeroepen (bijv. een eenmalig script).

Frequentie van fouten per model (percentage van gefaalde runs):

ModelUnverified assumptionMissed requirementIntegration errorRegressionWrong file
Fable 5.124,5%36,7%34,7%4,1%0%
GPT-6 Astra34,0%28,3%34,0%3,8%0%
Gemini 3.8 Flash10,9%29,1%49,1%10,9%0%
GLM 5.328,1%38,6%26,3%0%7,0%
Grok 4.624,6%67,2%8,2%0%0%
Muse Spark 1.319,7%36,1%41,0%3,3%0%
Kimi K315,4%53,8%27,7%0%3,1%
GPT-5.6 Sol43,3%31,3%16,4%9,0%0%

Kosten en Inspanning

Hogere kosten garanderen geen hoger oplossingspercentage. De geschatte kosten per rollout variëren van \$2,50 tot \$6,96.

RankModelGeschatte kosten (USD)Oplossingspercentage
1Gemini 3.8 Flash\$2,5031,2%
2GPT-5.6 Sol\$2,6516,2%
3Muse Spark 1.3\$2,7423,8%
4Grok 4.6\$3,4423,8%
5Kimi K3\$3,9018,8%
6GPT-6 Astra\$4,6733,8%
7GLM 5.3\$5,1228,8%
8Fable 5.1\$6,9638,8%

Gemiddeld output-tokens per rollout:

  • GLM 5.3: 117k
  • Gemini 3.8 Flash: 94k
  • Muse Spark 1.3: 87k
  • Grok 4.6: 67k
  • Fable 5.1: 64k
  • Kimi K3: 43k
  • GPT-6 Astra: 24k
  • GPT-5.6 Sol: 23k

Evaluatie-opzet

Elke agent werd uitgevoerd in een geïsoleerde sandbox. Alle taken zijn in Harbor-formaat en verifiers worden geïnjecteerd op het moment van beoordeling. De verifiers zijn gebaseerd op bestaande testsuites in de codebase of gebruiken deze tests letterlijk.