De Real-SWE benchmark van Specific Labs onderzoekt of AI-coding agents het werk van software engineers in de echte wereld kunnen overnemen. In tegenstelling tot synthetische benchmarks maakt Real-SWE gebruik van private, gelicentieerde productie-codebases, waardoor modellen worden uitgedaagd door propriëtaire systemen, zakelijke complexiteit en bedrijfsspecifieke conventies.
Belangrijkste resultaten:
- Prestaties: Fable 5.1 scoort het hoogst met een oplossingspercentage van 38,8%, gevolgd door GPT-6 Astra (33,8%) en Gemini 3.8 Flash (31,2%).
- Complexiteit: De taken zijn aanzienlijk complexer dan in andere benchmarks; de referentieoplossingen bewerken gemiddeld 11 bestanden per taak.
- Foutanalyse: De meest voorkomende reden voor falen is het missen van vereisten ('missed requirements'), gevolgd door integratiefouten en ongeverifieerde aannames.
- Kosten: Er is geen directe correlatie tussen de kosten per rollout en het succespercentage.
De benchmark concludeert dat huidige frontier-modellen nog steeds moeite hebben met het begrijpen van bedrijfsspecifieke patronen en het navigeren door systemen die niet in hun publieke trainingsdata voorkomen.
Real-SWE Benchmark — Specific Labs
Introductie
Vandaag presenteren wij Real-SWE, een benchmark die geavanceerde AI-modellen evalueert op private, real-world enterprise-codebases. Elke taak is afkomstig van een private productie-codebase die we hebben gelicentieerd van een echt bedrijf. Dit zijn problemen waar hun engineers in de praktijk aan werken, inclusief alle context en complexiteit die hoort bij een bestaand product.
De benchmark richt zich op drie kernaspecten:
- Private codebases: Agents moeten navigeren door propriëtaire systemen waarvan de code en oplossingen niet beschikbaar zijn op het openbare internet.
- Werk met zakelijke consequenties: Het correct implementeren van facturering, het berekenen van belastingen of het migreren van klanten. Dit zijn wijzigingen die direct invloed hebben op de bedrijfsvoering, vaak over meerdere services heen.
- Bedrijfsspecifieke complexiteit: Elk bedrijf heeft eigen regels en manieren van coderen. Agents moeten deze conventies begrijpen en wijzigingen aanbrengen die passen binnen de bestaande structuur.
De centrale vraag is: Kan een coding agent daadwerkelijk het werk van een software engineer in de echte wereld uitvoeren?
Resultaten: Oplossingspercentages
Het oplossingspercentage is gelijk aan pass@1, gemiddeld over acht onafhankelijke runs per taak.
| Rank | Model | Harness | Oplossingspercentage |
| 1 | Fable 5.1 | Claude Code | 38,8% |
| 2 | GPT-6 Astra | Codex CLI | 33,8% |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31,2% |
| 4 | GLM 5.3 | Claude Code | 28,8% |
| 5 | Grok 4.6 | Grok Build | 23,8% |
| 5 | Muse Spark 1.3 | Muse Code | 23,8% |
| 7 | Kimi K3 | Kimi Code | 18,8% |
| 8 | GPT-5.6 Sol | Codex CLI | 16,2% |
Methodologie en Complexiteit
Expert-gegenereerde of synthetische taken kunnen goed ontworpen zijn, maar ze zijn niet exact de taken die engineers in echte bedrijven moeten uitvoeren. Onze taken verschillen op twee assen: het onderliggende code-artefact en de specificiteit van de instructie. Beiden voegen complexiteiten toe die huidige frontier-modellen uitdagen.
We maken gebruik van native harnesses om te weerspiegelen hoe enterprise-engineers in de praktijk werken. We evalueren dus combinaties van model en harness, in plaats van modellen in isolatie.
Voorbeeld van een taak: Bedrijfsspecifieke context
Een voorbeeldtaak betreft de correcte facturering, wat afhankelijk is van zakelijke regels en externe services.
Instructie: "Herstel de facturering zodat elk bedrijf de juiste belasting in rekening brengt en vrijgestelde klanten niet belast worden. De facturering start maandag opnieuw en elke factuur die deze service uitgeeft, is momenteel onbelast. Elk bedrijf op het platform regelt belasting anders: sommigen hanteren zelf een tarief, sommigen willen elke factuur beprijsd tegen de bestemming van de koper via onze belastingautoriteit-provider, en sommigen innen helemaal niets. Voor klanten waarvoor we een vrijstelling hebben, wordt niets in rekening gebracht, ongeacht de configuratie van het bedrijf. Het beprijzen van een bestemming betekent het versturen van beide adressen, de beprijsde regels en de productcategorie waaronder het bedrijf verkoopt naar de autoriteit (sandbox of productie, afhankelijk van het account). Een adres dat de autoriteit weigert, moet worden gemeld zonder de factuur te stoppen. Het tarief, de belasting en het bruto bedrag horen op de uitgegeven factuur te staan. Zodra een factuur is voldaan, wordt de verkoop teruggestuurd naar de autoriteit onder het factuurnummer voor de aansluiting van de aangiften. Facturen tussen Europese partijen tonen de btw-registraties van beide zijden. De autoriteit en het grootboek zijn beschikbaar via TAXJARURL, PRODTAXJARURL en INFLUXURL."
Gebruikte services in deze sandbox:
- TJTaxJar sandbox
- TJTaxJar productie
- InfluxDB ledger
- NestJS service (TypeScript)
Technische Omgeving
Agents werken over code, infrastructuur en zakelijke tools heen. Elke taak stelt alleen de services beschikbaar die nodig zijn voor de specifieke workflow.
- Infrastructuur: AWS emulator, Docker, Kubernetes, GitHub.
- Databases: PostgreSQL, MySQL, MongoDB, GeGel, Redis.
- Talen & Tools: Go, Python, Node.js, Vitest.
- Zakelijke tools: Slack, Intercom, Google Drive, Email, ClickUp, Linear MCP.
Selectie van Codebases
We hebben codebases geselecteerd via een streng screeningsproces, waarbij we ons richtten op echte bedrijven met aanzienlijk gebruik, sterke engineering-teams en veeleisende productieworkloads. Voorbeelden van gebruikte codebases zijn:
- Een concurrent van Luma/Partiful met 200K+ gebruikers en een top 100 App Store-ranking.
- Een consumenten-fintechplatform dat 100K+ bankafschriften verwerkt.
- Enterprise AI-verkoopplatforms die complexe zakelijke workflows ondersteunen.
We geven prioriteit aan code die is geschreven om aan een werkelijke gebruikers- of zakelijke behoefte te voldoen, boven code die enkel is geschreven om een benchmarktaak te creëren.
Analyse van de Complexiteit
Instructies en Implementatie
Korte instructies kunnen wijzigingen in veel verschillende bestanden vereisen. Agents moeten implementatiedetails zelf ontdekken in de codebase en omringende tools.
Gemiddelde promptlengte (median):
- Terminal-Bench 3: 31.584 tekens
- DeepSWE: 1.975 tekens
- FrontierCode: 2.056 tekens
- FrontierSWE v2: 992 tekens
- Real-SWE: 1.742 tekens
Gemiddeld aantal bewerkte bestanden door de referentieoplossing (median):
- FrontierCode: 6
- DeepSWE: 6
- Real-SWE: 11
Faalanalyse bij korte uitvoeringen
Modellen falen zelfs bij korte rollouts. 71,4% van de rollouts van minder dan 10 minuten faalde, vergeleken met 73,4% bij langere rollouts. Dit toont aan dat het triëren van meerdere systemen en het begrijpen van vereisten in codebases vol zakelijke logica zeer moeilijk is.
Waarom Real-SWE relevant is
We vinden dit type taken interessant om drie redenen:
- Natuurlijk 'Out of Distribution': Taken op private codebases zijn niet beschikbaar op het internet en zijn waarschijnlijk nooit gebruikt voor training. 99% van de tokens in echte bedrijven is verborgen voor frontier-modellen.
- Economisch levensvatbaar werk: Elke taak heeft een directe relatie met kosten en werd oorspronkelijk toegewezen aan een engineer met een salaris.
- Belang van bedrijfsspecifieke patronen: Bedrijven hechten aan codestandaarden en patronen. Onze resultaten laten zien dat huidige modellen zwak zijn in het begrijpen van deze patronen en vaak vereisten missen of aannames niet verifiëren.
Gedetailleerde Analyse van Taken
Hieronder volgt de analyse van een steekproef van taken.
Oplossingspercentages per taak
| Taak | Oplossingspercentage | Top Model (Pass/8) | Slechtste Model (Pass/8) |
| Multi-region sweep | 67,2% | GPT-6 Astra / Gemini / Muse (8/8) | Kimi K3 (2/8) |
| API keys & environments | 65,6% | Fable 5.1 (8/8) | Kimi K3 (0/8) |
| Entitlement overage lines | 50,0% | Fable 5.1 (8/8) | Grok / Muse / GPT-5.6 (1/8) |
| Customer identity migration | 40,6% | Grok 4.6 (8/8) | GPT-5.6 Sol (0/8) |
| Billing schedule migration | 14,1% | Fable 5.1 (3/8) | Grok / Muse / GPT-5.6 (0/8) |
| API token metering | 12,5% | GPT-6 Astra (5/8) | Gemini / Grok / Muse / GPT-5.6 (0/8) |
| S3 datastore measurement | 10,9% | GLM 5.3 (3/8) | GPT-6 / Gemini / GPT-5.6 (0/8) |
| Linearizable scan | 4,7% | GLM 5.3 (2/8) | GPT-6 / Gemini / Muse / Kimi / GPT-5.6 (0/8) |
| Tax jurisdiction | 3,1% | Fable 5.1 (1/8) | GPT-6 / Gemini / Grok / Muse / Kimi / GPT-5.6 (0/8) |
| Analytics stream reducer | 0,0% | Geen (0/8) | Alle modellen (0/8) |
Type Fouten
Het missen van vereisten is de meest voorkomende reden voor falen.
Definities van fouten:
- Unverified assumption: Bouwt voort op een gok over het systeem in plaats van dit te controleren in de workspace.
- Missed requirement: Laat gedrag weg dat in de instructie wordt vereist.
- Integration error: Het juiste idee, maar incorrect aangesloten op het omringende systeem.
- Regression: Breekt bestaand gedrag terwijl de wijziging wordt aangebracht.
- Wrong file: Levert de wijziging aan in een bestand dat door de applicatie nooit wordt aangeroepen (bijv. een eenmalig script).
Frequentie van fouten per model (percentage van gefaalde runs):
| Model | Unverified assumption | Missed requirement | Integration error | Regression | Wrong file |
| Fable 5.1 | 24,5% | 36,7% | 34,7% | 4,1% | 0% |
| GPT-6 Astra | 34,0% | 28,3% | 34,0% | 3,8% | 0% |
| Gemini 3.8 Flash | 10,9% | 29,1% | 49,1% | 10,9% | 0% |
| GLM 5.3 | 28,1% | 38,6% | 26,3% | 0% | 7,0% |
| Grok 4.6 | 24,6% | 67,2% | 8,2% | 0% | 0% |
| Muse Spark 1.3 | 19,7% | 36,1% | 41,0% | 3,3% | 0% |
| Kimi K3 | 15,4% | 53,8% | 27,7% | 0% | 3,1% |
| GPT-5.6 Sol | 43,3% | 31,3% | 16,4% | 9,0% | 0% |
Kosten en Inspanning
Hogere kosten garanderen geen hoger oplossingspercentage. De geschatte kosten per rollout variëren van \$2,50 tot \$6,96.
| Rank | Model | Geschatte kosten (USD) | Oplossingspercentage |
| 1 | Gemini 3.8 Flash | \$2,50 | 31,2% |
| 2 | GPT-5.6 Sol | \$2,65 | 16,2% |
| 3 | Muse Spark 1.3 | \$2,74 | 23,8% |
| 4 | Grok 4.6 | \$3,44 | 23,8% |
| 5 | Kimi K3 | \$3,90 | 18,8% |
| 6 | GPT-6 Astra | \$4,67 | 33,8% |
| 7 | GLM 5.3 | \$5,12 | 28,8% |
| 8 | Fable 5.1 | \$6,96 | 38,8% |
Gemiddeld output-tokens per rollout:
- GLM 5.3: 117k
- Gemini 3.8 Flash: 94k
- Muse Spark 1.3: 87k
- Grok 4.6: 67k
- Fable 5.1: 64k
- Kimi K3: 43k
- GPT-6 Astra: 24k
- GPT-5.6 Sol: 23k
Evaluatie-opzet
Elke agent werd uitgevoerd in een geïsoleerde sandbox. Alle taken zijn in Harbor-formaat en verifiers worden geïnjecteerd op het moment van beoordeling. De verifiers zijn gebaseerd op bestaande testsuites in de codebase of gebruiken deze tests letterlijk.
Real-SWE Benchmark — Specific Labs
Introductie
Vandaag presenteren wij Real-SWE, een benchmark die geavanceerde AI-modellen evalueert op private, real-world enterprise-codebases. Elke taak is afkomstig van een private productie-codebase die we hebben gelicentieerd van een echt bedrijf. Dit zijn problemen waar hun engineers in de praktijk aan werken, inclusief alle context en complexiteit die hoort bij een bestaand product.
De benchmark richt zich op drie kernaspecten:
- Private codebases: Agents moeten navigeren door propriëtaire systemen waarvan de code en oplossingen niet beschikbaar zijn op het openbare internet.
- Werk met zakelijke consequenties: Het correct implementeren van facturering, het berekenen van belastingen of het migreren van klanten. Dit zijn wijzigingen die direct invloed hebben op de bedrijfsvoering, vaak over meerdere services heen.
- Bedrijfsspecifieke complexiteit: Elk bedrijf heeft eigen regels en manieren van coderen. Agents moeten deze conventies begrijpen en wijzigingen aanbrengen die passen binnen de bestaande structuur.
De centrale vraag is: Kan een coding agent daadwerkelijk het werk van een software engineer in de echte wereld uitvoeren?
Resultaten: Oplossingspercentages
Het oplossingspercentage is gelijk aan pass@1, gemiddeld over acht onafhankelijke runs per taak.
| Rank | Model | Harness | Oplossingspercentage |
| 1 | Fable 5.1 | Claude Code | 38,8% |
| 2 | GPT-6 Astra | Codex CLI | 33,8% |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31,2% |
| 4 | GLM 5.3 | Claude Code | 28,8% |
| 5 | Grok 4.6 | Grok Build | 23,8% |
| 5 | Muse Spark 1.3 | Muse Code | 23,8% |
| 7 | Kimi K3 | Kimi Code | 18,8% |
| 8 | GPT-5.6 Sol | Codex CLI | 16,2% |
Methodologie en Complexiteit
Expert-gegenereerde of synthetische taken kunnen goed ontworpen zijn, maar ze zijn niet exact de taken die engineers in echte bedrijven moeten uitvoeren. Onze taken verschillen op twee assen: het onderliggende code-artefact en de specificiteit van de instructie. Beiden voegen complexiteiten toe die huidige frontier-modellen uitdagen.
We maken gebruik van native harnesses om te weerspiegelen hoe enterprise-engineers in de praktijk werken. We evalueren dus combinaties van model en harness, in plaats van modellen in isolatie.
Voorbeeld van een taak: Bedrijfsspecifieke context
Een voorbeeldtaak betreft de correcte facturering, wat afhankelijk is van zakelijke regels en externe services.
Instructie: "Herstel de facturering zodat elk bedrijf de juiste belasting in rekening brengt en vrijgestelde klanten niet belast worden. De facturering start maandag opnieuw en elke factuur die deze service uitgeeft, is momenteel onbelast. Elk bedrijf op het platform regelt belasting anders: sommigen hanteren zelf een tarief, sommigen willen elke factuur beprijsd tegen de bestemming van de koper via onze belastingautoriteit-provider, en sommigen innen helemaal niets. Voor klanten waarvoor we een vrijstelling hebben, wordt niets in rekening gebracht, ongeacht de configuratie van het bedrijf. Het beprijzen van een bestemming betekent het versturen van beide adressen, de beprijsde regels en de productcategorie waaronder het bedrijf verkoopt naar de autoriteit (sandbox of productie, afhankelijk van het account). Een adres dat de autoriteit weigert, moet worden gemeld zonder de factuur te stoppen. Het tarief, de belasting en het bruto bedrag horen op de uitgegeven factuur te staan. Zodra een factuur is voldaan, wordt de verkoop teruggestuurd naar de autoriteit onder het factuurnummer voor de aansluiting van de aangiften. Facturen tussen Europese partijen tonen de btw-registraties van beide zijden. De autoriteit en het grootboek zijn beschikbaar via TAXJARURL, PRODTAXJARURL en INFLUXURL."
Gebruikte services in deze sandbox:
- TJTaxJar sandbox
- TJTaxJar productie
- InfluxDB ledger
- NestJS service (TypeScript)
Technische Omgeving
Agents werken over code, infrastructuur en zakelijke tools heen. Elke taak stelt alleen de services beschikbaar die nodig zijn voor de specifieke workflow.
- Infrastructuur: AWS emulator, Docker, Kubernetes, GitHub.
- Databases: PostgreSQL, MySQL, MongoDB, GeGel, Redis.
- Talen & Tools: Go, Python, Node.js, Vitest.
- Zakelijke tools: Slack, Intercom, Google Drive, Email, ClickUp, Linear MCP.
Selectie van Codebases
We hebben codebases geselecteerd via een streng screeningsproces, waarbij we ons richtten op echte bedrijven met aanzienlijk gebruik, sterke engineering-teams en veeleisende productieworkloads. Voorbeelden van gebruikte codebases zijn:
- Een concurrent van Luma/Partiful met 200K+ gebruikers en een top 100 App Store-ranking.
- Een consumenten-fintechplatform dat 100K+ bankafschriften verwerkt.
- Enterprise AI-verkoopplatforms die complexe zakelijke workflows ondersteunen.
We geven prioriteit aan code die is geschreven om aan een werkelijke gebruikers- of zakelijke behoefte te voldoen, boven code die enkel is geschreven om een benchmarktaak te creëren.
Analyse van de Complexiteit
Instructies en Implementatie
Korte instructies kunnen wijzigingen in veel verschillende bestanden vereisen. Agents moeten implementatiedetails zelf ontdekken in de codebase en omringende tools.
Gemiddelde promptlengte (median):
- Terminal-Bench 3: 31.584 tekens
- DeepSWE: 1.975 tekens
- FrontierCode: 2.056 tekens
- FrontierSWE v2: 992 tekens
- Real-SWE: 1.742 tekens
Gemiddeld aantal bewerkte bestanden door de referentieoplossing (median):
- FrontierCode: 6
- DeepSWE: 6
- Real-SWE: 11
Faalanalyse bij korte uitvoeringen
Modellen falen zelfs bij korte rollouts. 71,4% van de rollouts van minder dan 10 minuten faalde, vergeleken met 73,4% bij langere rollouts. Dit toont aan dat het triëren van meerdere systemen en het begrijpen van vereisten in codebases vol zakelijke logica zeer moeilijk is.
Waarom Real-SWE relevant is
We vinden dit type taken interessant om drie redenen:
- Natuurlijk 'Out of Distribution': Taken op private codebases zijn niet beschikbaar op het internet en zijn waarschijnlijk nooit gebruikt voor training. 99% van de tokens in echte bedrijven is verborgen voor frontier-modellen.
- Economisch levensvatbaar werk: Elke taak heeft een directe relatie met kosten en werd oorspronkelijk toegewezen aan een engineer met een salaris.
- Belang van bedrijfsspecifieke patronen: Bedrijven hechten aan codestandaarden en patronen. Onze resultaten laten zien dat huidige modellen zwak zijn in het begrijpen van deze patronen en vaak vereisten missen of aannames niet verifiëren.
Gedetailleerde Analyse van Taken
Hieronder volgt de analyse van een steekproef van taken.
Oplossingspercentages per taak
| Taak | Oplossingspercentage | Top Model (Pass/8) | Slechtste Model (Pass/8) |
| Multi-region sweep | 67,2% | GPT-6 Astra / Gemini / Muse (8/8) | Kimi K3 (2/8) |
| API keys & environments | 65,6% | Fable 5.1 (8/8) | Kimi K3 (0/8) |
| Entitlement overage lines | 50,0% | Fable 5.1 (8/8) | Grok / Muse / GPT-5.6 (1/8) |
| Customer identity migration | 40,6% | Grok 4.6 (8/8) | GPT-5.6 Sol (0/8) |
| Billing schedule migration | 14,1% | Fable 5.1 (3/8) | Grok / Muse / GPT-5.6 (0/8) |
| API token metering | 12,5% | GPT-6 Astra (5/8) | Gemini / Grok / Muse / GPT-5.6 (0/8) |
| S3 datastore measurement | 10,9% | GLM 5.3 (3/8) | GPT-6 / Gemini / GPT-5.6 (0/8) |
| Linearizable scan | 4,7% | GLM 5.3 (2/8) | GPT-6 / Gemini / Muse / Kimi / GPT-5.6 (0/8) |
| Tax jurisdiction | 3,1% | Fable 5.1 (1/8) | GPT-6 / Gemini / Grok / Muse / Kimi / GPT-5.6 (0/8) |
| Analytics stream reducer | 0,0% | Geen (0/8) | Alle modellen (0/8) |
Type Fouten
Het missen van vereisten is de meest voorkomende reden voor falen.
Definities van fouten:
- Unverified assumption: Bouwt voort op een gok over het systeem in plaats van dit te controleren in de workspace.
- Missed requirement: Laat gedrag weg dat in de instructie wordt vereist.
- Integration error: Het juiste idee, maar incorrect aangesloten op het omringende systeem.
- Regression: Breekt bestaand gedrag terwijl de wijziging wordt aangebracht.
- Wrong file: Levert de wijziging aan in een bestand dat door de applicatie nooit wordt aangeroepen (bijv. een eenmalig script).
Frequentie van fouten per model (percentage van gefaalde runs):
| Model | Unverified assumption | Missed requirement | Integration error | Regression | Wrong file |
| Fable 5.1 | 24,5% | 36,7% | 34,7% | 4,1% | 0% |
| GPT-6 Astra | 34,0% | 28,3% | 34,0% | 3,8% | 0% |
| Gemini 3.8 Flash | 10,9% | 29,1% | 49,1% | 10,9% | 0% |
| GLM 5.3 | 28,1% | 38,6% | 26,3% | 0% | 7,0% |
| Grok 4.6 | 24,6% | 67,2% | 8,2% | 0% | 0% |
| Muse Spark 1.3 | 19,7% | 36,1% | 41,0% | 3,3% | 0% |
| Kimi K3 | 15,4% | 53,8% | 27,7% | 0% | 3,1% |
| GPT-5.6 Sol | 43,3% | 31,3% | 16,4% | 9,0% | 0% |
Kosten en Inspanning
Hogere kosten garanderen geen hoger oplossingspercentage. De geschatte kosten per rollout variëren van \$2,50 tot \$6,96.
| Rank | Model | Geschatte kosten (USD) | Oplossingspercentage |
| 1 | Gemini 3.8 Flash | \$2,50 | 31,2% |
| 2 | GPT-5.6 Sol | \$2,65 | 16,2% |
| 3 | Muse Spark 1.3 | \$2,74 | 23,8% |
| 4 | Grok 4.6 | \$3,44 | 23,8% |
| 5 | Kimi K3 | \$3,90 | 18,8% |
| 6 | GPT-6 Astra | \$4,67 | 33,8% |
| 7 | GLM 5.3 | \$5,12 | 28,8% |
| 8 | Fable 5.1 | \$6,96 | 38,8% |
Gemiddeld output-tokens per rollout:
- GLM 5.3: 117k
- Gemini 3.8 Flash: 94k
- Muse Spark 1.3: 87k
- Grok 4.6: 67k
- Fable 5.1: 64k
- Kimi K3: 43k
- GPT-6 Astra: 24k
- GPT-5.6 Sol: 23k
Evaluatie-opzet
Elke agent werd uitgevoerd in een geïsoleerde sandbox. Alle taken zijn in Harbor-formaat en verifiers worden geïnjecteerd op het moment van beoordeling. De verifiers zijn gebaseerd op bestaande testsuites in de codebase of gebruiken deze tests letterlijk.