Overzicht van SWE-2
SWE-2 is een Mixture of Experts (MoE) model ontwikkeld door Cognition, gebaseerd op Kimi K3 en verder ontwikkeld met Reinforcement Learning (RL). Het model beschikt over 2,8 biljoen totale parameters, waarvan er 104 miljard actief zijn per token.
Technische Optimalisaties De serving-stack is geoptimaliseerd met NVFP4- en FP8-kernels en maakt gebruik van een draft-model via SpecForge voor langere acceptatie-lengtes. Daarnaast verbetert een prefill-delayer de tokens per seconde en de TPM per GPU.
Prestaties en Efficiëntie In vergelijking met SWE-1.7 is SWE-2 aanzienlijk efficiënter. Het 'Medium'-niveau behaalt een hogere FrontierCode-score met 58% minder beurten en 81% lagere kosten. De tijd tot de eerste effectieve bewerking is ook drastisch verkort.
Benchmarks
- Sterke punten: Zeer hoge score op Terminal-Bench 2.1 (92.8) en competitief op FrontierCode 1.1 (50.0), waarbij de kosten aanzienlijk lager liggen dan bij Claude Fable 5.1 en GPT-6 Astra.
- Zwakke punten: Een aanzienlijk lagere score op Terminal-Bench 4.0, wat wijst op uitdagingen bij complexe taken met een lange horizon.
Beschikbaarheid Het model is propriëtair en niet publiekelijk beschikbaar voor lokale uitvoering of via een per-token API. Het is momenteel geïntegreerd in Devin Desktop en CLI, met een geplande uitrol naar Devin Web en Fusion.
SWE-2
Serving Stack
De serving-stack maakt gebruik van MoE-inferentie op NVFP4- en FP8-kernels met quantisatie-bewuste training; FP8 wordt gebruikt voor K-, Q-, V- en score-berekeningen in de MLA-lagen. Een draft-model, opnieuw getraind met SpecForge, zorgt voor 15% langere acceptatie-lengtes. Daarnaast verhoogt een prefill-delayer de TPM (Tokens Per Minute) per GPU en de tokens/sec per verzoek met 10 tot 20% (hoewel de TTFT — Time To First Token — hieronder lijdt).
Inspanningsniveaus (Effort Levels)
Het gemiddelde aantal stappen per run is:
- Medium: 53 stappen
- Hoog: 80 stappen
- Max: 98 stappen
Ter vergelijking: SWE-1.7 vereiste 127 stappen. Het 'Medium'-niveau behaalt een hogere FrontierCode-score dan SWE-1.7 met 58% minder beurten en 81% lagere gemiddelde kosten. De eerste echte bewerking vindt plaats bij een mediaan van stap 18 (bij SWE-1.7 was dit stap 48).
Benchmarks
Op basis van zelfgerapporteerde gegevens van Cognition zijn de scores als volgt:
- FrontierCode 1.1 Main: 50.0
- DeepSWE 1.1: 73.0
- Terminal-Bench 2.1: 92.8
- Terminal-Bench 4.0: 27.3
De score van 50.0 op FrontierCode ligt één punt achter Claude Fable 5.1 (50.9) en 3.3 punten achter GPT-6 Astra (53.3). Cognition claimt echter dat de kosten 64% lager liggen dan bij Fable 5.1 en een kwart zijn van die van Astra. Terminal-Bench 2.1 is het hoogste getal in de gepubliceerde tabel. Het zwakke punt is Terminal-Bench 4.0, waar SWE-2 (27.3) ver achterblijft bij Fable 5.1 (55.8) en GPT-6 Astra (57.9). Dit suggereert dat het gat met de koplopers nog steeds bestaat bij agentic werk met een lange horizon.
Beschikbaarheid en Licenties
Het model maakt gebruik van propriëtaire gewichten; lokale uitvoering is niet mogelijk. Cognition heeft de gewichten van SWE-2 niet gepubliceerd, waardoor er niets te downloaden is en er geen quant-ladder beschikbaar is.
Het model is momenteel beschikbaar in Devin Desktop en CLI, met een uitrol naar Devin Web en Fusion. Cognition biedt geen per-token API aan voor SWE-2. De kostenvergelijkingen (zoals 64% goedkoper dan Fable 5.1 bij FrontierCode-pariteit) vormen daarom de prijsstructuur, in plaats van een tarievenlijst per miljoen tokens. Alle genoemde cijfers zijn afkomstig van Cognition en wachten op onafhankelijke replicatie.
Modelspecificaties
- Categorieën: coding, agentic
- Parameters: 2800.0B
- Licentie: propriëtair
- Ontwikkelaar: Cognition
- Herkomst: USA 🇺🇸
- Releasedatum: september 2026
Demo's en Publicaties
Er zijn echte demo's beschikbaar op X. De launch-post vermeldt: SWE-2, post-trained from Kimi K3 - FrontierCode 1.1 Main 50.0, Terminal-Bench 2.1 92.8.
Overzicht Benchmarkscores
(Vendor-gerapporteerd via de modelcard/technisch rapport van de ontwikkelaar)
| Benchmark | Score |
| DeepSWE | 73.0 |
| FrontierCode 1.1 Main | 50.0 |
| Terminal-Bench 2.1 | 92.8 |
| Terminal-Bench 4.0 | 27.3 |
SWE-2
Serving Stack
De serving-stack maakt gebruik van MoE-inferentie op NVFP4- en FP8-kernels met quantisatie-bewuste training; FP8 wordt gebruikt voor K-, Q-, V- en score-berekeningen in de MLA-lagen. Een draft-model, opnieuw getraind met SpecForge, zorgt voor 15% langere acceptatie-lengtes. Daarnaast verhoogt een prefill-delayer de TPM (Tokens Per Minute) per GPU en de tokens/sec per verzoek met 10 tot 20% (hoewel de TTFT — Time To First Token — hieronder lijdt).
Inspanningsniveaus (Effort Levels)
Het gemiddelde aantal stappen per run is:
- Medium: 53 stappen
- Hoog: 80 stappen
- Max: 98 stappen
Ter vergelijking: SWE-1.7 vereiste 127 stappen. Het 'Medium'-niveau behaalt een hogere FrontierCode-score dan SWE-1.7 met 58% minder beurten en 81% lagere gemiddelde kosten. De eerste echte bewerking vindt plaats bij een mediaan van stap 18 (bij SWE-1.7 was dit stap 48).
Benchmarks
Op basis van zelfgerapporteerde gegevens van Cognition zijn de scores als volgt:
- FrontierCode 1.1 Main: 50.0
- DeepSWE 1.1: 73.0
- Terminal-Bench 2.1: 92.8
- Terminal-Bench 4.0: 27.3
De score van 50.0 op FrontierCode ligt één punt achter Claude Fable 5.1 (50.9) en 3.3 punten achter GPT-6 Astra (53.3). Cognition claimt echter dat de kosten 64% lager liggen dan bij Fable 5.1 en een kwart zijn van die van Astra. Terminal-Bench 2.1 is het hoogste getal in de gepubliceerde tabel. Het zwakke punt is Terminal-Bench 4.0, waar SWE-2 (27.3) ver achterblijft bij Fable 5.1 (55.8) en GPT-6 Astra (57.9). Dit suggereert dat het gat met de koplopers nog steeds bestaat bij agentic werk met een lange horizon.
Beschikbaarheid en Licenties
Het model maakt gebruik van propriëtaire gewichten; lokale uitvoering is niet mogelijk. Cognition heeft de gewichten van SWE-2 niet gepubliceerd, waardoor er niets te downloaden is en er geen quant-ladder beschikbaar is.
Het model is momenteel beschikbaar in Devin Desktop en CLI, met een uitrol naar Devin Web en Fusion. Cognition biedt geen per-token API aan voor SWE-2. De kostenvergelijkingen (zoals 64% goedkoper dan Fable 5.1 bij FrontierCode-pariteit) vormen daarom de prijsstructuur, in plaats van een tarievenlijst per miljoen tokens. Alle genoemde cijfers zijn afkomstig van Cognition en wachten op onafhankelijke replicatie.
Modelspecificaties
- Categorieën: coding, agentic
- Parameters: 2800.0B
- Licentie: propriëtair
- Ontwikkelaar: Cognition
- Herkomst: USA 🇺🇸
- Releasedatum: september 2026
Demo's en Publicaties
Er zijn echte demo's beschikbaar op X. De launch-post vermeldt: SWE-2, post-trained from Kimi K3 - FrontierCode 1.1 Main 50.0, Terminal-Bench 2.1 92.8.
Overzicht Benchmarkscores
(Vendor-gerapporteerd via de modelcard/technisch rapport van de ontwikkelaar)
| Benchmark | Score |
| DeepSWE | 73.0 |
| FrontierCode 1.1 Main | 50.0 |
| Terminal-Bench 2.1 | 92.8 |
| Terminal-Bench 4.0 | 27.3 |