SWE-2

Serving Stack

De serving-stack maakt gebruik van MoE-inferentie op NVFP4- en FP8-kernels met quantisatie-bewuste training; FP8 wordt gebruikt voor K-, Q-, V- en score-berekeningen in de MLA-lagen. Een draft-model, opnieuw getraind met SpecForge, zorgt voor 15% langere acceptatie-lengtes. Daarnaast verhoogt een prefill-delayer de TPM (Tokens Per Minute) per GPU en de tokens/sec per verzoek met 10 tot 20% (hoewel de TTFT — Time To First Token — hieronder lijdt).

Inspanningsniveaus (Effort Levels)

Het gemiddelde aantal stappen per run is:

  • Medium: 53 stappen
  • Hoog: 80 stappen
  • Max: 98 stappen

Ter vergelijking: SWE-1.7 vereiste 127 stappen. Het 'Medium'-niveau behaalt een hogere FrontierCode-score dan SWE-1.7 met 58% minder beurten en 81% lagere gemiddelde kosten. De eerste echte bewerking vindt plaats bij een mediaan van stap 18 (bij SWE-1.7 was dit stap 48).

Benchmarks

Op basis van zelfgerapporteerde gegevens van Cognition zijn de scores als volgt:

  • FrontierCode 1.1 Main: 50.0
  • DeepSWE 1.1: 73.0
  • Terminal-Bench 2.1: 92.8
  • Terminal-Bench 4.0: 27.3

De score van 50.0 op FrontierCode ligt één punt achter Claude Fable 5.1 (50.9) en 3.3 punten achter GPT-6 Astra (53.3). Cognition claimt echter dat de kosten 64% lager liggen dan bij Fable 5.1 en een kwart zijn van die van Astra. Terminal-Bench 2.1 is het hoogste getal in de gepubliceerde tabel. Het zwakke punt is Terminal-Bench 4.0, waar SWE-2 (27.3) ver achterblijft bij Fable 5.1 (55.8) en GPT-6 Astra (57.9). Dit suggereert dat het gat met de koplopers nog steeds bestaat bij agentic werk met een lange horizon.

Beschikbaarheid en Licenties

Het model maakt gebruik van propriëtaire gewichten; lokale uitvoering is niet mogelijk. Cognition heeft de gewichten van SWE-2 niet gepubliceerd, waardoor er niets te downloaden is en er geen quant-ladder beschikbaar is.

Het model is momenteel beschikbaar in Devin Desktop en CLI, met een uitrol naar Devin Web en Fusion. Cognition biedt geen per-token API aan voor SWE-2. De kostenvergelijkingen (zoals 64% goedkoper dan Fable 5.1 bij FrontierCode-pariteit) vormen daarom de prijsstructuur, in plaats van een tarievenlijst per miljoen tokens. Alle genoemde cijfers zijn afkomstig van Cognition en wachten op onafhankelijke replicatie.

Modelspecificaties

  • Categorieën: coding, agentic
  • Parameters: 2800.0B
  • Licentie: propriëtair
  • Ontwikkelaar: Cognition
  • Herkomst: USA 🇺🇸
  • Releasedatum: september 2026

Demo's en Publicaties

Er zijn echte demo's beschikbaar op X. De launch-post vermeldt: SWE-2, post-trained from Kimi K3 - FrontierCode 1.1 Main 50.0, Terminal-Bench 2.1 92.8.

Overzicht Benchmarkscores

(Vendor-gerapporteerd via de modelcard/technisch rapport van de ontwikkelaar)

BenchmarkScore
DeepSWE73.0
FrontierCode 1.1 Main50.0
Terminal-Bench 2.192.8
Terminal-Bench 4.027.3