Ante Terminal Bench 2.1 Resultaten | Coding Agent Benchmark

Kerncijfers

  • Beste nauwkeurigheid: 82,7%
  • leidend model: DeepSeek V4 Flash 0731max
  • Taakset: 89 taken
  • Pogingen: 368 geslaagd van de 445 pogingen

Benchmarkprincipes

  • Wij benchmarken wat we leveren: Elke evaluatie maakt gebruik van een vastgepinde publieke Ante-release. Er worden geen specifieke prompts voor benchmarks of branches gebruikt die alleen voor evaluaties bedoeld zijn.
  • De runs zijn controleerbaar: Elk resultaat is gekoppeld aan de ruwe Harbor-run, zodat iedereen de pogingen achter de cijfers kan inspecteren.
  • De beperkingen zijn officieel: Alle pogingen volgen de officiële Terminal-Bench parameters: 89 taken, 5 pogingen per taak, strikte time-outs en hardwarelimieten.

Resultaten Ante-runs

Deze resultaten zijn gebaseerd op 89 taken met 5 pogingen per taak (bijgewerkt op 9 augustus 2026).

ModelNauwkeurigheidKosten ($)DuurAgentBronDatum
DeepSeek V4 Flash 0731max82,7% (±1.79 SE)$68,4138,9 minAnte0.preview.71Harbor link9 aug 2026
Grok 4.5medium*80,9% (±1.27 SE)$242,578,4 minAnte0.preview.56PR #12910 jul 2026
GLM 5.274,6% (±2.06 SE)$260,1111,3 minAnte0.preview.43Harbor link20 jun 2026
DeepSeek V4 Pro69,1% (±2.24 SE)$26,3448,4 minAnte0.preview.54Harbor link7 jul 2026
DeepSeek V4 Flash66,4% (±2.27 SE)$49,9841,4 minAnte0.preview.53Harbor link5 jul 2026
MiMo V2.565,8% (±2.30 SE)$73,7612,5 minAnte20260625-0824...Harbor link25 jun 2026
MiniMax M362,1% (±2.33 SE)$121,0013,9 minAnte20260623-0825...Harbor link23 jun 2026
Qwen3.6 27B56,2% (±2.36 SE)Lokaal61,6 minAnte20260701-0837...Harbor link3 jul 2026

\ Bij Grok 4.5medium werd 'reward hacking' geïdentificeerd in 20 trajecten. De weergegeven score sluit deze uit; zie PR #129 in de bron voor details.*

---

Terminal-Bench Referentie: Geverifieerde Publieke Leaderboard

Deze lijst bevat officiële geverifieerde rijen (bijgewerkt op 17 juli 2026) gebaseerd op dezelfde parameters: 89 taken en 5 pogingen per taak. Bron: Terminal-Bench official verified rows.

RankAgentModelNauwkeurigheidDatum
1Claude Code (Anthropic)Fable 5xhigh83,8% (±1.16 SE)7 jun 2026
-AnteDeepSeek V4 Flash 073182,7%(Zou tussen #2 en #3 passen)
-AnteGrok 4.580,9%(Zou tussen #2 en #3 passen)
2Codex (OpenAI)GPT-5.5xhigh83,2% (±1.13 SE)1 mei 2026
3Terminus 2 (Terminal-Bench)Fable 5high80,5% (±1.16 SE)5 jun 2026
4Cursor CLI (Cursor)Grok 4.5high79,3% (±1.46 SE)9 jul 2026
5Claude Code (Anthropic)Opus 4.8high78,9% (±1.31 SE)9 jul 2026
6Codex (OpenAI)GPT-5.6 Terramax78,4% (±1.25 SE)11 jul 2026
7Terminus 2 (Terminal-Bench)GPT-5.5xhigh78,0% (±1.22 SE)1 mei 2026
8mini-SWE-agent (Princeton)Muse Spark 1.1xhigh76,2% (±1.23 SE)9 jul 2026
9Codex (OpenAI)GPT-5.6 Lunamax75,7% (±1.32 SE)11 jul 2026
-AnteGLM 5.274,6%(Zou tussen #10 en #11 passen)
10Claude Code (Anthropic)Sonnet 5high74,6% (±1.64 SE)9 jul 2026
11Terminus 2 (Terminal-Bench)Gemini 3 Prohigh73,9% (±1.29 SE)1 mei 2026
-AnteDeepSeek V4 Pro69,1%(Zou tussen #11 en #12 passen)
12Claude Code (Anthropic)Opus 4.7max68,9% (±1.41 SE)1 mei 2026
-AnteDeepSeek V4 Flash66,4%(Zou tussen #12 en #13 passen)
13Terminus 2 (Terminal-Bench)Opus 4.7max66,1% (±1.37 SE)1 mei 2026
14Gemini CLI (Google)Gemini 3 Prohigh65,8% (±1.38 SE)1 mei 2026
-AnteMiMo V2.565,8%(Zou tussen #15 en #16 passen)
15Gemini CLI (Google)Gemini 3.1 Prohigh65,8% (±1.67 SE)5 mei 2026
-AnteMiniMax M362,1%(Zou tussen #16 en #17 passen)
16Terminus 2 (Terminal-Bench)Gemini 3.1 Prohigh65,6% (±1.65 SE)5 mei 2026
-AnteQwen3.6 27B56,2%(Zou onder #17 passen)
17Claude Code (Anthropic)GLM-5.1max58,6% (±1.24 SE)1 mei 2026