CursorBench 4.0

We evaluate agents on ambiguous, multi-file tasks from real Cursor sessions. Higher scores are better.

More about CursorBench
A scatter and line chart comparing Fable 5.1, Opus 5.5, Opus 5, Grok 4.7, Grok 4.6, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Sonnet 5.5, Sonnet 5, Haiku 5.5, Gemini 3.8 Flash, Muse Spark 1.3, GLM 5.3, GLM 5.3 Flash, and Composer 2.5 scores against average cost per task.60%CursorBench 4.0 score55%50%45%40%35%30%25%20%$18$15$12$9$6$3$0Average cost per taskOpus 5.5Fable 5.1Sonnet 5.5Haiku 5.5Gemini 3.8 FlashGPT-5.6 SolGrok 4.7
Model
1Opus 5.5 Max57.8%$13.43218,363185
2Opus 5.5 Extra High56.0%$6.98101,083109
3Opus 5.5 High56.0%$3.9753,07868
4Sonnet 5.5 Max55.5%$7.05271,920170
5Sonnet 5.5 Extra High53.1%$2.81100,15878
6Opus 5.5 Medium52.5%$2.9137,95454
7Fable 5.1 Max51.8%$17.28117,236128
8Fable 5.1 Extra High51.6%$13.0187,294101
9Fable 5.1 High49.2%$9.0858,43877
10Haiku 5.5 Max48.4%$1.12325,934163
11Sonnet 5.5 High47.8%$1.2037,39141
12Fable 5.1 Medium46.8%$7.0545,41163
13Opus 5 Max46.6%$11.9585,384106
14Grok 4.7 Extra High46.3%$6.0170,14188
15Opus 5 Extra High46.1%$11.4380,094103
16Fable 5.1 Low45.1%$5.4434,79551
17Opus 5 High44.7%$9.0061,40586
18Haiku 5.5 Extra High44.3%$0.56143,81393
19Grok 4.7 High43.9%$4.6956,38271
20Opus 5.5 Low43.7%$1.1715,81128
21Opus 5 Medium43.3%$6.9445,27272
22GLM 5.3 Max42.6%$5.0596,387166
23Haiku 5.5 High42.3%$0.3277,05759
24GPT-5.6 Sol Max41.7%$8.2342,94499
25Grok 4.7 Medium41.6%$3.4936,68360
26Muse Spark 1.3 Max41.6%$2.6452,00598
27Grok 4.6 Extra High41.4%$6.1049,81456
28GPT-5.6 Terra Max41.3%$5.1460,814107
29Opus 5 Low40.7%$4.8731,99557
30Grok 4.6 High40.4%$5.2041,38748
31Gemini 3.8 Flash High39.6%$4.70162,565324
32Sonnet 5.5 Medium39.2%$0.5216,03622
33GLM 5.3 High38.0%$3.2460,031114
34GPT-5.6 Sol Extra High37.7%$4.4024,72955
35Muse Spark 1.3 Extra High37.5%$2.1040,89183
36Gemini 3.8 Flash Medium37.3%$4.06128,364290
37Haiku 5.5 Medium36.9%$0.1742,65939
38GLM 5.3 Flash Max36.8%$0.3956,410118
39Grok 4.6 Medium36.1%$3.4824,89340
40GPT-5.6 Luna Max35.9%$1.0387,284208
41Sonnet 5.5 Low35.8%$0.3711,66818
42GPT-5.6 Sol High35.7%$2.8516,17441
43Sonnet 5 Max34.1%$7.17149,257140
44GPT-5.6 Terra Extra High33.6%$1.8123,43643
45Grok 4.6 Low33.4%$2.2516,30732
46Muse Spark 1.3 High33.4%$1.6630,65469
47GLM 5.3 Low33.3%$2.0431,98381
48Grok 4.7 Low33.1%$1.5815,67740
49GPT-5.6 Luna Extra High33.0%$0.4440,59898
50Muse Spark 1.3 Medium32.6%$1.4927,25564
51Sonnet 5 Extra High32.0%$4.5583,373102
52GPT-5.6 Sol Medium31.1%$1.7710,11132
53GLM 5.3 Flash High31.1%$0.2535,10484
54Haiku 5.5 Low30.9%$0.0823,38225
55Sonnet 5 High30.8%$3.4861,14685
56GPT-5.6 Terra High30.7%$1.1113,16233
57GPT-5.6 Luna High29.4%$0.2523,36864
58Muse Spark 1.3 Low29.3%$0.9317,48347
59Sonnet 5 Medium28.0%$2.3139,11465
60Composer 2.527.7%$0.6817,34741
61GPT-5.6 Terra Medium27.6%$0.647,30725
62GLM 5.3 Flash Low26.9%$0.1517,83158
63GPT-5.6 Terra Low25.2%$0.525,91423
64GPT-5.6 Sol Low24.6%$0.874,88521
65Muse Spark 1.3 Minimal24.3%$0.5610,62034
66Sonnet 5 Low24.1%$1.3923,77246
67GPT-5.6 Luna Medium22.2%$0.087,64232
68GPT-5.6 Luna Low16.0%$0.033,28818

Changelog

Reporting

  • Updated Sonnet 5.5 results to account for adjusted pricing.

Tasks

  • CursorBench 4.0
    • Introduced new long-horizon problems focused on edit, refactor, investigation, intent understanding, managing jobs, and design adherence.

Reporting

  • Updated Sonnet 5 results to account for adjusted pricing.

Reporting

  • Updated GPT-5.6 Terra and Luna results to account for adjusted pricing.

Reporting

  • Updated GPT-5.6 Sol, Terra, and Luna results to account for cache write costs.

Tasks

  • CursorBench 3.2
    • Introduced instruction following and advanced tool use problems.

Tasks

  • CursorBench 3.1
    • Introduced problems focused on codebase understanding, bugfinding, planning, and code review.
    • Improved grading criteria for some edit tasks.

Tasks

  • CursorBench 3.0
    • Initial set of tasks focused on edit, refactor, and bugfix problems.

Avg cost / task is computed by applying each model's published per-million-token pricing (input, cache read, cache write, and output) to the tokens it used on each task. Results are subject to variance; small differences in scores may not be statistically meaningful.