APIFlow-Bench 1.0 Leaderboard | Pagination
Whether a model walks paginated collections to completion — cursors, offsets, and page limits — instead of answering from the first page. 51 tasks × 24 models in this slice.
Pass rate
82.9%
Error Rate
0.1%
Trials
6,120
Tasks
51
Models
24
p95 Time
15.5m
p95 Tokens
1,111,810
Tool Calls Avg
24.1
| Rank | Rank Spread | Model | Pass rate ± 90% CI | Pass (no abstain) | Abstain% | p95 Time | p95 Tokens | Avg Tools |
|---|---|---|---|---|---|---|---|---|
| 1 | 1 ↔ 11 | gpt-5.5 | 92.2% 86.3%–98.0% | 94.0% 235/250 | 2.0% 5/255 | 2.8m | 411,784 | 19.3 |
| 2 | 1 ↔ 12 | gpt-5.6-sol | 91.8% 85.5%–97.6% | 94.0% 234/249 | 2.4% 6/255 | 11.5m | 332,659 | 17.5 |
| 3 | 1 ↔ 13 | deepseek-v4-flash | 91.4% 85.1%–96.9% | 92.1% 233/253 | 0.8% 2/255 | 3.7m | 883,444 | 25.6 |
| 3 | 1 ↔ 14 | kimi-k2p7-code | 91.4% 84.7%–97.3% | 92.5% 233/252 | 1.2% 3/255 | 13.0m | 678,749 | 17.9 |
| 5 | 1 ↔ 14 | claude-haiku-4-5-20251001 | 91.0% 84.3%–96.9% | 91.7% 232/253 | 0.8% 2/255 | 2.0m | 585,238 | 20.1 |
| 5 | 1 ↔ 14 | claude-opus-4-8 | 91.0% 84.7%–96.5% | 94.7% 232/245 | 3.9% 10/255 | 2.8m | 277,962 | 14.2 |
| 5 | 1 ↔ 14 | claude-sonnet-5 | 91.0% 84.3%–96.5% | 92.8% 232/250 | 2.0% 5/255 | 4.6m | 630,162 | 19.2 |
| 5 | 1 ↔ 14 | claude-sonnet-4-6 | 91.0% 85.1%–96.5% | 91.0% 232/255 | 0.0% 0/255 | 9.8m | 964,534 | 30.1 |
| 9 | 2 ↔ 15 | kimi-k3 | 90.6% 83.5%–96.5% | 90.6% 231/255 | 0.0% 0/255 | 38.8m | 1,239,877 | 26.7 |
| 10 | 2 ↔ 16 | gpt-5.6-terra | 90.2% 83.5%–96.1% | 92.4% 230/249 | 2.4% 6/255 | 3.8m | 158,636 | 14.4 |
| 10 | 2 ↔ 16 | kimi-k2p6 | 90.2% 82.4%–96.1% | 90.2% 230/255 | 0.0% 0/255 | 11.1m | 2,214,243 | 22.9 |
| 12 | 3 ↔ 17 | kimi-k2p5 | 89.4% 82.4%–96.1% | 90.8% 228/251 | 1.6% 4/255 | 2.7m | 457,528 | 17.3 |
| 12 | 3 ↔ 16 | glm-5p2 | 89.4% 82.7%–95.3% | 89.4% 228/255 | 0.0% 0/255 | 30.2m | 1,848,907 | 21.6 |
| 14 | 5 ↔ 18 | gpt-5.6-luna | 88.6% 81.6%–94.9% | 90.0% 226/251 | 1.6% 4/255 | 4.3m | 152,372 | 14.8 |
| 15 | 7 ↔ 20 | deepseek-v4-pro | 87.5% 80.0%–94.1% | 87.8% 223/254 | 0.4% 1/255 | 18.1m | 824,320 | 23.9 |
| 16 | 11 ↔ 21 | minimax-m2p7 | 86.3% 78.4%–92.9% | 87.6% 220/251 | 1.6% 4/255 | 1.8m | 324,539 | 15.1 |
| 16 | 11 ↔ 21 | qwen3p6-plus | 86.3% 79.6%–92.9% | 86.6% 220/254 | 0.4% 1/255 | 11.7m | 1,215,543 | 23.7 |
| 18 | 14 ↔ 21 | gpt-5-mini | 84.7% 77.6%–91.4% | 90.4% 216/239 | 6.3% 16/255 | 1.4m | 160,086 | 12.7 |
| 18 | 13 ↔ 21 | gpt-oss-20b | 84.7% 77.6%–91.0% | 87.1% 216/248 | 2.7% 7/255 | 4.2m | 159,641 | 16 |
| 18 | 14 ↔ 21 | qwen3p7-plus | 84.7% 77.6%–91.4% | 86.1% 216/251 | 1.6% 4/255 | 11.7m | 554,673 | 14 |
| 21 | 14 ↔ 21 | gpt-oss-120b | 84.3% 76.5%–91.4% | 84.6% 215/254 | 0.4% 1/255 | 49.7s | 164,607 | 15.1 |
| 22 | 22 ↔ 22 | gpt-5.4-mini | 70.2% 62.0%–78.4% | 75.5% 179/237 | 7.1% 18/255 | 24.0s | 42,407 | 11.4 |
| 23 | 23 ↔ 23 | minimax-m3 | 34.1% 27.4%–41.6% | 58.4% 87/149 | 41.6% 106/255 | 66.1m | 15,061,100 | 159.3 |
| 24 | 24 ↔ 24 | claude-fable-5 | 16.9% 9.4%–24.7% | 16.9% 43/255 | 0.0% 0/255 | 3.9m | 66,685 | 5.7 |
Diagnostics
Loading the full trial dataset for this view…