APIFlow-Bench 1.0 Leaderboard | Multi-step Workflow
How well a model chains dependent API calls end-to-end, carrying identifiers and intermediate results across steps without dropping them. 68 tasks × 24 models in this slice.
Pass rate
85.4%
Error Rate
0.0%
Trials
8,160
Tasks
68
Models
24
p95 Time
12.6m
p95 Tokens
668,793
Tool Calls Avg
22.7
| Rank | Rank Spread | Model | Pass rate ± 90% CI | Pass (no abstain) | Abstain% | p95 Time | p95 Tokens | Avg Tools |
|---|---|---|---|---|---|---|---|---|
| 1 | 1 ↔ 5 | kimi-k3 | 96.5% 93.5%–98.8% | 96.8% 328/339 | 0.3% 1/340 | 26.6m | 459,054 | 16.7 |
| 2 | 1 ↔ 12 | deepseek-v4-pro | 95.0% 90.6%–98.5% | 95.3% 323/339 | 0.3% 1/340 | 9.4m | 174,636 | 21.2 |
| 3 | 2 ↔ 13 | glm-5p2 | 94.4% 90.0%–97.9% | 94.4% 321/340 | 0.0% 0/340 | 20.7m | 366,777 | 16.9 |
| 4 | 2 ↔ 13 | claude-opus-4-8 | 94.1% 90.0%–97.6% | 96.4% 320/332 | 2.4% 8/340 | 1.7m | 125,249 | 12.5 |
| 4 | 2 ↔ 14 | deepseek-v4-flash | 94.1% 90.3%–97.4% | 94.4% 320/339 | 0.3% 1/340 | 2.1m | 182,816 | 21.4 |
| 4 | 2 ↔ 14 | claude-sonnet-5 | 94.1% 89.4%–97.9% | 95.2% 320/336 | 1.2% 4/340 | 2.5m | 243,031 | 16.2 |
| 4 | 2 ↔ 15 | kimi-k2p7-code | 94.1% 90.0%–97.6% | 95.0% 320/337 | 0.9% 3/340 | 6.3m | 165,772 | 15.4 |
| 8 | 2 ↔ 16 | kimi-k2p6 | 93.8% 89.4%–97.9% | 94.1% 319/339 | 0.3% 1/340 | 4.2m | 358,749 | 18 |
| 8 | 2 ↔ 16 | qwen3p6-plus | 93.8% 89.4%–97.6% | 93.8% 319/340 | 0.0% 0/340 | 13.1m | 784,420 | 20.6 |
| 10 | 3 ↔ 16 | gpt-5.6-luna | 93.5% 88.2%–97.9% | 94.1% 318/338 | 0.6% 2/340 | 2.7m | 67,531 | 14.2 |
| 10 | 2 ↔ 16 | gpt-5.6-sol | 93.5% 88.5%–97.9% | 94.6% 318/336 | 1.2% 4/340 | 6.2m | 141,922 | 15.2 |
| 12 | 3 ↔ 16 | gpt-5.5 | 93.2% 88.2%–97.6% | 93.2% 317/340 | 0.0% 0/340 | 1.9m | 138,655 | 15.7 |
| 13 | 4 ↔ 17 | claude-sonnet-4-6 | 92.9% 88.5%–97.1% | 92.9% 316/340 | 0.0% 0/340 | 1.7m | 92,601 | 24.9 |
| 14 | 6 ↔ 18 | qwen3p7-plus | 92.4% 87.9%–96.2% | 93.5% 314/336 | 1.2% 4/340 | 9.4m | 526,279 | 13.2 |
| 15 | 7 ↔ 18 | gpt-5.6-terra | 92.1% 86.5%–96.8% | 93.2% 313/336 | 1.2% 4/340 | 2.6m | 98,677 | 14.4 |
| 16 | 9 ↔ 19 | minimax-m2p7 | 91.2% 86.5%–95.6% | 91.4% 310/339 | 0.3% 1/340 | 1.5m | 126,568 | 14.6 |
| 16 | 9 ↔ 18 | kimi-k2p5 | 91.2% 86.5%–95.6% | 91.7% 310/338 | 0.6% 2/340 | 1.6m | 91,841 | 13.8 |
| 18 | 9 ↔ 19 | claude-haiku-4-5-20251001 | 90.9% 85.6%–95.6% | 91.7% 309/337 | 0.9% 3/340 | 2.1m | 216,994 | 17.9 |
| 19 | 18 ↔ 21 | gpt-oss-120b | 86.8% 80.6%–92.9% | 87.3% 295/338 | 0.6% 2/340 | 1.0m | 142,674 | 14.6 |
| 19 | 18 ↔ 21 | gpt-5-mini | 86.8% 81.2%–92.1% | 91.6% 295/322 | 5.3% 18/340 | 1.1m | 118,022 | 12.7 |
| 21 | 19 ↔ 21 | gpt-oss-20b | 85.9% 79.4%–91.8% | 86.4% 292/338 | 0.6% 2/340 | 4.4m | 173,029 | 16.1 |
| 22 | 22 ↔ 22 | gpt-5.4-mini | 76.2% 69.4%–82.4% | 79.0% 259/328 | 3.5% 12/340 | 24.7s | 41,707 | 12.6 |
| 23 | 23 ↔ 23 | minimax-m3 | 20.9% 15.0%–26.8% | 44.7% 71/159 | 53.2% 181/340 | 71.8m | 17,232,979 | 182.3 |
| 24 | 24 ↔ 24 | claude-fable-5 | 12.4% 7.1%–18.2% | 12.4% 42/340 | 0.0% 0/340 | 3.0m | 55,662 | 3 |
Diagnostics
Loading the full trial dataset for this view…