APIFlow-Bench 1.0 Leaderboard | Discovery
Whether a model can find the right API surface on its own — locating endpoints, operations, and parameters from the spec and docs instead of being handed them. 73 tasks × 24 models in this slice.
Pass rate
72.1%
Error Rate
0.0%
Trials
8,760
Tasks
73
Models
24
p95 Time
8.2m
p95 Tokens
222,112
Tool Calls Avg
17.1
| Rank | Rank Spread | Model | Pass rate ± 90% CI | Pass (no abstain) | Abstain% | p95 Time | p95 Tokens | Avg Tools |
|---|---|---|---|---|---|---|---|---|
| 1 | 1 ↔ 6 | claude-sonnet-4-6 | 82.5% 75.3%–89.3% | 82.5% 301/365 | 0.0% 0/365 | 52.8s | 62,369 | 9.3 |
| 1 | 1 ↔ 6 | claude-opus-4-8 | 82.5% 75.1%–89.3% | 82.9% 301/363 | 0.5% 2/365 | 1.1m | 94,890 | 10.4 |
| 3 | 2 ↔ 14 | glm-5p2 | 79.5% 72.1%–86.3% | 79.5% 290/365 | 0.0% 0/365 | 5.6m | 114,702 | 13.3 |
| 4 | 2 ↔ 15 | gpt-5.5 | 78.9% 71.2%–86.3% | 78.9% 288/365 | 0.0% 0/365 | 1.0m | 57,235 | 11.5 |
| 5 | 2 ↔ 15 | deepseek-v4-flash | 78.6% 71.2%–86.0% | 78.6% 287/365 | 0.0% 0/365 | 1.6m | 145,002 | 15.3 |
| 6 | 3 ↔ 17 | kimi-k2p5 | 77.8% 69.6%–85.2% | 77.8% 284/365 | 0.0% 0/365 | 1.3m | 84,062 | 10.2 |
| 6 | 3 ↔ 17 | qwen3p6-plus | 77.8% 69.3%–85.2% | 77.8% 284/365 | 0.0% 0/365 | 1.6m | 105,289 | 10.9 |
| 6 | 3 ↔ 17 | kimi-k3 | 77.8% 69.6%–85.2% | 78.0% 284/364 | 0.3% 1/365 | 13.5m | 105,215 | 12.3 |
| 9 | 3 ↔ 18 | gpt-5.6-luna | 77.5% 69.3%–85.2% | 77.5% 283/365 | 0.0% 0/365 | 2.1m | 47,812 | 11.6 |
| 9 | 3 ↔ 18 | kimi-k2p6 | 77.5% 69.3%–85.2% | 77.5% 283/365 | 0.0% 0/365 | 2.4m | 234,263 | 13.3 |
| 9 | 3 ↔ 18 | gpt-5.6-sol | 77.5% 69.9%–85.5% | 77.5% 283/365 | 0.0% 0/365 | 3.3m | 46,936 | 12.2 |
| 9 | 3 ↔ 17 | deepseek-v4-pro | 77.5% 69.3%–84.9% | 77.5% 283/365 | 0.0% 0/365 | 5.3m | 128,679 | 16.7 |
| 13 | 3 ↔ 18 | claude-haiku-4-5-20251001 | 77.3% 69.3%–84.7% | 77.3% 282/365 | 0.0% 0/365 | 53.3s | 114,813 | 12.8 |
| 13 | 4 ↔ 18 | kimi-k2p7-code | 77.3% 69.0%–85.2% | 77.3% 282/365 | 0.0% 0/365 | 3.4m | 71,005 | 11 |
| 15 | 4 ↔ 18 | minimax-m2p7 | 76.7% 67.9%–84.4% | 76.9% 280/364 | 0.3% 1/365 | 37.6s | 87,002 | 11.3 |
| 16 | 5 ↔ 19 | gpt-5.6-terra | 76.4% 68.5%–84.4% | 76.4% 279/365 | 0.0% 0/365 | 1.8m | 57,234 | 12 |
| 17 | 5 ↔ 19 | claude-sonnet-5 | 76.2% 67.9%–84.1% | 76.2% 278/365 | 0.0% 0/365 | 1.6m | 167,399 | 12.9 |
| 18 | 8 ↔ 19 | qwen3p7-plus | 75.1% 67.1%–82.7% | 75.3% 274/364 | 0.3% 1/365 | 9.5m | 572,018 | 9.6 |
| 19 | 14 ↔ 20 | gpt-oss-120b | 72.3% 64.4%–80.3% | 72.3% 264/365 | 0.0% 0/365 | 40.6s | 100,743 | 12.5 |
| 20 | 17 ↔ 21 | gpt-5-mini | 70.4% 61.9%–78.1% | 74.3% 257/346 | 5.2% 19/365 | 57.1s | 75,510 | 10.3 |
| 21 | 20 ↔ 22 | gpt-oss-20b | 67.4% 59.5%–75.3% | 68.3% 246/360 | 1.4% 5/365 | 3.8m | 121,648 | 13.9 |
| 22 | 21 ↔ 22 | gpt-5.4-mini | 62.7% 54.5%–70.7% | 64.3% 229/356 | 2.5% 9/365 | 21.6s | 38,081 | 10.2 |
| 23 | 23 ↔ 23 | minimax-m3 | 30.7% 25.2%–36.4% | 44.4% 112/252 | 31.0% 113/365 | 61.4m | 15,108,649 | 142.5 |
| 24 | 24 ↔ 24 | claude-fable-5 | 23.3% 17.0%–29.9% | 23.3% 85/365 | 0.0% 0/365 | 3.6m | 69,988 | 4.2 |
Diagnostics
Loading the full trial dataset for this view…