Postman APIFlow-Bench 1.0 Leaderboard
Task set ?20-subtask chain (11)15-subtask chain (11)10-subtask chain (12)5-subtask chain (13)Solo subtasks (82)All tasks (308)
Difficulty (as created):AllEasy (69)Medium (90)Hard (82)

Showing Solo subtasks created as hard — 82 tasks, 7,790 trials. Back to the default 20-subtask chain view.

APIFlow-Bench 1.0 Leaderboard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing the solo subtasks task set: 7,790 trials across 19 models and 82 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

☑ 7,790 trials ▤ 19 models ⛁ 82 tasks ⌖ Overall pass rate: 93.1%

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

RankModelScoringDifficulty bucket (pass rate)Horizon (pass rate)Cost / efficiencyBehavioral
Pass rate?API recovery?Easy?Long-horizon?Hard?Short?Medium?Long?Tool calls / trial?Time / trial?Tokens / trial?Cost / trial?Abstain %?Refusal %?
1claude-sonnet-597.6%400/410128/13699%138/140100%90/9098%171/17599%233/23598%156/160100%10/1014.055.4s138.6K$0.0601.2%5/4100.0%0/410
2claude-sonnet-4-696.8%397/41098/106100%140/140100%90/9095%166/17598%230/23598%156/160100%10/1012.047.7s118.9K$0.0620.0%0/4100.0%0/410
3kimi-k2p7-code96.6%396/410128/13499%138/14096%86/9097%170/17597%229/23597%155/160100%10/1013.51.9m96.6K$0.0361.0%4/4100.0%0/410
4gpt-5.596.3%395/410104/114100%140/14097%87/9096%168/17599%233/23595%152/160100%10/1014.131.6s54.0K$0.100.0%0/4100.0%0/410
5claude-opus-4-896.1%394/410121/134100%140/140100%90/9094%164/175100%235/23593%149/160100%10/1011.842.6s68.6K$0.0843.9%16/4100.0%0/410
6glm-5p295.6%392/410116/12697%136/14097%87/9097%169/17598%230/23595%152/160100%10/1014.33.2m85.7K$0.0770.0%0/4100.0%0/410
7kimi-k2p695.4%391/410134/14096%135/14094%85/9097%169/17597%227/23595%152/160100%10/1015.61.2m236.5K$0.0710.5%2/4100.0%0/410
7qwen3p6-plus95.4%391/410117/12997%136/14098%88/9095%167/17598%231/23594%150/160100%10/1015.11.4m136.5K$0.0530.0%0/4100.0%0/410
7deepseek-v4-pro95.4%391/410141/15299%139/14099%89/9093%162/17598%230/23594%150/160100%10/1018.93.5m130.3K$0.110.2%1/4100.0%0/410
10deepseek-v4-flash95.1%390/410139/14696%135/14096%86/9095%166/17596%225/23595%152/160100%10/1017.954.6s183.9K$0.0150.0%0/4100.0%0/410
11kimi-k2p593.9%385/410122/13097%136/14096%86/9092%161/17595%224/23593%149/160100%10/1012.128.6s75.1K$0.0310.7%3/4100.0%0/410
11gpt-5.6-terra93.9%385/41099/11298%137/14099%89/9091%159/17595%224/23594%151/160100%10/1012.31.0m36.6K$0.0362.0%8/4100.0%0/410
13minimax-m2p793.4%383/410144/15998%137/14094%85/9091%159/17596%225/23592%147/16090%9/1013.025.6s66.2K$0.0160.2%1/4100.0%0/410
14qwen3p7-plus93.2%382/410102/11397%136/14097%87/9092%159/17297%227/23492%146/15890%9/1011.93.5m146.6K$0.0421.7%7/4100.0%0/410
15claude-haiku-4-5-2025100192.4%379/410133/14795%133/14094%85/9092%161/17595%223/23591%146/160100%10/1014.829.5s101.6K$0.0261.7%7/4100.0%0/410
16gpt-oss-120b91.0%373/410130/14591%127/14098%88/9090%158/17591%215/23592%148/160100%10/1012.420.3s56.6K$0.0060.0%0/4100.0%0/410
17gpt-5-mini89.5%367/410115/12995%133/14090%81/9087%152/17593%218/23586%138/160100%10/1011.129.7s50.4K$0.0063.7%15/4100.0%0/410
18gpt-oss-20b87.1%357/410129/15086%121/14089%80/9089%156/17589%208/23588%140/16090%9/1013.51.5m65.4K$0.0032.0%8/4100.0%0/410
19gpt-5.4-mini74.4%305/410103/14981%114/14063%57/9077%134/17579%185/23572%115/16050%5/1010.314.2s20.9K$0.0082.7%11/4100.0%0/410

Slices

Behavior Mix
Top 10 of 19 models
passed?failed?abstained (clarify / report_blocked)?no-score?
Rank?Model?Mix?Pass rate?
1claude-sonnet-5
97.6%
2claude-sonnet-4-6
96.8%
3kimi-k2p7-code
96.6%
4gpt-5.5
96.3%
5claude-opus-4-8
96.1%
6glm-5p2
95.6%
7kimi-k2p6
95.4%
7qwen3p6-plus
95.4%
7deepseek-v4-pro
95.4%
10deepseek-v4-flash
95.1%
🔐Authentication
1,425 trials
Rank?Model?Pass rate?
1claude-sonnet-5100.0%
1claude-opus-4-8100.0%
1qwen3p6-plus100.0%
4glm-5p298.7%
5gpt-5.597.3%
6kimi-k2p696.0%
7kimi-k2p7-code94.7%
7deepseek-v4-pro94.7%
7qwen3p7-plus94.7%
10gpt-oss-120b93.3%
+9 more models below — click for the full ranking of all 19.
🔎Discovery
1,425 trials
Rank?Model?Pass rate?
18 models tied at 100%100.0%
9kimi-k2p598.7%
9deepseek-v4-flash98.7%
11qwen3p6-plus97.3%
11deepseek-v4-pro97.3%
13claude-haiku-4-5-2025100196.0%
14claude-sonnet-594.7%
15qwen3p7-plus93.3%
16gpt-oss-120b85.3%
16gpt-5-mini85.3%
18gpt-5.4-mini78.7%
+1 more model below — click for the full ranking of all 19.
Error Recovery
1,045 trials
Rank?Model?Pass rate?
1claude-sonnet-4-6100.0%
1claude-opus-4-8100.0%
1claude-sonnet-5100.0%
4gpt-5.6-terra98.2%
4deepseek-v4-pro98.2%
6minimax-m2p796.4%
6qwen3p6-plus96.4%
6qwen3p7-plus96.4%
9gpt-oss-120b94.5%
9gpt-5.594.5%
+9 more models below — click for the full ranking of all 19.
Multi-step Workflow
1,520 trials
Rank?Model?Pass rate?
1deepseek-v4-flash97.5%
2kimi-k2p696.2%
3kimi-k2p595.0%
3kimi-k2p7-code95.0%
3deepseek-v4-pro95.0%
6gpt-oss-120b93.8%
6gpt-5.593.8%
6claude-sonnet-4-693.8%
6claude-sonnet-593.8%
6glm-5p293.8%
+9 more models below — click for the full ranking of all 19.
Pagination
475 trials
Rank?Model?Pass rate?
111 models tied at 100%100.0%
12claude-opus-4-896.0%
12deepseek-v4-pro96.0%
14gpt-5.4-mini92.0%
14gpt-oss-120b92.0%
14qwen3p6-plus92.0%
14glm-5p292.0%
18claude-haiku-4-5-2025100188.0%
18gpt-oss-20b88.0%
Schema
855 trials
Rank?Model?Pass rate?
19 models tied at 100%100.0%
10deepseek-v4-flash97.8%
10gpt-5.597.8%
10gpt-oss-20b97.8%
10deepseek-v4-pro97.8%
14gpt-oss-120b95.6%
14gpt-5-mini95.6%
14gpt-5.6-terra95.6%
14claude-opus-4-895.6%
18minimax-m2p793.3%
19gpt-5.4-mini82.2%
Statefulness
1,045 trials
Rank?Model?Pass rate?
1claude-sonnet-598.2%
2claude-sonnet-4-694.5%
2kimi-k2p7-code94.5%
4gpt-5.592.7%
5claude-opus-4-890.9%
6deepseek-v4-pro89.1%
7deepseek-v4-flash87.3%
7qwen3p6-plus87.3%
7glm-5p287.3%
10gpt-5.6-terra85.5%
+9 more models below — click for the full ranking of all 19.

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).

claude-haiku-4-5-20251001
410 trials· 92.4%
claude-opus-4-8
410 trials· 96.1%
claude-sonnet-4-6
410 trials· 96.8%
claude-sonnet-5
410 trials· 97.6%
deepseek-v4-flash
410 trials· 95.1%
deepseek-v4-pro
410 trials· 95.4%
glm-5p2
410 trials· 95.6%
gpt-5-mini
410 trials· 89.5%
gpt-5.4-mini
410 trials· 74.4%
gpt-5.5
410 trials· 96.3%
gpt-5.6-terra
410 trials· 93.9%
gpt-oss-120b
410 trials· 91.0%
gpt-oss-20b
410 trials· 87.1%
kimi-k2p5
410 trials· 93.9%
kimi-k2p6
410 trials· 95.4%
kimi-k2p7-code
410 trials· 96.6%
minimax-m2p7
410 trials· 93.4%
qwen3p6-plus
410 trials· 95.4%
qwen3p7-plus
410 trials· 93.2%