Postman

APIFlow-Bench 1.0 Leaderboard

Solo subtasksHard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing the solo subtasks task set: 9,840 trials across 24 models and 82 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

Overall pass rate88.3%Trials9,840Models24Tasks82

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

Rank
Model
Scoring
Difficulty bucket (pass rate)
Horizon (pass rate)
Cost / efficiency
Behavioral
Pass rate
API recovery
Easy
Long-horizon
Hard
Short
Medium
Long
Tool calls / trial
Time / trial
Tokens / trial
Cost / trial
Abstain %
Refusal %
2claude-sonnet-597.6%400/410128/13699%138/140100%90/9098%171/17599%233/23598%156/160100%10/1014.055.4s138.6K$0.0601.2%5/4100.0%0/410
3claude-sonnet-4-696.8%397/41098/106100%140/140100%90/9095%166/17598%230/23598%156/160100%10/1012.047.7s118.9K$0.0620.0%0/4100.0%0/410
4kimi-k2p7-code96.6%396/410128/13499%138/14096%86/9097%170/17597%229/23597%155/160100%10/1013.51.9m96.6K$0.0361.0%4/4100.0%0/410
5gpt-5.596.3%395/410104/114100%140/14097%87/9096%168/17599%233/23595%152/160100%10/1014.131.6s54.0K$0.100.0%0/4100.0%0/410
6claude-opus-4-896.1%394/410121/134100%140/140100%90/9094%164/175100%235/23593%149/160100%10/1011.842.6s68.6K$0.0843.9%16/4100.0%0/410
7gpt-5.6-sol95.9%393/41092/10399%139/140100%90/9094%164/17598%230/23596%153/160100%10/1013.32.1m44.8K$0.0902.2%9/4100.0%0/410
8glm-5p295.6%392/410116/12697%136/14097%87/9097%169/17598%230/23595%152/160100%10/1014.33.2m85.7K$0.0770.0%0/4100.0%0/410
9kimi-k2p695.4%391/410134/14096%135/14094%85/9097%169/17597%227/23595%152/160100%10/1015.61.2m236.5K$0.0710.5%2/4100.0%0/410
9qwen3p6-plus95.4%391/410117/12997%136/14098%88/9095%167/17598%231/23594%150/160100%10/1015.11.4m136.5K$0.0530.0%0/4100.0%0/410
9deepseek-v4-pro95.4%391/410141/15299%139/14099%89/9093%162/17598%230/23594%150/160100%10/1018.93.5m130.3K$0.110.2%1/4100.0%0/410
12deepseek-v4-flash95.1%390/410139/14696%135/14096%86/9095%166/17596%225/23595%152/160100%10/1017.954.6s183.9K$0.0150.0%0/4100.0%0/410
13gpt-5.6-luna94.4%387/410101/11298%137/14098%88/9093%162/17596%226/23594%151/160100%10/1012.61.4m32.1K$0.0131.2%5/4100.0%0/410
14kimi-k2p593.9%385/410122/13097%136/14096%86/9092%161/17595%224/23593%149/160100%10/1012.128.6s75.1K$0.0310.7%3/4100.0%0/410
14gpt-5.6-terra93.9%385/41099/11298%137/14099%89/9091%159/17595%224/23594%151/160100%10/1012.31.0m36.6K$0.0362.0%8/4100.0%0/410
16minimax-m2p793.4%383/410144/15998%137/14094%85/9091%159/17596%225/23592%147/16090%9/1013.025.6s66.2K$0.0160.2%1/4100.0%0/410
17qwen3p7-plus93.2%382/410102/11397%136/14097%87/9092%159/17297%227/23492%146/15890%9/1011.93.5m146.6K$0.0421.7%7/4100.0%0/410
18claude-haiku-4-5-2025100192.4%379/410133/14795%133/14094%85/9092%161/17595%223/23591%146/160100%10/1014.829.5s101.6K$0.0261.7%7/4100.0%0/410
19gpt-oss-120b91.0%373/410130/14591%127/14098%88/9090%158/17591%215/23592%148/160100%10/1012.420.3s56.6K$0.0060.0%0/4100.0%0/410
20gpt-5-mini89.5%367/410115/12995%133/14090%81/9087%152/17593%218/23586%138/160100%10/1011.129.7s50.4K$0.0063.7%15/4100.0%0/410
21gpt-oss-20b87.1%357/410129/15086%121/14089%80/9089%156/17589%208/23588%140/16090%9/1013.51.5m65.4K$0.0032.0%8/4100.0%0/410
22gpt-5.4-mini74.4%305/410103/14981%114/14063%57/9077%134/17579%185/23572%115/16050%5/1010.314.2s20.9K$0.0082.7%11/4100.0%0/410
23minimax-m341.5%170/410170/41060%84/14028%25/9035%61/17560%140/23518%29/16010%1/10141.823.5m3.8M$0.2633.9%139/4100.0%0/410
24claude-fable-520.5%84/4102/825%35/14022%20/9017%29/17523%55/23518%29/1600%0/103.41.0m17.4K$0.0380.0%0/41082.9%340/410

Slices

Behavior Mix
10 models
passedfailedabstainedno-score
RankModelMixPass rate
1kimi-k3
99.0%
2claude-sonnet-5
97.6%
3claude-sonnet-4-6
96.8%
4kimi-k2p7-code
96.6%
5gpt-5.5
96.3%
6claude-opus-4-8
96.1%
7gpt-5.6-sol
95.9%
8glm-5p2
95.6%
9kimi-k2p6
95.4%
9qwen3p6-plus
95.4%
Authentication
1,800 trials
RankModelPass rate
1claude-sonnet-5100.0%
1claude-opus-4-8100.0%
1qwen3p6-plus100.0%
1kimi-k3100.0%
5glm-5p298.7%
6gpt-5.597.3%
7kimi-k2p696.0%
8kimi-k2p7-code94.7%
8gpt-5.6-sol94.7%
8deepseek-v4-pro94.7%
Discovery
1,800 trials
RankModelPass rate
11kimi-k2p598.7%
11deepseek-v4-flash98.7%
13qwen3p6-plus97.3%
13gpt-5.6-luna97.3%
13deepseek-v4-pro97.3%
16claude-haiku-4-5-2025100196.0%
17claude-sonnet-594.7%
18qwen3p7-plus93.3%
19gpt-oss-120b85.3%
19gpt-5-mini85.3%
Error Recovery
1,320 trials
RankModelPass rate
6gpt-5.6-terra98.2%
6deepseek-v4-pro98.2%
8minimax-m2p796.4%
8qwen3p6-plus96.4%
8gpt-5.6-luna96.4%
8qwen3p7-plus96.4%
12gpt-oss-120b94.5%
12gpt-5.594.5%
12kimi-k2p7-code94.5%
12glm-5p294.5%
Multi-step Workflow
1,920 trials
RankModelPass rate
1kimi-k398.8%
2deepseek-v4-flash97.5%
3kimi-k2p696.2%
4kimi-k2p595.0%
4kimi-k2p7-code95.0%
4deepseek-v4-pro95.0%
7gpt-oss-120b93.8%
7gpt-5.593.8%
7gpt-5.6-luna93.8%
7gpt-5.6-sol93.8%
Pagination
600 trials
RankModelPass rate
14claude-opus-4-896.0%
14gpt-5.6-sol96.0%
14deepseek-v4-pro96.0%
17gpt-5.4-mini92.0%
17gpt-oss-120b92.0%
17qwen3p6-plus92.0%
17glm-5p292.0%
21claude-haiku-4-5-2025100188.0%
21gpt-oss-20b88.0%
23minimax-m356.0%
Schema
1,080 trials
RankModelPass rate
12deepseek-v4-flash97.8%
12gpt-5.597.8%
12gpt-oss-20b97.8%
12gpt-5.6-sol97.8%
12deepseek-v4-pro97.8%
17gpt-oss-120b95.6%
17gpt-5-mini95.6%
17gpt-5.6-terra95.6%
17claude-opus-4-895.6%
21minimax-m2p793.3%
Statefulness
1,320 trials
RankModelPass rate
1claude-sonnet-598.2%
2claude-sonnet-4-694.5%
2kimi-k2p7-code94.5%
2kimi-k394.5%
5gpt-5.592.7%
6claude-opus-4-890.9%
7gpt-5.6-sol89.1%
7deepseek-v4-pro89.1%
9deepseek-v4-flash87.3%
9qwen3p6-plus87.3%

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).