Postman APIFlow-Bench 1.0 Leaderboard
Task set ?20-subtask chain (11)15-subtask chain (11)10-subtask chain (12)5-subtask chain (13)Solo subtasks (82)All tasks (308)
Difficulty (as created):AllEasy (69)Medium (90)Hard (308)

Showing All tasks created as hard — 308 tasks, 29,258 trials. Back to the default 20-subtask chain view.

APIFlow-Bench 1.0 Leaderboard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing all tasks: 29,258 trials across 19 models and 308 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

☑ 29,258 trials ▤ 19 models ⛁ 308 tasks ⌖ Overall pass rate: 81.3%

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

RankModelScoringDifficulty bucket (pass rate)Horizon (pass rate)Cost / efficiencyBehavioral
Pass rate?API recovery?Easy?Long-horizon?Hard?Hard + Long-horizon?Short?Medium?Long?Tool calls / trial?Time / trial?Tokens / trial?Cost / trial?Abstain %?Refusal %?
1claude-sonnet-4-685.8%1321/1540469/556100%140/140100%130/13095%171/18081%879/108598%230/23598%156/16082%934/114021.81.5m1.3M$0.440.2%3/15400.0%0/1540
2claude-opus-4-884.7%1305/1540537/625100%140/14096%125/13094%169/18080%871/1085100%235/23593%149/16081%921/114012.948.5s76.7K$0.0922.8%43/15400.0%0/1540
3deepseek-v4-flash84.6%1303/1540580/67496%135/14094%122/13095%171/18080%872/108596%225/23595%152/16081%923/114020.453.5s137.7K$0.0120.1%2/15400.0%0/1540
4gpt-5.584.5%1302/1540491/581100%140/14094%122/13096%173/18080%867/108599%233/23595%152/16080%917/114015.937.6s57.5K$0.120.4%6/15400.0%0/1540
5kimi-k2p684.2%1296/1540560/63896%135/14092%120/13097%174/18080%865/108597%227/23595%152/16080%915/114018.21.5m227.6K$0.0780.5%7/15400.0%0/1540
6glm-5p284.0%1294/1540521/61397%136/14095%123/13097%174/18079%861/108598%230/23595%152/16080%912/114017.24.1m159.4K$0.120.5%8/15400.0%0/1540
7kimi-k2p7-code83.9%1292/1540528/61899%138/14093%121/13097%175/18079%856/108597%229/23597%155/16079%906/114014.52.4m78.3K$0.0310.5%7/15400.0%0/1540
8claude-sonnet-583.6%1287/1540516/61899%138/14096%125/13098%176/18078%847/108599%233/23598%156/16079%897/114016.457.8s127.7K$0.0591.0%16/15400.0%0/1540
9qwen3p6-plus83.4%1283/1539544/65097%136/14095%124/13096%172/18079%851/108498%231/23594%150/16079%902/113917.41.6m161.2K$0.0630.0%0/15390.0%0/1539
10deepseek-v4-pro82.8%1275/1540670/80099%139/14095%124/13093%167/18078%844/108598%230/23594%150/16078%894/114022.13.8m123.9K$0.120.1%2/15400.0%0/1540
11claude-haiku-4-5-2025100182.3%1267/1540524/62495%133/14093%121/13092%166/18078%847/108595%223/23591%146/16079%898/114017.535.8s117.6K$0.0291.0%15/15400.0%0/1540
12gpt-5.6-terra82.1%1264/1540470/57098%137/14095%124/13091%164/18077%839/108595%224/23594%151/16078%889/114014.01.3m42.4K$0.0421.4%22/15400.0%0/1540
13minimax-m2p781.7%1257/1539564/67998%137/14092%120/13091%164/18077%834/108496%225/23592%147/16078%883/113913.726.2s61.6K$0.0150.5%8/15390.0%0/1539
14kimi-k2p581.4%1253/1540509/60697%136/14093%121/13092%166/18076%828/108595%224/23593%149/16077%878/114013.032.1s69.3K$0.0290.5%8/15400.0%0/1540
15qwen3p7-plus81.3%1252/1540472/57897%136/14094%121/12993%164/17777%831/107397%227/23492%146/15878%879/112712.94.1m123.8K$0.0371.1%17/15400.0%0/1540
16gpt-oss-120b77.9%1200/1540518/66691%127/14092%120/13090%162/18073%791/108591%215/23592%148/16073%837/114014.326.8s67.8K$0.0070.3%5/15400.0%0/1540
17gpt-oss-20b76.9%1184/1540557/71286%121/14088%114/13089%161/18073%788/108589%208/23588%140/16073%836/114015.81.7m78.0K$0.0041.8%28/15400.0%0/1540
18gpt-5-mini75.8%1168/1540489/62195%133/14088%115/13087%156/18070%763/108593%218/23586%138/16071%811/114012.236.0s54.8K$0.0065.8%90/15400.0%0/1540
19gpt-5.4-mini63.6%980/1540432/69281%114/14065%84/13077%138/18059%644/108579%185/23572%115/16060%680/114011.815.4s23.9K$0.0093.2%49/15400.0%0/1540

Slices

Behavior Mix
Top 10 of 19 models
passed?failed?abstained (clarify / report_blocked)?no-score?
Rank?Model?Mix?Pass rate?
1claude-sonnet-4-6
85.8%
2claude-opus-4-8
84.7%
3deepseek-v4-flash
84.6%
4gpt-5.5
84.5%
5kimi-k2p6
84.2%
6glm-5p2
84.0%
7kimi-k2p7-code
83.9%
8claude-sonnet-5
83.6%
9qwen3p6-plus
83.4%
10deepseek-v4-pro
82.8%
🔐Authentication
4,369 trials
Rank?Model?Pass rate?
1gpt-5.586.5%
2claude-sonnet-4-683.9%
3qwen3p6-plus83.5%
4glm-5p283.0%
5kimi-k2p682.6%
6deepseek-v4-flash82.2%
6deepseek-v4-pro82.2%
8kimi-k2p7-code81.7%
9qwen3p7-plus80.9%
10claude-opus-4-879.6%
+9 more models below — click for the full ranking of all 19.
🔎Discovery
4,750 trials
Rank?Model?Pass rate?
1claude-sonnet-4-676.4%
2claude-opus-4-874.4%
3gpt-5.570.8%
3glm-5p270.8%
5deepseek-v4-flash68.8%
6kimi-k2p568.4%
7claude-haiku-4-5-2025100168.0%
8qwen3p6-plus67.6%
8gpt-5.6-terra67.6%
8kimi-k2p667.6%
+9 more models below — click for the full ranking of all 19.
Error Recovery
4,560 trials
Rank?Model?Pass rate?
1claude-opus-4-887.1%
2claude-sonnet-4-685.8%
3deepseek-v4-flash85.4%
4claude-sonnet-585.0%
5qwen3p6-plus84.6%
6kimi-k2p7-code84.2%
6qwen3p7-plus84.2%
8glm-5p283.3%
9kimi-k2p682.5%
10minimax-m2p782.1%
+9 more models below — click for the full ranking of all 19.
Multi-step Workflow
4,655 trials
Rank?Model?Pass rate?
1kimi-k2p695.1%
1deepseek-v4-pro95.1%
1glm-5p295.1%
4deepseek-v4-flash93.9%
4claude-sonnet-593.9%
4kimi-k2p7-code93.9%
7gpt-5.593.1%
7claude-opus-4-893.1%
7qwen3p6-plus93.1%
10claude-sonnet-4-691.8%
+9 more models below — click for the full ranking of all 19.
Pagination
2,755 trials
Rank?Model?Pass rate?
1gpt-5.589.7%
2deepseek-v4-flash89.0%
3claude-haiku-4-5-2025100188.3%
3gpt-5.6-terra88.3%
3kimi-k2p7-code88.3%
6claude-opus-4-887.6%
6claude-sonnet-587.6%
6claude-sonnet-4-687.6%
9kimi-k2p686.2%
10minimax-m2p785.5%
+9 more models below — click for the full ranking of all 19.
Schema
3,610 trials
Rank?Model?Pass rate?
1kimi-k2p689.5%
2kimi-k2p588.4%
2deepseek-v4-flash88.4%
4claude-haiku-4-5-2025100187.4%
5kimi-k2p7-code86.3%
5qwen3p6-plus86.3%
7claude-sonnet-4-685.3%
7claude-sonnet-585.3%
9gpt-5.584.7%
10qwen3p7-plus83.7%
+9 more models below — click for the full ranking of all 19.
Statefulness
4,559 trials
Rank?Model?Pass rate?
1claude-sonnet-591.2%
2claude-sonnet-4-690.4%
3claude-opus-4-889.6%
4claude-haiku-4-5-2025100188.3%
4kimi-k2p7-code88.3%
4glm-5p288.3%
7minimax-m2p787.9%
7kimi-k2p687.9%
9qwen3p6-plus87.9%
10gpt-5.587.5%
+9 more models below — click for the full ranking of all 19.

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).

claude-haiku-4-5-20251001
1540 trials· 82.3%
claude-opus-4-8
1540 trials· 84.7%
claude-sonnet-4-6
1540 trials· 85.8%
claude-sonnet-5
1540 trials· 83.6%
deepseek-v4-flash
1540 trials· 84.6%
deepseek-v4-pro
1540 trials· 82.8%
glm-5p2
1540 trials· 84.0%
gpt-5-mini
1540 trials· 75.8%
gpt-5.4-mini
1540 trials· 63.6%
gpt-5.5
1540 trials· 84.5%
gpt-5.6-terra
1540 trials· 82.1%
gpt-oss-120b
1540 trials· 77.9%
gpt-oss-20b
1540 trials· 76.9%
kimi-k2p5
1540 trials· 81.4%
kimi-k2p6
1540 trials· 84.2%
kimi-k2p7-code
1540 trials· 83.9%
minimax-m2p7
1539 trials· 81.7%
qwen3p6-plus
1539 trials· 83.4%
qwen3p7-plus
1540 trials· 81.3%