Postman APIFlow-Bench 1.0 Leaderboard
Task set ?20-subtask chain (11)15-subtask chain (11)10-subtask chain (12)5-subtask chain (13)Solo subtasks (241)All tasks (467)

Showing 15-subtask chain — 11 tasks, 1,045 trials. Back to the default 20-subtask chain view.

APIFlow-Bench 1.0 Leaderboard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing the 15-subtask chain task set: 1,045 trials across 19 models and 11 tasks covering 6 of the 7 axes — authentication, discovery, error recovery, multi-step workflow, schema, statefulness (all 7 under All tasks). Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

☑ 1,045 trials ▤ 19 models ⛁ 11 tasks ⌖ Overall pass rate: 66.3%

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty/horizon breakdowns are omitted: every task in this slice is judged Hard + Long-horizon and Long-horizon. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

RankModelScoringCost / efficiencyBehavioral
Pass rate?API recovery?Tool calls / trial?Time / trial?Tokens / trial?Cost / trial?Abstain %?Refusal %?
1glm-5p274.5%41/5516/2013.31.6m46.9K$0.0380.0%0/550.0%0/55
2gpt-5.572.7%40/5516/2111.924.8s26.4K$0.0690.0%0/550.0%0/55
2claude-sonnet-572.7%40/5515/2014.535.3s68.4K$0.0310.0%0/550.0%0/55
2claude-opus-4-872.7%40/5516/2110.635.9s51.2K$0.0620.0%0/550.0%0/55
2kimi-k2p7-code72.7%40/5515/2010.81.9m28.2K$0.0130.0%0/550.0%0/55
6deepseek-v4-flash70.9%39/5516/2217.938.8s52.3K$0.0050.0%0/550.0%0/55
6kimi-k2p670.9%39/5514/1912.334.9s41.5K$0.0200.0%0/550.0%0/55
8qwen3p6-plus69.1%38/5520/2511.229.3s42.3K$0.0180.0%0/550.0%0/55
8claude-sonnet-4-669.1%38/5513/1810.332.2s37.2K$0.0270.0%0/550.0%0/55
8gpt-oss-120b69.1%38/5513/1813.741.6s60.2K$0.0060.0%0/550.0%0/55
11qwen3p7-plus67.3%37/5515/209.23.5m77.5K$0.0310.0%0/550.0%0/55
12gpt-5.6-terra65.5%36/5511/1612.41.2m30.6K$0.0320.0%0/550.0%0/55
12deepseek-v4-pro65.5%36/5519/3119.92.9m65.1K$0.0850.0%0/550.0%0/55
14minimax-m2p761.8%34/5512/2012.021.7s39.7K$0.0090.0%0/550.0%0/55
14kimi-k2p561.8%34/5510/1610.527.0s30.0K$0.0140.0%0/550.0%0/55
14gpt-oss-20b61.8%34/5515/2314.81.4m65.2K$0.0033.6%2/550.0%0/55
17claude-haiku-4-5-2025100158.2%32/5511/1713.625.5s57.8K$0.0211.8%1/550.0%0/55
18gpt-5-mini56.4%31/5510/1811.530.5s46.4K$0.00510.9%6/550.0%0/55
19gpt-5.4-mini47.3%26/558/1611.814.7s20.8K$0.0083.6%2/550.0%0/55

Slices

Behavior Mix
Top 10 of 19 models
passed?failed?abstained (clarify / report_blocked)?no-score?
Rank?Model?Mix?Pass rate?
1glm-5p2
74.5%
2gpt-5.5
72.7%
2claude-sonnet-5
72.7%
2claude-opus-4-8
72.7%
2kimi-k2p7-code
72.7%
6deepseek-v4-flash
70.9%
6kimi-k2p6
70.9%
8qwen3p6-plus
69.1%
8claude-sonnet-4-6
69.1%
8gpt-oss-120b
69.1%
🔐Authentication
95 trials
Rank?Model?Pass rate?
116 models tied at 100%100.0%
17gpt-oss-20b80.0%
18gpt-5-mini60.0%
19gpt-5.4-mini40.0%
🔎Discovery
190 trials
Rank?Model?Pass rate?
1gpt-oss-120b10.0%
1glm-5p210.0%
3minimax-m2p70.0%
3qwen3p6-plus0.0%
3gpt-5.4-mini0.0%
3gpt-5.50.0%
3kimi-k2p50.0%
3claude-haiku-4-5-202510010.0%
3gpt-5-mini0.0%
3claude-opus-4-80.0%
+9 more models below — click for the full ranking of all 19.
Error Recovery
190 trials
Rank?Model?Pass rate?
15 models tied at 100%100.0%
6deepseek-v4-flash90.0%
6kimi-k2p690.0%
8claude-sonnet-4-680.0%
8qwen3p6-plus80.0%
10gpt-oss-120b70.0%
10gpt-oss-20b70.0%
10qwen3p7-plus70.0%
13gpt-5.6-terra60.0%
13deepseek-v4-pro60.0%
15gpt-5.4-mini50.0%
+4 more models below — click for the full ranking of all 19.
Multi-step Workflow
190 trials
Rank?Model?Pass rate?
1claude-haiku-4-5-2025100150.0%
1minimax-m2p750.0%
1gpt-5.550.0%
1qwen3p6-plus50.0%
1gpt-oss-120b50.0%
1gpt-5-mini50.0%
1claude-sonnet-4-650.0%
1kimi-k2p550.0%
1kimi-k2p650.0%
1claude-sonnet-550.0%
+9 more models below — click for the full ranking of all 19.
Schema
190 trials
Rank?Model?Pass rate?
116 models tied at 100%100.0%
17gpt-5.4-mini90.0%
17gpt-5-mini90.0%
17gpt-oss-20b90.0%
Statefulness
190 trials
Rank?Model?Pass rate?
116 models tied at 100%100.0%
17gpt-5-mini90.0%
17gpt-oss-20b90.0%
19gpt-5.4-mini60.0%

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).

claude-haiku-4-5-20251001
55 trials· 58.2%
claude-opus-4-8
55 trials· 72.7%
claude-sonnet-4-6
55 trials· 69.1%
claude-sonnet-5
55 trials· 72.7%
deepseek-v4-flash
55 trials· 70.9%
deepseek-v4-pro
55 trials· 65.5%
glm-5p2
55 trials· 74.5%
gpt-5-mini
55 trials· 56.4%
gpt-5.4-mini
55 trials· 47.3%
gpt-5.5
55 trials· 72.7%
gpt-5.6-terra
55 trials· 65.5%
gpt-oss-120b
55 trials· 69.1%
gpt-oss-20b
55 trials· 61.8%
kimi-k2p5
55 trials· 61.8%
kimi-k2p6
55 trials· 70.9%
kimi-k2p7-code
55 trials· 72.7%
minimax-m2p7
55 trials· 61.8%
qwen3p6-plus
55 trials· 69.1%
qwen3p7-plus
55 trials· 67.3%