Postman APIFlow-Bench 1.0 Leaderboard
Task set ?20-subtask chain (11)15-subtask chain (11)10-subtask chain (12)5-subtask chain (13)Solo subtasks (241)All tasks (467)
Difficulty (as created):AllEasy (69)Medium (90)Hard (308)

Showing All tasks — 467 tasks, 44,362 trials. Back to the default 20-subtask chain view.

APIFlow-Bench 1.0 Leaderboard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing all tasks: 44,362 trials across 19 models and 467 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

☑ 44,362 trials ▤ 19 models ⛁ 467 tasks ⌖ Overall pass rate: 85.2%

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

RankModelScoringDifficulty bucket (pass rate)Horizon (pass rate)Cost / efficiencyBehavioral
Pass rate?API recovery?Easy?Long-horizon?Hard?Hard + Long-horizon?Short?Medium?Long?Tool calls / trial?Time / trial?Tokens / trial?Cost / trial?Abstain %?Refusal %?
1claude-sonnet-4-689.0%2077/2335621/728100%505/505100%335/33589%357/40081%879/108597%675/69595%462/48582%939/114518.91.3m920.7K$0.310.2%4/23350.0%0/2335
2claude-opus-4-888.6%2068/2335728/835100%505/50599%330/33590%362/40080%871/108599%685/69594%457/48581%926/114512.148.2s70.9K$0.0852.4%55/23350.0%0/2335
3deepseek-v4-flash88.4%2065/2335805/92199%499/50597%326/33591%365/40080%872/108597%674/69595%460/48581%928/114519.653.7s153.2K$0.0130.2%4/23350.0%0/2335
4kimi-k2p687.9%2052/2335776/87498%495/50597%324/33592%366/40080%865/108597%672/69594%458/48580%920/114517.01.4m205.7K$0.0710.3%8/23350.0%0/2335
5gpt-5.587.8%2051/2335646/759100%504/50598%327/33588%353/40080%867/108598%678/69593%451/48581%922/114514.836.6s52.1K$0.110.6%15/23350.0%0/2335
6claude-sonnet-587.8%2050/2335717/842100%503/50599%330/33592%369/40078%847/108599%689/69594%458/48579%902/114515.353.8s119.6K$0.0541.0%24/23350.0%0/2335
7kimi-k2p7-code87.6%2046/2335713/82799%502/50597%326/33590%360/40079%856/108597%677/69594%456/48580%911/114513.92.3m81.5K$0.0310.7%16/23350.0%0/2335
8qwen3p6-plus87.3%2038/2334744/87899%498/50598%329/33590%360/40079%851/108498%678/69593%453/48579%907/114416.31.5m143.9K$0.0570.1%2/23340.0%0/2334
9glm-5p287.1%2033/2335686/81699%499/50597%326/33587%347/40079%861/108597%675/69591%441/48580%917/114516.33.9m140.8K$0.100.3%8/23350.0%0/2335
10deepseek-v4-pro86.7%2024/2335894/105899%502/50598%327/33588%350/40078%844/108598%678/69592%446/48579%899/114520.43.6m114.3K$0.120.1%3/23350.0%0/2335
11claude-haiku-4-5-2025100186.0%2007/2335773/90497%492/50597%325/33586%343/40078%847/108596%664/69591%440/48579%903/114516.535.5s110.1K$0.0281.0%24/23350.0%0/2335
12kimi-k2p585.9%2005/2335723/84999%499/50597%326/33588%350/40076%828/108596%670/69593%450/48577%883/114512.331.9s69.6K$0.0290.6%15/23350.0%0/2335
13qwen3p7-plus85.5%1997/2335645/77698%497/50595%318/33389%351/39577%831/107397%670/69492%444/48078%883/113212.14.0m120.7K$0.0351.2%28/23350.0%0/2335
14minimax-m2p785.5%1995/2334829/98198%493/50596%322/33586%344/40077%834/108495%662/69591%443/48578%888/114412.926.8s58.9K$0.0140.4%10/23340.0%0/2334
15gpt-5.6-terra85.4%1993/2335615/75599%500/50598%327/33582%327/40077%839/108595%663/69590%436/48578%894/114513.01.2m37.9K$0.0381.3%31/23350.0%0/2335
16gpt-oss-120b82.0%1914/2335715/90194%474/50594%315/33584%334/40073%791/108592%642/69589%430/48574%842/114513.525.5s62.4K$0.0060.3%7/23350.0%0/2335
17gpt-oss-20b80.9%1889/2334768/96591%462/50591%304/33484%335/40073%788/108591%630/69587%421/48573%838/114414.91.6m72.3K$0.0031.9%45/23340.0%0/2334
18gpt-5-mini80.6%1881/2335682/85295%479/50594%314/33581%324/40070%763/108593%646/69586%418/48571%816/114511.534.3s51.0K$0.0065.5%128/23350.0%0/2335
19gpt-5.4-mini68.5%1599/2335607/96482%416/50579%263/33569%276/40059%644/108580%553/69575%366/48559%680/114511.014.9s22.4K$0.0083.1%72/23350.0%0/2335

Slices

Behavior Mix
Top 10 of 19 models
passed?failed?abstained (clarify / report_blocked)?no-score?
Rank?Model?Mix?Pass rate?
1claude-sonnet-4-6
89.0%
2claude-opus-4-8
88.6%
3deepseek-v4-flash
88.4%
4kimi-k2p6
87.9%
5gpt-5.5
87.8%
6claude-sonnet-5
87.8%
7kimi-k2p7-code
87.6%
8qwen3p6-plus
87.3%
9glm-5p2
87.1%
10deepseek-v4-pro
86.7%
🔐Authentication
6,079 trials
Rank?Model?Pass rate?
1gpt-5.587.5%
2claude-sonnet-4-686.6%
3deepseek-v4-flash85.3%
4deepseek-v4-pro85.0%
4glm-5p285.0%
6kimi-k2p684.4%
6qwen3p6-plus84.4%
8kimi-k2p7-code83.8%
9claude-sonnet-582.8%
9qwen3p7-plus82.8%
+9 more models below — click for the full ranking of all 19.
🔎Discovery
6,935 trials
Rank?Model?Pass rate?
1claude-sonnet-4-682.5%
1claude-opus-4-882.5%
3glm-5p279.5%
4gpt-5.578.9%
5deepseek-v4-flash78.6%
6kimi-k2p577.8%
6qwen3p6-plus77.8%
8kimi-k2p677.5%
8deepseek-v4-pro77.5%
10claude-haiku-4-5-2025100177.3%
+9 more models below — click for the full ranking of all 19.
Error Recovery
7,220 trials
Rank?Model?Pass rate?
1claude-opus-4-889.5%
2claude-sonnet-588.9%
3deepseek-v4-flash87.9%
4claude-sonnet-4-687.6%
5kimi-k2p7-code87.4%
6kimi-k2p687.1%
6qwen3p7-plus87.1%
8qwen3p6-plus86.8%
9minimax-m2p785.8%
10gpt-5.585.5%
+9 more models below — click for the full ranking of all 19.
Multi-step Workflow
6,460 trials
Rank?Model?Pass rate?
1deepseek-v4-pro95.0%
2glm-5p294.4%
3claude-opus-4-894.1%
3deepseek-v4-flash94.1%
3claude-sonnet-594.1%
3kimi-k2p7-code94.1%
7kimi-k2p693.8%
7qwen3p6-plus93.8%
9gpt-5.593.2%
10claude-sonnet-4-692.9%
+9 more models below — click for the full ranking of all 19.
Pagination
4,845 trials
Rank?Model?Pass rate?
1gpt-5.592.2%
2deepseek-v4-flash91.4%
2kimi-k2p7-code91.4%
4claude-haiku-4-5-2025100191.0%
4claude-opus-4-891.0%
4claude-sonnet-591.0%
4claude-sonnet-4-691.0%
8gpt-5.6-terra90.2%
8kimi-k2p690.2%
10kimi-k2p589.4%
+9 more models below — click for the full ranking of all 19.
Schema
5,605 trials
Rank?Model?Pass rate?
1kimi-k2p693.2%
2kimi-k2p592.5%
2deepseek-v4-flash92.5%
4claude-haiku-4-5-2025100191.2%
4qwen3p6-plus91.2%
6kimi-k2p7-code90.8%
7claude-sonnet-4-690.5%
7claude-sonnet-590.5%
9gpt-5.590.2%
10deepseek-v4-pro89.5%
+9 more models below — click for the full ranking of all 19.
Statefulness
7,218 trials
Rank?Model?Pass rate?
1claude-sonnet-4-692.4%
2claude-sonnet-592.1%
3claude-opus-4-891.8%
4qwen3p6-plus91.3%
5deepseek-v4-flash90.8%
6kimi-k2p690.5%
7minimax-m2p790.3%
7kimi-k2p7-code90.3%
9claude-haiku-4-5-2025100190.0%
10kimi-k2p589.7%
+9 more models below — click for the full ranking of all 19.

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).

claude-haiku-4-5-20251001
2335 trials· 86.0%
claude-opus-4-8
2335 trials· 88.6%
claude-sonnet-4-6
2335 trials· 89.0%
claude-sonnet-5
2335 trials· 87.8%
deepseek-v4-flash
2335 trials· 88.4%
deepseek-v4-pro
2335 trials· 86.7%
glm-5p2
2335 trials· 87.1%
gpt-5-mini
2335 trials· 80.6%
gpt-5.4-mini
2335 trials· 68.5%
gpt-5.5
2335 trials· 87.8%
gpt-5.6-terra
2335 trials· 85.4%
gpt-oss-120b
2335 trials· 82.0%
gpt-oss-20b
2334 trials· 80.9%
kimi-k2p5
2335 trials· 85.9%
kimi-k2p6
2335 trials· 87.9%
kimi-k2p7-code
2335 trials· 87.6%
minimax-m2p7
2334 trials· 85.5%
qwen3p6-plus
2334 trials· 87.3%
qwen3p7-plus
2335 trials· 85.5%