Postman APIFlow-Bench 1.0 Leaderboard
Task set ?20-subtask chain (0)15-subtask chain (0)10-subtask chain (0)5-subtask chain (0)Solo subtasks (90)All tasks (90)
Difficulty (as created):AllEasy (69)Medium (90)Hard (82)

Showing Solo subtasks created as medium — 90 tasks, 8,549 trials. Back to the default 20-subtask chain view.

APIFlow-Bench 1.0 Leaderboard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing the solo subtasks task set: 8,549 trials across 19 models and 90 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

☑ 8,549 trials ▤ 19 models ⛁ 90 tasks ⌖ Overall pass rate: 92.0%

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

RankModelScoringDifficulty bucket (pass rate)Horizon (pass rate)Cost / efficiencyBehavioral
Pass rate?API recovery?Easy?Long-horizon?Hard?Short?Medium?Long?Tool calls / trial?Time / trial?Tokens / trial?Cost / trial?Abstain %?Refusal %?
1deepseek-v4-flash96.2%433/450135/150100%170/17099%129/13092%134/145100%225/22594%203/215100%5/520.51.0m256.9K$0.0200.4%2/4500.0%0/450
2claude-opus-4-896.0%432/450113/129100%170/170100%130/13091%132/145100%225/22594%202/215100%5/511.747.2s69.1K$0.0842.2%10/4500.0%0/450
3qwen3p6-plus95.6%430/450118/13599%169/170100%130/13090%131/145100%224/22593%201/215100%5/516.31.4m144.8K$0.0560.4%2/4500.0%0/450
4claude-sonnet-4-695.3%429/45089/106100%170/170100%130/13089%129/14598%220/22595%204/215100%5/515.252.7s226.4K$0.0960.2%1/4500.0%0/450
4kimi-k2p695.3%429/450121/140100%170/170100%130/13089%129/145100%225/22593%199/215100%5/515.71.2m210.6K$0.0690.2%1/4500.0%0/450
6claude-sonnet-594.9%427/450111/133100%170/170100%130/13088%127/145100%225/22592%197/215100%5/514.653.1s131.5K$0.0561.8%8/4500.0%0/450
7kimi-k2p7-code94.4%425/450101/122100%170/170100%130/13086%125/145100%224/22591%196/215100%5/514.02.5m119.0K$0.0391.8%8/4500.0%0/450
8kimi-k2p594.0%423/450118/14199%169/170100%130/13086%124/14599%222/22591%196/215100%5/512.532.9s100.9K$0.0381.6%7/4500.0%0/450
9gpt-5.593.8%422/45093/114100%170/170100%130/13084%122/14598%221/22591%196/215100%5/513.836.3s47.9K$0.1001.8%8/4500.0%0/450
9deepseek-v4-pro93.8%422/450134/16199%168/17098%128/13087%126/14599%223/22590%194/215100%5/519.03.3m113.6K$0.110.2%1/4500.0%0/450
11glm-5p293.1%419/45098/12599%169/170100%130/13083%120/14599%222/22589%192/215100%5/515.13.8m121.5K$0.0890.0%0/4500.0%0/450
12claude-haiku-4-5-2025100192.7%417/450142/16599%168/170100%130/13082%119/14598%220/22589%192/215100%5/516.235.5s112.8K$0.0281.6%7/4500.0%0/450
13qwen3p7-plus92.2%415/45097/11898%166/17096%124/12987%125/14396%217/22592%194/21280%4/512.14.0m147.1K$0.0382.2%10/4500.0%0/450
14minimax-m2p791.6%412/450145/17197%165/17098%127/13083%120/14596%217/22588%190/215100%5/512.428.5s62.4K$0.0150.4%2/4500.0%0/450
15gpt-5.6-terra90.9%409/45083/11499%169/17098%128/13077%112/14597%219/22586%185/215100%5/511.91.1m32.6K$0.0341.8%8/4500.0%0/450
16gpt-oss-120b88.7%399/450103/13295%162/17095%124/13078%113/14594%212/22585%182/215100%5/512.522.5s55.6K$0.0060.0%0/4500.0%0/450
17gpt-5-mini88.0%396/450103/13094%160/17096%125/13077%111/14594%211/22584%180/215100%5/511.132.3s48.6K$0.0065.6%25/4500.0%0/450
18gpt-oss-20b87.3%392/449116/15294%159/17093%120/12978%113/14593%209/22584%181/21550%2/414.01.6m66.9K$0.0032.9%13/4490.0%0/449
19gpt-5.4-mini75.1%338/450105/16481%137/17083%108/13064%93/14578%176/22575%162/2150%0/510.314.2s20.9K$0.0082.4%11/4500.0%0/450

Slices

Behavior Mix
Top 10 of 19 models
passed?failed?abstained (clarify / report_blocked)?no-score?
Rank?Model?Mix?Pass rate?
1deepseek-v4-flash
96.2%
2claude-opus-4-8
96.0%
3qwen3p6-plus
95.6%
4claude-sonnet-4-6
95.3%
4kimi-k2p6
95.3%
6claude-sonnet-5
94.9%
7kimi-k2p7-code
94.4%
8kimi-k2p5
94.0%
9gpt-5.5
93.8%
9deepseek-v4-pro
93.8%
🔐Authentication
1,330 trials
Rank?Model?Pass rate?
1claude-sonnet-4-698.6%
1deepseek-v4-flash98.6%
3deepseek-v4-pro97.1%
4claude-sonnet-595.7%
5gpt-5.594.3%
6claude-opus-4-892.9%
6kimi-k2p692.9%
6kimi-k2p7-code92.9%
6glm-5p292.9%
10claude-haiku-4-5-2025100190.0%
+9 more models below — click for the full ranking of all 19.
🔎Discovery
1,045 trials
Rank?Model?Pass rate?
16 models tied at 100%100.0%
7kimi-k2p7-code98.2%
7glm-5p298.2%
9kimi-k2p596.4%
9claude-haiku-4-5-2025100196.4%
11minimax-m2p794.5%
11qwen3p7-plus94.5%
13gpt-5.592.7%
14claude-sonnet-4-690.9%
14gpt-5.6-terra90.9%
16gpt-oss-120b89.1%
+3 more models below — click for the full ranking of all 19.
Error Recovery
1,330 trials
Rank?Model?Pass rate?
19 models tied at 100%100.0%
10minimax-m2p798.6%
10claude-sonnet-598.6%
10deepseek-v4-flash98.6%
10qwen3p7-plus98.6%
14claude-haiku-4-5-2025100197.1%
14deepseek-v4-pro97.1%
16gpt-oss-120b95.7%
17gpt-5-mini91.4%
17gpt-oss-20b91.4%
19gpt-5.4-mini81.4%
Multi-step Workflow
950 trials
Rank?Model?Pass rate?
1claude-opus-4-894.0%
1qwen3p6-plus94.0%
1qwen3p7-plus94.0%
4claude-sonnet-4-692.0%
4deepseek-v4-flash92.0%
4kimi-k2p692.0%
7claude-haiku-4-5-2025100190.0%
7kimi-k2p590.0%
7claude-sonnet-590.0%
7minimax-m2p790.0%
+9 more models below — click for the full ranking of all 19.
Pagination
1,140 trials
Rank?Model?Pass rate?
1claude-opus-4-891.7%
1gpt-5.591.7%
1kimi-k2p591.7%
1claude-sonnet-4-691.7%
1claude-sonnet-591.7%
1kimi-k2p7-code91.7%
1kimi-k2p691.7%
8gpt-5-mini90.0%
8claude-haiku-4-5-2025100190.0%
8deepseek-v4-flash90.0%
+9 more models below — click for the full ranking of all 19.
Schema
950 trials
Rank?Model?Pass rate?
112 models tied at 100%100.0%
13gpt-oss-120b98.0%
13minimax-m2p798.0%
13gpt-5-mini98.0%
16claude-haiku-4-5-2025100196.0%
16gpt-oss-20b96.0%
16qwen3p7-plus96.0%
19gpt-5.4-mini88.0%
Statefulness
1,804 trials
Rank?Model?Pass rate?
1qwen3p6-plus95.8%
2claude-opus-4-894.7%
2deepseek-v4-flash94.7%
4claude-sonnet-4-693.7%
5kimi-k2p592.6%
5kimi-k2p692.6%
7gpt-oss-120b91.6%
7minimax-m2p791.6%
7qwen3p7-plus91.6%
10claude-haiku-4-5-2025100190.5%
+9 more models below — click for the full ranking of all 19.

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).

claude-haiku-4-5-20251001
450 trials· 92.7%
claude-opus-4-8
450 trials· 96.0%
claude-sonnet-4-6
450 trials· 95.3%
claude-sonnet-5
450 trials· 94.9%
deepseek-v4-flash
450 trials· 96.2%
deepseek-v4-pro
450 trials· 93.8%
glm-5p2
450 trials· 93.1%
gpt-5-mini
450 trials· 88.0%
gpt-5.4-mini
450 trials· 75.1%
gpt-5.5
450 trials· 93.8%
gpt-5.6-terra
450 trials· 90.9%
gpt-oss-120b
450 trials· 88.7%
gpt-oss-20b
449 trials· 87.3%
kimi-k2p5
450 trials· 94.0%
kimi-k2p6
450 trials· 95.3%
kimi-k2p7-code
450 trials· 94.4%
minimax-m2p7
450 trials· 91.6%
qwen3p6-plus
450 trials· 95.6%
qwen3p7-plus
450 trials· 92.2%