Postman APIFlow-Bench 1.0 Leaderboard
Task set ?20-subtask chain (0)15-subtask chain (0)10-subtask chain (0)5-subtask chain (0)Solo subtasks (69)All tasks (69)
Difficulty (as created):AllEasy (69)Medium (90)Hard (82)

Showing Solo subtasks created as easy — 69 tasks, 6,555 trials. Back to the default 20-subtask chain view.

APIFlow-Bench 1.0 Leaderboard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing the solo subtasks task set: 6,555 trials across 19 models and 69 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

☑ 6,555 trials ▤ 19 models ⛁ 69 tasks ⌖ Overall pass rate: 93.5%

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

RankModelScoringDifficulty bucket (pass rate)Horizon (pass rate)Cost / efficiencyBehavioral
Pass rate?API recovery?Easy?Long-horizon?Hard?Short?Medium?Tool calls / trial?Time / trial?Tokens / trial?Cost / trial?Abstain %?Refusal %?
1claude-sonnet-597.4%336/34590/91100%195/195100%75/7588%66/7598%231/23595%105/11011.437.2s68.1K$0.0330.0%0/3450.0%0/345
2claude-opus-4-895.9%331/34578/81100%195/195100%75/7581%61/7596%225/23596%106/1109.448.5s47.7K$0.0580.6%2/3450.0%0/345
3qwen3p7-plus95.7%330/34576/80100%195/19597%73/7583%62/7596%226/23595%104/1108.73.4m72.4K$0.0250.3%1/3450.0%0/345
4kimi-k2p595.4%329/34596/10299%194/195100%75/7580%60/7595%224/23595%105/1108.729.5s30.4K$0.0140.0%0/3450.0%0/345
4deepseek-v4-flash95.4%329/34590/9799%194/195100%75/7580%60/7595%224/23595%105/11014.746.5s87.7K$0.0080.0%0/3450.0%0/345
4kimi-k2p7-code95.4%329/34584/8799%194/195100%75/7580%60/7595%224/23595%105/11011.21.9m46.8K$0.0200.3%1/3450.0%0/345
7claude-sonnet-4-694.8%327/34563/66100%195/195100%75/7576%57/7596%225/23593%102/11010.549.6s82.7K$0.0430.0%0/3450.0%0/345
7gpt-5.594.8%327/34562/6499%194/195100%75/7577%58/7595%224/23594%103/11011.032.3s33.5K$0.0750.3%1/3450.0%0/345
7kimi-k2p694.8%327/34595/9697%190/19599%74/7584%63/7594%220/23597%107/11012.955.5s101.4K$0.0410.0%0/3450.0%0/345
7deepseek-v4-pro94.8%327/34590/97100%195/195100%75/7576%57/7596%225/23593%102/11014.32.7m72.6K$0.0790.0%0/3450.0%0/345
11minimax-m2p794.5%326/345120/13198%191/195100%75/7580%60/7594%220/23596%106/11010.227.1s42.2K$0.0110.0%0/3450.0%0/345
12qwen3p6-plus94.2%325/34582/9399%193/195100%75/7576%57/7595%223/23593%102/11011.155.3s65.1K$0.0290.0%0/3450.0%0/345
13claude-haiku-4-5-2025100193.6%323/345107/11598%191/19599%74/7577%58/7594%221/23593%102/11012.533.8s73.1K$0.0220.6%2/3450.0%0/345
14gpt-5.6-terra92.8%320/34562/7199%194/195100%75/7568%51/7594%220/23591%100/1109.952.3s25.0K$0.0260.3%1/3450.0%0/345
14glm-5p292.8%320/34567/7899%194/19597%73/7571%53/7595%223/23588%97/11013.62.9m83.0K$0.0650.0%0/3450.0%0/345
16gpt-5-mini91.9%317/34590/10195%186/19599%74/7576%57/7592%217/23591%100/1109.229.4s37.0K$0.0053.8%13/3450.0%0/345
17gpt-oss-120b91.3%315/34594/10395%185/19595%71/7579%59/7591%215/23591%100/11011.223.8s47.2K$0.0050.6%2/3450.0%0/345
18gpt-oss-20b90.7%313/34595/10193%182/19593%70/7581%61/7591%213/23591%100/11012.21.3m53.9K$0.0031.2%4/3450.0%0/345
19gpt-5.4-mini81.4%281/34570/10885%165/19595%71/7560%45/7582%192/23581%89/1108.513.5s18.0K$0.0073.5%12/3450.0%0/345

Slices

Behavior Mix
Top 10 of 19 models
passed?failed?abstained (clarify / report_blocked)?no-score?
Rank?Model?Mix?Pass rate?
1claude-sonnet-5
97.4%
2claude-opus-4-8
95.9%
3qwen3p7-plus
95.7%
4kimi-k2p5
95.4%
4deepseek-v4-flash
95.4%
4kimi-k2p7-code
95.4%
7claude-sonnet-4-6
94.8%
7gpt-5.5
94.8%
7kimi-k2p6
94.8%
7deepseek-v4-pro
94.8%
🔐Authentication
380 trials
Rank?Model?Pass rate?
1claude-sonnet-580.0%
1claude-opus-4-880.0%
1qwen3p7-plus80.0%
1glm-5p280.0%
5minimax-m2p775.0%
5kimi-k2p575.0%
5kimi-k2p675.0%
5deepseek-v4-flash75.0%
5gpt-5.6-terra75.0%
5gpt-5.575.0%
+9 more models below — click for the full ranking of all 19.
🔎Discovery
1,140 trials
Rank?Model?Pass rate?
112 models tied at 100%100.0%
13gpt-5-mini98.3%
13claude-haiku-4-5-2025100198.3%
13kimi-k2p698.3%
13glm-5p298.3%
17gpt-5.4-mini95.0%
18gpt-oss-120b91.7%
19gpt-oss-20b86.7%
Error Recovery
1,330 trials
Rank?Model?Pass rate?
1claude-sonnet-592.9%
2kimi-k2p690.0%
3claude-opus-4-887.1%
4kimi-k2p585.7%
4gpt-oss-20b85.7%
4minimax-m2p785.7%
4deepseek-v4-flash85.7%
4qwen3p7-plus85.7%
4kimi-k2p7-code85.7%
10gpt-oss-120b84.3%
+9 more models below — click for the full ranking of all 19.
Multi-step Workflow
855 trials
Rank?Model?Pass rate?
17 models tied at 100%100.0%
8kimi-k2p597.8%
8qwen3p6-plus97.8%
8deepseek-v4-flash97.8%
8gpt-5.597.8%
8qwen3p7-plus97.8%
13minimax-m2p795.6%
13claude-haiku-4-5-2025100195.6%
13glm-5p295.6%
16gpt-oss-120b91.1%
17kimi-k2p688.9%
+2 more models below — click for the full ranking of all 19.
Pagination
950 trials
Rank?Model?Pass rate?
114 models tied at 100%100.0%
15qwen3p6-plus98.0%
15gpt-oss-20b98.0%
17minimax-m2p796.0%
18gpt-5-mini94.0%
19gpt-5.4-mini90.0%
Schema
1,045 trials
Rank?Model?Pass rate?
113 models tied at 100%100.0%
14kimi-k2p7-code98.2%
14glm-5p298.2%
16gpt-5.6-terra96.4%
17gpt-oss-120b92.7%
18gpt-5-mini90.9%
19gpt-5.4-mini81.8%
Statefulness
855 trials
Rank?Model?Pass rate?
114 models tied at 100%100.0%
15claude-haiku-4-5-2025100197.8%
15gpt-5-mini97.8%
15claude-opus-4-897.8%
15gpt-oss-20b97.8%
19gpt-5.4-mini80.0%

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).

claude-haiku-4-5-20251001
345 trials· 93.6%
claude-opus-4-8
345 trials· 95.9%
claude-sonnet-4-6
345 trials· 94.8%
claude-sonnet-5
345 trials· 97.4%
deepseek-v4-flash
345 trials· 95.4%
deepseek-v4-pro
345 trials· 94.8%
glm-5p2
345 trials· 92.8%
gpt-5-mini
345 trials· 91.9%
gpt-5.4-mini
345 trials· 81.4%
gpt-5.5
345 trials· 94.8%
gpt-5.6-terra
345 trials· 92.8%
gpt-oss-120b
345 trials· 91.3%
gpt-oss-20b
345 trials· 90.7%
kimi-k2p5
345 trials· 95.4%
kimi-k2p6
345 trials· 94.8%
kimi-k2p7-code
345 trials· 95.4%
minimax-m2p7
345 trials· 94.5%
qwen3p6-plus
345 trials· 94.2%
qwen3p7-plus
345 trials· 95.7%