Postman

APIFlow-Bench 1.0 Leaderboard

All tasksMedium

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing all tasks: 10,799 trials across 24 models and 90 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

Overall pass rate87.0%Trials10,799Models24Tasks90

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

Rank
Model
Scoring
Difficulty bucket (pass rate)
Horizon (pass rate)
Cost / efficiency
Behavioral
Pass rate
API recovery
Easy
Long-horizon
Hard
Short
Medium
Long
Tool calls / trial
Time / trial
Tokens / trial
Cost / trial
Abstain %
Refusal %
2deepseek-v4-flash96.2%433/450135/150100%170/17099%129/13092%134/145100%225/22594%203/215100%5/520.51.0m256.9K$0.0200.4%2/4500.0%0/450
3claude-opus-4-896.0%432/450113/129100%170/170100%130/13091%132/145100%225/22594%202/215100%5/511.747.2s69.1K$0.0842.2%10/4500.0%0/450
4qwen3p6-plus95.6%430/450118/13599%169/170100%130/13090%131/145100%224/22593%201/215100%5/516.31.4m144.8K$0.0560.4%2/4500.0%0/450
5claude-sonnet-4-695.3%429/45089/106100%170/170100%130/13089%129/14598%220/22595%204/215100%5/515.252.7s226.4K$0.0960.2%1/4500.0%0/450
5kimi-k2p695.3%429/450121/140100%170/170100%130/13089%129/145100%225/22593%199/215100%5/515.71.2m210.6K$0.0690.2%1/4500.0%0/450
7claude-sonnet-594.9%427/450111/133100%170/170100%130/13088%127/145100%225/22592%197/215100%5/514.653.1s131.5K$0.0561.8%8/4500.0%0/450
8kimi-k2p7-code94.4%425/450101/122100%170/170100%130/13086%125/145100%224/22591%196/215100%5/514.02.5m119.0K$0.0391.8%8/4500.0%0/450
9kimi-k2p594.0%423/450118/14199%169/170100%130/13086%124/14599%222/22591%196/215100%5/512.532.9s100.9K$0.0381.6%7/4500.0%0/450
10gpt-5.593.8%422/45093/114100%170/170100%130/13084%122/14598%221/22591%196/215100%5/513.836.3s47.9K$0.1001.8%8/4500.0%0/450
10deepseek-v4-pro93.8%422/450134/16199%168/17098%128/13087%126/14599%223/22590%194/215100%5/519.03.3m113.6K$0.110.2%1/4500.0%0/450
12gpt-5.6-sol93.1%419/45075/100100%170/170100%130/13082%119/14599%222/22589%192/215100%5/513.12.2m35.4K$0.0802.2%10/4500.0%0/450
12glm-5p293.1%419/45098/12599%169/170100%130/13083%120/14599%222/22589%192/215100%5/515.13.8m121.5K$0.0890.0%0/4500.0%0/450
14claude-haiku-4-5-2025100192.7%417/450142/16599%168/170100%130/13082%119/14598%220/22589%192/215100%5/516.235.5s112.8K$0.0281.6%7/4500.0%0/450
15qwen3p7-plus92.2%415/45097/11898%166/17096%124/12987%125/14396%217/22592%194/21280%4/512.14.0m147.1K$0.0382.2%10/4500.0%0/450
16gpt-5.6-luna92.0%414/45089/11397%165/17098%128/13083%121/14596%217/22589%192/215100%5/512.31.4m29.0K$0.0130.9%4/4500.0%0/450
17minimax-m2p791.6%412/450145/17197%165/17098%127/13083%120/14596%217/22588%190/215100%5/512.428.5s62.4K$0.0150.4%2/4500.0%0/450
18gpt-5.6-terra90.9%409/45083/11499%169/17098%128/13077%112/14597%219/22586%185/215100%5/511.91.1m32.6K$0.0341.8%8/4500.0%0/450
19gpt-oss-120b88.7%399/450103/13295%162/17095%124/13078%113/14594%212/22585%182/215100%5/512.522.5s55.6K$0.0060.0%0/4500.0%0/450
20gpt-5-mini88.0%396/450103/13094%160/17096%125/13077%111/14594%211/22584%180/215100%5/511.132.3s48.6K$0.0065.6%25/4500.0%0/450
21gpt-oss-20b87.3%392/449116/15294%159/17093%120/12978%113/14593%209/22584%181/21550%2/414.01.6m66.9K$0.0032.9%13/4490.0%0/449
22gpt-5.4-mini75.1%338/450105/16481%137/17083%108/13064%93/14578%176/22575%162/2150%0/510.314.2s20.9K$0.0082.4%11/4500.0%0/450
23minimax-m344.0%198/450198/45061%103/17036%47/13033%48/14561%137/22528%61/2150%0/5135.723.1m3.5M$0.2534.7%156/4500.0%0/450
24claude-fable-513.3%60/45010/1413%22/17025%32/1304%6/14510%23/22516%35/21540%2/52.958.4s19.1K$0.0430.0%0/45088.7%399/450

Slices

Behavior Mix
10 models
passedfailedabstainedno-score
RankModelMixPass rate
1kimi-k3
97.3%
2deepseek-v4-flash
96.2%
3claude-opus-4-8
96.0%
4qwen3p6-plus
95.6%
5claude-sonnet-4-6
95.3%
5kimi-k2p6
95.3%
7claude-sonnet-5
94.9%
8kimi-k2p7-code
94.4%
9kimi-k2p5
94.0%
10gpt-5.5
93.8%
Authentication
1,680 trials
RankModelPass rate
1kimi-k3100.0%
2claude-sonnet-4-698.6%
2deepseek-v4-flash98.6%
4deepseek-v4-pro97.1%
5claude-sonnet-595.7%
6gpt-5.594.3%
7claude-opus-4-892.9%
7kimi-k2p692.9%
7gpt-5.6-sol92.9%
7kimi-k2p7-code92.9%
Discovery
1,320 trials
RankModelPass rate
7kimi-k2p7-code98.2%
7glm-5p298.2%
7kimi-k398.2%
10kimi-k2p596.4%
10claude-haiku-4-5-2025100196.4%
12minimax-m2p794.5%
12gpt-5.6-sol94.5%
12qwen3p7-plus94.5%
15gpt-5.592.7%
15gpt-5.6-luna92.7%
Error Recovery
1,680 trials
RankModelPass rate
13minimax-m2p798.6%
13claude-sonnet-598.6%
13deepseek-v4-flash98.6%
13qwen3p7-plus98.6%
17claude-haiku-4-5-2025100197.1%
17deepseek-v4-pro97.1%
19gpt-oss-120b95.7%
20gpt-5-mini91.4%
20gpt-oss-20b91.4%
22gpt-5.4-mini81.4%
Multi-step Workflow
1,200 trials
RankModelPass rate
1claude-opus-4-894.0%
1qwen3p6-plus94.0%
1qwen3p7-plus94.0%
1kimi-k394.0%
5claude-sonnet-4-692.0%
5deepseek-v4-flash92.0%
5kimi-k2p692.0%
8claude-haiku-4-5-2025100190.0%
8kimi-k2p590.0%
8claude-sonnet-590.0%
Pagination
1,440 trials
RankModelPass rate
1claude-opus-4-891.7%
1gpt-5.591.7%
1kimi-k2p591.7%
1gpt-5.6-sol91.7%
1claude-sonnet-4-691.7%
1claude-sonnet-591.7%
1kimi-k2p7-code91.7%
1kimi-k2p691.7%
1kimi-k391.7%
10gpt-5-mini90.0%
Schema
1,200 trials
RankModelPass rate
16gpt-oss-120b98.0%
16minimax-m2p798.0%
16gpt-5-mini98.0%
19claude-haiku-4-5-2025100196.0%
19gpt-oss-20b96.0%
19qwen3p7-plus96.0%
22gpt-5.4-mini88.0%
23minimax-m370.0%
24claude-fable-54.0%
Statefulness
2,279 trials
RankModelPass rate
1kimi-k396.8%
2qwen3p6-plus95.8%
3claude-opus-4-894.7%
3deepseek-v4-flash94.7%
3gpt-5.6-luna94.7%
6claude-sonnet-4-693.7%
7kimi-k2p592.6%
7kimi-k2p692.6%
9gpt-oss-120b91.6%
9minimax-m2p791.6%

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).