Postman

APIFlow-Bench 1.0 Leaderboard

All tasksHard

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing all tasks: 36,958 trials across 24 models and 308 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

Overall pass rate76.6%Trials36,958Models24Tasks308

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

Rank
Model
Scoring
Difficulty bucket (pass rate)
Horizon (pass rate)
Cost / efficiency
Behavioral
Pass rate
API recovery
Easy
Long-horizon
Hard
Hard + Long-horizon
Short
Medium
Long
Tool calls / trial
Time / trial
Tokens / trial
Cost / trial
Abstain %
Refusal %
2claude-sonnet-4-685.8%1321/1540469/556100%140/140100%130/13095%171/18081%879/108598%230/23598%156/16082%934/114021.81.5m1.3M$0.440.2%3/15400.0%0/1540
3claude-opus-4-884.7%1305/1540537/625100%140/14096%125/13094%169/18080%871/1085100%235/23593%149/16081%921/114012.948.5s76.7K$0.0922.8%43/15400.0%0/1540
4deepseek-v4-flash84.6%1303/1540580/67496%135/14094%122/13095%171/18080%872/108596%225/23595%152/16081%923/114020.453.5s137.7K$0.0120.1%2/15400.0%0/1540
5gpt-5.584.5%1302/1540491/581100%140/14094%122/13096%173/18080%867/108599%233/23595%152/16080%917/114015.937.6s57.5K$0.120.4%6/15400.0%0/1540
6kimi-k2p684.2%1296/1540560/63896%135/14092%120/13097%174/18080%865/108597%227/23595%152/16080%915/114018.21.5m227.6K$0.0780.5%7/15400.0%0/1540
7gpt-5.6-sol84.1%1295/1540462/55899%139/14096%125/13094%169/18079%862/108598%230/23596%153/16080%912/114015.02.6m51.1K$0.111.5%23/15400.0%0/1540
8glm-5p284.0%1294/1540521/61397%136/14095%123/13097%174/18079%861/108598%230/23595%152/16080%912/114017.24.1m159.4K$0.120.5%8/15400.0%0/1540
9kimi-k2p7-code83.9%1292/1540528/61899%138/14093%121/13097%175/18079%856/108597%229/23597%155/16079%906/114014.52.4m78.3K$0.0310.5%7/15400.0%0/1540
10claude-sonnet-583.6%1287/1540516/61899%138/14096%125/13098%176/18078%847/108599%233/23598%156/16079%897/114016.457.8s127.7K$0.0591.0%16/15400.0%0/1540
11qwen3p6-plus83.4%1283/1539544/65097%136/14095%124/13096%172/18079%851/108498%231/23594%150/16079%902/113917.41.6m161.2K$0.0630.0%0/15390.0%0/1539
12deepseek-v4-pro82.8%1275/1540670/80099%139/14095%124/13093%167/18078%844/108598%230/23594%150/16078%894/114022.13.8m123.9K$0.120.1%2/15400.0%0/1540
13gpt-5.6-luna82.4%1269/1540475/57698%137/14095%124/13093%167/18078%841/108596%226/23594%151/16078%892/114013.71.6m35.7K$0.0140.7%11/15400.0%0/1540
14claude-haiku-4-5-2025100182.3%1267/1540524/62495%133/14093%121/13092%166/18078%847/108595%223/23591%146/16079%898/114017.535.8s117.6K$0.0291.0%15/15400.0%0/1540
15gpt-5.6-terra82.1%1264/1540470/57098%137/14095%124/13091%164/18077%839/108595%224/23594%151/16078%889/114014.01.3m42.4K$0.0421.4%22/15400.0%0/1540
16minimax-m2p781.7%1257/1539564/67998%137/14092%120/13091%164/18077%834/108496%225/23592%147/16078%883/113913.726.2s61.6K$0.0150.5%8/15390.0%0/1539
17kimi-k2p581.4%1253/1540509/60697%136/14093%121/13092%166/18076%828/108595%224/23593%149/16077%878/114013.032.1s69.3K$0.0290.5%8/15400.0%0/1540
18qwen3p7-plus81.3%1252/1540472/57897%136/14094%121/12993%164/17777%831/107397%227/23492%146/15878%879/112712.94.1m123.8K$0.0371.1%17/15400.0%0/1540
19gpt-oss-120b77.9%1200/1540518/66691%127/14092%120/13090%162/18073%791/108591%215/23592%148/16073%837/114014.326.8s67.8K$0.0070.3%5/15400.0%0/1540
20gpt-oss-20b76.9%1184/1540557/71286%121/14088%114/13089%161/18073%788/108589%208/23588%140/16073%836/114015.81.7m78.0K$0.0041.8%28/15400.0%0/1540
21gpt-5-mini75.8%1168/1540489/62195%133/14088%115/13087%156/18070%763/108593%218/23586%138/16071%811/114012.236.0s54.8K$0.0065.8%90/15400.0%0/1540
22gpt-5.4-mini63.6%980/1540432/69281%114/14065%84/13077%138/18059%644/108579%185/23572%115/16060%680/114011.815.4s23.9K$0.0093.2%49/15400.0%0/1540
23minimax-m325.7%396/1540392/153360%84/14028%37/13034%62/18020%213/108560%140/23518%29/16020%227/1140164.828.1m4.5M$0.3143.6%672/15400.0%0/1540
24claude-fable-514.5%224/154026/6625%35/14025%32/13016%29/18012%128/108523%55/23518%29/16012%140/11403.71.2m24.0K$0.0480.0%0/154085.2%1312/1540

Slices

Behavior Mix
10 models
passedfailedabstainedno-score
RankModelMixPass rate
1kimi-k3
86.0%
2claude-sonnet-4-6
85.8%
3claude-opus-4-8
84.7%
4deepseek-v4-flash
84.6%
5gpt-5.5
84.5%
6kimi-k2p6
84.2%
7gpt-5.6-sol
84.1%
8glm-5p2
84.0%
9kimi-k2p7-code
83.9%
10claude-sonnet-5
83.6%
Authentication
5,519 trials
RankModelPass rate
1gpt-5.586.5%
1kimi-k386.5%
3claude-sonnet-4-683.9%
4qwen3p6-plus83.5%
5gpt-5.6-sol83.0%
5glm-5p283.0%
7kimi-k2p682.6%
8deepseek-v4-flash82.2%
8deepseek-v4-pro82.2%
10kimi-k2p7-code81.7%
Discovery
6,000 trials
RankModelPass rate
1claude-sonnet-4-676.4%
2claude-opus-4-874.4%
3gpt-5.570.8%
3glm-5p270.8%
5deepseek-v4-flash68.8%
5gpt-5.6-luna68.8%
7kimi-k2p568.4%
7gpt-5.6-sol68.4%
9claude-haiku-4-5-2025100168.0%
9kimi-k368.0%
Error Recovery
5,760 trials
RankModelPass rate
1claude-opus-4-887.1%
1kimi-k387.1%
3claude-sonnet-4-685.8%
4deepseek-v4-flash85.4%
5claude-sonnet-585.0%
6qwen3p6-plus84.6%
6gpt-5.6-sol84.6%
8kimi-k2p7-code84.2%
8qwen3p7-plus84.2%
10glm-5p283.3%
Multi-step Workflow
5,880 trials
RankModelPass rate
1kimi-k396.3%
2kimi-k2p695.1%
2deepseek-v4-pro95.1%
2glm-5p295.1%
5deepseek-v4-flash93.9%
5claude-sonnet-593.9%
5kimi-k2p7-code93.9%
8gpt-5.6-luna93.5%
9gpt-5.593.1%
9claude-opus-4-893.1%
Pagination
3,480 trials
RankModelPass rate
1gpt-5.589.7%
2deepseek-v4-flash89.0%
2gpt-5.6-sol89.0%
4claude-haiku-4-5-2025100188.3%
4gpt-5.6-terra88.3%
4gpt-5.6-luna88.3%
4kimi-k2p7-code88.3%
8claude-opus-4-887.6%
8claude-sonnet-587.6%
8claude-sonnet-4-687.6%
Schema
4,560 trials
RankModelPass rate
1kimi-k2p689.5%
2kimi-k2p588.4%
2deepseek-v4-flash88.4%
4claude-haiku-4-5-2025100187.4%
5kimi-k386.8%
6kimi-k2p7-code86.3%
6qwen3p6-plus86.3%
8claude-sonnet-4-685.3%
8claude-sonnet-585.3%
10gpt-5.584.7%
Statefulness
5,759 trials
RankModelPass rate
1kimi-k391.7%
2claude-sonnet-591.2%
3claude-sonnet-4-690.4%
4claude-opus-4-889.6%
5gpt-5.6-sol89.2%
6claude-haiku-4-5-2025100188.3%
6kimi-k2p7-code88.3%
6glm-5p288.3%
9minimax-m2p787.9%
9kimi-k2p687.9%

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).