Postman

APIFlow-Bench 1.0 Leaderboard

All tasksEasy

Deterministic API engineering benchmark spanning 7 capability axes, over REST APIs only (GraphQL and MCP are planned). Showing all tasks: 8,280 trials across 24 models and 69 tasks covering all 7 axes — authentication, discovery, error recovery, multi-step workflow, pagination, schema, statefulness. Switch task set above; click any card to drill into a slice with the full interactive detail view; click any model name to see its per-task results.

Overall pass rate88.7%Trials8,280Models24Tasks69

Overall Ranking

Columns are grouped into metric families. Pass rate = passed ÷ all trials; API recovery = passed ÷ trials that hit a 4xx/5xx. Difficulty bucket is judged per task from its content and reference solve transcripts (Easy / Long-horizon / Hard / Hard + Long-horizon) — a separate taxonomy from the creation-time “Difficulty (as created)” filter, so the two don't map one-to-one. Per-trial details (verifier groups, checkpoints, step counts) live on the model → task → trial pages.

Rank
Model
Scoring
Difficulty bucket (pass rate)
Horizon (pass rate)
Cost / efficiency
Behavioral
Pass rate
API recovery
Easy
Long-horizon
Hard
Short
Medium
Tool calls / trial
Time / trial
Tokens / trial
Cost / trial
Abstain %
Refusal %
2kimi-k397.1%335/34589/9299%193/195100%75/7589%67/7597%228/23597%107/11011.87.0m69.3K$0.0980.6%2/3450.0%0/345
3claude-opus-4-895.9%331/34578/81100%195/195100%75/7581%61/7596%225/23596%106/1109.448.5s47.7K$0.0580.6%2/3450.0%0/345
4qwen3p7-plus95.7%330/34576/80100%195/19597%73/7583%62/7596%226/23595%104/1108.73.4m72.4K$0.0250.3%1/3450.0%0/345
5kimi-k2p595.4%329/34596/10299%194/195100%75/7580%60/7595%224/23595%105/1108.729.5s30.4K$0.0140.0%0/3450.0%0/345
5deepseek-v4-flash95.4%329/34590/9799%194/195100%75/7580%60/7595%224/23595%105/11014.746.5s87.7K$0.0080.0%0/3450.0%0/345
5kimi-k2p7-code95.4%329/34584/8799%194/195100%75/7580%60/7595%224/23595%105/11011.21.9m46.8K$0.0200.3%1/3450.0%0/345
8claude-sonnet-4-694.8%327/34563/66100%195/195100%75/7576%57/7596%225/23593%102/11010.549.6s82.7K$0.0430.0%0/3450.0%0/345
8gpt-5.594.8%327/34562/6499%194/195100%75/7577%58/7595%224/23594%103/11011.032.3s33.5K$0.0750.3%1/3450.0%0/345
8kimi-k2p694.8%327/34595/9697%190/19599%74/7584%63/7594%220/23597%107/11012.955.5s101.4K$0.0410.0%0/3450.0%0/345
8deepseek-v4-pro94.8%327/34590/97100%195/195100%75/7576%57/7596%225/23593%102/11014.32.7m72.6K$0.0790.0%0/3450.0%0/345
12minimax-m2p794.5%326/345120/13198%191/195100%75/7580%60/7594%220/23596%106/11010.227.1s42.2K$0.0110.0%0/3450.0%0/345
13qwen3p6-plus94.2%325/34582/9399%193/195100%75/7576%57/7595%223/23593%102/11011.155.3s65.1K$0.0290.0%0/3450.0%0/345
13gpt-5.6-sol94.2%325/34562/6699%194/195100%75/7575%56/7595%224/23592%101/11011.21.7m27.1K$0.0620.3%1/3450.0%0/345
15gpt-5.6-luna93.9%324/34568/7299%193/195100%75/7575%56/7594%222/23593%102/11010.41.2m22.7K$0.0100.0%0/3450.0%0/345
16claude-haiku-4-5-2025100193.6%323/345107/11598%191/19599%74/7577%58/7594%221/23593%102/11012.533.8s73.1K$0.0220.6%2/3450.0%0/345
17gpt-5.6-terra92.8%320/34562/7199%194/195100%75/7568%51/7594%220/23591%100/1109.952.3s25.0K$0.0260.3%1/3450.0%0/345
17glm-5p292.8%320/34567/7899%194/19597%73/7571%53/7595%223/23588%97/11013.62.9m83.0K$0.0650.0%0/3450.0%0/345
19gpt-5-mini91.9%317/34590/10195%186/19599%74/7576%57/7592%217/23591%100/1109.229.4s37.0K$0.0053.8%13/3450.0%0/345
20gpt-oss-120b91.3%315/34594/10395%185/19595%71/7579%59/7591%215/23591%100/11011.223.8s47.2K$0.0050.6%2/3450.0%0/345
21gpt-oss-20b90.7%313/34595/10193%182/19593%70/7581%61/7591%213/23591%100/11012.21.3m53.9K$0.0031.2%4/3450.0%0/345
22gpt-5.4-mini81.4%281/34570/10885%165/19595%71/7560%45/7582%192/23581%89/1108.513.5s18.0K$0.0073.5%12/3450.0%0/345
23minimax-m349.3%170/345167/34067%130/19525%19/7528%21/7560%141/23526%29/110112.319.3m2.8M$0.2027.2%94/3450.0%0/345
24claude-fable-515.9%55/3453/521%41/19512%9/757%5/7519%45/2359%10/1102.551.8s14.0K$0.0280.0%0/34585.2%294/345

Slices

Behavior Mix
10 models
passedfailedabstainedno-score
RankModelMixPass rate
1claude-sonnet-5
97.4%
2kimi-k3
97.1%
3claude-opus-4-8
95.9%
4qwen3p7-plus
95.7%
5kimi-k2p5
95.4%
5deepseek-v4-flash
95.4%
5kimi-k2p7-code
95.4%
8claude-sonnet-4-6
94.8%
8gpt-5.5
94.8%
8kimi-k2p6
94.8%
Authentication
480 trials
RankModelPass rate
1kimi-k390.0%
2claude-sonnet-580.0%
2claude-opus-4-880.0%
2qwen3p7-plus80.0%
2glm-5p280.0%
6minimax-m2p775.0%
6kimi-k2p575.0%
6kimi-k2p675.0%
6gpt-5.6-luna75.0%
6deepseek-v4-flash75.0%
Discovery
1,440 trials
RankModelPass rate
16gpt-5-mini98.3%
16claude-haiku-4-5-2025100198.3%
16kimi-k2p698.3%
16glm-5p298.3%
20gpt-5.4-mini95.0%
21gpt-oss-120b91.7%
22gpt-oss-20b86.7%
23minimax-m343.3%
24claude-fable-535.0%
Error Recovery
1,680 trials
RankModelPass rate
1claude-sonnet-592.9%
2kimi-k391.4%
3kimi-k2p690.0%
4claude-opus-4-887.1%
5kimi-k2p585.7%
5gpt-oss-20b85.7%
5minimax-m2p785.7%
5deepseek-v4-flash85.7%
5qwen3p7-plus85.7%
5kimi-k2p7-code85.7%
Multi-step Workflow
1,080 trials
RankModelPass rate
10kimi-k2p597.8%
10qwen3p6-plus97.8%
10deepseek-v4-flash97.8%
10gpt-5.597.8%
10gpt-5.6-luna97.8%
10qwen3p7-plus97.8%
16minimax-m2p795.6%
16claude-haiku-4-5-2025100195.6%
16glm-5p295.6%
19gpt-oss-120b91.1%
Pagination
1,200 trials
RankModelPass rate
18qwen3p6-plus98.0%
18gpt-oss-20b98.0%
20minimax-m2p796.0%
21gpt-5-mini94.0%
22gpt-5.4-mini90.0%
23minimax-m358.0%
24claude-fable-512.0%
Schema
1,320 trials
RankModelPass rate
14gpt-5.6-luna98.2%
14gpt-5.6-sol98.2%
14kimi-k2p7-code98.2%
14glm-5p298.2%
18gpt-5.6-terra96.4%
18kimi-k396.4%
20gpt-oss-120b92.7%
21gpt-5-mini90.9%
22gpt-5.4-mini81.8%
23minimax-m361.8%
Statefulness
1,080 trials
RankModelPass rate
18claude-haiku-4-5-2025100197.8%
18gpt-5-mini97.8%
18claude-opus-4-897.8%
18gpt-oss-20b97.8%
22gpt-5.4-mini80.0%
23minimax-m364.4%
24claude-fable-515.6%

Per-Model Results

Drill into any model to see per-task pass rates across its attempted tasks. This build contains aggregate results only (no per-trial pages).