Postman

APIFlow-Bench 1.0 Leaderboard | Authentication

How reliably a model obtains and applies credentials — picking the right auth scheme, minting and refreshing tokens, and scoping them correctly — before the actual workflow can start. 64 tasks × 24 models in this slice.

Ranking◴ Generated 2026-07-317,679 trials24 models
Pass rate
76.2%
Error Rate
0.0%
Trials
7,679
Tasks
64
Models
24
p95 Time
10.8m
p95 Tokens
696,140
Tool Calls Avg
19.7
Rank
Rank Spread
Model
Pass rate ± 90% CI
Pass (no abstain)
Abstain%
p95 Time
p95 Tokens
Avg Tools
113kimi-k389.7% 83.4%95.0%90.3% 287/3180.6% 2/32029.4m379,53915.9
218gpt-5.587.5% 80.9%93.8%89.7% 280/3122.5% 8/3202.4m131,42415.1
3110claude-sonnet-4-686.6% 80.0%93.1%87.7% 277/3161.3% 4/3202.5m177,19914.7
4213deepseek-v4-flash85.3% 78.1%91.6%85.6% 273/3190.3% 1/3202.2m180,55221.3
5213deepseek-v4-pro85.0% 77.8%91.3%85.0% 272/3200.0% 0/3208.6m170,44120.9
5213glm-5p285.0% 77.8%91.6%85.8% 272/3170.9% 3/32011.6m270,89215.6
7314gpt-5.6-sol84.7% 76.9%91.6%87.4% 271/3103.1% 10/3205.8m94,19213.7
8315kimi-k2p684.4% 77.2%90.9%84.9% 270/3180.6% 2/3202.6m181,70215.3
8314qwen3p6-plus84.4% 77.2%91.0%84.6% 270/3190.3% 1/3202.8m212,15614.5
10315kimi-k2p7-code83.8% 76.9%90.9%85.6% 268/3132.2% 7/3204.0m107,01114.2
11516claude-sonnet-582.8% 75.6%89.7%84.9% 265/3122.5% 8/3201.9m209,37815.6
11517qwen3p7-plus82.8% 75.3%89.4%84.9% 265/3122.5% 8/32011.1m591,30214
13517claude-opus-4-882.5% 75.3%89.4%86.3% 264/3064.4% 14/3201.8m101,79212.7
14918claude-haiku-4-5-2025100180.6% 72.5%87.8%81.9% 258/3151.6% 5/32049.7s134,65616
14818gpt-5.6-terra80.6% 73.1%88.4%84.0% 258/3074.1% 13/3203.6m129,23813.6
16919minimax-m2p780.3% 72.0%87.8%80.5% 256/3180.3% 1/31947.2s80,53513.2
171120gpt-5.6-luna78.8% 70.3%86.6%79.7% 252/3161.3% 4/3202.9m75,32812.7
181421kimi-k2p577.8% 69.4%85.6%79.3% 249/3141.9% 6/3201.3m71,69411.9
191721gpt-oss-120b75.0% 67.2%82.5%75.2% 240/3190.3% 1/32046.2s126,22614
191621gpt-5-mini75.0% 66.9%82.8%77.9% 240/3083.8% 12/3201.4m141,36912.1
211721gpt-oss-20b74.4% 66.6%82.2%75.8% 238/3141.9% 6/3203.8m176,25915.9
222222gpt-5.4-mini59.4% 51.6%67.2%60.9% 190/3122.5% 8/32021.6s38,40011.4
232323minimax-m329.4% 23.4%35.6%46.1% 94/20436.3% 116/32060.8m13,146,580145.2
242424claude-fable-514.4% 8.4%20.9%14.4% 46/3200.0% 0/3202.9m54,4853.5

Diagnostics

Loading the full trial dataset for this view…