Postman

APIFlow-Bench 1.0 Leaderboard | Behavior Mix | Overall

Every trial ends one of four ways: passed, failed, abstained (the model asked for clarification or declined), or no-score (runtime error). This page shows each model's mix, separating "tried and failed" from "chose not to try". 467 tasks × 24 models in this slice.

Ranking◴ Generated 2026-07-3156,037 trials24 models
Pass rate
80.4%
Error Rate
0.0%
Trials
56,037
Tasks
467
Models
24
p95 Time
11.1m
p95 Tokens
583,536
Tool Calls Avg
20
Behavior Mix
24 models
passedfailedabstainedno-score
ModelPass / Fail / Abstain / ErrorScore
kimi-k3
89.9%
claude-sonnet-4-6
89.0%
claude-opus-4-8
88.6%
deepseek-v4-flash
88.4%
kimi-k2p6
87.9%
gpt-5.5
87.8%
claude-sonnet-5
87.8%
kimi-k2p7-code
87.6%
gpt-5.6-sol
87.3%
qwen3p6-plus
87.3%
glm-5p2
87.1%
deepseek-v4-pro
86.7%
claude-haiku-4-5-20251001
86.0%
gpt-5.6-luna
86.0%
kimi-k2p5
85.9%
qwen3p7-plus
85.5%
minimax-m2p7
85.5%
gpt-5.6-terra
85.4%
gpt-oss-120b
82.0%
gpt-oss-20b
80.9%
gpt-5-mini
80.6%
gpt-5.4-mini
68.5%
minimax-m3
32.7%
claude-fable-5
14.5%
Rank
Rank Spread
Model
Pass rate ± 90% CI
Pass (no abstain)
Abstain%
p95 Time
p95 Tokens
Avg Tools
113kimi-k389.9% 87.8%91.8%90.3% 2,098/2,3230.5% 12/2,33525.4m439,24216.7
216claude-sonnet-4-689.0% 86.7%91.1%89.1% 2,077/2,3310.2% 4/2,3351.7m122,55418.9
318claude-opus-4-888.6% 86.3%90.8%90.7% 2,068/2,2802.4% 55/2,3351.8m136,46012.1
429deepseek-v4-flash88.4% 86.2%90.5%88.6% 2,065/2,3310.2% 4/2,3352.2m229,05519.6
5211kimi-k2p687.9% 85.3%90.1%88.2% 2,052/2,3270.3% 8/2,3355.2m612,91117
6311gpt-5.587.8% 85.4%90.1%88.4% 2,051/2,3200.6% 15/2,3352.0m148,05014.8
7312claude-sonnet-587.8% 85.4%90.1%88.7% 2,050/2,3111.0% 24/2,3352.4m249,81315.3
8313kimi-k2p7-code87.6% 85.2%90.0%88.2% 2,046/2,3190.7% 16/2,3356.1m164,51413.9
9413gpt-5.6-sol87.3% 84.8%89.6%88.6% 2,039/2,3011.5% 34/2,3355.9m116,62814.1
10414qwen3p6-plus87.3% 85.0%89.6%87.4% 2,038/2,3320.1% 2/2,3346.5m381,98116.3
11514glm-5p287.1% 84.6%89.4%87.4% 2,033/2,3270.3% 8/2,33519.6m542,34216.3
12716deepseek-v4-pro86.7% 84.2%89.1%86.8% 2,024/2,3320.1% 3/2,3359.4m220,43620.4
131018claude-haiku-4-5-2025100186.0% 83.4%88.3%86.8% 2,007/2,3111.0% 24/2,3351.5m211,66116.5
131018gpt-5.6-luna86.0% 83.3%88.5%86.5% 2,007/2,3200.6% 15/2,3352.7m68,41113
151118kimi-k2p585.9% 83.1%88.3%86.4% 2,005/2,3200.6% 15/2,3351.6m95,40712.3
161218qwen3p7-plus85.5% 83.1%87.8%86.6% 1,997/2,3071.2% 28/2,33510.5m542,51912.1
171218minimax-m2p785.5% 82.9%87.9%85.8% 1,995/2,3240.4% 10/2,3341.1m137,71912.9
181218gpt-5.6-terra85.4% 82.7%87.9%86.5% 1,993/2,3041.3% 31/2,3352.6m90,69013
191921gpt-oss-120b82.0% 79.2%84.5%82.2% 1,914/2,3280.3% 7/2,33550.3s126,91613.5
201921gpt-oss-20b80.9% 78.4%83.5%82.5% 1,889/2,2891.9% 45/2,3343.9m150,18514.9
211921gpt-5-mini80.6% 78.0%83.2%85.2% 1,881/2,2075.5% 128/2,3351.1m105,15111.5
222222gpt-5.4-mini68.5% 65.7%71.3%70.7% 1,599/2,2633.1% 72/2,33522.9s39,01511
232323minimax-m332.7% 30.3%35.1%54.1% 764/1,41339.5% 922/2,33563.5m14,499,727151.4
242424claude-fable-514.5% 12.3%16.7%14.5% 339/2,3350.0% 0/2,3353.1m56,7193.3

Diagnostics

Loading the full trial dataset for this view…