---
title: "AIPay Benchmark"
route: "/developers/benchmark"
source_html: "dist/developers/benchmark/index.html"
description: "AIPay Benchmark：基于真实项目任务，比较模型、Coding Agent 与官方 Skill 的支付集成完成度、Skill 提升和任务成本。"
---

# AIPay Benchmark

哪套 Agent 配置能把支付接好？

基于 18 个真实项目任务，对比模型、Coding Agent 与官方 Skill 的完整配置，评估支付集成完成度、Skill 带来的提升与对应任务成本。

- 9 个支付产品
- 8 个真实项目
- 18 个集成任务
- 开源可复现

## 支付集成综合完成度

1. Kimi K3：92.90%
2. Claude Opus 4.8：91.37%
3. GLM-5.2：87.12%

- 官方 Skill 平均提升：+9.87pp
- 最低任务运行费用：$0.1544

综合分由 9 个 Basic 与 9 个 Advanced 任务各占 50% 产生；所有模型均使用 Claude Code 并搭配官方 Skill 运行。

> Agent 友好：把页面链接交给 Agent。Agent 会读取 AIPay 官方页面，帮你选产品、找依据、排查问题。

## Benchmark 发布进度

当前页面只呈现两项与开发者接入直接相关的 Benchmark。已产生的数据明确展示；尚未启动的评测不虚构分数和排名。

### 01 · 支付集成：PIBench · 真实项目支付接入

已发布。评估完整 Agent 配置能否修改真实项目、跑通支付链路，并满足验签、幂等与业务状态一致性要求。

- 完成度排名
- Skill 成对提升
- 成本与效果

### 02 · 开发者入驻：Benchmark 待建设

待建设。相关评测尚未发布。完成建设与验证后，再公开能力结果。

## PIBench 支持的三个决策

### 选哪套完整配置

比较模型 × Coding Agent × 官方 Skill 的完整配置，而不是只看模型。

### Skill 是否值得安装

同模型、同项目、同任务成对对照，只改变是否使用官方 Skill。

### 一次任务运行要花多少

展示真实 API 费用、No Skill 价格基线，以及这笔费用对应的支付集成完成度。

## 官方 Skill 提升完成度

综合范围平均提升 +9.87 个百分点。

126 组成对实验中，113 组提升、8 组下降、5 组基本不变。

实验保持模型、Coding Agent、项目、任务和评测环境一致，只改变是否使用官方 Skill。

- 113 / 126 对照组提升
- basic基础接入：+11.65pp
- Advanced 风险加固：+8.09pp

## 支付集成排行榜

排行榜提供三个视角：集成完成度、Skill 提升、成本与效果。默认按使用官方 Skill 后的完成度排序，并展示 No Skill 基线与 Skill 提升。

### 公开排名规则

综合完成度榜按安装官方 Skill 后的完成度降序，同分优先 Advanced；非综合范围同分优先综合完成度。Skill 提升榜按当前范围提升幅度降序；成本榜按当前范围使用 Skill 后的每次任务运行费用升序，同价时按完成度降序。

### 综合 · 18 个任务

9 个 Basic + 9 个 Advanced，两类能力各占 50%。 126 组成对结果：113 组提升、8 组下降、5 组基本不变，平均提升 +9.87pp。

| 排名 | 模型 | 官方 Skill 完成度 | No Skill 基线 | Skill 提升 | 使用 Skill 后成本 | No Skill 成本 | 成本变化 |
| ---: | --- | ---: | ---: | ---: | ---: | ---: | ---: |
| 1 | Kimi K3 | 92.90% | 85.68% | +7.22pp | $2.4533 | $2.6727 | −$0.2194 (−8.21%) |
| 2 | Claude Opus 4.8 | 91.37% | 84.57% | +6.81pp | $9.9215 | $9.1727 | +$0.7489 (+8.16%) |
| 3 | GLM-5.2 | 87.12% | 78.56% | +8.56pp | $1.0665 | $1.0102 | +$0.0564 (+5.58%) |
| 4 | Kimi K2.7 Code | 82.18% | 66.67% | +15.51pp | $1.4179 | $1.2423 | +$0.1756 (+14.13%) |
| 5 | Qwen3.7-Max | 75.78% | 64.63% | +11.15pp | $2.3300 | $2.1091 | +$0.2209 (+10.47%) |
| 6 | DeepSeek-V4-Pro | 75.23% | 63.38% | +11.85pp | $0.1544 | $0.1406 | +$0.0138 (+9.79%) |
| 7 | MiniMax M3 | 68.58% | 60.61% | +7.98pp | $0.9625 | $0.9857 | −$0.0232 (−2.36%) |

### basic基础接入 · 9 个任务

评估能否建立可用、可信的基础支付闭环。 63 组成对结果：58 组提升、1 组下降、4 组基本不变，平均提升 +11.65pp。

| 排名 | 模型 | 官方 Skill 完成度 | No Skill 基线 | Skill 提升 | 使用 Skill 后成本 | No Skill 成本 | 成本变化 |
| ---: | --- | ---: | ---: | ---: | ---: | ---: | ---: |
| 1 | Kimi K3 | 94.94% | 81.01% | +13.93pp | $1.9347 | $2.4333 | −$0.4987 (−20.49%) |
| 2 | Claude Opus 4.8 | 92.58% | 83.96% | +8.62pp | $9.4120 | $9.4521 | −$0.0401 (−0.42%) |
| 3 | GLM-5.2 | 87.05% | 76.72% | +10.33pp | $1.0708 | $0.9255 | +$0.1453 (+15.70%) |
| 4 | Kimi K2.7 Code | 80.31% | 66.52% | +13.79pp | $1.4285 | $1.2234 | +$0.2051 (+16.77%) |
| 5 | DeepSeek-V4-Pro | 71.13% | 55.46% | +15.67pp | $0.1636 | $0.1383 | +$0.0253 (+18.28%) |
| 6 | Qwen3.7-Max | 70.88% | 60.38% | +10.50pp | $2.5323 | $2.5098 | +$0.0225 (+0.90%) |
| 7 | MiniMax M3 | 70.20% | 61.51% | +8.69pp | $0.8993 | $1.0389 | −$0.1396 (−13.44%) |

### Advanced 风险加固 · 9 个任务

评估异常条件下能否守住资金与业务状态边界。 63 组成对结果：55 组提升、7 组下降、1 组基本不变，平均提升 +8.09pp。

| 排名 | 模型 | 官方 Skill 完成度 | No Skill 基线 | Skill 提升 | 使用 Skill 后成本 | No Skill 成本 | 成本变化 |
| ---: | --- | ---: | ---: | ---: | ---: | ---: | ---: |
| 1 | Kimi K3 | 90.86% | 90.35% | +0.51pp | $2.9719 | $2.9122 | +$0.0598 (+2.05%) |
| 2 | Claude Opus 4.8 | 90.17% | 85.17% | +5.00pp | $10.4310 | $8.8932 | +$1.5378 (+17.29%) |
| 3 | GLM-5.2 | 87.19% | 80.39% | +6.80pp | $1.0623 | $1.0948 | −$0.0326 (−2.97%) |
| 4 | Kimi K2.7 Code | 84.05% | 66.82% | +17.23pp | $1.4073 | $1.2613 | +$0.1460 (+11.58%) |
| 5 | Qwen3.7-Max | 80.67% | 68.87% | +11.80pp | $2.1277 | $1.7084 | +$0.4193 (+24.54%) |
| 6 | DeepSeek-V4-Pro | 79.33% | 71.30% | +8.03pp | $0.1452 | $0.1429 | +$0.0022 (+1.57%) |
| 7 | MiniMax M3 | 66.97% | 59.70% | +7.27pp | $1.0256 | $0.9325 | +$0.0931 (+9.99%) |

## 用官方 Skill 接入真实项目

按业务场景选择对应 Skill，再让 Coding Agent 完成接入、沙箱验证与上线准备。

### 网页与移动应用收款

适合 AI 网页、移动应用收款，以及按量调用后的支付接入与排障。

`通过 npx -y @alipay/alipay-aipay@latest install 安装支付宝 AI 付 Skill，加载 alipay-aipay 技能，根据我的项目类型集成网页或 APP 支付，完成沙箱测试，并完成签约入驻`

### 订阅解决方案

适合套餐、续费、升降级等订阅业务。

`通过 npx alipay-subscription-skill 安装支付宝 AI 订阅 Skill，为我的项目集成套餐、续费和升降级能力，完成沙箱测试，并完成签约入驻`

### Agent 支付

适合 Agent 在授权范围内完成购买、调用与支付。

`通过 npx -y @alipay/agent-payment@latest install 安装支付宝 Agent 支付 Skill，加载 Agent 支付技能，让我的 Agent 在用户授权下完成购买、调用与支付`

## PIBench 分数与成本如何产生？

PIBench 不只读取 Agent 的回答，而是修改真实项目，再用自动化执行结果与 LLM-assisted assessment 共同判定，并按统一 Token 价格快照计算运行费用。

### 以真实项目运行结果判定

评测从代码结构、单元测试、集成测试、端到端流程和支付领域规则五个层面展开。Basic 关注能否跑通基础支付闭环；Advanced 关注验签、幂等、异常状态处理和业务状态一致性等风险防护能力

评测证据及权重：

- 静态测试：1
- 单元测试：1
- 集成测试：2
- 端到端测试：2
- LLM-assisted assessment：1

- [阅读论文](https://arxiv.org/html/2607.14573v3)
- [在 GitHub 复现](https://github.com/inclusionAI/PIBench)
