AIPay Benchmark

哪套 Agent 配置能把支付接好?

基于真实业务项目构建的18个支付集成任务,评估Coding Agent完成支付接入与风险加固的能力,对比不同模型的表现、官方skill带来的提升及任务运行成本。

9 个支付产品 8 个真实项目 18 个集成任务 开源可复现

Benchmark 发布进度

当前页面只呈现两项与开发者接入直接相关的 Benchmark。已产生的数据明确展示;尚未启动的评测不虚构分数和排名。

PIBench 能帮你了解什么?

从支付集成表现、Skill 使用效果和运行费用三个方面,为选择和使用 Coding Agent 提供参考。

哪个模型更擅长支付接入?

在相同 Coding Agent 和官方 Skill 条件下,对比不同模型在基础接入与风险加固任务中的表现。

官方 Skill 能带来多大提升?

在相同模型、项目和任务下,对比使用与未使用官方 Skill 的评测结果。

完成任务需要多少运行费用?

结合任务得分与模型调用费用,对比不同模型及 Skill 使用条件下的成本与效果。

官方 Skill 提升完成度

综合范围 · 平均提升
+9.87 个百分点

126 组成对实验结果

113 组提升、8 组下降、5 组基本不变。

实验控制

只改变是否使用官方 Skill

实验保持模型、Coding Agent、项目、任务和评测环境一致,更清楚地观察官方 Skill 带来的变化。

113 / 126对照组提升
+11.65ppBasic基础接入
+8.09ppAdvanced 风险加固

支付集成排行榜

默认按使用官方 Skill 后的完成度排序,并展示 No Skill 基线与 Skill 提升。

质量已发布

综合完成度、Basic基础接入、Advanced 风险加固,以及九类产品任务通过情况。

成本已发布

每次任务运行费用、No Skill 价格基线、费用变化和对应的支付集成完成度。

任务范围 综合 · 18 个任务 9 个 Basic + 9 个 Advanced,两类能力各占 50%。
公开排名规则

综合完成度榜按安装官方 Skill 后的完成度降序,同分优先 Advanced;Skill 提升榜按提升幅度降序;成本榜按使用 Skill 后的每次任务运行费用升序,同价时按完成度降序。

用官方 Skill 接入真实项目

按业务场景选择对应 Skill,再让 Coding Agent 完成接入、沙箱验证与上线准备。

通过 npx -y @alipay/alipay-aipay@latest install 安装支付宝 AI 付 Skill,加载 alipay-aipay 技能,根据我的项目类型集成网页或 APP 支付,完成沙箱测试,并完成签约入驻

PIBench 分数与成本如何产生?

PIBench 不只读取 Agent 的回答,而是修改真实项目,再用自动化执行结果与 LLM-assisted assessment 共同判定,并按统一 Token 价格快照计算运行费用。

以真实项目运行结果判定

评测从代码结构、单元测试、集成测试、端到端流程和支付领域规则五个层面展开。Basic 关注能否跑通基础支付闭环;Advanced 关注验签、幂等、异常状态处理和业务状态一致性等风险防护能力

静态测试权重 1
单元测试权重 1
集成测试权重 2
端到端测试权重 2
LLM-assisted assessment权重 1