AIPay Benchmark

哪套 Agent 配置能把支付接好?

基于 18 个真实项目任务,对比模型、Coding Agent 与官方 Skill 的完整配置,评估支付集成完成度、Skill 带来的提升与对应任务成本。

9 个支付产品 8 个真实项目 18 个集成任务 开源可复现

Benchmark 发布进度

当前页面只呈现两项与开发者接入直接相关的 Benchmark。已产生的数据明确展示;尚未启动的评测不虚构分数和排名。

PIBench 支持的三个决策

榜单不只给一个分数,而是把支付集成完成度、Skill 影响和任务成本放进同一套可比较口径。

已发布

选哪套完整配置

比较模型 × Coding Agent × 官方 Skill 的完整配置,而不是只看模型。

已发布

Skill 是否值得安装

同模型、同项目、同任务成对对照,只改变是否使用官方 Skill。

已发布

一次任务运行要花多少

展示真实 API 费用、No Skill 价格基线,以及这笔费用对应的支付集成完成度。

官方 Skill 提升完成度

综合范围 · 平均提升
+9.87 个百分点

126 组成对实验结果

113 组提升、8 组下降、5 组基本不变。

实验控制

只改变是否使用官方 Skill

实验保持模型、Coding Agent、项目、任务和评测环境一致,更清楚地观察官方 Skill 带来的变化。

113 / 126对照组提升
+11.65ppbasic基础接入
+8.09ppAdvanced 风险加固

支付集成排行榜

默认按使用官方 Skill 后的完成度排序,并展示 No Skill 基线与 Skill 提升。

质量已发布

综合完成度、basic基础接入、Advanced 风险加固,以及九类产品任务通过情况。

成本已发布

每次任务运行费用、No Skill 价格基线、费用变化和对应的支付集成完成度。

任务范围 综合 · 18 个任务 9 个 Basic + 9 个 Advanced,两类能力各占 50%。
公开排名规则

综合完成度榜按安装官方 Skill 后的完成度降序,同分优先 Advanced;Skill 提升榜按提升幅度降序;成本榜按使用 Skill 后的每次任务运行费用升序,同价时按完成度降序。

用官方 Skill 接入真实项目

按业务场景选择对应 Skill,再让 Coding Agent 完成接入、沙箱验证与上线准备。

通过 npx -y @alipay/alipay-aipay@latest install 安装支付宝 AI 付 Skill,加载 alipay-aipay 技能,根据我的项目类型集成网页或 APP 支付,完成沙箱测试,并完成签约入驻

PIBench 分数与成本如何产生?

PIBench 不只读取 Agent 的回答,而是修改真实项目,再用自动化执行结果与 LLM-assisted assessment 共同判定,并按统一 Token 价格快照计算运行费用。

以真实项目运行结果判定

评测从代码结构、单元测试、集成测试、端到端流程和支付领域规则五个层面展开。Basic 关注能否跑通基础支付闭环;Advanced 关注验签、幂等、异常状态处理和业务状态一致性等风险防护能力

静态测试权重 1
单元测试权重 1
集成测试权重 2
端到端测试权重 2
LLM-assisted assessment权重 1