A/B 实验 开始运行后,商户可以在实验详情页的 实验数据 标签页对比各实验组的转化漏斗、收入数据、风险指标及自定义数据。系统还会结合实验结果与置信度提供 AI Insights,帮助商户判断实验差异是否可靠,并决定是否将表现更好的版本正式上线。
进入实验数据页面
- 打开实验数据: 登录 Subotiz 后台,前往 数据 > A/B 实验,点击需要分析的实验名称,然后进入 实验数据 标签页。页面顶部会展示以下总览数据:
- 实验时长: 实验激活后至当前时间的累计时长。
- 参与用户数: 当前已进入实验并被分配至实验组的用户数量。
商户可以通过这两项数据快速了解实验运行进度及当前样本规模。转化漏斗、收入数据及风险数据会按照实验分组分栏展示。每个分组对应一栏,栏名与创建实验时设置的分组名称一致。
- 识别指标类型: 实验指标根据数据类型采用不同的展示方式。
- 数量类指标: 仅显示各分组的原始数值,不展示相对变化百分比及置信度,例如浏览人数、支付成功人数和支付订单数。
- 比率及金额类指标: 展示各分组的实际数值、相对对照组的变化百分比及该差异的置信度,例如支付成功率、浏览转化率、GMV 和 ARPU。
当实验刚开始运行或参与用户数较少时,页面可能显示较大的变化幅度,但对应置信度仍然较低。例如,某实验当前只有少量用户参与,GMV 可能显示:- 对照组:$64,580.28
- 实验组:$0.00
- 相对变化:-100%
- 置信度:0.0%
这类结果通常表示当前样本量不足,暂时无法判断实验组是否确实表现较差,而不代表实验组一定会造成 GMV 下降。建议继续运行实验并收集更多数据,再结合置信度判断结果。
分析转化漏斗
实验数据页面会展示用户从浏览页面到支付成功的主要转化路径。每个漏斗环节分别显示对应人数及转化比率。
数量行仅展示各分组的原始人数;比率行会同时展示实际比率、相对对照组的变化百分比及置信度。人数指标本身不计算置信度。
- 浏览人数: 进入实验页面的去重用户数量。浏览人数是转化漏斗的起点,因此没有对应的转化比率。
- 发起结账人数 / 结账发起率: 进入结账页面的用户数量,以及发起结账人数占浏览人数的比例。
- 提交订单人数 / 交易单提交率: 在结账页面完成信息填写并点击订阅或购买的用户数量,以及提交订单人数占浏览人数的比例。
- 完成支付操作人数 / 支付操作完成率: 已完成支付认证或支付操作步骤的用户数量,以及该人数占浏览人数的比例。完成支付操作不代表支付已经成功,交易仍可能因风险控制、余额不足、银行拒绝或其他原因失败。
- 支付成功人数 / 支付成功率: 成功完成支付的用户数量及其占比。
- 浏览转化率: 支付成功人数占浏览人数的比例,用于衡量用户从进入页面到完成支付的整体转化表现。

对比收入与风险数据
除转化漏斗外,商户还可以对比各实验组的收入表现、订阅表现及退款风险。
支付订单数属于数量类指标,仅显示原始数值。GMV、ARPU、订阅续订率及退款率会额外展示相对对照组的变化百分比与置信度。
- 支付订单数: 各实验组成功支付的订单数量。
- GMV: 各实验组支付成功的交易总额。当前 GMV 统计口径包含后续发生退款的订单金额。
- ARPU: 各实验组用户平均付费金额。计算方式: GMV ÷ 支付用户数。该指标可用于判断实验版本是否提升每位付费用户产生的平均收入。
- 订阅续订率: 已进入第二个订阅周期的用户占比。试用用户成功转为首个付费订阅周期时,系统也会将该行为计入续订统计。续订行为只会在当前订阅周期结束后发生,因此页面展示的续订率仅基于已经到期的用户样本计算。为获得更完整的续订结果,建议在实验停止接收新用户后,继续观察至少一个完整订阅周期,例如:
- 试用期为 7 天:继续观察约 7 天。
- 月付订阅:继续观察约 30 天。
- 年付订阅:根据实际业务周期决定观察时间。
- 退款率: 退款成功用户数占支付成功用户数的比例,用于判断不同实验版本是否带来更高的售后或退款风险。

理解置信度与结论建议
置信度用于衡量实验组与对照组之间的差异是否可能由真实改动造成,而不是由随机波动产生。
置信度越高,表示当前实验结果越可靠。较大的提升或下降幅度并不一定代表结果可信,商户仍需结合参与用户数与置信度进行判断。
系统会结合实验配置、实验结果及 A/B 测试分析规则生成 AI 解读,并显示在实验数据页面。商户可以参考 AI 解读及以下规则判断实验结论。AI 解读仅用于辅助分析,最终决策仍需结合样本规模、业务指标及实际运营情况。
- 判断显著胜出: 当置信度不低于 95%,且相对提升幅度大于 0 时,表示实验组表现显著优于对照组。商户可以考虑采用实验组版本。
- 判断显著变差: 当置信度不低于 95%,且相对变化幅度小于 0 时,表示实验组表现显著低于对照组。建议停止采用该改动。
- 识别潜在机会: 当置信度不低于 80% 且低于 95%,且相对提升幅度大于 0 时,表示实验组当前表现较好,但结果尚未达到显著水平。建议延长实验并收集更多数据。
- 识别数据不足: 当置信度低于 80% 时,表示当前差异可能由随机波动造成。建议继续增加实验样本,不要仅根据当前变化幅度作出决定。
- 判断无明显差异: 当相对变化幅度接近 0 时,表示两个分组表现基本一致,当前改动未产生明显影响。
置信度只代表统计结果的可靠程度,不代表业务影响的重要程度。即使某项指标达到较高置信度,商户仍应同时评估收入、风险、用户体验及实施成本,再作出最终上线决策。
分析自定义数据
如果创建实验时配置了自定义数据,实验数据页面会按照分组展示对应的直接数据与派生数据。
- 对比自定义数据: 分析各实验组的实际指标值、相对对照组的变化百分比及置信度。
- 页面按钮点击
- 特定功能使用
- 注册步骤完成
- 内容互动
- 商户自定义业务事件
自定义指标是否准确,取决于 SDK 事件上报及数据口径配置。分析结果前,请确认各实验组采用相同的数据采集规则。
留意数据更新与统计口径
分析实验结果时,请留意以下数据规则,避免误读实验表现。
- 等待数据更新: 实验数据最快每 5 分钟更新一次。用户完成操作后,相关数据不会立即显示。
- 继续观察延迟指标: 实验结束或终止后,系统不再接收新用户,但已参与实验用户产生的续订、退款等延迟反馈指标仍会继续更新。
- 区分用户统计口径:A/B 实验会根据实验用户 ID 进行分组及人数统计。该口径与 数据概览 模块中的用户统计方式不同,因此两个页面显示的人数可能存在差异。
- 核对订单实验信息: 交易单导出文件包含 A/B 实验 字段,记录订单参与的实验 ID 及所属分组。商户可以根据导出数据进一步核对实验对订单及收入的影响。
- 避免过早下结论: 实验参与人数较少时,即使变化百分比较大,结果也可能缺乏统计可靠性。建议优先参考置信度及完整业务周期内的数据表现。
商户可以通过实验数据页面顶部的实验时长与参与用户数了解实验进度,并进一步对比各分组的转化漏斗、收入数据、风险指标及自定义数据。数量类指标仅展示原始数值,比率及金额类指标则会同时展示相对变化与置信度。
当样本量不足或置信度较低时,不应仅根据表面变化幅度作出上线决定。结合置信度、AI 解读、收入影响及风险表现,商户可以更准确地判断实验结果,并决定是否将表现更好的版本推广给全部用户。