版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
A/BA/B小,测试的灵敏度,也就是Power不足,所以并没有检测到两组指标的不同。A/B通过提高Power来提高A/B测试检测到实验结果不同的概率。在第6节课我讲过了,Power越大,越能够准确地检测出实验组与对照组的不同。所以当我们提高了Power之后,有什么方法可以提高Power我们再来回顾下第6节课讲到的样本量估算2(Z1−α+Z1−β (Z1−α+Zpowern (σ (σ α(1α对应的ZScore ZPower为Power对应的ZScoreσ2σ
为实验组和对照组的综合方差(PooledVariance在里,我们找出影响Power的因素,也就是样本量和方差。其中PowerPower。方差和Power成反比。即通过减小方差就可以提高Power。具体来说,实践中,在有条件获得更大样本量的情况下,可以选择增大样本量的方法来提高Power,相对简单易操作。如果受流量或时间限制,没有条件获得的样本量,此时可以通过减小方差来提高Power。接下来,我就分别从增大样本量和减小方差这两个维度,来讲解6种提高Power的具体方61A/B100总流量的一部分,比如10%,也就是测试使用流量在总流量中的占比。一方面,A/B比如要测试是否要增加一个新功能时,公司并不想在测试阶段就把这个新功能给用户,以免给用户造成困扰。所以它们一般会先使用很小比例的流量来做AB测试(比如1%),确定得到显著结果后再把AB测试中的变化慢慢推广到100%的流量。A/BA/B上我们就需要设计4个实验,需要有4个实验组和4个对照组。假设我们现在的可用流量一共是8万,那么每组就有1利用率太低了,因为每个实验的对照组其实都是一样的(原推送)。但如果我们把4个对4个实验组和1个对照组,每组就有1.6你看,在同一个基础上想同时验证多个变化,也就是跑多个A/B测试有相同的对照组的时候,我们可以把对照组合并,减少分组数量,这样每组的样本量也会增加。这种测试又叫做ABn测试。通过增加样本量来提高Power,是实践中最常见的方法,但是业务场景千变万化,虽然不常见,但有时候确实没有办法获得的样本,比如时间紧迫,同时已经使用了100%的总流量,结果还是不显著,那这个时候就要通过减少方差来提高Power了。封顶阈值(CapThreshold)的方法把离群值剔除掉。比如可以根据指标的分布,只选取95%的取值范围,然后把剩下的5%的离群值剔除掉。常见的指标,比如中的人均花费,或者音乐App中的人均收听时间,由于会有些极少热衷于线上购物的用户花费居多,或者音乐发烧友一直在听歌,那么这些极少部分的用户就可能变成离群值,从而增加方差。取值范围窄的指标比取值范围广的指标方差要小。比如点击者量比点击量的方差小(因为一个点击者可以产生多个点击,点击比点击者多,取值范围广);率比人均花费的方差小(因为率是表征买或不买的二元,只有两个取值,人均花费则可以是任何数倾向评分匹配(PropensityScore倾向评分匹配,简称PSM,是因果推断的法,目的是解决实验组和对照组分布不均我来总结下。如果说合理性检验是帮我们确定两组分布是否相似的方法,那么PSM帮我们找出两组中相似部分的回溯性分析方法。简单来说,两组的各个特征越相似,就说明两组的方差越小。PSM的基本原理,就是把一组中的数据点,找到在另一组和它们相似的数据点,进行一对一的匹配,这个相似性是通过比较每个数据点的倾向评分(ProeiyScore)得到的。如果不理解倾向评分也没关系,你只需要知道这一点就够了:倾向评分越接近,说明两个数据点越相似。这里的一个数据点,指的就是AB测试中的一个实验单位。PSM置,使用产品/服务的特征等)放进一个 逻辑回归(LogisticsRegression)然后,算出每个数据点的倾向评分,然后再用诸如最邻近(NearestNeighbor)等 编程语言Python和R中都有相应的库,比如Python中的pymatch和R中的在倾向评分匹配这个部分,你只需要记住一个结论就可以了,那就是:PSM在A/B测试中我们把实验单位进行随机分组的这个过程叫做分配(Assignment),同时你要知道,在有些A/B测试中,比如在第8节课的案例中,我们要测试的变化是需要满足测试可以分为两种。A/B变发A/B测试中的变化。实践中大部分的A/BA/B还记得第8A/BA/B该用户已经对某首歌听了4次,当第5次时触发弹窗这里要注意的是,在对照组也会有用户满足弹窗触发规则的,只不过因为他们在对照组,所以即使他们满足了弹窗触发规则,我们也不会给这些用户发弹窗,我们还是要统计这些人因为要用他们做分母来计算评价指标。在工程实现上其实是有一个小技巧的:对于对照组的用户,如果他们符合触发规则,我们就给他们发送一个只有一个像素点的看不见的弹窗,这样的话我们在数据中会有相关记录,方便之后的指标计算,同时又保证了对照组不会受到弹窗的影响。这种需要触发的A/B测试多出现在有固定的用户使用路径的业务中,比如。在中,用户一般有较明确的多层级的使用路径:进入/App—>浏览商品列表—>查看具体商品—>加入购物车—>在的A/B测试中,一般是在用户进入/App时就被分配到实验组或者对照组,如车”页面的用户才能触发A/B总体而言,通过减少方差来提高Power的情况不多(常见的是通过增加样本量来提高Power)。如果真的遇到这种情况,那么比较简单快速的方法就是减小指标的方差。当然如果有条件的话我还是推荐更加科学的倾向评分匹配(PSM)。那么对于在A/B测试中的变化存在触发的情况下,就一定要在触发阶段计算指标。为了解决A/B不显著的问题,这节课我们主要讲解了提高A/B测试Power的如果在尝试过这些方法后,重新跑实验得出的还不显著,那就说明两组的指标事实上是相同的,我们就要放弃这个AB测试中的变化,用其他的变化来优化业务和产品。最后再强调一下,做出一个能真正提升业务的改变并不容易。从FLAG这些大厂披露所以也不要气馁,虽然不是每次实验都会有显著的结果,但是你可以从每次实验中学到新的知识(比如变化到底对业务有没有效果),沉淀新的方法论,还能从中发现业务、数据或者工程上潜在的一些问题。这些个人技能上的成长、业务流程上的完善,都是非常宝贵的。A/B 归科技所有 不得售卖。页面已增加防盗追踪,将依法其上一 08|案例串讲:从0开始,搭建一个规
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 2026外贸船员面试题及答案
- 2026武汉联想面试题目及答案
- 26新三上语文卷面提升训练字帖
- 2026-2031年中国LCD液晶屏行业市场调查研究及发展前景预测报告
- 2025-2026学年河北省邢台市宁晋县三年级数学第二学期期中联考试题含答案解析
- 2025-2026学年河北省承德市双滦区数学四年级下学期期中达标测试试题(含解析)
- 居家养老服务(照料)中心联建项目可行性研究报告模板-申批备案
- 西安交通大学(谢海鹏):2025年量子计算驱动的电力系统弹性提升-探索与展望报告
- 南昌市万溪学校招聘教师笔试真题2025
- 2026 年普外科腹部手术围手术期护理个案研讨
- 种子繁育员操作水平知识考核试卷含答案
- GB 44721-2026智能网联汽车自动驾驶系统安全要求
- 农贸市场框架工程施工组织设计方案
- 2026广东佛山市顺德区(家电)知识产权快速维权中心招聘合同制人员招聘2人备考题库带答案详解(完整版)
- 2026山东青岛广电影视传媒集团有限公司二次招聘24人笔试题库【典型题】附答案详解
- 2026年浙江中考(语文)真题带答案
- 2026年医师定期考核考试题库及答案
- 2026年重庆市渝中区中考二模语文试卷
- 行政处罚案卷评查评分标准教学课件
- GB/T 34531-2017液化二甲醚钢瓶定期检验与评定
- DB32-T 1087-2022高速公路沥青路面施工技术规范
评论
0/150
提交评论