刚接触数据分析的学生、科研人员、职场新人不要被复杂的建模概念所吓倒,本文整理出业务场景中经常使用到的7种主流数据分析方法,看完之后可以建立起完整的基础认知框架,完全满足知识启蒙阶段用户搭建数据分析方法体系的需求,没有多余的跳转和无关的内容。
根据国内头部互联网公司数据分析岗的公开基础能力要求,整理出一份新手适配筛选矩阵,把所有的方法按照零基础上手难度、业务落地见效周期两个维度进行分区标注,使你可以清楚地看出每一种方法的投入产出比。
同时我们补充多数科普内容未提及的「不同行业最低成本适配方案」:
- 中小电商不需要复杂的建模,只用Excel的排序和SUM函数就可以完成帕累托分析,3小时内整理出贡献80%营收的20%核心客户;
- 制造业的质量管控场景中,用帕累托分析法统计各个缺陷类型的出现次数,半天就可以找到造成80%生产损耗的20%核心缺陷原因;
- 互联网创业团队没有专业的BI工具,依靠已经存在的埋点后台导出的转化数据,用漏斗分析法2小时就可以找到产品核心路径的最高流失节点。
某初创公司运营新人以前只会用Excel做基础求和,花了3个小时用帕累托分析法找出贡献80%营收的20%核心客户群,配合RFM分层在一周内完成精准触达,直接促使老客复购率提高了17%——这个真实的案例充分证明了零基础用户不需要深厚的编程或者建模功底,只要掌握了基本的数据分析方法就可以得到明显的业务收益。
1. 数据分析方法的核心分类框架:从认知到落地的4大层级
行业内通用的数据分析方法分类逻辑,是按照分析目标由浅入深分为描述性、诊断性、预测性、指导性四个层次,涵盖了从现状还原到决策优化的全部需求,各个层次的能力边界、投入成本以及业务价值存在明显的区别,新手入门可以依照这个框架逐步提升,防止一开始就陷入复杂的建模误区。
四大层级数据分析方法能力边界与价值对比金字塔图
- 底层:描述性分析(现状还原):是所有数据分析的基础,占日常业务使用频率的60%以上,实施成本最低,只需要基本的Excel操作能力,核心价值是把零散的数据整理成直观的业务结论,明确现在发生了什么。
- 二层:诊断性分析(根因定位):占日常业务使用频率的25%左右,实施成本中等,需要有基本的维度拆解逻辑,核心价值是穿透表面的数据现象,找到业务波动背后的真实原因,明确为什么会发生。
- 三层:预测性分析(趋势预判):占日常业务使用频率的10%左右,实施成本较高,需要一定的数据建模能力,核心价值是根据历史数据规律来预测未来业务的走向,明确未来可能会发生什么。
- 顶层:指导性分析(决策优化):占日常业务使用频率的5%以下,实施成本最高,一般需要跨部门合作才能完成,核心价值就是直接给出可以落地的最优行动方案,明确怎么做才能得到最好的结果。
不同业务阶段所对应的方法选择优先级也很清楚,业务初创期先用描述性分析快速了解现状,业务进入增长期后再配合诊断性分析找到增长瓶颈,业务进入成熟期之后才开始逐步使用预测性和指导性的方法来改进决策,不能在业务早期就投入大量的资源去做复杂的建模,最后得到的结果是无法落地的空泛结论。
2. 描述性数据分析方法:还原业务真实现状的基础工具
描述性数据分析方法是所有数据分析入门的第一步,主要目的就是将零散的原始数据转化为结构化的业务指标结果,使业务人员可以快速地了解目前的业务状况,这些方法的共同特点是上手快、数据要求低,即使只有基础的Excel汇总数据也可以直接使用,可以满足日常80%以上的基础数据分析需求。
不同层级数据分析方法使用频率分布
描述性分析核心方法详解
对最常用的三种实体方法进行针对性的拆解,即对比分析法、帕累托分析法、趋势分析法这三个主要工具。
对比分析法
对比分析法是所有数据分析逻辑的基础,行业内通用标准定义里把对比分析法分为三类细分逻辑,即同比、环比和横向对标。同比是和去年同一周期的数据进行对比,消除季节性波动的影响,适合年度级别的业务复盘;环比是和上一个相邻周期的数据进行对比,比如本月和上月、本周和上周,适合短期业务波动的快速校验;横向对标是和同行业竞品、内部同赛道的其他业务线进行对比,判断自身业务在大盘中所处的位置。
对比分析法的参照系选择是核心原则,新手最容易犯的错误就是选错参照系,比如618大促后日常销量与大促期间峰值销量做环比,得出销量大幅下滑的错误结论,其实这种波动是正常的促销后回落,用去年同期大促后的销量做同比才能得到正确的判断。国内头部互联网公司数据分析岗的公开基础能力要求把“正确选择对比基准”作为入职第一考核项,说明它很重要。
对比分析法的核心价值在于选择一个参照系,将孤立的数字变成有业务意义的结论,例如本月销售额100万本身没有任何意义,但是与上月80万相比可以得出“环比增长25%”的直观判断,与120万的月度目标相比可以得出“完成率83%”的明确结果,从而快速找到业务的好坏程度。
帕累托分析法
帕累托分析法本质上是80/20法则,即80%的业务结果是由20%的核心因素所决定的,在实际应用中只需将所有的影响因素按贡献度从高到低排序,计算累计贡献占比,当累计占比达到80%时,对应的前20%左右的因素就是核心影响因素。
新手实操的极简步骤完全不需要复杂的工具,第一步把所有的客户、商品、渠道的营收数据粘贴到Excel中,第二步按照营收金额从大到小排序,第三步计算每一项的营收占总营收的比例,第四步下拉计算累计占比,找到累计占比达到80%的那条分界线,之前的所有条目就是贡献80%营收的核心群体。国内制造业质量管控通用公开标准中,把帕累托分析法作为生产缺陷定位的主要工具,其输出结果直接成为生产流程改进的主要依据。
帕累托分析法的主要价值就是把有限的业务资源优先投入到能产生最大回报的20%的核心场景中,避免因为平均分配资源而造成的整体投入产出比低下的情况,例如运营团队不需要给所有用户发同样的优惠券,只需要针对贡献80%营收的20%核心用户做专属权益,就可以用最少的预算获得最高的复购提升效果。
趋势分析法
趋势分析法是将同一指标的历史数据按时间先后顺序排列,从中找出长期的上升、下降或者周期性波动的规律,常用的时间粒度有日、周、月、年等,适合于展示长期业务走势。将过去12个月用户活跃度数据绘制成折线图之后,可以清楚地看出用户规模增长趋势是否符合预期,并且能够发现是否存在固定的月度波动规律。国内零售行业公开运营规范中,把月度趋势分析作为门店业绩复盘的必要环节,规定运营人员要依据3个月及以上连续的数据输出趋势判断,防止单月数据波动造成决策失误。
3. 诊断性数据分析方法:定位业务问题根因的核心手段
当描述性分析发现业务出现异常波动时,就需要使用诊断性数据分析方法,穿透表面现象找到背后的原因,这些方法不需要复杂的建模能力,主要考验的是拆解问题的逻辑能力,是所有业务岗数据分析能力的核心考核项。
诊断性分析核心方法详解
对漏斗分析法、相关性分析法两种主要的实体方法进行详细的拆解。
漏斗分析法
漏斗分析法的基本思想就是将用户完成某个转化行为所经过的全部路径,拆分成一系列前后相连的节点,统计每个节点的用户转化人数,计算相邻节点之间的转化率,最后找出整个路径中流失率最高的薄弱环节。漏斗分析法的节点设置要遵循两个基本原则,即所有的节点用户样本必须同源,也就是前一个节点的用户是后一个节点用户的全集;节点之间的顺序要符合真实用户的行为路径,不能有逻辑上的跳跃。
漏斗分析的节点设置合理性校验标准很清楚,如果拆解后某个节点的转化率一直大于90%或者小于10%,那么这个节点就没有拆分的意义了,应该把相邻的节点合并起来重新调整漏斗结构。电商下单路径的漏斗不能将用户打开APP直接跳转到提交订单,而应该在中间加上商品浏览、加购等必要的节点,否则得到的整体转化率结论是没有参考价值的。字节跳动对于用户行为分析岗位的基础能力要求中,把“漏斗节点拆解合理性”当作新人转正的主要考核标准。
漏斗分析法的主要价值就是直观地表现出整个转化路径的全链路流失情况,把原本模糊的“下单转化率低”的问题,准确地定位到“商品详情页到加购按钮的转化率只有5%”这样的具体节点上,业务团队可以直接针对这个节点进行优化,而不需要猜测问题出在哪里。
相关性分析法
相关性分析法的主要作用就是找出两个变量之间的相关趋势,行业通用标准清楚地界定了相关关系和因果关系的界限,相关性只能说明两个变量之间存在同步变化的趋势,例如夏季冰淇淋销量上升的时候溺水死亡人数也会同步上升,但是这两者之间并没有因果关系,真实的共同影响因素是气温升高,新手最容易犯的错误就是把相关关系当作因果关系,从而得出完全错误的分析结论。
相关性数值范围为-1到1之间,绝对值越接近1表示相关性越强,正数表示两个变量同步上升的正相关,负数表示一个变量上升的时候另一个变量下降的负相关。国内高校统计类课程通用教学规范中,把“相关≠因果”当作相关性分析的第一入门准则,防止学生在科研项目里出现逻辑上的偏差。
相关性分析法的主要价值就是帮助你快速找到影响业务结果的潜在变量,缩小根因排查范围,比如产品用户留存率下降时,你可以先用相关性分析快速筛选出与留存相关度最高的几个因素,即新版本更新、服务器故障、竞品大促等,再对这些因素进行验证,而不是在几百个零散的变量中一一排查。
4. 预测性与指导性数据分析方法:驱动业务前置决策的高阶能力
当业务进入稳定期之后,需要依靠历史数据来预测未来的趋势,并且直接对业务决策进行指导的时候,就可以使用高阶的预测性和指导性数据分析方法,这些方法不需要复杂的算法开发,普通零基础的用户也可以通过开源工具或者Excel插件来完成基础的落地。
首先对行业常用的用户分层类方法进行拆解
RFM用户分层模型
RFM模型是行业通用的用户价值分层方法,准确对应三个维度的计算规则:R(Recency)表示用户最近一次消费的时间距离现在的天数,数值越小说明用户最近消费越频繁;F(Frequency)表示用户在统计周期内消费的次数,数值越大说明用户的消费忠诚度越高;M(Monetary)表示用户在统计周期内累计消费的金额,数值越大说明用户为企业带来的营收越高。
模型的分层判定阈值参照阿里公开的用户分层通用判定标准,把三个维度的数值分别进行排序,取前50%的用户标记为高维度值,后50%标记为低维度值,组合之后就可以将全部用户分为8个类型,即重要价值用户、重要召回用户、新用户等不同的群体,针对不同的群体可以直接匹配相应的运营策略,例如对于很久没有消费的重要召回用户推送专属大额优惠券,对于高频消费的重要价值用户推送会员专属权益,不需要统一发一样的内容浪费预算。
聚类分析法
聚类分析法属于典型的无监督分类方法,其主要特点就是不需要事先设定分类规则,算法会根据用户的特征数据自动将相似度高的用户划分到同一个群体中,适合于在你对用户群体没有先验认识的情况下进行自动分群,例如你手中拥有全部用户的行为数据,但是不知道如何对用户进行分组,这时使用聚类分析就可以将用户分成“高频活跃内容消费者”、“低频付费核心用户”等不同的特征群体。国内互联网行业公开的用户运营能力标准中,把聚类分析法当作精细化用户分群的主要补充手段,适合于用户规模大于10万,用户特征差别很大的业务场景。
最后对决策优化类方法进行拆解:
A/B测试分析法
A/B测试分析法的核心前提是变量唯一,在其他所有条件都相同的情况下,只对一个变量进行调整,给两组用户展示不同的方案,最后统计两组用户的核心指标差异,从而判断调整后的方案是否真的能带来正向收益。例如要检验新按钮颜色能否提高点击率,就需要将用户完全随机地分成两组,除了按钮颜色之外页面上的所有元素、用户的人群属性等都保持一致,最后比较两组的点击率数据才能得出正确的结论。
国内头部互联网公司公开的A/B测试落地规范中,规定了单次测试的实验样本量不能少于1万用户,测试周期要包含完整的7天周期,防止由于样本量不够或者时间周期过短而造成结论的偏差。A/B测试分析法的主要价值就是用小流量实验来检验策略的效果,避免全量上线错误方案造成的大额业务损失,例如某个功能如果全量上线会导致转化率下降10%,那么通过10%流量的小范围A/B测试就可以提前发现问题,将损失控制在可接受的范围内。
5. 不同场景下数据分析方法的选择参考指南
很多新手在入门的时候会纠结于不知道遇到具体的业务问题时该用什么方法,这里整理出通用的选型决策流程,帮助你快速找到最适合的工具。
根据业务目标选择合适的数据分析方法流程图
第一步确定分析目标,明确目前的需求是做现状总结、问题根因排查、未来趋势预判还是行动方案指导,不同的目标对应着不同的方法集合;
第二步判断现有的数据是否满足要求,例如做漏斗分析需要有全路径的用户行为埋点数据,如果没有埋点数据就只能退而求其次,用对比分析来定位表层异常;
第三步根据复杂度匹配相应的方法,能用Excel对比分析解决的问题就不要使用复杂的聚类分析,以免造成不必要的时间浪费;
第四步校验结论的合理性,最终得出的分析结论要符合日常业务直觉,如果结论与业务常识相悖,就要回溯检查方法选择或者数据处理过程中哪里出了问题。
这里整理出全场景覆盖的常见数据分析方法适用场景及核心价值对照表。
根据不同的岗位日常业务场景,整理出7类方法的阶梯式学习顺序,避免不必要的学习弯路
1. 运营岗学习优先级:首先要掌握对比分析、帕累托分析,满足日常业绩复盘的需求,然后学习漏斗分析、RFM用户分层模型,支撑日常用户运营、活动复盘的工作,最后补充学习相关性分析、A/B测试、聚类分析,完成高阶能力的提升;
2. 产品岗学习优先级:首先要掌握对比分析、漏斗分析,快速找到产品的核心路径问题,然后学习A/B测试、相关性分析,检验产品优化方案的效果,最后补充帕累托分析、RFM用户分层、聚类分析,支撑全链路的产品决策;
3. 市场岗学习优先级:首先要掌握对比分析、帕累托分析,快速盘点出各个投放渠道的产出效果,然后学习相关性分析、RFM用户分层,找到高转化的核心用户群体,最后补充漏斗分析、A/B测试、聚类分析,优化全链路营销流程。
新手常见误用误区
大多数入门用户在学习数据分析方法的时候,很容易犯一些共性的错误,从而导致分析结论与实际业务情况大相径庭。
1. 对比分析法混淆同比和对标逻辑,例如把本月数据与上月进行环比,但用同比的业务逻辑去解释季节性波动,最后得出错误的增长判断,或者错误地选择了不同体量的竞品进行横向对标,将对方的百亿级营收与自己的百万级营收进行对比,得到的结论没有任何参考价值;
2. 相关性分析法直接推导因果关系,最典型的就是看到两个变量的数据同步上涨,就直接判定A是B的原因,完全忽略了隐藏的第三个共同影响因素,比如看到雪糕销量上涨的时候溺水人数上升,就得出卖雪糕导致溺水的荒谬结论,完全忽略了气温这个核心变量;
3. A/B测试没有严格控制单一变量,很多新手在做测试的时候,同时改变按钮颜色、文案和页面排版三个变量,最后发现转化率上升,但是不知道是哪个调整带来的正向效果,之后也无法复用经验,等于白做了测试;
4. RFM模型阈值设置不符合业务实际,很多新手直接照搬网上通用的近30天消费为R高值的阈值标准,但是如果你的业务是大宗家电类,用户平均复购周期是1年,那么这个阈值就完全不符合业务属性,最后分层结果没有任何实用价值。
常见问题
常见问题
共 4 个问题,点击展开查看答案
-
从门槛低、业务匹配度高的描述类方法入手,即对比分析、趋势分析、占比分析这三种,先培养数据感知能力,在1-2周内养成看到数据先找合理参照系进行对比的习惯,然后再慢慢学习诊断类、预测类的方法,不需要一开始就强行啃复杂的建模知识。
-
基本方法通用,但是侧重点不同,电商行业常用RFM分层、漏斗分析来关注用户的消费全过程优化,制造业重视过程质量的帕累托分析、因果分析来找出生产损耗的主要原因,互联网产品看重A/B测试、用户行为路径分析来改善产品体验,To B企业服务行业更多地使用帕累托分析来确定高价值客户资源倾斜的主要方向。
-
首先要确定当前的分析目的,是进行现状总结、问题根因排查、未来趋势预测还是行动方案指导,然后选择相应的方法,同时考虑数据的可得性以及落地成本,不能为了追求复杂的模型而忽视了实际的数据条件,例如手上只有Excel的汇总数据,硬要做聚类分析反而会浪费大量的时间,用基础的帕累托分析就可以得到80%以上的预期收益。
-
容易造成结论偏差、不能解释业务真实问题、误导决策,例如误用相关性分析直接得出因果关系,或者忽略数据样本偏差造成预测结果与实际业务情况完全不符,严重时会使得团队将有限的资源投入到完全错误的优化方向上,比如误把虚假关联的因素当作核心优化点,投入几十万的运营预算后才发现完全没有效果。