这是本节的多页打印视图。 .
第六章 · 数据分析
增长黑客与传统营销最大的区别在于「可衡量」。本章讲如何用数据驱动增长决策:从指标体系搭建,到用户体验度量,再到 A/B 测试的实验方法。
本章要点
- 了解数据和数据分析的价值:从流量思维到数据思维
- 搭建公司的业务指标体系和四个层级(北极星指标 → 一级指标 → 二级指标 → 行动指标)
- 衡量产品用户体验的 HEART 模型(愉悦度、参与度、接受度、留存度、任务完成度)
- 数据分析的五个步骤
- 了解什么是 A/B 测试及其正确使用姿势
1 - 了解数据和数据分析的价值
数据为王:从测量历史到大数据时代
增长黑客在实践中最重要的原则之一就是数据为王——不断去测量和实验,通过数据结论指导行动。整个人类的发展历史,就是人类不断尝试记录、测量自身和外在世界的过程:从古时候发明算盘、阿拉伯数字,到近代发明二进制计算器,都是这一现象的体现。但人类对自己和世界的认知目前仍很粗浅——描述一个人只能说性别、年龄、身高体重,提到环境只能说天气、温度如何。尽管如此,人类对数据测量的需求一直没有减弱。
大约从 2014 年前后开始,网上谈论大数据的人越来越多,人类仿佛一下子进入大数据时代:行业峰会、互联网转型战略的制定、政府政策风向的扶持引导,都开始重视数据的价值,数据好像一下子变成了一座金矿。关于每天产生的数据量,这里给出几个数字:
- 谷歌的 Eric Schmidt 曾推算,互联网上每天产生的数据量约为 2.5 EB;
- 思科估算,2015 到 2020 年之间数据的年复合增长率约为 66%;
- IDC 预测,到 2020 年数据量将达到 40 ZB。
换算公式:1 ZB = 1024 EB,1 EB = 1024 PB,1 PB = 1024 TB,1 TB = 1024 GB,依此类推;传统数据库支持的体量一般在 10-100 TB 之间。更直观地理解 40 ZB:相当于世界人口全年每天观看 14.5 小时高清视频流所产生的数据量;如果把中国每天产生的数据量装进常规容量的硬盘平铺在地面,中国 960 万平方公里的广袤面积都不够放。
数据量的快速增长已远远超过单个计算机所能存储和处理的能力,数据处理变得越来越重要,也驱动数据中心网络不断向大带宽、低延时方向演进。
海量数据从哪里来
- 人与人之间的连接:以 Facebook 为例,从注册账号开始,添加了哪些好友、产生了哪些互动——小到一个评论点赞,大到发起一场线上演唱会直播,每一次有意义的鼠标点击或网页跳转,都会成为 Facebook 数据服务器内的一条新增记录,直到指导 Facebook 改进自己的产品。
- 设备与设备之间的连接:作者上大学时"云"的概念刚被提出,业内很推崇云端战略。作者那时做了一个个人博客"同步控",专门研究哪些软件支持云同步——要么用一个账号跨平台,要么把数据导到 Dropbox、iCloud 等第三方云存储平台,从而无论在哪里都能随时存取自己的数据。作者当时的设想是:未来数据应该在网上自由流动,硬件本身变得不值钱,像现在的共享单车、共享雨伞、充电宝一样随处廉价取用,通过指纹或虹膜登录就能立即取回数据开始使用——满大街都可以看作是有你的手机和 Pad。现在整个互联网的演进方向看来的确有这个趋势:上台面一点的移动产品都必须同时推出跨平台版本,不支持云同步或账号互通简直贻笑大方;再如区块链这个很火的概念,解决的也是同一份数据如何在网络上同时分发给多个节点、多个设备并保持一致性,本质就是设备之间如何产生数据连接。
- 工具与服务之间的连接:一连串工具之间互导互通的自动化流程(营销自动化一章有专门介绍)——在服务管道之间像血液一样流通的,就是各种各样的用户信息和行为数据,通过不同工具服务重新打散、整理、整合、加工,最后产生新的商业价值。
这两年不仅大数据企业增多,围绕大数据的培训、数据交易、数据竞赛及相关媒体也大量涌现,不少学校开设了大数据专业专门培养人才,相关立法逐渐完善,政府也开始重视数据建设。但必须提醒:不要张口闭口对着一行 Excel 统计报表就说"这是我们产品用户行为的大数据"——日常生活中大部分谈论大数据的人,根本没搞清楚什么是大数据,大数据被完全过度神话了。杜克大学教授 Dan Ariely 打过一个很妙的比方:
大数据就像青少年的性:每个人都在谈论它,但没有人真正知道怎么做;每个人都觉得别人都在做,于是也声称自己在做。
到底多大的数据量才能谈大数据?这要看数据的信息量。几种常见定义:
- 百度百科的定义:大数据(或称巨量资料)指所涉及的资料规模巨大到无法透过目前主流软件工具,在合理时间内获取、管理、处理,并整理成为帮助企业经营决策的资讯。
- 国际知名统计机构 Gartner 的定义:大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
- 从应用角度看,当数据量大到传统技术难以处理时,就可以称作大数据——例如传统数据库已不能高效处理 1 PB 的数据,仅向磁盘写入 1 PB 就要耗费两百多天。此外还要看数据的复杂性以及产生数据的速度。也有说法认为,大数据不在于数据量有多大,而在于通过对相对全量的繁杂数据进行分析、找出相关规律,从而实现对未来的预测或改善原先的方案。
对什么是大数据,说法本就众说纷纭,没有谁给出明确界定,很多人只是人云亦云。我个人比较接受的界定方式,是大数据应具备 5V 特征:
- Volume(数据量大):正常计算机处理 4 GB 数据需要 4 分钟,处理 1 TB 需要 3 小时,达到 1 PB 则需要约 100 天——只有达到 PB 以上的数据才可能被称为大数据。
- Velocity(高速):接上例,处理 1 PB 数据如果不到一秒就能实现,就是高速。要高速是因为数据有时效性,超过时间就失去原有价值了。
- Variety(多样性):最简单的数据分类是结构化与非结构化,随着互联网和物联网的发展,逐渐扩展到网页、社交媒体、感知数据,涵盖音频、图片、视频、模拟信号等,真正诠释了数据的广度和多样性。
- Value(价值):获取有价值的数据。以股市为例,真正有价值的数据只会在很小的范围内传播,极少流落到整个互联网上——如果只看股民评论来预测股市,就要非常小心。因此要设法从各种维度挖掘真实、有价值的信息。
- Veracity(真实性):大数据中很多内容与真实世界关联,大数据就是从庞大的网络数据中提取出能够解释和预测现实世界的过程。
5V 在网上版本很多,图中另一个版本还提出了不同的 V 特征,甚至还有 6V、7V 等说法,没有明确界定。但通过这些特征可以大概有个感觉:不是任何数据、任何数字报表都能称为大数据。以后再看到有人动不动拿"大数据"来忽悠,就要警觉了——同事邮件里发来的一组数据不叫大数据,那不过是一个统计数字罢了。
数据与数据分析的本质
究竟什么是数据?区分三个概念:“100"是数——单纯的阿拉伯数字,脱离具体语境,是抽象概念,不知道有什么现实表达和应用;“100 个"是数量——数词后加量词,含义更进一步,但仍缺乏上下文语境;“今天新增用户 100 个"才是数据——它反映了对某件事状态的量化和评估,可以被衡量、被比较。
简单来说,数据是一种量化事物的手段,就像身高、体重、三围一样,是代表事物现实存在客观情况的数字指标。数据最大的特征是客观性:无论是否触碰,它就在那里;人们可以衡量它,也可以通过外在努力去改进、优化它,但不能凭意念肆意改变一个客观存在的数据。
未来随着数据量增多,数据分析将成为一种常态。它既是一门科学,与商业智能、数据挖掘、人机分析处理、机器学习等行业概念密不可分;也是一门艺术,需要在技术、想象力、经验和意愿的综合因素中寻求平衡与融合。它的最终目的是解决业务问题,帮助人从数据中获得智慧,在寻根溯源、节约资源、提高效率等方面发挥巨大价值,未来会像日常寻常技术一样深入各行各业。
数据分析的四大价值
数据分析在增长黑客的产品开发运营中发挥哪些作用?根据作者的经验总结为四点,以下分别结合案例展开。
一、不靠感觉,有据可依
Facebook 内部一直贯彻数据为王的理念,流传着很多经典案例。曾经有一位产品 VP 级的人物,在解读产品日常数据时发现一个趋势:很多用户在图片功能上花了大量时间——发图片、看别人的照片、发表评论,图片成为高频使用的功能。而他对现有版本(左图)不够满意:页面上密密麻麻都是各种小字,发图和消费图片的功能不清晰,用户体验不好。于是他专门组建了一个 30 人的临时项目小组,花了九个月时间研究如何对首页进行大改版,目标是做出更适合发图和浏览图片的新版本。迭代打磨将近一年后,团队发布了右图的新版本:图片够大够清晰,刷起来很爽,侧边栏隐藏了不重要的文字信息、全部用图标表示,整个页面现代大气。
对这个全新版本,Facebook 内部一开始很支持,很多员工表示喜欢,扎克伯格也非常赞同。但走正常发布流程要遵循灰度发布规则,于是先对全网 0.5% 的用户开放。上线后这位产品 VP 惊讶地发现,整体数据不但没有变好看,反而出现异常抖动;团队以为是用户不熟悉新版本,继续发布到 1%、2%,用户在线时长出现小幅下降;他不信邪,继续发布到 3%、5%、7%,该版本对在线时长的下降产生了显著影响。要知道在 Facebook,用户使用时长是非常重要的指标,它直接与广告曝光时长挂钩——使用时间越短,广告营收越少,这是无法被容忍的。发到 10%、12% 时,数据彻底断崖式下跌,在线时长减少了三分之一,扎克伯格终于坐不住,勒令退回原版本。所以 Facebook 至今仍沿用类似左图的版本,只是新版本中的一些闪光点被吸收沿用,整个大改版计划被彻底废弃。这就是 Facebook 通过数据、而不是靠感觉来决定产品是否上线的决策流程。
反例是当时一家"没有灵魂的公司"人人网,很会东施效颦。Facebook 还在做灰度发布时,人人网别的不行,执行力和山寨速度很快,迅速抄出了一版几乎一样的界面:图片很大、菜单缩到最左边、文字隐藏只用图标。Facebook 发现数据不好看后很快回滚,人人网却最终停留在这个版本上,数据不断下滑,加上后来不断作死,才导致了今天的局面。这就是数据驱动与不靠数据、光靠感觉跟在别人后面亦步亦趋的抄袭效仿,导致的两种不同结果。
二、量化标准,驱动产品持续改进
讲一个作者以前做产品的案例。大概 2011-2012 年,作者在上海跟别人一起创业,做了很多产品,其中有一款模仿美国产品 Tinder 的社交应用(类似今天的探探):屏幕上出现附近异性的头像,右边按钮代表喜欢、左边代表不喜欢,凭第一印象决定;如果双方互相点击喜欢,就配对成功。这类社交平台上女性用户很重要,团队非常注重女性用户体验。有段时间增加私信功能后,发现女性用户的使用度、活跃度开始下降,一些人气较高的优质女性慢慢渐行渐远。团队大概猜到了原因:平台上很多不会玩的男性用户(内部管他们叫"男屌丝”)打招呼不友善、不礼貌,上来就说"美女,约吗”,吓走了很多优质女性用户。
为此团队做了调研,询问一些女用户:像大部分邮箱系统一样做一个"一键标为已读”,点一下就把所有未读私信的红气泡去掉,好不好?女生们都说好。接到正面反馈后团队就开发上线了,结果数据一看与反馈大相径庭——根本没人用。一开始以为是统计埋点出了问题,反复排查没有任何问题。后来团队又做了一次"小黑屋"用户访谈,邀请 6 位女性(其中 3 个是闺蜜)到办公室面对面访谈,了解她们为什么不用这个功能。这一访谈发现了真实场景:周末闺蜜们相约吃 Brunch 或喝下午茶时闲聊,第一个女生会说"我最近在用叉叉叉(这款产品),很有意思,可以配对附近的人,你们一起来玩",掏出手机——屏幕上有五六个人发来仰慕之情的私信;第二个女生也掏出手机——十几条私信;第三个女生说"我都快卸载了,太烦了",一掏手机——四五十条陌生人私信。
团队恍然大悟:比起减少骚扰,通过未读数字气泡展示自己人气的需求更加强烈——她们宁可留着未读气泡不去点掉,也要随时在不经意的场合展示自己在社交平台上的人气有多高。如果不进行这样反复的追踪、不量化产品使用效果,作为一群直男,团队恐怕永远无法知道还有这样一个很实际的使用场景。这也驱使团队不断改进产品、持续迭代:把这个功能藏得深了一点,并做了别的功能来减少女性被骚扰的可能性。
三、挖掘隐藏需求
春秋航空是国内最大、也是最早的低成本航空公司,收入利润做得比较好,主要因为他们抓住了两波红利:移动互联网的人口流量红利,以及粉丝经济的红利。截至成文时,春秋航空微信服务号粉丝已突破 890 万,App 下载量 4800 万,注册会员 2800 万,线上产生的收入利润在国内位居前列,其中自家 App 直销占比达到 66.9%,这还不含携程等各大 OTA 平台带来的销售额。
春秋航空做产品时,一直通过线上产品的细节打磨来提升精细化运营水平。比如在 App 上订票时需要选择出发城市和到达城市,原本只有出发城市有"当前位置、历史记录、热门城市",到达城市则完全没有。负责人参考热力图和用户反馈后发现,用户选择到达城市费时费力、转化率较低,于是在到达城市也加上了这三项。结果是:从选择城市到机票搜索页,整体转化率提升了 14.4%,订票整体转化比较上一版本提升了 2.68%。后续还做了很多优化:国际城市展示机场代码、规范控件导航目录、针对游客增加城市推荐及理由、搜索展示全部城市、空铁/空巴联运用标签分类等,都极大提升了产品每个环节的转化效果——这正是对用户需求的深层次挖掘和更好的理解。
四、提升精细化能力,降低运营成本
2017 年的某一个工作日早上,作者团队抓取了上海这座城市摩拜单车停放的位置,图上星散的蓝点就代表摩拜单车。可以看到这些点在地铁口、公交站比较聚集——共享单车解决的就是出行第一公里或最后一公里的需求:早上上班从家到地铁站,晚上下班从公司到地铁站。因此车辆停放位置有些区域相对聚集,有些区域使用较少。以前摩拜、ofo 会租赁搬家公司的卡车在马路上开来开去,把停放稀疏区域的单车搬上车,驱车十几二十公里开到用车密集的区域再放下来——本质上靠租赁搬厂公司重新调配共享单车的位置,让车尽可能出现在更多被使用的地方。在车辆产量有限的情况下,这是一种调配手段,但会占据一定的运营成本。
2017 年年中,摩拜新版本推出了一个很有意思的功能——红包车。乍一听跟滴滴、快的早期做红包有点像:打开 App 搜索附近共享单车时,会发现有些车带红包图标,点击解锁这辆车就可以获得一个红包,可能是几毛钱或一两块钱;骑上红包车到达特定地点、或骑行特定里程数时,就能得到几毛到几块钱的红包奖励。表面看它是在提升获客能力、拉动使用以提升活跃度和留存度,但仔细想,红包车更精妙之处在于提升了共享单车厂商的精细化能力、帮助降低运营成本:以前每天在很多城市雇搬厂公司或物流公司用卡车搬车,成本比较高;用了红包车之后,用户会为几毛几分钱的蝇头小利,主动把一辆车从 A 地骑到 B 地。最巧妙的是,红包车一定不会出现在热门商圈,而是在比较偏僻冷门的地方偶尔停着的车上——这些车很容易刷出红包。官方的意图很明显:把"搬车"这件事众包掉了,不再需要每天花几百万上千万的预算雇人搬车,只靠几毛几块钱的小恩小惠,自然有用户愿意把车从冷门的地方骑到热门的地方。这个一举多得的设计,成为摩拜 2017 年很成功的增长黑客策略之一。
以上这些案例,很好地体现了数据价值在一款产品的设计、运营和增长过程中起到的重要性。
2 - 搭建公司的业务指标体系和四个层级
为什么需要指标体系
管理大师彼得·德鲁克说过:“If you can’t measure it, you can’t improve it”——如果你不能衡量,就无法管理。互联网产品的增长建立在对过往版本不断循环迭代的基础之上,因此量化的对比衡量是其应有之义,而很重要的一点,就是为产品构建一套数据指标体系。
指标是用于衡量事物发展程度的单位或方法,是一种度量标准,用于追踪和评估商业进程的状态,比如人口数、GDP、收入、用户数、留存率、利润率、覆盖率等。很多公司都有自己的 KPI 指标体系,通过关键指标衡量业务运营的好坏。指标需要经过加和、平均等汇总计算得到,且必须在时间、地点、范围等前提下进行汇总——即常说的统计口径与范围。
常见的指标根据分类维度的不同,可以分出很多种:
- 基础指标:新增用户、活跃用户、启动次数等,是很多产品都会统计的通用指标。
- 流量指标:多在网页端体现,如 UV、PV、跳出率等。
- 使用数据:衡量用户实际使用产品时产生的行为,如使用时长、使用频率、两次访问的间隔等,体现用户使用产品的频繁程度。
- 业务指标:订单量、客单价、复购率、扫码率等,传统电商网站常统计。
- 垂直领域的细化指标:如女性用户在双十一大促的客单价,就是非常细分的指标。
- 成本类指标:CAC(Customer Acquisition Cost,客户获取成本)、LTV(Lifetime Value,用户生命周期价值)、Payback Period(成本回收周期)等。
老板开会常问"今天的 UV、PV、注册转化率、购买率是多少"。普通员工会说"老板等一下,我看下报表";优秀的增长黑客能立即接茬:“老板,昨天转化率是 80%,今天只有 70%,可能是昨天上线的新流程造成数据波动,解决思路是重新优化登录流程设计。“这就是普通员工与增长黑客的差距。做数据分析除了统计、编程、算法等能力,还必须非常熟悉公司业务;提升业务熟悉度和数据指标敏感度最直接有效的办法没有别的,就是多看多记。不妨自查:不查资料、不看报表,能否说出公司每天/每周/每月的营业额、活跃量、流量?周末和周中差别如何?早、中、晚用户有何关键差别?在北京、上海及其他主要地区,产品的市场份额和消费能力怎么样?这些指标很多互联网公司都有,但能不能记住,是区分增长黑客数据分析能力的重要方面,应烂熟于心,几乎成为第二本能。有工程师诉苦:“产品经理每天找我要一堆指标,根本不知道有什么用”——因此要学会选择好的指标,这才说明真正掌握了衡量业务表现的方法。
什么是好的指标
脱离业务单谈一个指标的好坏,或者拼凑很多指标,都是没有意义的。好指标具有以下特征:
- 可比性:能拿来被比较。首先要求指标衡量的事物是可以对比的,比如拿两个页面的 PV 比较、拿登录人数和注册人数比较,是有意义的,因为它们是性质相同的数据指标;但拿 App 下载量和网页端营业额做比较,就很难得出有意义的结论。
- 简单:正因为简单,使用者不会轻易犯错,也能轻松把指标背后的意义和故事展示给老板、同事。搞一个很复杂的指标,别人光理解就需要深厚的背景知识或很长时间,指标就很有迷惑性。市面上很多经济学家和权威机构爱搞耸人听闻的复杂指标——真正有本事的人完全可以用简单的语言解释,他们偏要复杂化,就是不让受众多思考、顺着想、受蛊惑即可。这也是经济学家利用公开渠道发言影响大众舆论、私底下操盘"收韭菜"的一种手法。
- 通常是一个比率:绝对数值的指标有局限性。比如当日成交量,一周内不同时间、一天内不同时段、一年之内同比环比,都可能因天气、节庆、政策、习惯等出现波动,直接比较受限较多;而交易额比上成交量反映平均客单价,在一段时间内不会产生出乎意料的剧烈波动,拿来做横向、纵向比较都比较放心。
五组指标维度与虚荣指标
指标分类的维度很多,这里列举五种分析维度,各自给出一组对比概念:
- 定性指标 vs 定量指标:定量指标是可以被量化的指标,如数字或可比较的等级(A/B/C/D);不能定量的即定性指标,无法直接通过数据计算分析评价,需要对评价对象进行客观描述和分析来反映结果,如主观评定的及格、良好、优异。
- 探索性指标 vs 报告性指标:报告性指标让人时刻了解当前运营状况和管理活动,像日常看报告一样;探索性指标帮助团队了解"那些你不知道自己不知道的事实”,提供原本不为人知的洞见。比如发现产品活跃度很差是报告性指标;进一步拆解数据,发现为数不多的活跃人群中年轻妈妈群体撑起了主要活跃度,于是调整重心、专门开发了一款母婴社区并大受好评——发现年轻妈妈占比高就是探索性指标,帮助发现隐含的有价值信息。
- 先见性指标 vs 后见性指标:先见性指标用来预测未来,如通过现有产品的日常增量和漏斗转化情况预测第二天大概有多少成交客户,或通过异常预警做到未雨绸缪;后见性指标用来解释过去,如季度订单量、流失率等,通常是亡羊补牢的行为,虽可通过一些做法弥补,但很多时候为时已晚。
- 相关性指标 vs 因果性指标:有时两组数据彼此相关、同受第三者因素影响,如网站卡顿不稳定时,UV 和 PV 会同时下降;有的指标之间存在因果关系,即 A 指标变化引发 B 波动,如用户在线时长减少,靠展示曝光获得的广告营收也就减少,前者是导致后者的直接原因。
- 虚荣指标 vs 可付诸行动指标:虚荣指标让人自我感觉很良好,但实际上没什么业务价值,会让人沉溺其中、忽略真正重要的事——比如今天网站 PV 很高,有人为此沾沾自喜,但实际成交转化率很低,依然赚不到钱,PV 高只能让人自嗨一小会儿。可付诸行动(可实施)指标能指导最佳行动方案、提供商业行动建议,只要思路正确、照着正确的方法调整,就能实实在在获得增长。
关于虚荣指标,有两个案例:
MySpace:曾是 Facebook 之前美国社交网络的老大哥——Facebook 只有区区六七千万用户的时候,MySpace 的用户就早已突破 3 亿。但 MySpace 最后还是陨落了,原因很多,其中一点值得玩味:当年管理团队非常注重注册用户数这个虚荣指标。这 3 亿用户里,有多少是五年前注册的?多少注册后从未二次访问?多少试用几次就成了僵尸用户?注册用户数在投资人那里好看、员工说起来好听,实际却让 MySpace 错误估计形势、走偏方向、抓错重点。相比之下,Facebook 的扎克伯格从来不看重注册用户数,只看月活跃用户数,这确保 Facebook 内部任何决策都指向真实、持续活跃的用户增长,甚至向投资人汇报也只报月活。在互联网浪潮刚兴起时做到这点很不容易——注水的注册量好看,但真正做产品、做业务的,绝不能只追求报表漂亮,那是自己忽悠自己。
SocialCam:定位与朋友即时分享视频的短视频社交应用,2011 年 3 月上线后曾在世界范围内迅速火爆:一个月时间获得 25 万下载量,四个月内达到 100 万,一度成为 App Store 排名第一的免费应用,被认为是"视频版的 Instagram”。但 SocialCam 追求的是网站流量和下载量——今天看来都是虚荣指标,无法锚定产品的核心价值。早期漂亮的增长完全仰赖一个叫 FreeAppADay 的在线广告推广服务,以及与 Facebook 生态的深度整合(利用开放图谱带来很大流量)。后来成功融资并被收购,SocialCam 开始减少使用该推广服务,排名迅速下降;随着 Facebook 改变开放图谱的参数,流量降低,活跃用户下滑更惊人:2012 年 6 月(被收购前)每月连接到 Facebook 的活跃用户有 8360 万,到 11 月只剩 430 万,短短五个月减少了 95%。只观测虚荣指标、盲目扩张,往往导致企业浪费资源,甚至最终死亡。
指标的四个层级
在产品实际运营中,有时需要根据指标的重要程度设定层级或优先级,以合理分配管理成本。一般可将指标分成四个等级:优先度最高的叫北极星指标(核心指标);其次是一级指标,用来衡量公司的战略和目标;再往后是二级指标,针对一级指标做路径分析拆解,以此更高效地定位一级指标波动的原因;最后是三级指标,是对二级指标路径的分析拆解,用来定位二级指标中波动的原因。
北极星指标
为什么叫北极星指标?因为这个指标一旦确立,就应该像夜晚高悬天上的北极星,不管走到哪儿都指引方向,牵引公司上上下下向同一个方向迈进。北极星指标是二十年前丰田提出来的,旨在用最精简的方式去掉冗余部分、服务公司的终极目标——公司日常运作的各项指标,最后累加的反应都应该能增加北极星指标。它的作用有四:
- 集中火力抓重点:增长涉及方方面面,没有明确指引,日常很容易眉毛胡子一把抓,无法有效集中火力。
- 优化团队资源配置:公司到达一定规模后,共同目标可以帮助把团队调整到同一个方向、同一个步调,明确任务优先级,效率更高。
- 大幅提高行动力:Y Combinator 联合创始人 Paul Graham 说过,一旦选择了指标,就只有一件事可做——努力达到那个目标。可以通过目标了解公司状况,有针对性地上线各种项目和试验,观察有没有具体成效。
- 提升公司的文化和价值观:明确公司长期优先级、凝聚团队。比如衡量今天中国的发展程度,北极星指标是 GDP,政治考核都以 GDP 为指标,所以像达康书记这样的官员很知道努力的方向在哪边。
再看硅谷科技公司的案例:许多优秀的硅谷公司都将体验过 Aha Moment(啊哈时刻)的用户数量作为北极星指标——Aha Moment 指的就是用户体会到产品价值的那个节点,经历过它的用户带来的增长才是真正健康的增长。当然这也不是绝对的,取决于企业处在什么时期。
2017 年年底作者团队在北京办了一场增长大会,见到了 LinkedIn 国际化增长部门的负责人。他在闭门分享中表示:LinkedIn 做产品的核心价值是让用户建立自己的社交网络。他们发现,添加认识的人为好友的用户长期留存率很高;留存率更高的,是那些一注册就马上被认识的人添加为好友的用户——刚注册就收到好友申请,是非常有价值、友好的体验。意识到这一点后,他们尽可能引导新用户尽早在 LinkedIn 上建立社交网络,对新用户留存非常有效。同时也要关注老用户留存,确保他们持续在产品中获得价值;留存率较好时就可以开始增长了。LinkedIn 判断一个新注册用户是否是高质量用户的依据是:完善个人资料的程度(至少罗列一个职位信息)、建立至少一个连接、开放社交权限可以被其他用户搜索到。据说 LinkedIn 内部的数据指标有几千组,基本由产品和数据分析成员通过数据分析和机器学习手段定义,以此衡量长期用户的活跃度。
如何找到一个合适的北极星指标?首先要说明,这不是一蹴而就的事,可能需要很多次尝试和改版。开始之前,把脑袋里有的指标写下来,逐条追问下面几个问题:
- 产品的核心价值是什么?这个指标可以让人知道用户体验到这种价值了吗?比如做投资 App,用户核心价值就是投资,北极星指标应该和投资有关。
- 这个指标能反映用户的活跃程度吗?比如前面例子里 MySpace 的注册用户数,就没有反映用户的活跃程度。
- 如果这个指标变好了,能不能说明整个公司在向好的方向发展?比如对 Uber 来说,只把注册司机数作为北极星指标,显然忽略了乘客端;它的北极星指标应该能反映司机和乘客的供需平衡,用总乘车数是更合适的指标。
- 这个指标是不是容易被团队理解和交流?一般建议北极星指标选一个绝对数比较好,而不是比例或百分比,比如总订单数就比"超过 100 元的订单比例"更好理解。
- 它是先导性指标还是滞后性指标?比如 SaaS 公司喜欢用收入作北极星指标,这不是坏指标,但确实是较滞后的指标——有的用户可能已经停止使用几个月,却还在默默信用卡扣款付月费,这种情况下活跃用户数可能是更好的先导指标。
- 它是不是可操作(可付诸行动)的指标?简单说,如果对一个指标什么都做不了,那它就相当于不存在。
列举五种常见互联网商业模式常用的核心指标:
- 双边市场(如淘宝、打车应用):商品数量、用户规模、买家数量、卖家数量、成交金额、交易达成率等。
- UGC 产品:优质内容产生数量、可生产内容用户数、消费内容用户数、广告收入等。
- 媒体型产品:优质内容数量、用户访问量、广告收入。
- 互联网金融产品:资金规模、利润、绑卡用户数、对外投资优质资产的数量、活跃投资用户数。
- 工具类应用:使用用户数、付费用户或付费企业数、商业化收入等。
这些要针对产品所处的周期和具体业务目标来制定。
一、二、三级指标
- 一级指标(Tier 1):顺承北极星指标,用来衡量公司的战略和目标;是管理层认可、能够对公司所有层级员工提出核心指导意义的指标。一般建议定 5-8 个比较好,如 GMV、订单数、日活/周活用户数、商城活跃用户量等,具体要结合自身业务,从公司或用户两个角度出发找到合适的一级指标。
- 二级指标:用来更高效地定位一级指标中波动的原因。比如每日 GMV 和订单数上升,潜在路径拆分下来可能是货品单价上升、活跃用户数量增多,或某个站内推广渠道产生了效果,可通过二级指标来定位。很多公司的二级指标有上百个甚至上千个,多是流程中的指标,而非最终结果的汇报、被老板关注上报的指标。
- 三级指标:顾名思义,帮人定位二级指标中的波动,通常以子流程或个体的方式定义,由一线作战的市场、产品、运营团队关注;看到结果后往往采取相应行动,比如用产品或运营的手段来提升或降低它。
用 OSM 模型搭建指标体系
数据指标的分层很复杂、分类方法也很多样,日常工作中如何搭建数据指标体系?需要用体系化来思考业务度量和指标的选择。这里介绍一个 OSM 模型:Objective(业务目标)、Strategy(业务策略)、Measurement(度量)三个层级。作者曾拿这个模型帮助很多客户思考数据监控和分析的体系,进行有针对性的优化。
- O = Objective,业务目标:要衡量某个业务的表现,首先要理解业务目标——公司、业务、产品存在的目的是什么。
- S = Strategy,业务策略:为达成上述业务目标应该采取什么策略。一个目标可以对应多个策略,但不要太多。
- M = Measurement,度量:选择合适的度量指标来衡量策略是否有效,反映目标最终有没有达成。
实战案例:非标住宿产品的搜索功能
非标住宿不同于传统的酒店标准住宿提供商,特点是 SKU 比较少、业务差异比较大,像 Airbnb、小猪短租、途家网都属于非标住宿。假设这款产品搜索和预定的流程是:发起搜索 → 进入搜索结果列表 → 点击列表中某个项目进入详情展示 → 感兴趣的话从详情展示转到填写订单 → 订单支付完成预定成功。如果是负责这款产品搜索功能的增长黑客,会如何搭建指标体系?以下用 OSM 模型逐一分析。
O,业务目标:定义公司、产品、业务存在的目的,直白说就是为什么要做这件事。比如做一次线上营销,真正目的是引导用户注册账户成为销售线索,还是促进直接下单?回到案例,预定功能存在的目的分两方面:从用户体验出发,让用户高效找到心仪的住所;从公司运营出发,通过搜索提高下单转化率。第一条显而易见——信息量大的网站都少不了搜索功能;第二条是根据经验和数据推理——搜索提高需求匹配效率,让用户第一时间看到想要的东西,转化率自然高。目标怎样确定?可从三个角度:其一,公司是一个整体,要与上级确认、考虑全局、看资源如何分配——决定开发预定功能,领导是否认可、能否安排工程师配合?其二,目标应有长期短期之分,不同业务阶段有不同目标——短期想提高盈利就提高下单转化率,长期改进产品体验就要在搜索上下功夫。其三,综合考虑 AARRR 各业务环节,这里的目标就处于 Revenue(收入)阶段。
目标的选择还应遵循一些原则。《Web Analytics 2.0》的作者在书中提出了目标制定的原则:Doable(切实可执行,目标可以被达成,不要设定不可能完成的任务)、Understandable(简单易懂、容易被记住,促进顺利推进和执行)、Manageable(可干预、可管理,能够流程化、系统性地被管理执行)、Beneficial(有实际的业务价值)。从反面讲,要设法避免两个误区:一是过于模糊,目标没办法被执行;二是过于保守,太保守的目标有时无法有效激励团队,得不到想要的正向增长结果。
S,业务策略:为完成目标采取的针对性策略。这个例子里怎么提升搜索的价值?其一,提供精准的匹配结果——匹配不准,用户需求难以满足、体验大打折扣,下单转化率自然被拉低。其二,提供有效的搜索结果排序——既降低用户选择焦虑,也把同类型下最优秀的住宿结果呈现给用户、提高产品体验。其三,无结果或结果过少时进行有效推荐——搜索为空时用户自然离开、转化率为零;若能根据用户的兴趣偏好推荐相似关键词或近似公寓,就有很大机会抓住即将流失的用户。注意两点:第一,策略由结果驱动、靠最终结果考量——再天马行空、五花八门的策略,最后无法在结果上验证,都属于"花活";第二,同时考虑宏观和微观层面的转化——比如微观上下单到支付流程的转化率提升 1%,宏观上可能是整个集团今年整体营收因此提升 1%,二者有相关性。
M,度量:对策略和最终目标的衡量,是反映业务目标和策略有效性的非常重要的指标,换句话说就是反映业务目标有没有达成。抛开业务目标和业务策略,直接谈衡量指标,这种行为通常被称作"耍流氓"。最常见的衡量指标就是 KPI,用它直接度量策略的有效性、直接反映目标达成情况。在这个案例里,为了提高下单量,最终确定的策略是提高返回结果与用户搜索词的匹配度,据此设定了两个度量指标:一是搜索页到详情页的转化率能否因此达到 30%;二是详情页到下单的转化率能否达到 20%。
OSM 确定之后,就可以搭建监控体系来追踪转化率的变化,比如 GrowingIO 提供的案例演示截图,可以看到每一步转化率的变化,以及围绕转化率上下波动、进行调整的情况。
AARRR 各环节的常见指标
最后介绍 AARRR 各个环节常见的指标举例,有些很简单,有些比较少见,可以根据自身的具体业务和目标策略来设定 KPI 集合:
- 获客阶段:重点关注渠道的表现,包括渠道规模(能拉来多少用户、访问量、访问用户);渠道的拉新能力(渠道带来的流量中多少是新访客);渠道质量指标(基础的如访问时长、每次会话浏览的页面数、跳出率等);以及业务和目标转化相关指标(注册转化率,或购买、预定转化率等)。
- 激活阶段和留存阶段:关注产品整体使用规模的指标(日/周/月的活跃用户数、留存率);重点关注新用户的引导激活情况(如果产品有新手任务,可以拿它来监控完成率和时长);还关注产品使用情况的指标(产品活跃度、各个模块的活跃度、产品的核心转化流程、产品的整体留存率和功能留存率)。
- 其余环节的常见指标已汇总在表格中。可对照检查自己对 AARRR 各环节哪些概念比较熟悉、哪些还没怎么接触过,有针对性地补充学习。
3 - 6.3衡量产品用户体验的HEART模型
用户体验为何难以量化
大约十二年前,“用户体验"这一概念在业界逐渐兴起,许多产品设计领域的知名博主纷纷开始从用户体验的视角讨论产品如何设计与优化。但当时存在一个明显的问题:谈用户体验的人很多,能拿出被公众认可的、可衡量的客观标准的人却很少,多数讨论停留在产品带给自己的主观感受上——而主观感受是靠不住的。
更棘手的是遇到不懂产品的老板,动辄以"用户体验差"这类笼统反馈要求团队照其意图修改:结果越改越糟,老板本人却觉得颇为受用、很有掌控感,产品上线后很快被用户的负面评价淹没。此外,申请企业内部资源或制定 KPI 时,有些指标(如成交转化率)很容易量化,用户体验却看起来无从衡量。于是产品设计师只能被迫向这种"黑恶势力"低头:为了提升转化率,堆砌又大又丑的按钮、自动跳转,甚至误导性设计乃至黑暗模式,全然不顾用户在页面上被折腾得难以忍受。
用户体验是否可以被量化、被数据指标衡量?是有办法的——这就是 HEART 模型。
HEART 模型:Google 的衡量框架
HEART 模型由 Google 发明,是其用户体验研究团队设计的框架。起因是内部团队发现用户体验没有被有效衡量:当时虽有不少有效的测量方法,如完成任务所用的时间、任务完成率等,但都偏重微观层面;Google 的 UX 设计师缺乏宏观层面的商业指标,而这些指标更直接影响公司策略。因此 Google 最终研发出这套 HEART 指标体系,作为新的用户体验衡量框架。
HEART 是五个单词首字母的缩写,同时包含宏观和微观的方面,可用于确定产品用户体验的实际影响:
- H——Happiness(愉悦度):衡量产品使用过程中的愉悦度或满意度。
- E——Engagement(参与度):用户专注投入到产品中的程度。
- A——Adoption(接受度):用户对产品新版本或新功能的接受情况。
- R——Retention(留存率):用户愿意回访的比例。
- T——Task Success(任务成功率):用户完成任务的程度与效率。
五个元素分述如下。
H——愉悦度(Happiness)
愉悦度是一种情绪的衡量,可以通过 NPS(净推荐值) 或用户问卷来衡量,从而了解产品的发展方向是否符合用户心意。
NPS 最早由贝恩咨询公司于 2003 年在《哈佛商业评论》上首次提出,计算方式为:推荐者数量 ÷ 样本总数 × 100%,减去贬损者数量 ÷ 样本总数 × 100%。具体做法是问客户一个问题——是否愿意将这个产品推荐给他的朋友或同事——并让客户在 0 到 10 分之间打分:
- 9~10 分:对产品具有狂热忠诚度的人,愿意继续购买或把它引荐给其他人(推荐者)。
- 7~8 分:总体满意但并不狂热,仍会考虑其他竞争对手的产品。
- 0~6 分:批评者,使用并不满意,对公司或产品没有忠诚度(贬损者)。
得分解读:NPS 在 50% 以上可以被认为还不错;在 70%~80% 之间,则证明公司拥有一批高忠诚度的好客户。调查显示,大部分公司的 NPS 还在 5%~10% 之间徘徊;而像特斯拉这样的公司,每年做 NPS 调查时,对新款车型的满意度都能达到 90% 以上,这一数字相当惊人。
除 NPS 外,另一个调查用户满意度的方法是用户调研:
Dropbox 早期做过一次调研,问用户:如果以下某个功能不再提供,你是否会感到失望?候选功能包括备份、存储同步、分享、编辑,并允许用户自己提出其他功能。最终排序为:用户最喜欢存储同步,其次是分享,紧接着是编辑,最后是备份;用户提到的其他希望的功能是管理照片。
Dropbox 根据调研结果进行了相关优化:增加了照片管理的新功能;优化了官网的新手引导流程,根据不同情境强调产品对应的功能来促进拉新转化;还根据反馈重新设计了官网。
此外还有一些其他评判用户满意度的指标,比如看用户对产品的评价或投诉——许多产品都提供反馈入口,请用户给产品打好评或给某个功能评分,这也是直观且可量化的用户满意度衡量方法。
E 与 A——参与度与接受度
E——Engagement(参与度):即用户专注到一个产品中的程度。在这个容易分心的世界里,培养和增强用户使用一个产品的习惯非常困难,因此它在某种程度上与产品活跃度略有重合。Google 经常衡量的参与度指标包括:每天或每周每个用户的平均访问量、每天或每周平均每个用户上传照片的数量、每天发生的分享数等。一款产品的活跃度或某个功能的激活情况,可以间接视作参与度的衡量指标——具体衡量方法见前文介绍活跃度的章节。
A——Adoption(接受度):指用户对一个功能或一组功能的接受情况,或新用户接受一个产品的情况。两种场景并不相同,但在如何向用户介绍新功能、如何引导用户使用产品上有共同点。Google 会利用一些技巧提高产品接受度,例如用不同的弹窗告诉老用户有了新功能——有的是居中式、有的是侧滑式,哪一种对用户转化率更好、最可接受,都通过数据来衡量。常用的接受度衡量指标有:
- 升级速率:用堆积图显示不同版本用户的占比,衡量新版本的普及速度,比如从发布到该版本占比 60% 所花费的时间。显然,新版本体验更好的话,更多用户就愿意升级,升级的时间周期也更短。这类堆积图反映了一个版本从上线到逐步扩散的用户规模变化周期,可以拿来对各版本做横向比较。
- 新功能使用比例:一种视角是看新功能上线后的浏览量占整个产品其他核心功能浏览量的比例——例如约 2%,就意味着 100 个用户里大概有 2 个会看到、使用这个功能;另一种是看使用该功能的用户量占总登录用户的规模。无论看浏览量还是实际使用量,都能体现一个新功能究竟有多受欢迎。
- 新用户购买转化率:更侧重交易类产品,可以判断一个新用户在购买的各个流程之间一步步如何转化。如果能成功完成购买流程、转化率维持在一个可观甚至较高的水平,就说明用户买账、认可产品,并会因此完成交易。
R 与 T——留存率与任务成功率
R——Retention(留存率):这一维度较为常见,衡量用户愿意回访的比例——良好的用户体验能让用户持续产生回访。如何拆分不同用户分群来研究留存率、如何提升产品功能模块的留存率、以及如何通过内容运营等手段提升留存,见前文留存相关章节。
T——Task Success(任务成功率):衡量用户能否通过产品解决问题、完成任务,以及是否高效,例如搜索结果的成功率、上传照片的平均时长、个人资料创建的完成率等用户具体任务的成功情况。好的交互设计师通常有一些方法来提高任务的成功完成率:通过突出核心流程、强化界面元素、简化操作步骤,帮助用户更快速地完成给定任务。
Google Photos 分享优化:某一版 Google Photos 的界面中,蓝色指示气泡指向一种新的分享方式,点击分享按钮会打开新的分享界面。Google 应当是注意到许多用户通过链接或 Gmail 附件发送照片,认为这个体验可以做得更流畅,因此优化了 Photos 中照片发送和分享的方式:使用极简式的发送窗口,有效减少分享照片过程中的无用步骤——打开之后只需点一下,就可以直接分享给某个常用的邮件联系人,完全不需要填写邮件正文、输入邮件联系人名称,甚至想个标题。这体现了 Google 为帮助用户更好地完成"分享"这个任务所做的贴心优化。
小结
回顾 HEART 五要素:H 是 Happiness(愉悦度),E 是 Engagement(参与度),A 是 Adoption(接受度),R 是 Retention(留存率),T 是 Task Success(任务成功率)。
有了这样一个模型,再面对固执的老板或合作伙伴时,就可以对精心设计的产品据理力争:拿出上面一种或几种量化指标作为论据,有理、有据、有节地展开观点,把好的设计理念传达给对方。愿产品世界里多一些好的用户体验设计,少一些令人崩溃的糟糕设计。
4 - 6.4数据分析的五个步骤
前提:明确目的,建立预期
数据分析的价值与指标体系的搭建见前文,本篇笔记梳理数据分析的一般流程。在正式开始之前,必须明确两个前提:
- 明确目的:不要为了数据分析而进行数据分析。特别是面对满屏幕的统计指标和数据反馈时,往往越看越乱,这时更要明确目标、抽丝剥茧,从一堆数字里准确找出真正用得着的。说到底,数据分析只是手段,手段服务于目的;不知道分析目的是什么就掏出计算器对着 Excel 忙一下午,到最后也不知道自己在做什么,那就是浪费时间。
- 建立预期:哪怕没有明确的预期,也得毛估出一个大概——估不出数字区间,起码能估个量级。这个能力要通过大量的练习和实践来训练。有了预期,等结果出来才能进行对比:是令人满意,还是差强人意、有优化提升的空间。
确立好前提,就进入数据分析的一般流程。整个流程分成五个环节:数据获取、数据清洗、数据分析、验证发现、数据可视化。
第一步:数据获取
数据分析的起点是起码先得有数据。常用来源有五种:
- 文件下载:最常见、用得最多的方式。可下载的文件既有公司内部服务器上提供的,也有网上公开的免费报告、统计报表,还包括花钱从咨询公司采购的。
- 服务器访问日志:每次请求服务器,都会给服务器的请求日志增加一条记录。可以向服务器管理员申请索要这个记录,其中一堆指标可以作为参考。
- 交互界面访问:比如编程时后端用 MySQL 这样的数据库,既可以用命令行方式访问,也有前端的交互界面工具——例如 PHP 的管理工具 phpMyAdmin,提供了 MySQL 的图形化访问界面。
- 应用程序接口(API):比如接了新浪微博,开发程序时就可以通过微博提供的数据接口 API 获取返回的数据,如收发微博的消息等。
- 技术手段采集:有些数据并非为外部获取而存在,如果懂一些抓取手段,也可以巧妙获得。比如前两年 O2O 创业很火、人人都去做 O2O 的时候,很多团队倾向于去抓大众点评的数据;做股票财经分析的,则很喜欢抓取雅虎财经的数据。
当然可能还有其他来源,方法很多,主要取决于手头有哪些途径、掌握哪些技术。
第二步:数据清洗
数据清洗顾名思义,就是把脏数据洗掉——各种整理、检查、修复,是正式开始分析前的准备工作。只有干净的数据,接下来分析时才能确保结果准确。打个比方:如果数据分析是下厨房做菜,数据清洗就相当于提前准备食材——去皮、去籽、洗干净,该焯水的焯水、该预热的预热,准备工作都完成了,才能真正煎炸烹煮出一道美味佳肴。
常见的清洗对象有六种:
- 缺失值:比如抓取来一组一百个随机路人的年龄,想统计平均年龄时发现其中一人漏统计、数据是空的。再找个路人替补已经来不及,这时要么去掉空值、统计剩下 99 人的平均年龄,要么想办法补齐——填一个比较合理的、最能减少最终结果误差的数字,比如补上其余 99 人的平均年龄再算均值,误差会小一些。除平均值外,根据实际情况也可以补充中位数、众数等来代替缺失值;这类办法简单,但没有充分考虑数据中已有的信息,误差可能较大。另一种办法是根据调查对象其他问题的答案,通过变量之间的相关分析或逻辑结论来推理预估——比如某产品的拥有情况可能与家庭收入有关,就可以根据家庭收入推算拥有该产品的可能性,再填充缺失值。
- 垃圾信息:收上来的数据可能包含无效项目。比如发问卷统计一百个小朋友的年龄,有人调皮填了 500 岁,显然是垃圾信息,需要剔除。有时还可以反向利用这一点,故意在调查中设置陷阱:某人在第三题选了 A,第八题换种说法重复问同样的问题他却选了 B,前后矛盾,说明他没有认真客观地答题、可能只是囫囵吞枣乱填,这份调查表就视作无效,从样本数据中剔除。
- 规范化:比如样本数据里有个字段叫日期,有人填阿拉伯数字 2018.10.10,有人汉字数字混写"二零一八年十月十日",有人提交的是英文 October tenth, two thousand eighteen。这时就要人工或借助工具,把不同的格式统一规范转换成一样的格式,后续才能统一处理。
- 重复记录:很好理解,样本里有多的,就酌情删除或合并归类。
- 特殊值:比如想统计某大学一届毕业生毕业三年的平均月薪,大部分人的收入服从正态分布、大概在一两万上下波动;但假如有一个有能力有背景的小伙子毕业不久就平步青云,工资加奖金月入一百万,他的收入就属于比较极端、特殊的值。直接放进统计会拉高全体毕业生的月薪均值,让结果偏高不准确。对这种特殊值应采取特殊手段取舍,比如直接不纳入统计。
- 合并数据集:比如做电商产品,手头有两份 Excel 表,一份是一百款产品的销量、另一份是它们的单价,需要根据这两份数据计算总销售额。与其在两个表之间来回跳转、狂按计算器拿销量乘以单价再挨个加总,不如熟练运用 Excel,通过函数把两个数据集合并在一张表上——一列销量、一列单价——直接算出总销售额。合并数据集的价值,是让分散在不同数据表里的数据集中到一起,方便统一处理。
实操中可能还有其他特殊数据,要酌情处理。常用的清洗工具有两类:
- Excel:天生为数据而生,有很多现成的函数;如果熟悉 VBA,还可以写脚本和自动化工具,实现一键处理。曾有一位在美国咨询公司工作的分析师,Excel 用得非常熟练:一些其他分析师要花三四个下午才能完成的常用流程,他用 VBA 写了一个函数,每次点一下启动按钮只要二十几秒就全部完成。他很幸运,离开那家咨询公司时,公司还花 20 万美金把他的脚本收购了。
- 编程语言:常用的有 Python、PHP、R 语言。Python 和 PHP 比较轻量级,第三方开源的库和工具非常多,写起来快;R 语言是专门为数据分析而生的语言,语法很简单,数据分析相关的工具和函数非常强大,可以完成非常复杂的数据分析工作。
第三步:数据分析的七种手段
数据清洗完成、原材料准备就绪,接下来就可以运用各种方法进行数据分析。方法手段很多,根据不同场合、不同目的选择最合适的。以下介绍七种常用手段:画像分群、趋势维度分析、漏斗洞察、行为轨迹分析、留存分析、A/B 测试、优化建模。
1. 画像分群
精细化运营中,常常需要对有某个特定行为的用户组进行分析和比对——比如男女在电商平台上的行为表现完全不一样,游戏里付费氪金的土豪玩家和免费玩家也不一样。这就需要剥离开不同群体单独查看,与分层运营的思路基本一致。增长黑客可以将多维度、多指标作为分群条件,有针对性地优化产品、提升用户体验。
例如想优化注册环节,就必须找出某个特定人群在注册环节每一步的表现,以便对特定环节重点优化。维度选择上:选地理位置,筛出北京、上海、深圳、广州等一线城市的主要用户来源;选设备,通过浏览器 Mobile Safari 筛出 iPhone 用户——他们是移动端主力。指标选择上:想看第三步未注册成功的用户行为,就筛选"第二步浏览页面数大于 0"(在第二步产生了浏览行为),同时"第三步页面浏览数等于 0"(第三步没有浏览),即从第二步没能成功转化到第三步。在这个条件设定下,就能准确筛出北上广深 iPhone 浏览器用户中第三步注册未成功的人群,随后深度研究他们的行为来优化第三步。
2. 趋势维度分析
如果说画像分群是相对静态的,趋势分析就是动态的。它能迅速呈现市场、用户或产品功能(feature)的基本表现,甚至可用于对未来表现做预测。日常工作中对这种趋势维度的数据分析接触较多,比如经常看的新增用户趋势图,都属于统计一段周期内的变化。观察趋势有助于抓住优化的关键点、提升决策的有效性,给出一个很明确的方向。
例如一幅趋势图:从 9 月 30 日到 10 月 6 日,注册和完成注册的用户比例明显下滑——观察到这个信号,就可以检查这段时间网站是否出现了 bug,还是推广渠道错误导致,据此排查原因。再如环比上个周期,注册用户量和登录用户量都大幅上升——就应该总结到底哪些事做对了、能否复制成功经验:是活动做得特别成功,还是选到了很精准的流量渠道。这些异常的数据变化都能直观地从趋势分析图上看出来、引起注意。
3. 漏斗洞察
转化漏斗是用户行为的数据化体现,比单纯的数字更直观;对转化率进行优化是增长黑客的核心工作,漏斗分析是最常见的分析手段之一。它按由先到后的顺序还原某一个用户的使用路径,分析每一个转化节点的转化数据——前文谈到的 AARRR 流量漏斗模型,就是一个经典的转化漏斗模型。
例如某注册流程整体转化率只有 33.8%,比较低。进一步展开细分漏斗可以发现,是第一步到第二步的转化率过低——7000 多人进来只转化了 3000 多——导致整体表现很不理想。接下来就要在第一步转化的页面花更多精力,研究阻碍用户转化的因素并加以改进。另外从设备维度分析,移动端转化率只有 17.1%,明显低于桌面端,很可能意味着移动端适配做得不够好,于是可以逐层优化移动端的转化漏斗,目测应该从第一页往第二页的优化做起。
4. 行为轨迹分析
画像、分群或趋势分析针对的是一群人的群像,是结果数据;针对单独用户的行为轨迹分析,看到的则是一个很细节的过程数据。借助一些分析工具,可以很清晰地看到一个用户究竟在网站上做了什么:先点了哪个按钮、再点了哪个标签、接下来进了哪个页面、观看了多久的视频等。通过他们的行为,可以找到用户最感兴趣的点,或阻力最大的点。根据当前国家相关法律法规,能做的用户轨迹分析大部分是匿名的、保证用户隐私的,各种分析工具平台一般用一个随机 ID 作为用户的身份识别。有了行为轨迹,就可以根据用户的使用习惯来设计产品、投放内容。
例如某幅使用网站分析服务 GrowingIO 的用户轨迹图中,可以看到该用户对留存数据特别感兴趣。这是个个例还是用户的共性?需要多去寻找用户轨迹来分析。如果是共性,就证明 GrowingIO 需要强化留存分析的产品功能——因为它最契合用户的兴趣,这就成为指导改进迭代产品的依据。
5. 留存分析
留存分析是增长黑客方法论中贯穿始终的分析方法,值得再次单独强调:留存老用户的成本要远远低于获取新用户。做留存分析最常见的还是用户分群,拆分出某个具体渠道或特定着陆页的用户来分析。典型的用户留存数据图中,下方是某个访问日期内用户群体在此后不同间隔对应的留存数字,上方是过去 14 天所有用户次日留存平均值画成的曲线。
从图上可以看到,新用户在首次访问后的第二天留存率就大幅降低——是否需要考虑一些办法刻意触发用户的留存行为?比如推送、邮件召回等。而一周之后,用户留存率开始上升直至平稳——可以初步判断:如果能设法让用户使用一周以上,那时还没有失去兴趣的用户,更倾向于留下来长期使用。于是要做的事,就是想办法帮用户度过这段危险期,例如设计一个连续七天签到的奖励,鼓励用户使用一周以上。
6. A/B 测试
A/B 测试比较适用于高密度数据的场合,简单说就是数据量要足够大;如果网站每天只有区区三五十个 PV,就提出要做 A/B 测试看怎么优化,其实没什么意义、也不准确。做法是把要测试的对象拆分成 A、B 两组,分别看结果对比,选择最后用哪个。它还有个衍生版本叫多变量测试——不是只测试一组变量的两个版本,而是可以一次测试好几个。后续章节会专门展开,此处先看案例:
图中是两组 A/B 测试的实际执行数据截图,上面三张是一组、下面三张是另一组,每组最右边一张是对照组(即产品原版本的数据),对应行里的 A 和 B 是进行两种不同试验后的结果。第一行里,A 组结果并没有比对照组更好,而 B 组提升明显——就可以想想 B 组究竟做对了什么,把方案的闪光点应用在原先的产品里。而下面一组实验的 A、B 结果均不太理想、没有比原本的产品数据更好——这种情况下可以继续测试;在没得出比较好的结论之前,先按兵不动,不要乱改。
7. 优化建模
这是数据分析中比较高阶、比较有难度的分析手段,放在最后简单介绍。顾名思义,建模就是根据过往数据建立一个模型,模型的价值在于:在特定的适用条件下,它可以用来预测未来——向模型输入什么,它就输出对应的结果。当优化建模与其他数据分析手段结合时,能在商业上产生更多有价值的应用。
例如一家按年付费的 SaaS 企业,需要通过一些数据指标加上一套判断依据(即一个分析模型)来评估:哪些客户来年很可能继续续费,哪些逐渐显出疲态、可能会流失。可以根据他们的行为、公司信息、用户画像、使用轨迹等,做一个付费用户的"温度模型"。图例是一款 SaaS 产品基于分析模型算出的客户温度(客户名称用字母代替,右边是对应的温度指数):所谓温度,就是通过使用情况、反馈情况、活跃率、留存率、拜访时产生的统计数据和采访反馈等,判断哪些是平台优质用户,再通过加权计算得出——越优质的客户温度值越高,几乎无需额外操心,时间到了他们自然很容易续费;而表里越靠后、温度越低的客户,越需要主动建立关联、去关怀和"温暖"他们,把温度值提上来。整个表的生成,靠的就是一套严密的优化建模。每家公司会设置自己的指标体系,也有专门的数据分析师负责构建模型并监测结果。
第四步:验证发现——警惕三类谬误
进行一系列数据分析后会得到一些初步结论,但这些结论是否正确靠谱,需要想办法用科学的方法进行验证,检验当初的数据是否准确无误地反映了客观事实、是否存在思维漏洞或考虑不完善的情况——这对分析者的逻辑思维要求相当高。数据虽然不会说谎,但人在对数据进行分析和验证时,会因为主观原因对数据产生误读、发生各种谬误。有三个流传甚广的"一句话笑话":
- 自 1930 年至今近一个世纪的世界杯历史中,还没有任何一支亚洲球队能在世界杯上战胜中国队;即使是巴西队这样的世界强队,也仅战胜过中国队一次。
- 经过统计,美女配丑男的概率远大于美女配帅哥,所以要追女神的话,先把自己弄成丑男,成功率会大一些。
- 研究表明,过生日的次数越多,人的寿命越长。
会心一笑之余不难发现,它们的共同之处是:对看似客观真实的统计数据进行了误读,导致啼笑皆非的结论。曾两度出任英国首相的本杰明·迪斯雷利有句名言:“世界上有三种谎言:谎言、该死的谎言,还有统计数据。“实际生活中,大量统计数据由于主客观原因被有意或无意地滥用误读,不仅无法清晰描述和传递信息,反而阻碍信息传递、误导接收者。如果拿到正确的数据,却因分析验证方法有问题导出完全相反的结论、最终误了事,那就很糟糕了。以下是三个很有代表性的谬误。
1. 虚假相关
有人做过一张图:1999 年到 2009 年期间,美国掉进游泳池里淹死的人数,与同一周期内美国影星尼古拉斯·凯奇出演电影的数量,两条曲线的趋势惊人相似。由此能否得出"凯奇是恶魔的使者,一拍电影就有人淹死,所以防止泳池溺水的方法就是彻底封杀凯奇"的结论?显然很荒谬——二者本来没什么联系,这只是一个很偶然的巧合。
另一个案例:统计研究发现,冰激凌销量最高的时候,正是公共游泳池溺水事故发生频率最高的时候。如果由此推断"溺水的发生促进了冰激凌的销售”,显然是错误的——导致这一情况的直接原因是:冰激凌的销售和公共泳池的开放都在夏天,是"夏天的到来"这一个因素引发了二者共同发生,而不是这二者之间谁引发了谁。类似的还有"棍棒底下出孝子"“天天打游戏人就会变笨"“每天上网六小时的人是因为得了网瘾要接受电击治疗"等原本并不存在必然因果关系的叙述。不仔细斟酌,很容易受这种虚假相关的蒙蔽。
2. 因果倒置
任何两件事情形成因果关系,需同时满足两个条件:一方必然引起另一方的发生;二者在时间上有先行后续的关系。“拥有自己独立办公大楼的公司更容易成功"就是典型的因果倒置——不是拥有独立办公大楼的公司容易获得成功,而是成功的公司才买得起自己的办公大楼。再如"坐轮椅很危险,因为大部分坐轮椅的人都遭遇过车祸"也是奇谈怪论——究其原因,是出了车祸的人大多数需要坐轮椅。这类逻辑漏洞在于错把原因说成结果、忽略了事情发生的先后顺序。
3. 沉默数据
经典案例:二战的时候,英国为降低战斗机的损失,要给机身增加装甲,但预算有限,于是决定把装甲安装在最容易受到攻击的部位。对受损战斗机的统计分析发现,大多数弹孔分布在机翼上,占 26%,于是他们在机翼上加装装甲,结果并没有收获预想的理想效果。后来有人重新研究发现:真正应该加固的不是机翼,而是驾驶舱——因为那些真正被射中驾驶舱的飞机,几乎都没能飞回来、没能加入统计队列;而驾驶舱中弹却侥幸返航的飞机,只占当初统计中弹部位飞机的 7%,远低于机翼的 26%。这就是所谓的"死人不会说话”。网上有人智慧地总结:统计数据就像比基尼——暴露出的那部分固然重要,但没暴露出的那部分才更加致命。
分析数据时,人们容易把注意力集中在可见的数字或事物本身(因为它们相对容易获取),而忽略了那些"不会发出声音"的部分,尽管它们很可能同样对结果造成重要影响。再如:实验显示"连续抛硬币获得正面的可能性是 66.6%"——得出这样与常识相违的结论,是因为省略了"总共只抛了三次硬币"这一限定条件;某地区从五年前起,每年为约 500 名新生儿接种新研发的小儿麻痹疫苗,此后该地区未见一例小儿麻痹发病纪录,看上去新疫苗很有成效、值得推广——却忽略了前提:小儿麻痹症的发病率本身就不到十万分之一。有时数据提供者为了误导读者,会刻意隐藏一些信息,需要仔细甄别、防止上当。
归根到底,数据本身不会说谎,而是人们在收集、整理、归纳、解读数据的过程中产生了各种问题。只有善用正确的思维方式去使用数据,才能让数据为决策服务,而不至于跌入陷阱。
第五步:数据可视化与延伸阅读
为什么进行数据可视化?因为人都是爱读图的动物,人们对图像的接受反应速度是文字的 60 万倍——这主要与人脑的构造有关:右脑图像脑比左脑逻辑脑的信息流入速度更快。数据可视化就是利用人脑这一机制,把枯燥晦涩的数字转换成更加清晰易读的图像,帮助理解、分析,以及向他人汇报传达。为了有效传达思想概念,美学形式与功能需要齐头并进,通过直观的传达,实现对相当稀疏而复杂的数据集的深入洞察。
可视化不能为了看上去绚丽多彩而做得很复杂。现在有些数据分析师本末倒置,不能很好地把握设计与功能之间的平衡,创造出华而不实的可视化形式,无法达到传达信息的主要目的,反而让人无法聚焦、关注点偏移。另外,科技在进步、社会在发展,数据可视化也应适应时代的需求:除了在数据和数据展示上下足功夫,还要强调应用性和操作的人性化,不要有太高的学习门槛,让技术人员之外更多的业务人员也能了解数据平台和数据可视化。
常见的形式有:
- Excel 统计图:日常工作中最常接触,操作成本较低;但问题是相对单调,输出的统计图也不够美观。想制作精美的汇报材料,用 Excel 要花点功夫,所以很多人用 Excel 做数据分析,再用其他第三方工具绘图。
- 信息图:更进一步是绘制更有设计感的信息图,目的在于用图像的形式表现需要传达的数据信息和知识。图形可能由信息所代表的事物或相关事物的抽象图标、图像组成,也可能是点线面等基本图形,或手动绘制几个 icon。信息图中的元素未必与所表达的信息在语义上一致,但必须达到向受众清晰传达正确信息的标准。把历史或日常生活中常见现象做统计分析再输出图片,配上鲜艳的色彩,能让人更好地摄入信息——人对颜色很敏感,彩色鲜亮的信息容易让人印象深刻。
- 思维导图:将信息、数据图像化的常见手段。日本有位叫七田真的研究者专门研究过思维导图,还写过一些著作,感兴趣者可以查阅。
- 实时报告图:比如天猫双十一全球狂欢节时阿里巴巴内部的数据统计大屏——每年双十一全体员工镇守阿里总部,对着大屏幕实时显示今天多少人参与购物、实时成交额是多少,数字每年还在攀升;数据统计维度更多、数据量更大、图也做得更精美。又如腾讯 QQ 的同时在线人数,官网提供了入口可以点进去看:全中国星罗棋布、多点开花,风靡大江南北。
- 交互数据图:在网页里用前端手段实现丰富的操作——拖拽拉伸、隐藏浮层、判断鼠标悬停的位置等,通过各种鼠标操作和交互来窥探想查看的数据细节。百度地图其实就是一个交互数据图:缩放某个城市、聚焦某条街道、点击某个建筑就能看到地址、电话等数据,还可以切换图层查看不同的地图模式(如旅游地图),点选两个地方测试距离。
- 视频:2011 年旧金山一个共享单车开放数据公开赛的获奖作品里就有这样的例子:一位获奖者把骑共享单车的各种数据(时间、距离、速度等)拍成一个生活化的短片,展示他一天当中怎么骑共享单车,用视频字幕与画面的配合让数据更生动,也得了创意奖。
说到底,数据可视化的手段丰富多样,但归根到底形式要服务于目的,也得考虑性价比:具体呈现时要综合考虑信息传达的效率、美观度和制作成本,选择最合适的方式。
最后推荐几本数据分析的书,可以根据自己的能力阶段和兴趣选择——数据分析本身是一门精深的学问,不可能靠几个小时速成,修行还是要靠个人:
- 《精益数据分析》:笔者很喜欢的一本书,讲一个产品该怎么进行数据分析、应该怎么设立指标、应该看哪些数据;不同类型的产品(比如移动游戏、SaaS 产品)可以监控哪些指标,有哪些比较好的行业参照。
- 《统计数字会撒谎》:针对上面讲的那些谬误——怎么识别、怎么判断,有哪些常见经典的"数字撒谎"谬误。这本书用很多丰富的案例,帮读者用科学的逻辑武装头脑,避免在看数据、分析数据的过程中产生失误。
- 《深入浅出数据分析》:Head First(深入浅出)系列。这本书挺厚,但每页信息量不大、图文并茂以图片为主,很多概念其实很简单,可以翻得很快;寓教于乐,算是数据分析很好的入门书。
- 《数据化管理:洞悉零售及电子商务运营》:从副标题可以看出,从事零售或电子商务相关工作的读者能从中获得很垂直的指导。
- 《利用 Python 进行数据分析》:适合有些编程功底、熟练使用 Python、想通过它进行数据分析的读者,这本书在一些函数及相关库的推荐上有很多有意思的启发,可以看一看。
5 - 6.5了解什么是A/B测试
为什么需要 A/B 测试
在互联网产品开发中,经常面临多种方案的选择。有些选择轻而易举:面向大众的产品,主色调定成蓝色,最权威、最稳重而且广为接受;强调安全的服务,绿色是不二之选。但还有些时候,备选方案是模棱两可的,甚至看起来完全无关紧要:某个按钮用橙色还是红色?位置是偏左还是偏右?
面对这种情况,传统解决方式要么根据设计师的审美来定,要么一群人共同表决,要么由某位领导拍板决定。无论哪种方式都免不了受个人主观因素的制约,未必代表广大真实用户在实际使用场景中的认知——正所谓"不识庐山真面目,只缘身在此山中"。
还有一种情况:一个改动背后利益方的诉求不同、想法很多很分散。比如一个电商网站的购买转化率很低,团队内部就会出现各种不同的声音:产品经理认为是市场推广人员广告投放不精准,而不是购物车流程复杂冗长导致的交互问题;设计师抱怨程序员擅自修改了酷炫的视觉特效;程序员却觉得优先确保兼容性才是提升转化率的方法;老板要求页面文案充分体现技术的首创性;销售团队则认为顾客只关心给自己带去什么利益,根本不管技术是怎么个首创法。这时到底谁更对——产品负责人的感觉、老板的意见,还是刚好路过的扫地阿姨看了一眼屏幕后发表的看法?怎样进行科学的判断?答案是:直接做一次 A/B 测试。
什么是 A/B 测试
A/B 测试也叫做随机实验或对照实验,是一种比较流行的产品优化方法,一般在 Web 网页版产品里用得较多,可以用来提升转化率、注册率等指标。简单说,就是为同一个目标制定两个方案,将产品的用户流量分割成 A、B 两组(一组实验组、一组对照组),两组用户特点类似且同时跑实验;实验运行一段时间后,分别统计两组用户的表现,再将数据结果进行对比,就可以科学地帮助决策。
比如让 50% 的用户看到 A 页面、50% 的用户看到 B 页面,结果 A 版本带来 50 个注册,B 版本带来 75 个注册,相当于 B 版本比 A 高出 50%。在试验流量足够大的情况下,就可以判定 B 版本最终胜出,然后把 B 版本推送给所有用户。A/B 测试是一种先验的实验体系,属于预测型的结论,与一些后验型的归纳性结论差别比较大。
这个方法曾在很多领域产生过深远影响,包括医药、农业、制造业和广告等。其中西医算是比较早引入 A/B 测试来验证新药疗效的:
新药验证一般是这样一个流程:有一百名患者参与测试,医生悄悄分成 A、B 两组——注意患者自己并不知道被分了组,且两组患者的健康情况比较接近一致。A 组患者将得到试验的新药,B 组患者得到长得和新药一模一样的安慰剂,也就是没什么效果的药。如果最终 A 组患者比 B 组疗效更好,就能证明这个新药的疗效是有用的。
可见,A/B 测试的目的在于:通过科学的实验设计(采样样本要有代表性)、流量分割与小流量测试等方法,获得具有代表性的实验结论,并且确信这个结论推广到全部流量时是可信的——这又涉及到数据化驱动决策与确定性的优化提升等概念。
自然界中也存在类似 A/B 测试的事件。达尔文在《物种起源》的编定过程中,发现了一类体型很小、羽毛颜色很暗淡的雀鸟:其中一支大约有十三个种,分布在加拉帕戈斯群岛;另一种则生活在科科斯群岛。这些鸟几乎有同样的体型(差不多都在十到二十厘米),但生活环境的细微不同,让它们进化出了尺寸和形状差别很大的嘴型,以此适应不同的食物。这一发现对达尔文推导出大自然物竞天择的演化理论起到了贡献。这种通过环境影响个体形态、从而筛选出最适合存活下来的物种的例子,其实就包含了 A/B 测试的基本思想:提供多个方案并行测试,不同方案之间只存在一个变量,并以某种标准来判定结果、筛选出最优的方案。
其中"只存在一个变量"这个单变量原则需要重点关注:
- 某种方案的优劣不光与方案本身有关,也可能与方案所适配的环境密不可分。比如同样一段文案涂成黑色,在浅色底上清楚醒目,在深色底上看起来就很费眼力;涂成白色,在深浅不同的底色上视觉效果恰恰相反。不能简单得出黑色和白色哪种绝对好,只能说在深色或浅色底的确定条件下,使用白色或黑色的配色方案,才能取得最佳视觉效果、最大程度上吸引眼球。
- 被比较的两个变量本身也不能是复杂变量,而应该是单一变量。比如拿红烧茄子跟干拌土豆拼个高下,哪种美味只能靠评判者主观的味蕾偏好。解决办法是:要么都改成红烧,要么都换成土豆,确保基于单一的烹制方法或单一的食材,最终做出的评价才更客观。
硅谷基石与成功案例
硅谷的明星科技公司都将 A/B 测试看作稳步增长的基石。Google 从 2004 年到 2007 年历时三年,逐步构建并打磨出一套很强大的内部 A/B 测试系统,每个月会跑几百次实验(有一张 2007 年到 2010 年期间 Google 进行 A/B 测试数量的统计图)。Facebook 也是高频测试的笃行者:据一位名叫卡斯卡特的项目经理介绍,每当工程师对某个算法进行一次微调,Facebook 都会单独针对这次调整筛选出一组用户来进行测试,且每次的测试对象不相同;他还透露,最多的时候甚至有差不多一千种不同版本的 Facebook 面向不同的用户群运行。Facebook 从所有测试对象中提取信息,了解哪些优化算法真正改善了情况、哪些没有产生效果。此外,Facebook 移动版在每次上线时,都会提前把未来六个月想要测试的实验集成到代码里。
再看几个现实中的成功应用:
- 微软 Bing——页面配色:Bing 曾通过 A/B 测试反复调整页面的配色方案。两个测试版本肉眼只能看出细微的差别:右边的蓝色稍微深一点,黑色稍微淡一点(中间三个色块的对比比较明显)。不要小看这简单的配色——对 Bing 这样流量很大的搜索引擎,最右边获胜的方案最终每年带来一千万美金的营收增长。
- 亚马逊——信用卡广告位:亚马逊最早试着销售自己推出的信用卡服务时,曾把信用卡广告放在商品页面的侧边栏广告位,结果无人问津,还浪费了宝贵的广告展示空间。后来运营人员提出把推销信用卡的广告放到购物车结算时,A/B 测试对比下来佐证了这个想法:改动大幅提升了信用卡的申请率,给亚马逊带来了上亿美元的营收增长。
- Netflix——海报测试:Netflix 是笃行 A/B 测试、靠海量测试成就伟大产品的公司。早在 2013 年,它就尝试通过 A/B 测试验证不同版本的海报风格对观看点击的影响。
- 电影《Short Game》(中文名译作《人小志气高》,讲述几个小朋友如何在高尔夫运动中击败其他竞争者的励志故事):在默认海报(default artwork)之外,又测试了另两种不同设计的海报。结果发现,有一张小朋友打球剪影的海报,点击转化率比原海报提升了 6%;效果更好的版本是小朋友的背影、同时家长陪伴在后——既能体现打高尔夫球的电影主题,又体现出父子关系——这样的海报更吸引注意力,转化率比原海报提升了 14%。
- 《驯龙高手:飞跃边界》:Netflix 测试了六个版本的海报,结果很有意思:画绿色箭头的方案二和方案三最终胜出,而这两个方案放的都是反派人物(坏人或邪龙),反而比放主人公的海报更容易吸引人。仔细想想也有道理:看动漫作品时,高大全的正派主角固然讨喜,但混进一些亦正亦邪、有点坏坏的角色,观众反而会很喜欢——就像《七龙珠》里的贝吉塔、《名侦探柯南》里的怪盗基德,有些反派角色比主角更吸引人。
- 美剧《我本坚强》:也尝试放不同版本的海报,实验证明最后一组效果最好。其他几组放一个美女、放一个标题或放一些物件,第五组稍微诙谐,但都太平庸了;获胜的一组不但放了两个人物,还用很夸张的造型、很有戏剧冲突的面部表情演绎,体现了这部剧荒诞诙谐的特征,更容易引发网友点击。
- 《超感猎杀》:通过 A/B 测试甚至发现,不同国家点击效果最好的海报也不一样。第一张在德国点击率最高——很符合德国人四平八稳、严谨古板的感觉:前面一个标题、后面的一个"8"体现了四张人脸;第二张人物剪影在巴西效果更好;第三张在美国点击转化率表现最好——可能美国人对华裔的功夫元素天生感兴趣,背景上呈现了华裔女性和很有亚洲特点的建筑,容易吸引美国用户注意;第四张在英国点击转化率最好——很像英国人最喜欢的传统 007 式特工角色:一个硬派男士拿着一把枪,在英国深入人心。剩下两张测试下来效果反馈就很一般。可见 A/B 测试不但能测同一个国家地区不同海报的效果,还能测出世界上不同地方、不同人群的口味。
一个失败案例:Sam 的"点赞给钱"
前两年有个很火的小众社交应用 Sam,有点像轻量级的百度贴吧,有很多小而美的频道供匿名社交,一度成为资本追捧的宠儿,曾拿到知名投资机构两千万美金的投资。大约 2015 年,Sam 上线了一个"点赞给钱"的功能:每次收到他人点赞(在 Sam 里叫"同感"),用户就能从对方那边收到一毛钱;换句话说,给别人点赞就要付一毛钱。
功能上线后,Sam 的点赞数量急剧下降,后来只在一些很少的福利向频道(比如轻性感频道)里保留,再后来连这些频道也都去掉了,功能被彻底关闭。“点赞给钱"最终成了 Sam 由盛转衰的滑铁卢:活跃用户数量大幅下降,日活大概在二十万上下就再也上不去了,如今这款产品在市场上也没什么声音了。
归根到底:点赞对用户来说是一个比较随性的互动方式,跟打赏有着本质区别——随手点赞可能只是觉得有点意思,并不代表认同感强烈到愿意花钱;原本 Sam 上用户的互动没有太多维护关系的负担,一旦点赞给钱,这种社交关系就不再那么单纯。何况 Sam 的用户很单纯而且低龄化,对这种赤裸裸、充满铜臭的商业变现很抵触,Sam 团队当时遭到大量用户批评。如果 Sam 先通过 A/B 测试,找两个差不多量级和活跃度的频道小规模测试一番,等验证成功后再上全站,可能就不会出现这种问题了。说到底还是盲目决策拍脑袋、不听信数据,把一手好牌打烂了。
A/B 测试的价值与置信区间
通过这几个例子,可以说 A/B 测试具有下面这些价值:
- 帮助建立数据驱动、持续不断优化的闭环过程。
- 消除用户体验设计中不同意见的纷争,根据实际效果确定最佳方案。
- 通过对比实验找到问题的真正原因,提高产品设计和运营的水平。
- 降低新产品或新特性发布的风险,为产品创新提供保障。
进行 A/B 测试时,有时会看到一个词语叫置信区间。比如在 Google Play 应用商店发布一款安卓应用时,Google 允许针对产品文案和营收做不同版本的 A/B 测试,但这个测试看起来不太一样:通常会说 B 版本相比 A 版本提高了多少个百分点,而谷歌后台的这项测试并不能直接从图中得到版本 C 的转化率比原版本提高了多少,而是给出一段区间,同时提供一个有点陌生的指标,叫做"90% 置信区间”。维基百科上有一段不带任何字母公式的纯文字定义:
在统计学中,一个概率样本的置信区间,是对这个样本的某个总体参数的区间估计。置信区间展现的是:这个总体参数的真实值,有一定概率落在与该测量结果有关的某对应区间。举例来说,如果在一次大选中,某人的支持率为 55%,而置信水平 0.95 上的置信区间是从 50% 到 60%,那么他的真实支持率有 95% 的几率落在 50% 和 60% 之间。
初次接触容易越听越糊涂,梳理一下置信区间这个概念的由来,可能就相对容易理解:
二十世纪二十年代,剑桥有位统计学家叫 Ronald Fisher,正悠闲地和朋友一起喝下午茶。英国人喝的是奶茶(牛奶和茶的混合物),但先倒奶还是先倒茶,基本没什么讲究。喝茶过程中,有一位女士突然说自己可以分辨一杯奶茶究竟是先倒的奶还是先倒的茶。Fisher 和其他人都不相信,就让她分辨自己杯子里的奶茶,结果那位女士居然说对了。但 Fisher 还是不相信——她随口一说,都有 50% 的正确率。于是他们做了一个实验:冲了八杯配方完全一致的奶茶,其中四杯先倒奶、四杯先倒茶,请女士分辨,结果她依然完全正确。这种情况下,她仍有可能碰巧蒙对,但八杯茶比一杯茶有说服力得多。八杯茶的说服力有多少?Fisher 算了一下:八杯全蒙对的概率是 0.5 的 8 次方,即 0.00390625,差不多是 0.39%;也就是说,有 100% 减去 0.39%、即差不多 96.1% 的概率她真的能分辨,而不是瞎蒙。这个 96.1% 的概率就是传说中的置信度。若是 90% 的置信度,就表示有九成把握相信她真的能分辨一杯奶茶,而她碰巧蒙对的概率只有 10%。
所以,前述案例中第三行"从 -6.2% 到 +11%“处在 90% 置信区间,就可以说:采用这个方案有 90% 的可行性,数据会在下降 6.2% 到提升 11% 之间不等,平均值落在提升 2.4%。
再看一个留存率实验的例子。假设做了一个产品,想测试以下三种情况对留存率的影响:某功能 X 有可能降低留存率——第一种情况,功能 X 默认打开开关,允许所有用户都看到并使用;第二种情况,还是功能 X,只是默认关闭开关,用户感兴趣可以到设置里手动打开;第三种情况,功能 X 默认关闭,且设置里不提供开关入口,相当于永久隐藏。对次日留存率的影响,用 90% 置信区间图可以读出三个结论:
- 关闭并隐藏开关,至少有 90% 的概率,最后的留存率在 69.97% 以上,而且有比较大的概率落在区间均值 77.17% 上,甚至有一定的小概率最高提升到 84.19%。
- 默认开启功能 X 对留存的影响很大:拿它 90% 置信区间里最好的结果 57.86%,与"关闭并隐藏开关"最差的结果 69.97% 比较,留存率至少降低 12%,最多甚至可以降到 38%。
- 默认关闭功能 X 时,X 的设置开关是否可见,对留存的影响并没有很大:虽然均值的差距在 10% 左右,但两组留存区间有将近一半重叠。所以如果只是说"关闭并隐藏 X 功能,会比仅关闭 X 功能的留存率高 10%",是不太准确的。
置信区间要足够窄,才能说明得出了一个比较好的结论。如果得出一个置信区间说"95% 的可能性,最后的结果在降低 100% 到提升 100% 之间”,那就等于什么都没说。
样本量、实验周期与业务权衡
积攒多少样本才能得出结论,这件事和置信区间也是相关的,主要取决于几个方面:一个是试验的流量本身,一个是转化率本身。比如通过 A/B 测试看到的某个转化率,变化值很低、只有百分之零点零几,无法判断是 A/B 测试带来的影响,还是数据本身正常波动的范围,这时可能需要非常多的样本才能做出有效的测试、看出比较明显的变化;但如果目标是转化率提升 50%,那么可能一千个样本做完就达到了目标——这么明显的提升足以说明问题,一千个样本就够了。
A/B 测试该选多大的样本?这里提供一个现成的线上工具(网址见配图)。用法:先设置一个 Baseline Conversion Rate(基准转化率),即要测试的某个指标原本的基准转化率或对照组的值,比如原本的留存率是 20%;再写一个最小可侦测的结果(百分数),意思是实验后如果基准转化率上下波动达到或超过这个百分数,实验才被视作有效、确实是因为改动对产品产生了实际影响。比如填 5%,那么上线实验后,留存率从 20% 提升到 25% 以上或降到 15% 以下,实验就算达到了能得出结论的阶段。这个工具会用统计概率的算法结合置信区间,给出一个比较合适的实验样本量,比如 1030——也就是说至少要针对 1030 人进行 A/B 测试,得出的结果才比较可靠;样本少于这个数字,试验的置信度就比较低。
A/B 测试要持续多少天?一般要持续 7 天或 14 天。因为在其他条件都不变的情况下,试验时间需要覆盖用户周中(周一到周五)和周末(周六、周日)的行为——两者可能不一样,所以 7 天是比较理想的时间;想更准确最好跑 14 天;如果流量比较少,可能要跑更长时间。怎么得出结论?等置信区间收窄到一定程度,就可以决定上线或下线了。
Airbnb 的教训:Airbnb 的工程师曾尝试改进价格过滤器功能,允许用户筛选房源价格时,把过滤器的上限从原本的 300 美金提升到 1000 美金。实验跑了 7 天,对产品转化率的影响幅度一开始还比较明显,但 Airbnb 的测试工程师比较有经验,没有就此下定结论,而是继续把实验跑了 30 天以上。最后发现大概从两周之后开始,变化幅度就没那么明显了;到一个月整个实验跑完,新设计的价格过滤器跟老版本相比,对转化率的影响基本上没有任何区别。于是 Airbnb 最后果断放弃了这个多余的方案。
另外,做 A/B 测试不要只盲目看测试的数据结论,有时还要跟具体的业务结合,最后敲定选择什么方案。
百姓网的权衡:百姓网是上海的一家公司,业务很像五八同城,或有点像大众点评里的二手频道,允许用户在上面买卖二手车、租赁房屋等。有一次,百姓网广告部的同事提出需求:希望把付费购买增值服务的广告主信息,在列表页面置顶。产品团队就此展开两派很激烈的讨论:一派认为,增值服务的信息在为期一个月的展示期内会始终存在,而手机屏幕空间就这么大,用户每次进来看到的置顶都是同一批信息,就会觉得没有新鲜感——为什么这里的信息总是不更新?另一方认为,用户一定会往下滚屏,滚下去就能看到更多信息,操作很简单。双方各自都很有道理,一时间谁也说服不了谁。如果大动干戈直接改交互——比如按免费与付费的区别改成标签分栏,或提供很强大但很复杂的高级筛选工具——开发起来很复杂,而且广告销售部等不起,希望尽快上线,因为这是对广告主的捆绑销售,丝毫不能怠慢。经过一番权衡,团队决定跑一次 A/B 测试:通过服务器控制下发信息,将用户按 UDID 分成两组,一组下发带固定付费信息的列表(右边方案),另一组下发付费信息不固定的列表(左边方案)。考核两个指标:一个是从列表页到付费信息详情页的转化率,另一个是下拉获取下一屏列表的事件数。测试跑了几天,结果让产品同事大跌眼镜:固定展示付费信息的改动,虽然对用户体验有些影响、不如左边方案,但对核心数据的影响差值只在千分位之后(百分之零点几),对整个产品而言完全可接受;而从商业角度考量,右边方案虽然 A/B 测试数据稍微差了一点,却能为广告主带来更多增值服务的收入,从而提高营收。最终百姓网拍板敲定了右边这个方案。
由此可见,进行 A/B 测试时,除了用高效的手段进行验证,也要结合现有的业务,探究哪种方案最终能取得一个平衡。
数据分析本身是一门精深的学问,需要在实践中不断摸索、总结。既要充分相信数据,用事实和逻辑打败主观臆断;同时也要保持一颗清醒的头脑,不被数据蒙蔽,更不盲目偏信数据而忘记具体问题具体分析。最后用一句话概括:敬畏数据,但时刻保持怀疑精神。