# 了解数据和数据分析的价值

> 从大数据时代谈起，厘清数、数量与数据的区别与大数据的 5V 特征，并结合 Facebook 改版、社交 App 访谈、春秋航空、摩拜红包车四个案例讲解数据分析的四大价值。

---

LLMS 索引： [llms.txt](/llms.txt)

---

## 数据为王：从测量历史到大数据时代

增长黑客在实践中最重要的原则之一就是**数据为王**——不断去测量和实验，通过数据结论指导行动。整个人类的发展历史，就是人类不断尝试记录、测量自身和外在世界的过程：从古时候发明算盘、阿拉伯数字，到近代发明二进制计算器，都是这一现象的体现。但人类对自己和世界的认知目前仍很粗浅——描述一个人只能说性别、年龄、身高体重，提到环境只能说天气、温度如何。尽管如此，人类对数据测量的需求一直没有减弱。

大约从 2014 年前后开始，网上谈论大数据的人越来越多，人类仿佛一下子进入大数据时代：行业峰会、互联网转型战略的制定、政府政策风向的扶持引导，都开始重视数据的价值，数据好像一下子变成了一座金矿。关于每天产生的数据量，这里给出几个数字：

- 谷歌的 Eric Schmidt 曾推算，互联网上每天产生的数据量约为 **2.5 EB**；
- 思科估算，2015 到 2020 年之间数据的年复合增长率约为 66%；
- IDC 预测，到 2020 年数据量将达到 **40 ZB**。

换算公式：1 ZB = 1024 EB，1 EB = 1024 PB，1 PB = 1024 TB，1 TB = 1024 GB，依此类推；传统数据库支持的体量一般在 10-100 TB 之间。更直观地理解 40 ZB：相当于世界人口全年每天观看 14.5 小时高清视频流所产生的数据量；如果把中国每天产生的数据量装进常规容量的硬盘平铺在地面，中国 960 万平方公里的广袤面积都不够放。

数据量的快速增长已远远超过单个计算机所能存储和处理的能力，数据处理变得越来越重要，也驱动数据中心网络不断向大带宽、低延时方向演进。

## 海量数据从哪里来

- **人与人之间的连接**：以 Facebook 为例，从注册账号开始，添加了哪些好友、产生了哪些互动——小到一个评论点赞，大到发起一场线上演唱会直播，每一次有意义的鼠标点击或网页跳转，都会成为 Facebook 数据服务器内的一条新增记录，直到指导 Facebook 改进自己的产品。
- **设备与设备之间的连接**：作者上大学时"云"的概念刚被提出，业内很推崇云端战略。作者那时做了一个个人博客"同步控"，专门研究哪些软件支持云同步——要么用一个账号跨平台，要么把数据导到 Dropbox、iCloud 等第三方云存储平台，从而无论在哪里都能随时存取自己的数据。作者当时的设想是：未来数据应该在网上自由流动，硬件本身变得不值钱，像现在的共享单车、共享雨伞、充电宝一样随处廉价取用，通过指纹或虹膜登录就能立即取回数据开始使用——满大街都可以看作是有你的手机和 Pad。现在整个互联网的演进方向看来的确有这个趋势：上台面一点的移动产品都必须同时推出跨平台版本，不支持云同步或账号互通简直贻笑大方；再如区块链这个很火的概念，解决的也是同一份数据如何在网络上同时分发给多个节点、多个设备并保持一致性，本质就是设备之间如何产生数据连接。
- **工具与服务之间的连接**：一连串工具之间互导互通的自动化流程（营销自动化一章有专门介绍）——在服务管道之间像血液一样流通的，就是各种各样的用户信息和行为数据，通过不同工具服务重新打散、整理、整合、加工，最后产生新的商业价值。

这两年不仅大数据企业增多，围绕大数据的培训、数据交易、数据竞赛及相关媒体也大量涌现，不少学校开设了大数据专业专门培养人才，相关立法逐渐完善，政府也开始重视数据建设。但必须提醒：不要张口闭口对着一行 Excel 统计报表就说"这是我们产品用户行为的大数据"——日常生活中大部分谈论大数据的人，根本没搞清楚什么是大数据，大数据被完全过度神话了。杜克大学教授 Dan Ariely 打过一个很妙的比方：

> 大数据就像青少年的性：每个人都在谈论它，但没有人真正知道怎么做；每个人都觉得别人都在做，于是也声称自己在做。

到底多大的数据量才能谈大数据？这要看数据的信息量。几种常见定义：

- 百度百科的定义：大数据（或称巨量资料）指所涉及的资料规模巨大到无法透过目前主流软件工具，在合理时间内获取、管理、处理，并整理成为帮助企业经营决策的资讯。
- 国际知名统计机构 Gartner 的定义：大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
- 从应用角度看，当数据量大到传统技术难以处理时，就可以称作大数据——例如传统数据库已不能高效处理 1 PB 的数据，仅向磁盘写入 1 PB 就要耗费两百多天。此外还要看数据的复杂性以及产生数据的速度。也有说法认为，大数据不在于数据量有多大，而在于通过对相对全量的繁杂数据进行分析、找出相关规律，从而实现对未来的预测或改善原先的方案。

对什么是大数据，说法本就众说纷纭，没有谁给出明确界定，很多人只是人云亦云。我个人比较接受的界定方式，是大数据应具备 **5V 特征**：

1. **Volume（数据量大）**：正常计算机处理 4 GB 数据需要 4 分钟，处理 1 TB 需要 3 小时，达到 1 PB 则需要约 100 天——只有达到 PB 以上的数据才可能被称为大数据。
2. **Velocity（高速）**：接上例，处理 1 PB 数据如果不到一秒就能实现，就是高速。要高速是因为数据有时效性，超过时间就失去原有价值了。
3. **Variety（多样性）**：最简单的数据分类是结构化与非结构化，随着互联网和物联网的发展，逐渐扩展到网页、社交媒体、感知数据，涵盖音频、图片、视频、模拟信号等，真正诠释了数据的广度和多样性。
4. **Value（价值）**：获取有价值的数据。以股市为例，真正有价值的数据只会在很小的范围内传播，极少流落到整个互联网上——如果只看股民评论来预测股市，就要非常小心。因此要设法从各种维度挖掘真实、有价值的信息。
5. **Veracity（真实性）**：大数据中很多内容与真实世界关联，大数据就是从庞大的网络数据中提取出能够解释和预测现实世界的过程。

5V 在网上版本很多，图中另一个版本还提出了不同的 V 特征，甚至还有 6V、7V 等说法，没有明确界定。但通过这些特征可以大概有个感觉：不是任何数据、任何数字报表都能称为大数据。以后再看到有人动不动拿"大数据"来忽悠，就要警觉了——同事邮件里发来的一组数据不叫大数据，那不过是一个统计数字罢了。

## 数据与数据分析的本质

究竟什么是数据？区分三个概念：**"100"是数**——单纯的阿拉伯数字，脱离具体语境，是抽象概念，不知道有什么现实表达和应用；**"100 个"是数量**——数词后加量词，含义更进一步，但仍缺乏上下文语境；**"今天新增用户 100 个"才是数据**——它反映了对某件事状态的量化和评估，可以被衡量、被比较。

简单来说，**数据是一种量化事物的手段**，就像身高、体重、三围一样，是代表事物现实存在客观情况的数字指标。数据最大的特征是**客观性**：无论是否触碰，它就在那里；人们可以衡量它，也可以通过外在努力去改进、优化它，但不能凭意念肆意改变一个客观存在的数据。

未来随着数据量增多，数据分析将成为一种常态。它既是一门**科学**，与商业智能、数据挖掘、人机分析处理、机器学习等行业概念密不可分；也是一门**艺术**，需要在技术、想象力、经验和意愿的综合因素中寻求平衡与融合。它的最终目的是解决业务问题，帮助人从数据中获得智慧，在寻根溯源、节约资源、提高效率等方面发挥巨大价值，未来会像日常寻常技术一样深入各行各业。

## 数据分析的四大价值

数据分析在增长黑客的产品开发运营中发挥哪些作用？根据作者的经验总结为四点，以下分别结合案例展开。

### 一、不靠感觉，有据可依

Facebook 内部一直贯彻数据为王的理念，流传着很多经典案例。曾经有一位产品 VP 级的人物，在解读产品日常数据时发现一个趋势：很多用户在图片功能上花了大量时间——发图片、看别人的照片、发表评论，图片成为高频使用的功能。而他对现有版本（左图）不够满意：页面上密密麻麻都是各种小字，发图和消费图片的功能不清晰，用户体验不好。于是他专门组建了一个 30 人的临时项目小组，花了九个月时间研究如何对首页进行大改版，目标是做出更适合发图和浏览图片的新版本。迭代打磨将近一年后，团队发布了右图的新版本：图片够大够清晰，刷起来很爽，侧边栏隐藏了不重要的文字信息、全部用图标表示，整个页面现代大气。

对这个全新版本，Facebook 内部一开始很支持，很多员工表示喜欢，扎克伯格也非常赞同。但走正常发布流程要遵循**灰度发布**规则，于是先对全网 0.5% 的用户开放。上线后这位产品 VP 惊讶地发现，整体数据不但没有变好看，反而出现异常抖动；团队以为是用户不熟悉新版本，继续发布到 1%、2%，用户在线时长出现小幅下降；他不信邪，继续发布到 3%、5%、7%，该版本对在线时长的下降产生了显著影响。要知道在 Facebook，用户使用时长是非常重要的指标，它直接与广告曝光时长挂钩——使用时间越短，广告营收越少，这是无法被容忍的。发到 10%、12% 时，数据彻底断崖式下跌，在线时长减少了三分之一，扎克伯格终于坐不住，勒令退回原版本。所以 Facebook 至今仍沿用类似左图的版本，只是新版本中的一些闪光点被吸收沿用，整个大改版计划被彻底废弃。这就是 Facebook 通过数据、而不是靠感觉来决定产品是否上线的决策流程。

反例是当时一家"没有灵魂的公司"人人网，很会东施效颦。Facebook 还在做灰度发布时，人人网别的不行，执行力和山寨速度很快，迅速抄出了一版几乎一样的界面：图片很大、菜单缩到最左边、文字隐藏只用图标。Facebook 发现数据不好看后很快回滚，人人网却最终停留在这个版本上，数据不断下滑，加上后来不断作死，才导致了今天的局面。这就是数据驱动与不靠数据、光靠感觉跟在别人后面亦步亦趋的抄袭效仿，导致的两种不同结果。

### 二、量化标准，驱动产品持续改进

讲一个作者以前做产品的案例。大概 2011-2012 年，作者在上海跟别人一起创业，做了很多产品，其中有一款模仿美国产品 Tinder 的社交应用（类似今天的探探）：屏幕上出现附近异性的头像，右边按钮代表喜欢、左边代表不喜欢，凭第一印象决定；如果双方互相点击喜欢，就配对成功。这类社交平台上女性用户很重要，团队非常注重女性用户体验。有段时间增加私信功能后，发现女性用户的使用度、活跃度开始下降，一些人气较高的优质女性慢慢渐行渐远。团队大概猜到了原因：平台上很多不会玩的男性用户（内部管他们叫"男屌丝"）打招呼不友善、不礼貌，上来就说"美女，约吗"，吓走了很多优质女性用户。

为此团队做了调研，询问一些女用户：像大部分邮箱系统一样做一个"一键标为已读"，点一下就把所有未读私信的红气泡去掉，好不好？女生们都说好。接到正面反馈后团队就开发上线了，结果数据一看与反馈大相径庭——根本没人用。一开始以为是统计埋点出了问题，反复排查没有任何问题。后来团队又做了一次"小黑屋"用户访谈，邀请 6 位女性（其中 3 个是闺蜜）到办公室面对面访谈，了解她们为什么不用这个功能。这一访谈发现了真实场景：周末闺蜜们相约吃 Brunch 或喝下午茶时闲聊，第一个女生会说"我最近在用叉叉叉（这款产品），很有意思，可以配对附近的人，你们一起来玩"，掏出手机——屏幕上有五六个人发来仰慕之情的私信；第二个女生也掏出手机——十几条私信；第三个女生说"我都快卸载了，太烦了"，一掏手机——四五十条陌生人私信。

团队恍然大悟：比起减少骚扰，**通过未读数字气泡展示自己人气**的需求更加强烈——她们宁可留着未读气泡不去点掉，也要随时在不经意的场合展示自己在社交平台上的人气有多高。如果不进行这样反复的追踪、不量化产品使用效果，作为一群直男，团队恐怕永远无法知道还有这样一个很实际的使用场景。这也驱使团队不断改进产品、持续迭代：把这个功能藏得深了一点，并做了别的功能来减少女性被骚扰的可能性。

### 三、挖掘隐藏需求

春秋航空是国内最大、也是最早的低成本航空公司，收入利润做得比较好，主要因为他们抓住了两波红利：移动互联网的人口流量红利，以及粉丝经济的红利。截至成文时，春秋航空微信服务号粉丝已突破 890 万，App 下载量 4800 万，注册会员 2800 万，线上产生的收入利润在国内位居前列，其中自家 App 直销占比达到 66.9%，这还不含携程等各大 OTA 平台带来的销售额。

春秋航空做产品时，一直通过线上产品的细节打磨来提升精细化运营水平。比如在 App 上订票时需要选择出发城市和到达城市，原本只有出发城市有"当前位置、历史记录、热门城市"，到达城市则完全没有。负责人参考热力图和用户反馈后发现，用户选择到达城市费时费力、转化率较低，于是在到达城市也加上了这三项。结果是：从选择城市到机票搜索页，整体转化率提升了 14.4%，订票整体转化比较上一版本提升了 2.68%。后续还做了很多优化：国际城市展示机场代码、规范控件导航目录、针对游客增加城市推荐及理由、搜索展示全部城市、空铁/空巴联运用标签分类等，都极大提升了产品每个环节的转化效果——这正是对用户需求的深层次挖掘和更好的理解。

### 四、提升精细化能力，降低运营成本

2017 年的某一个工作日早上，作者团队抓取了上海这座城市摩拜单车停放的位置，图上星散的蓝点就代表摩拜单车。可以看到这些点在地铁口、公交站比较聚集——共享单车解决的就是出行**第一公里或最后一公里**的需求：早上上班从家到地铁站，晚上下班从公司到地铁站。因此车辆停放位置有些区域相对聚集，有些区域使用较少。以前摩拜、ofo 会租赁搬家公司的卡车在马路上开来开去，把停放稀疏区域的单车搬上车，驱车十几二十公里开到用车密集的区域再放下来——本质上靠租赁搬厂公司重新调配共享单车的位置，让车尽可能出现在更多被使用的地方。在车辆产量有限的情况下，这是一种调配手段，但会占据一定的运营成本。

2017 年年中，摩拜新版本推出了一个很有意思的功能——**红包车**。乍一听跟滴滴、快的早期做红包有点像：打开 App 搜索附近共享单车时，会发现有些车带红包图标，点击解锁这辆车就可以获得一个红包，可能是几毛钱或一两块钱；骑上红包车到达特定地点、或骑行特定里程数时，就能得到几毛到几块钱的红包奖励。表面看它是在提升获客能力、拉动使用以提升活跃度和留存度，但仔细想，红包车更精妙之处在于**提升了共享单车厂商的精细化能力、帮助降低运营成本**：以前每天在很多城市雇搬厂公司或物流公司用卡车搬车，成本比较高；用了红包车之后，用户会为几毛几分钱的蝇头小利，主动把一辆车从 A 地骑到 B 地。最巧妙的是，红包车一定不会出现在热门商圈，而是在比较偏僻冷门的地方偶尔停着的车上——这些车很容易刷出红包。官方的意图很明显：把"搬车"这件事**众包**掉了，不再需要每天花几百万上千万的预算雇人搬车，只靠几毛几块钱的小恩小惠，自然有用户愿意把车从冷门的地方骑到热门的地方。这个一举多得的设计，成为摩拜 2017 年很成功的增长黑客策略之一。

以上这些案例，很好地体现了数据价值在一款产品的设计、运营和增长过程中起到的重要性。
