<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>第六章 · 数据分析 on 增长黑客课程笔记</title><link>https://growth-hacker.limbo101.win/docs/ch06-analytics/</link><description>Recent content in 第六章 · 数据分析 on 增长黑客课程笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Tue, 01 Sep 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://growth-hacker.limbo101.win/docs/ch06-analytics/index.xml" rel="self" type="application/rss+xml"/><item><title>了解数据和数据分析的价值</title><link>https://growth-hacker.limbo101.win/docs/ch06-analytics/01-6.1%E4%BA%86%E8%A7%A3%E6%95%B0%E6%8D%AE%E5%92%8C%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E7%9A%84%E4%BB%B7%E5%80%BC/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0800</pubDate><guid>https://growth-hacker.limbo101.win/docs/ch06-analytics/01-6.1%E4%BA%86%E8%A7%A3%E6%95%B0%E6%8D%AE%E5%92%8C%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E7%9A%84%E4%BB%B7%E5%80%BC/</guid><description>&lt;h2 id="数据为王从测量历史到大数据时代"&gt;数据为王：从测量历史到大数据时代&#10;&lt;/h2&gt;&#10;&lt;p&gt;增长黑客在实践中最重要的原则之一就是&lt;strong&gt;数据为王&lt;/strong&gt;——不断去测量和实验，通过数据结论指导行动。整个人类的发展历史，就是人类不断尝试记录、测量自身和外在世界的过程：从古时候发明算盘、阿拉伯数字，到近代发明二进制计算器，都是这一现象的体现。但人类对自己和世界的认知目前仍很粗浅——描述一个人只能说性别、年龄、身高体重，提到环境只能说天气、温度如何。尽管如此，人类对数据测量的需求一直没有减弱。&lt;/p&gt;&#10;&lt;p&gt;大约从 2014 年前后开始，网上谈论大数据的人越来越多，人类仿佛一下子进入大数据时代：行业峰会、互联网转型战略的制定、政府政策风向的扶持引导，都开始重视数据的价值，数据好像一下子变成了一座金矿。关于每天产生的数据量，这里给出几个数字：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;谷歌的 Eric Schmidt 曾推算，互联网上每天产生的数据量约为 &lt;strong&gt;2.5 EB&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;思科估算，2015 到 2020 年之间数据的年复合增长率约为 66%；&lt;/li&gt;&#10;&lt;li&gt;IDC 预测，到 2020 年数据量将达到 &lt;strong&gt;40 ZB&lt;/strong&gt;。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;换算公式：1 ZB = 1024 EB，1 EB = 1024 PB，1 PB = 1024 TB，1 TB = 1024 GB，依此类推；传统数据库支持的体量一般在 10-100 TB 之间。更直观地理解 40 ZB：相当于世界人口全年每天观看 14.5 小时高清视频流所产生的数据量；如果把中国每天产生的数据量装进常规容量的硬盘平铺在地面，中国 960 万平方公里的广袤面积都不够放。&lt;/p&gt;&#10;&lt;p&gt;数据量的快速增长已远远超过单个计算机所能存储和处理的能力，数据处理变得越来越重要，也驱动数据中心网络不断向大带宽、低延时方向演进。&lt;/p&gt;&#10;&lt;h2 id="海量数据从哪里来"&gt;海量数据从哪里来&#10;&lt;/h2&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;人与人之间的连接&lt;/strong&gt;：以 Facebook 为例，从注册账号开始，添加了哪些好友、产生了哪些互动——小到一个评论点赞，大到发起一场线上演唱会直播，每一次有意义的鼠标点击或网页跳转，都会成为 Facebook 数据服务器内的一条新增记录，直到指导 Facebook 改进自己的产品。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;设备与设备之间的连接&lt;/strong&gt;：作者上大学时&amp;quot;云&amp;quot;的概念刚被提出，业内很推崇云端战略。作者那时做了一个个人博客&amp;quot;同步控&amp;quot;，专门研究哪些软件支持云同步——要么用一个账号跨平台，要么把数据导到 Dropbox、iCloud 等第三方云存储平台，从而无论在哪里都能随时存取自己的数据。作者当时的设想是：未来数据应该在网上自由流动，硬件本身变得不值钱，像现在的共享单车、共享雨伞、充电宝一样随处廉价取用，通过指纹或虹膜登录就能立即取回数据开始使用——满大街都可以看作是有你的手机和 Pad。现在整个互联网的演进方向看来的确有这个趋势：上台面一点的移动产品都必须同时推出跨平台版本，不支持云同步或账号互通简直贻笑大方；再如区块链这个很火的概念，解决的也是同一份数据如何在网络上同时分发给多个节点、多个设备并保持一致性，本质就是设备之间如何产生数据连接。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;工具与服务之间的连接&lt;/strong&gt;：一连串工具之间互导互通的自动化流程（营销自动化一章有专门介绍）——在服务管道之间像血液一样流通的，就是各种各样的用户信息和行为数据，通过不同工具服务重新打散、整理、整合、加工，最后产生新的商业价值。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;这两年不仅大数据企业增多，围绕大数据的培训、数据交易、数据竞赛及相关媒体也大量涌现，不少学校开设了大数据专业专门培养人才，相关立法逐渐完善，政府也开始重视数据建设。但必须提醒：不要张口闭口对着一行 Excel 统计报表就说&amp;quot;这是我们产品用户行为的大数据&amp;quot;——日常生活中大部分谈论大数据的人，根本没搞清楚什么是大数据，大数据被完全过度神话了。杜克大学教授 Dan Ariely 打过一个很妙的比方：&lt;/p&gt;</description></item><item><title>搭建公司的业务指标体系和四个层级</title><link>https://growth-hacker.limbo101.win/docs/ch06-analytics/02-6.2%E6%90%AD%E5%BB%BA%E5%85%AC%E5%8F%B8%E7%9A%84%E4%B8%9A%E5%8A%A1%E6%8C%87%E6%A0%87%E4%BD%93%E7%B3%BB%E5%92%8C%E5%9B%9B%E4%B8%AA%E5%B1%82%E7%BA%A7/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0800</pubDate><guid>https://growth-hacker.limbo101.win/docs/ch06-analytics/02-6.2%E6%90%AD%E5%BB%BA%E5%85%AC%E5%8F%B8%E7%9A%84%E4%B8%9A%E5%8A%A1%E6%8C%87%E6%A0%87%E4%BD%93%E7%B3%BB%E5%92%8C%E5%9B%9B%E4%B8%AA%E5%B1%82%E7%BA%A7/</guid><description>&lt;h2 id="为什么需要指标体系"&gt;为什么需要指标体系&#10;&lt;/h2&gt;&#10;&lt;p&gt;管理大师彼得·德鲁克说过：&amp;ldquo;If you can&amp;rsquo;t measure it, you can&amp;rsquo;t improve it&amp;rdquo;——如果你不能衡量，就无法管理。互联网产品的增长建立在对过往版本不断循环迭代的基础之上，因此量化的对比衡量是其应有之义，而很重要的一点，就是为产品构建一套&lt;strong&gt;数据指标体系&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;指标&lt;/strong&gt;是用于衡量事物发展程度的单位或方法，是一种度量标准，用于追踪和评估商业进程的状态，比如人口数、GDP、收入、用户数、留存率、利润率、覆盖率等。很多公司都有自己的 KPI 指标体系，通过关键指标衡量业务运营的好坏。指标需要经过加和、平均等汇总计算得到，且必须在时间、地点、范围等前提下进行汇总——即常说的&lt;strong&gt;统计口径与范围&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;常见的指标根据分类维度的不同，可以分出很多种：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;基础指标&lt;/strong&gt;：新增用户、活跃用户、启动次数等，是很多产品都会统计的通用指标。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;流量指标&lt;/strong&gt;：多在网页端体现，如 UV、PV、跳出率等。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;使用数据&lt;/strong&gt;：衡量用户实际使用产品时产生的行为，如使用时长、使用频率、两次访问的间隔等，体现用户使用产品的频繁程度。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;业务指标&lt;/strong&gt;：订单量、客单价、复购率、扫码率等，传统电商网站常统计。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;垂直领域的细化指标&lt;/strong&gt;：如女性用户在双十一大促的客单价，就是非常细分的指标。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;成本类指标&lt;/strong&gt;：CAC（Customer Acquisition Cost，客户获取成本）、LTV（Lifetime Value，用户生命周期价值）、Payback Period（成本回收周期）等。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;老板开会常问&amp;quot;今天的 UV、PV、注册转化率、购买率是多少&amp;quot;。普通员工会说&amp;quot;老板等一下，我看下报表&amp;quot;；优秀的增长黑客能立即接茬：&amp;ldquo;老板，昨天转化率是 80%，今天只有 70%，可能是昨天上线的新流程造成数据波动，解决思路是重新优化登录流程设计。&amp;ldquo;这就是普通员工与增长黑客的差距。做数据分析除了统计、编程、算法等能力，还必须非常熟悉公司业务；提升业务熟悉度和数据指标敏感度最直接有效的办法没有别的，就是&lt;strong&gt;多看多记&lt;/strong&gt;。不妨自查：不查资料、不看报表，能否说出公司每天/每周/每月的营业额、活跃量、流量？周末和周中差别如何？早、中、晚用户有何关键差别？在北京、上海及其他主要地区，产品的市场份额和消费能力怎么样？这些指标很多互联网公司都有，但&lt;strong&gt;能不能记住，是区分增长黑客数据分析能力的重要方面&lt;/strong&gt;，应烂熟于心，几乎成为第二本能。有工程师诉苦：&amp;ldquo;产品经理每天找我要一堆指标，根本不知道有什么用&amp;rdquo;——因此要学会选择好的指标，这才说明真正掌握了衡量业务表现的方法。&lt;/p&gt;&#10;&lt;h2 id="什么是好的指标"&gt;什么是好的指标&#10;&lt;/h2&gt;&#10;&lt;p&gt;脱离业务单谈一个指标的好坏，或者拼凑很多指标，都是没有意义的。好指标具有以下特征：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;可比性&lt;/strong&gt;：能拿来被比较。首先要求指标衡量的事物是可以对比的，比如拿两个页面的 PV 比较、拿登录人数和注册人数比较，是有意义的，因为它们是性质相同的数据指标；但拿 App 下载量和网页端营业额做比较，就很难得出有意义的结论。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;简单&lt;/strong&gt;：正因为简单，使用者不会轻易犯错，也能轻松把指标背后的意义和故事展示给老板、同事。搞一个很复杂的指标，别人光理解就需要深厚的背景知识或很长时间，指标就很有迷惑性。市面上很多经济学家和权威机构爱搞耸人听闻的复杂指标——真正有本事的人完全可以用简单的语言解释，他们偏要复杂化，就是不让受众多思考、顺着想、受蛊惑即可。这也是经济学家利用公开渠道发言影响大众舆论、私底下操盘&amp;quot;收韭菜&amp;quot;的一种手法。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;通常是一个比率&lt;/strong&gt;：绝对数值的指标有局限性。比如当日成交量，一周内不同时间、一天内不同时段、一年之内同比环比，都可能因天气、节庆、政策、习惯等出现波动，直接比较受限较多；而交易额比上成交量反映平均客单价，在一段时间内不会产生出乎意料的剧烈波动，拿来做横向、纵向比较都比较放心。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;h2 id="五组指标维度与虚荣指标"&gt;五组指标维度与虚荣指标&#10;&lt;/h2&gt;&#10;&lt;p&gt;指标分类的维度很多，这里列举五种分析维度，各自给出一组对比概念：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;定性指标 vs 定量指标&lt;/strong&gt;：定量指标是可以被量化的指标，如数字或可比较的等级（A/B/C/D）；不能定量的即定性指标，无法直接通过数据计算分析评价，需要对评价对象进行客观描述和分析来反映结果，如主观评定的及格、良好、优异。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;探索性指标 vs 报告性指标&lt;/strong&gt;：报告性指标让人时刻了解当前运营状况和管理活动，像日常看报告一样；探索性指标帮助团队了解&amp;quot;那些你不知道自己不知道的事实&amp;rdquo;，提供原本不为人知的洞见。比如发现产品活跃度很差是报告性指标；进一步拆解数据，发现为数不多的活跃人群中年轻妈妈群体撑起了主要活跃度，于是调整重心、专门开发了一款母婴社区并大受好评——发现年轻妈妈占比高就是探索性指标，帮助发现隐含的有价值信息。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;先见性指标 vs 后见性指标&lt;/strong&gt;：先见性指标用来预测未来，如通过现有产品的日常增量和漏斗转化情况预测第二天大概有多少成交客户，或通过异常预警做到未雨绸缪；后见性指标用来解释过去，如季度订单量、流失率等，通常是亡羊补牢的行为，虽可通过一些做法弥补，但很多时候为时已晚。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;相关性指标 vs 因果性指标&lt;/strong&gt;：有时两组数据彼此相关、同受第三者因素影响，如网站卡顿不稳定时，UV 和 PV 会同时下降；有的指标之间存在因果关系，即 A 指标变化引发 B 波动，如用户在线时长减少，靠展示曝光获得的广告营收也就减少，前者是导致后者的直接原因。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;虚荣指标 vs 可付诸行动指标&lt;/strong&gt;：虚荣指标让人自我感觉很良好，但实际上没什么业务价值，会让人沉溺其中、忽略真正重要的事——比如今天网站 PV 很高，有人为此沾沾自喜，但实际成交转化率很低，依然赚不到钱，PV 高只能让人自嗨一小会儿。可付诸行动（可实施）指标能指导最佳行动方案、提供商业行动建议，只要思路正确、照着正确的方法调整，就能实实在在获得增长。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;关于虚荣指标，有两个案例：&lt;/p&gt;</description></item><item><title>6.3衡量产品用户体验的HEART模型</title><link>https://growth-hacker.limbo101.win/docs/ch06-analytics/03-6.3%E8%A1%A1%E9%87%8F%E4%BA%A7%E5%93%81%E7%94%A8%E6%88%B7%E4%BD%93%E9%AA%8C%E7%9A%84heart%E6%A8%A1%E5%9E%8B/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0800</pubDate><guid>https://growth-hacker.limbo101.win/docs/ch06-analytics/03-6.3%E8%A1%A1%E9%87%8F%E4%BA%A7%E5%93%81%E7%94%A8%E6%88%B7%E4%BD%93%E9%AA%8C%E7%9A%84heart%E6%A8%A1%E5%9E%8B/</guid><description>&lt;h2 id="用户体验为何难以量化"&gt;用户体验为何难以量化&#10;&lt;/h2&gt;&#10;&lt;p&gt;大约十二年前，&amp;ldquo;用户体验&amp;quot;这一概念在业界逐渐兴起，许多产品设计领域的知名博主纷纷开始从用户体验的视角讨论产品如何设计与优化。但当时存在一个明显的问题：谈用户体验的人很多，能拿出被公众认可的、可衡量的客观标准的人却很少，多数讨论停留在产品带给自己的主观感受上——而主观感受是靠不住的。&lt;/p&gt;&#10;&lt;p&gt;更棘手的是遇到不懂产品的老板，动辄以&amp;quot;用户体验差&amp;quot;这类笼统反馈要求团队照其意图修改：结果越改越糟，老板本人却觉得颇为受用、很有掌控感，产品上线后很快被用户的负面评价淹没。此外，申请企业内部资源或制定 KPI 时，有些指标（如成交转化率）很容易量化，用户体验却看起来无从衡量。于是产品设计师只能被迫向这种&amp;quot;黑恶势力&amp;quot;低头：为了提升转化率，堆砌又大又丑的按钮、自动跳转，甚至误导性设计乃至黑暗模式，全然不顾用户在页面上被折腾得难以忍受。&lt;/p&gt;&#10;&lt;p&gt;用户体验是否可以被量化、被数据指标衡量？是有办法的——这就是 &lt;strong&gt;HEART 模型&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;h2 id="heart-模型google-的衡量框架"&gt;HEART 模型：Google 的衡量框架&#10;&lt;/h2&gt;&#10;&lt;p&gt;HEART 模型由 Google 发明，是其用户体验研究团队设计的框架。起因是内部团队发现用户体验没有被有效衡量：当时虽有不少有效的测量方法，如完成任务所用的时间、任务完成率等，但都偏重微观层面；Google 的 UX 设计师缺乏宏观层面的商业指标，而这些指标更直接影响公司策略。因此 Google 最终研发出这套 HEART 指标体系，作为新的用户体验衡量框架。&lt;/p&gt;&#10;&lt;p&gt;HEART 是五个单词首字母的缩写，同时包含宏观和微观的方面，可用于确定产品用户体验的实际影响：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;H——Happiness（愉悦度）&lt;/strong&gt;：衡量产品使用过程中的愉悦度或满意度。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;E——Engagement（参与度）&lt;/strong&gt;：用户专注投入到产品中的程度。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;A——Adoption（接受度）&lt;/strong&gt;：用户对产品新版本或新功能的接受情况。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;R——Retention（留存率）&lt;/strong&gt;：用户愿意回访的比例。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;T——Task Success（任务成功率）&lt;/strong&gt;：用户完成任务的程度与效率。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;五个元素分述如下。&lt;/p&gt;&#10;&lt;h2 id="h愉悦度happiness"&gt;H——愉悦度（Happiness）&#10;&lt;/h2&gt;&#10;&lt;p&gt;愉悦度是一种情绪的衡量，可以通过 &lt;strong&gt;NPS（净推荐值）&lt;/strong&gt; 或用户问卷来衡量，从而了解产品的发展方向是否符合用户心意。&lt;/p&gt;&#10;&lt;p&gt;NPS 最早由贝恩咨询公司于 2003 年在《哈佛商业评论》上首次提出，计算方式为：推荐者数量 ÷ 样本总数 × 100%，减去贬损者数量 ÷ 样本总数 × 100%。具体做法是问客户一个问题——是否愿意将这个产品推荐给他的朋友或同事——并让客户在 0 到 10 分之间打分：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;9~10 分&lt;/strong&gt;：对产品具有狂热忠诚度的人，愿意继续购买或把它引荐给其他人（推荐者）。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;7~8 分&lt;/strong&gt;：总体满意但并不狂热，仍会考虑其他竞争对手的产品。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;0~6 分&lt;/strong&gt;：批评者，使用并不满意，对公司或产品没有忠诚度（贬损者）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;得分解读：NPS 在 50% 以上可以被认为还不错；在 70%~80% 之间，则证明公司拥有一批高忠诚度的好客户。调查显示，大部分公司的 NPS 还在 5%~10% 之间徘徊；而像特斯拉这样的公司，每年做 NPS 调查时，对新款车型的满意度都能达到 90% 以上，这一数字相当惊人。&lt;/p&gt;</description></item><item><title>6.4数据分析的五个步骤</title><link>https://growth-hacker.limbo101.win/docs/ch06-analytics/04-6.4%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E7%9A%84%E4%BA%94%E4%B8%AA%E6%AD%A5%E9%AA%A4/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0800</pubDate><guid>https://growth-hacker.limbo101.win/docs/ch06-analytics/04-6.4%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E7%9A%84%E4%BA%94%E4%B8%AA%E6%AD%A5%E9%AA%A4/</guid><description>&lt;h2 id="前提明确目的建立预期"&gt;前提：明确目的，建立预期&#10;&lt;/h2&gt;&#10;&lt;p&gt;数据分析的价值与指标体系的搭建见前文，本篇笔记梳理数据分析的一般流程。在正式开始之前，必须明确两个前提：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;明确目的&lt;/strong&gt;：不要为了数据分析而进行数据分析。特别是面对满屏幕的统计指标和数据反馈时，往往越看越乱，这时更要明确目标、抽丝剥茧，从一堆数字里准确找出真正用得着的。说到底，数据分析只是手段，手段服务于目的；不知道分析目的是什么就掏出计算器对着 Excel 忙一下午，到最后也不知道自己在做什么，那就是浪费时间。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;建立预期&lt;/strong&gt;：哪怕没有明确的预期，也得毛估出一个大概——估不出数字区间，起码能估个量级。这个能力要通过大量的练习和实践来训练。有了预期，等结果出来才能进行对比：是令人满意，还是差强人意、有优化提升的空间。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;确立好前提，就进入数据分析的一般流程。整个流程分成五个环节：&lt;strong&gt;数据获取、数据清洗、数据分析、验证发现、数据可视化&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;h2 id="第一步数据获取"&gt;第一步：数据获取&#10;&lt;/h2&gt;&#10;&lt;p&gt;数据分析的起点是起码先得有数据。常用来源有五种：&lt;/p&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;strong&gt;文件下载&lt;/strong&gt;：最常见、用得最多的方式。可下载的文件既有公司内部服务器上提供的，也有网上公开的免费报告、统计报表，还包括花钱从咨询公司采购的。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;服务器访问日志&lt;/strong&gt;：每次请求服务器，都会给服务器的请求日志增加一条记录。可以向服务器管理员申请索要这个记录，其中一堆指标可以作为参考。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;交互界面访问&lt;/strong&gt;：比如编程时后端用 MySQL 这样的数据库，既可以用命令行方式访问，也有前端的交互界面工具——例如 PHP 的管理工具 phpMyAdmin，提供了 MySQL 的图形化访问界面。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;应用程序接口（API）&lt;/strong&gt;：比如接了新浪微博，开发程序时就可以通过微博提供的数据接口 API 获取返回的数据，如收发微博的消息等。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;技术手段采集&lt;/strong&gt;：有些数据并非为外部获取而存在，如果懂一些抓取手段，也可以巧妙获得。比如前两年 O2O 创业很火、人人都去做 O2O 的时候，很多团队倾向于去抓大众点评的数据；做股票财经分析的，则很喜欢抓取雅虎财经的数据。&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;p&gt;当然可能还有其他来源，方法很多，主要取决于手头有哪些途径、掌握哪些技术。&lt;/p&gt;&#10;&lt;h2 id="第二步数据清洗"&gt;第二步：数据清洗&#10;&lt;/h2&gt;&#10;&lt;p&gt;数据清洗顾名思义，就是把脏数据洗掉——各种整理、检查、修复，是正式开始分析前的准备工作。只有干净的数据，接下来分析时才能确保结果准确。打个比方：如果数据分析是下厨房做菜，数据清洗就相当于提前准备食材——去皮、去籽、洗干净，该焯水的焯水、该预热的预热，准备工作都完成了，才能真正煎炸烹煮出一道美味佳肴。&lt;/p&gt;&#10;&lt;p&gt;常见的清洗对象有六种：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;缺失值&lt;/strong&gt;：比如抓取来一组一百个随机路人的年龄，想统计平均年龄时发现其中一人漏统计、数据是空的。再找个路人替补已经来不及，这时要么去掉空值、统计剩下 99 人的平均年龄，要么想办法补齐——填一个比较合理的、最能减少最终结果误差的数字，比如补上其余 99 人的平均年龄再算均值，误差会小一些。除平均值外，根据实际情况也可以补充中位数、众数等来代替缺失值；这类办法简单，但没有充分考虑数据中已有的信息，误差可能较大。另一种办法是根据调查对象其他问题的答案，通过变量之间的相关分析或逻辑结论来推理预估——比如某产品的拥有情况可能与家庭收入有关，就可以根据家庭收入推算拥有该产品的可能性，再填充缺失值。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;垃圾信息&lt;/strong&gt;：收上来的数据可能包含无效项目。比如发问卷统计一百个小朋友的年龄，有人调皮填了 500 岁，显然是垃圾信息，需要剔除。有时还可以反向利用这一点，故意在调查中设置陷阱：某人在第三题选了 A，第八题换种说法重复问同样的问题他却选了 B，前后矛盾，说明他没有认真客观地答题、可能只是囫囵吞枣乱填，这份调查表就视作无效，从样本数据中剔除。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;规范化&lt;/strong&gt;：比如样本数据里有个字段叫日期，有人填阿拉伯数字 2018.10.10，有人汉字数字混写&amp;quot;二零一八年十月十日&amp;quot;，有人提交的是英文 October tenth, two thousand eighteen。这时就要人工或借助工具，把不同的格式统一规范转换成一样的格式，后续才能统一处理。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;重复记录&lt;/strong&gt;：很好理解，样本里有多的，就酌情删除或合并归类。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;特殊值&lt;/strong&gt;：比如想统计某大学一届毕业生毕业三年的平均月薪，大部分人的收入服从正态分布、大概在一两万上下波动；但假如有一个有能力有背景的小伙子毕业不久就平步青云，工资加奖金月入一百万，他的收入就属于比较极端、特殊的值。直接放进统计会拉高全体毕业生的月薪均值，让结果偏高不准确。对这种特殊值应采取特殊手段取舍，比如直接不纳入统计。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;合并数据集&lt;/strong&gt;：比如做电商产品，手头有两份 Excel 表，一份是一百款产品的销量、另一份是它们的单价，需要根据这两份数据计算总销售额。与其在两个表之间来回跳转、狂按计算器拿销量乘以单价再挨个加总，不如熟练运用 Excel，通过函数把两个数据集合并在一张表上——一列销量、一列单价——直接算出总销售额。合并数据集的价值，是让分散在不同数据表里的数据集中到一起，方便统一处理。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;实操中可能还有其他特殊数据，要酌情处理。常用的清洗工具有两类：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;Excel&lt;/strong&gt;：天生为数据而生，有很多现成的函数；如果熟悉 VBA，还可以写脚本和自动化工具，实现一键处理。曾有一位在美国咨询公司工作的分析师，Excel 用得非常熟练：一些其他分析师要花三四个下午才能完成的常用流程，他用 VBA 写了一个函数，每次点一下启动按钮只要二十几秒就全部完成。他很幸运，离开那家咨询公司时，公司还花 20 万美金把他的脚本收购了。&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;编程语言&lt;/strong&gt;：常用的有 Python、PHP、R 语言。Python 和 PHP 比较轻量级，第三方开源的库和工具非常多，写起来快；R 语言是专门为数据分析而生的语言，语法很简单，数据分析相关的工具和函数非常强大，可以完成非常复杂的数据分析工作。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="第三步数据分析的七种手段"&gt;第三步：数据分析的七种手段&#10;&lt;/h2&gt;&#10;&lt;p&gt;数据清洗完成、原材料准备就绪，接下来就可以运用各种方法进行数据分析。方法手段很多，根据不同场合、不同目的选择最合适的。以下介绍七种常用手段：&lt;strong&gt;画像分群、趋势维度分析、漏斗洞察、行为轨迹分析、留存分析、A/B 测试、优化建模&lt;/strong&gt;。&lt;/p&gt;</description></item><item><title>6.5了解什么是A/B测试</title><link>https://growth-hacker.limbo101.win/docs/ch06-analytics/05-6.5%E4%BA%86%E8%A7%A3%E4%BB%80%E4%B9%88%E6%98%AFavb%E6%B5%8B%E8%AF%95/</link><pubDate>Tue, 01 Sep 2026 00:00:00 +0800</pubDate><guid>https://growth-hacker.limbo101.win/docs/ch06-analytics/05-6.5%E4%BA%86%E8%A7%A3%E4%BB%80%E4%B9%88%E6%98%AFavb%E6%B5%8B%E8%AF%95/</guid><description>&lt;h2 id="为什么需要-ab-测试"&gt;为什么需要 A/B 测试&#10;&lt;/h2&gt;&#10;&lt;p&gt;在互联网产品开发中，经常面临多种方案的选择。有些选择轻而易举：面向大众的产品，主色调定成蓝色，最权威、最稳重而且广为接受；强调安全的服务，绿色是不二之选。但还有些时候，备选方案是模棱两可的，甚至看起来完全无关紧要：某个按钮用橙色还是红色？位置是偏左还是偏右？&lt;/p&gt;&#10;&lt;p&gt;面对这种情况，传统解决方式要么根据设计师的审美来定，要么一群人共同表决，要么由某位领导拍板决定。无论哪种方式都免不了受个人主观因素的制约，未必代表广大真实用户在实际使用场景中的认知——正所谓&amp;quot;不识庐山真面目，只缘身在此山中&amp;quot;。&lt;/p&gt;&#10;&lt;p&gt;还有一种情况：一个改动背后利益方的诉求不同、想法很多很分散。比如一个电商网站的购买转化率很低，团队内部就会出现各种不同的声音：产品经理认为是市场推广人员广告投放不精准，而不是购物车流程复杂冗长导致的交互问题；设计师抱怨程序员擅自修改了酷炫的视觉特效；程序员却觉得优先确保兼容性才是提升转化率的方法；老板要求页面文案充分体现技术的首创性；销售团队则认为顾客只关心给自己带去什么利益，根本不管技术是怎么个首创法。这时到底谁更对——产品负责人的感觉、老板的意见，还是刚好路过的扫地阿姨看了一眼屏幕后发表的看法？怎样进行科学的判断？答案是：直接做一次 A/B 测试。&lt;/p&gt;&#10;&lt;h2 id="什么是-ab-测试"&gt;什么是 A/B 测试&#10;&lt;/h2&gt;&#10;&lt;p&gt;&lt;strong&gt;A/B 测试&lt;/strong&gt;也叫做&lt;strong&gt;随机实验&lt;/strong&gt;或&lt;strong&gt;对照实验&lt;/strong&gt;，是一种比较流行的产品优化方法，一般在 Web 网页版产品里用得较多，可以用来提升转化率、注册率等指标。简单说，就是为同一个目标制定两个方案，将产品的用户流量分割成 A、B 两组（一组实验组、一组对照组），两组用户特点类似且同时跑实验；实验运行一段时间后，分别统计两组用户的表现，再将数据结果进行对比，就可以科学地帮助决策。&lt;/p&gt;&#10;&lt;p&gt;比如让 50% 的用户看到 A 页面、50% 的用户看到 B 页面，结果 A 版本带来 50 个注册，B 版本带来 75 个注册，相当于 B 版本比 A 高出 50%。在试验流量足够大的情况下，就可以判定 B 版本最终胜出，然后把 B 版本推送给所有用户。A/B 测试是一种&lt;strong&gt;先验&lt;/strong&gt;的实验体系，属于&lt;strong&gt;预测型的结论&lt;/strong&gt;，与一些后验型的归纳性结论差别比较大。&lt;/p&gt;&#10;&lt;p&gt;这个方法曾在很多领域产生过深远影响，包括医药、农业、制造业和广告等。其中西医算是比较早引入 A/B 测试来验证新药疗效的：&lt;/p&gt;&#10;&lt;blockquote&gt;&#10;&lt;p&gt;新药验证一般是这样一个流程：有一百名患者参与测试，医生悄悄分成 A、B 两组——注意患者自己并不知道被分了组，且两组患者的健康情况比较接近一致。A 组患者将得到试验的新药，B 组患者得到长得和新药一模一样的安慰剂，也就是没什么效果的药。如果最终 A 组患者比 B 组疗效更好，就能证明这个新药的疗效是有用的。&lt;/p&gt;&#10;&lt;/blockquote&gt;&#10;&lt;p&gt;可见，A/B 测试的目的在于：通过科学的实验设计（采样样本要有代表性）、流量分割与小流量测试等方法，获得具有代表性的实验结论，并且确信这个结论推广到全部流量时是可信的——这又涉及到数据化驱动决策与确定性的优化提升等概念。&lt;/p&gt;&#10;&lt;p&gt;自然界中也存在类似 A/B 测试的事件。达尔文在《物种起源》的编定过程中，发现了一类体型很小、羽毛颜色很暗淡的雀鸟：其中一支大约有十三个种，分布在加拉帕戈斯群岛；另一种则生活在科科斯群岛。这些鸟几乎有同样的体型（差不多都在十到二十厘米），但生活环境的细微不同，让它们进化出了尺寸和形状差别很大的嘴型，以此适应不同的食物。这一发现对达尔文推导出大自然物竞天择的演化理论起到了贡献。这种通过环境影响个体形态、从而筛选出最适合存活下来的物种的例子，其实就包含了 A/B 测试的基本思想：&lt;strong&gt;提供多个方案并行测试，不同方案之间只存在一个变量，并以某种标准来判定结果、筛选出最优的方案&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;其中&amp;quot;只存在一个变量&amp;quot;这个单变量原则需要重点关注：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;某种方案的优劣不光与方案本身有关，也可能与方案所适配的环境密不可分。比如同样一段文案涂成黑色，在浅色底上清楚醒目，在深色底上看起来就很费眼力；涂成白色，在深浅不同的底色上视觉效果恰恰相反。不能简单得出黑色和白色哪种绝对好，只能说在深色或浅色底的确定条件下，使用白色或黑色的配色方案，才能取得最佳视觉效果、最大程度上吸引眼球。&lt;/li&gt;&#10;&lt;li&gt;被比较的两个变量本身也不能是复杂变量，而应该是单一变量。比如拿红烧茄子跟干拌土豆拼个高下，哪种美味只能靠评判者主观的味蕾偏好。解决办法是：要么都改成红烧，要么都换成土豆，确保基于单一的烹制方法或单一的食材，最终做出的评价才更客观。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="硅谷基石与成功案例"&gt;硅谷基石与成功案例&#10;&lt;/h2&gt;&#10;&lt;p&gt;硅谷的明星科技公司都将 A/B 测试看作稳步增长的基石。Google 从 2004 年到 2007 年历时三年，逐步构建并打磨出一套很强大的内部 A/B 测试系统，每个月会跑几百次实验（有一张 2007 年到 2010 年期间 Google 进行 A/B 测试数量的统计图）。Facebook 也是高频测试的笃行者：据一位名叫卡斯卡特的项目经理介绍，每当工程师对某个算法进行一次微调，Facebook 都会单独针对这次调整筛选出一组用户来进行测试，且每次的测试对象不相同；他还透露，最多的时候甚至有差不多一千种不同版本的 Facebook 面向不同的用户群运行。Facebook 从所有测试对象中提取信息，了解哪些优化算法真正改善了情况、哪些没有产生效果。此外，Facebook 移动版在每次上线时，都会提前把未来六个月想要测试的实验集成到代码里。&lt;/p&gt;</description></item></channel></rss>