拿真实数据判断
小样本和自己人的感受都不算数。判断一个产品行不行,只有真实用户在真实场景下的行为记录算数。
「我用着挺好的」「我朋友说不错」「我们用户数在涨」——这些都不算数据。判断一个产品行不行,只有一种东西算数:真实用户在真实场景下的行为记录。
你会遇到的现象:
- 靠「自己人觉得」下结论,几个人觉得好就推上线
- 问卷收回来几十份,就当成规律往外推
- 功能上线了,但没有行为数据,说不清用没用、用到哪一步
为什么小样本不算数
小样本和自己人的感受,问题不在「不真实」,而在带偏——它们会顺着你想要的方向,给出让你舒服的答案。
- **自己人是「知道自己会用」的人。**你做什么他们都说好,因为他们支持的是你,不是产品。你需要的恰恰是那些「需要被说服」的人。
- **小样本的波动可以支撑任何结论。**三个人里有两个人点了某个按钮,你读出「六成」——可这只是掷了三次骰子。样本小到一定程度,数字反映的是运气,不是规律。
- **当面问出来的,是「他想让你听到的」。**人倾向于表现得配合、理性、乐于助人。他说「这个功能我很需要」,不代表他下个月真的会用。
- **投放带来的短期涨,不是产品的功劳。**涨跌要能归因。搞不清哪一环带来变化,涨了也无从复制。
什么样才算真实数据
同样是数字,有的算数据,有的只是噪音。判断标准有四条:
- **看行为,不看表态。**用户实际做了什么,比嘴上说了什么可靠得多。问「你需不需要」不如数「有没有人用、用了几次」。
- 看完整路径,不看单点。「浏览量涨了」没有意义,要看从进入到完成的整条链路里,人在哪一步停住。
- **样本要有量级。**至少能区分「波动」和「趋势」——个位数的样本,除了暴露问题,给不了结论。注意这和可用性测试不是一回事:找界面哪里难用,几个用户就能暴露大半;判断产品有没有价值、要不要继续投,样本必须够大。nng5
- **是真实场景。**他自己用、没人在旁边盯、没有奖励诱导。测试环境、演示环境里的数据都不能算。
把这四条过一遍,「浏览量涨了」这类汇报就会现形:涨了多少、谁在涨、从哪个入口进来、在哪一步离开,答不上其中任何一环,这个数就不能用来做决定。判断产品行不行,靠的是这一条条经得起追问的记录。
没有数据怎么办
「我现在就是没有真实数据」——这是最常见的处境,也有对应解法:
- **先埋点,后上线。**没有埋点的功能,上线等于没上。把埋点当成功能的一部分,跟着一起验收。参见先埋点后上线。
- **先放一个小版本给真实用户。**小流量的真实行为,好过一百个自己人的感受。窄受众、最小版本,都是为了让真实数据早点来。参见最小切片。
- **别用问卷代替行为。**问卷能告诉你「他说他想要」,行为能告诉你「他到底用不用」。两者配合可以,但问卷不能当行为数据用。
- **先定要验证什么,再定看什么数。**北极星定下来之后,才知道哪些数值得埋、哪些数只是好看。参见指标体系怎么搭。
