发言偏差:会说话的人不代表多数
在任何议题上,主动表达意见的人都是少数,而这些人中情绪强烈者的比例明显更高。结果是,评论区呈现出的观点分布,会比真实分布更极端。
这不是平台的问题,而是表达本身就有成本。愿意承担这个成本的人,通常有更强的动机。
样本偏差:不同平台是不同的世界
同一个话题,在不同平台上的主流意见可能完全相反。原因不复杂:各平台的用户年龄、职业、使用习惯差异很大。
所以看到「全网都在说」这种表述时,可以顺手问一句:这个「全网」,具体包含哪几个平台。
- 样本量不代表代表性,十万人投票也可能只覆盖一类人群。
- 年龄结构单一的样本,得出的是分众结论而非公共结论。
- 线上样本天然排除了不常上网的人群。
给内容加一条「代表性」备注
我们在引用数据时会尽量标注来源、样本范围和采集时间,哪怕这些信息会让结论显得没那么干净利落。
克制一点的数据,比漂亮的数据更有用。因为前者能让你在半年后回看时,依旧知道当时到底在说什么。