抽样的节奏稳胜过抽得多
午间分组翻看抽样得来的公开样本时,先站在层间差异的角度想一想,再落笔写进分层台账簿。顺手一分,逐层调整就够,层别看得清楚,更便于归纳一些。
不必把分层台账簿做得面面俱到:抽样得来的公开样本占一边,组号栏占一边,剩下的全丢进备注。栏目一少,每层末段维护一次就不吃力,刚学着分层的人也容易坚持。
若分层归档的公开数值是从汇总转发的层表来的,组内条数那栏至少要写清出处。出处齐了,一个统计季之后再逐层清点就轻松,也不至于把转述当原件用。
长期记样本的读者记的条数多少不打紧,要紧的是顺着组间差异栏能不能还原当时的判断。样本能接得上了,哪怕大半个样本期之后看法变了,分层台账簿里的过程也还讲得清。
想让抽样清单本用得久,拼的不是密度而是节奏:每两个组期动一次,一次只挪一小块。两三个统计周攒够之后,按组划分的公开记录的好处自然显出来,分层经得起复查。
从层别看问题而不是看单组
分层方差的价值恰恰在于它管住了能说什么。它不许把话讲满,于是分组的期次样本条目到了第一次做分组的人手里只是材料,样本能提供参照,不能替代判断这句也就落了地,更利落归组一些。
把分层归档的公开数值照每批样本尾一行行排开,那些所谓冷热多半只是组间落差带来的观感。与其急着记进层别说明,更匀层的做法是先承认这种观感存在。
一个说法能不能站住,关键看它用了多少组间落差、跨了多长的半个样本期。个别例子说明不了什么;先把组距值补齐,再走一遍交叉分层,偶尔估数的朋友的结论自然会温和些。
有人问分层归档的公开数值里一连串相似结果该怎么理解。换成组间落差的角度就没什么特别:分层能减少杂乱,不能改变分布,更成组一些看待更好。
层内离散度的价值恰恰在于它管住了能说什么。它不许把话讲满,于是按组距分好的公开数据到了愿意逐层核对的读者手里只是材料,组距能对齐口径,对不齐结果这句也就落了地,更分得清一些。
几种常见的分层失真
碰到分层抽取的期次条目里方向感很强的说法,更成组的做法是先晾一晾,别立刻写进组内条数。隔几个组期再回看,当时漏掉的反例往往就浮出来了。
提醒不该只堆在组距对照的结尾。凡涉及判断的段落,都可以顺手补一句适用范围,例如并组能省力气,省不掉随机性,让有抽样习惯的读者清楚几个组期之后要不要重新确认。
当分层抽取的期次条目前后对不上,习惯分组的读者先别动手改旧的。另开一栏把差异写进抽样记录簿,组内条数的原貌照留,好让二次抽样看出岔子出自哪一步。
当按组距分好的公开数据前后对不上,爱做抽样的朋友先别动手改旧的。另开一栏把差异写进分层标记册,组号栏的原貌照留,好让交叉分层看出岔子出自哪一步。
凡是沾到分层抽取的期次条目的分层台账簿,先把范围交代清楚。组距能对齐口径,对不齐结果——这不是客套,而是让愿意逐层核对的读者明白它能做什么、不能做什么。
可直接采信的先单独归层
两个来源的分组的期次样本条目数字对不上时,先把差异记进层别说明,别急着选边站。差异留得住,日后有抽样习惯的读者做二次抽样才还原得出当时的判断环境。
翻分组截图的时候,最容易踩的坑就是并组之后口径被改。碰上没写出处的说法,先塞进组距对照表的备注栏,等并组核对之后再说用不用,更清楚分层一些。
遇到群里转来的分组表,偶尔估数的朋友先别急着下结论,先分清它属于哪一类材料。像页面上贴出的分组框这样的可以直接核对,转述来的则要多一层确认,不妨先记在分组汇总页的备注里。
同一话题在几个渠道里说法不同,愿意逐层核对的读者把分层抽取的期次条目摆到一处就能看出来。与其追问谁对谁错,不如把相关条目并排放进分层标记册,让二次抽样指出差异在哪。
回看是为了检查抽样过程
当按抽样框整理的条目里的现象和习惯分组的读者原先的判断拉开距离时,不妨把它当成一次提醒:心里装着抽样能描述过去,不能承诺未来这句话,讨论共用一套组反倒更容易做到,更分得清一些。
复盘时可以单开一行:写下看分组的期次样本条目时最没底的那一点,一起收进组距对照表。日子久了会发现,这一行比结果栏更说明问题,几个组期之后有抽样习惯的读者想法的变化也有迹可循。
回看时若判断站不住,第一次做分组的人先别改方法:把当时的样本覆盖面和后来的复核结果并排摆进分层统计册,分清差别是信息不足,还是推理跳了步,一个统计季之后再动手也不迟。
复盘用不着长,每五组一轮一次即可:愿意逐层核对的读者只问三句——这条依据在哪、记录缺了哪一段、判断有没有掺进事实。答案写进分组登记表,比长篇总结顶用,层别看得清楚也落到实处。
抽样的节奏也算内容的一部分
浏览与判断可以错开时段:清早抽样适合收集条目,另一段时间只做一件事——分组。两边不重叠,分组口径一致就更容易实现,刚学着分层的人也不至于越看越乱。
午后并组里给浏览定个固定时段有一样好处:习惯之后,再遇到情绪波动大的抽样得来的公开样本,也更容易按分组比例的角度去看,愿意逐层核对的读者不至于被临时牵着走。
匀着估不等于消极,它只是承认分组能看清结构,看不清结果。想通这一层,按组划分的公开记录依然有用:刚学着分层的人能借它照见自己的习惯,以及常犯的判断偏差,更清楚分层一些。
清早抽样里给浏览定个固定时段有一样好处:习惯之后,再遇到情绪波动大的分组的期次样本条目,也更容易按分组比例的角度去看,爱做抽样的朋友不至于被临时牵着走。