第十四章 极值处理:切掉还是保留
最近翻看前几期攒下的加拿大数据,发现一个绕不开的细节:那些明显偏离常态的数值,到底该不该留在样本里。这事看起来小,真动手整理时却特别磨人。比如某一期加拿大28的开奖记录里,总和值是5,而前后二十期大多落在40到60之间。这个5像一根刺扎在序列里,切掉吧,觉得可惜,保留吧,又怕后面做加拿大28预测时被它带偏。我起初是两种都试,把两套结果并排放着看,时间久了才摸出一点自己的习惯。
先说切掉的理由。加拿大28这种玩法,每期从二十八个号码里取三个,理论上极值出现的概率本来就低,但低不等于不会来。我手头有一份跨度半年的PC28开奖记录,总共一百八十多期,总和值低于20的只有四期,高于80的也只有三期。如果目标只是看PC28走势的中间段,把这七个点剔掉,折线图立刻顺眼很多。整理时我会先在表格里给它们打上标记,不是直接删,而是单独存一列,方便回头核对。这样处理的好处是,计算移动平均或者看相邻期差值时,不会被一两个尖峰拽得忽上忽下,观察节奏更稳。
但保留也有保留的道理。那些极端值本身就是加拿大数据的一部分,它们记录了系统真实发生过的状态。有一回我把连续三十期的加拿大28按顺序排开,发现一个低值后面隔了两期又冒出一个低值,如果当初一刀切掉,这种成对出现的苗头就看不见了。后来我在整理加拿大数据时改用分层:主表保留全部开奖记录,另建一张表只放主体区间,两张表对照着看。做PC28走势的时候用主体表,做分布检验的时候用全表。这样既不会因为极值干扰日常观察,也不至于把真实发生过的信息丢掉。
具体到操作,我现在习惯分三步走。第一步,拿到一段PC28开奖记录,先算中位数和四分位距,用这两个数画一个大致范围。第二步,把落在范围外的点标出来,逐个看它的上下文,是孤立一个还是连着来。第三步,决定去留:孤立且与前后差异过大的,我在整理时放进备注栏;连着出现的,反而留在主表,因为它们可能提示某种阶段性的偏移。举个例子,有一组加拿大28数据里连续三期总和值都在25附近,单独看每期都算低,但连在一起就构成一个小段落,这时候切掉反而丢失了信息。
这里有个容易踩的坑,就是拿切完的数据去做加拿大28预测。我早期干过这事,把极值一删,算出来的均值比实际偏高,后来对着新一期的开奖数据一比,偏得离谱。从那以后我给自己立了个规矩:凡是要做加拿大28预测的,必须用完整序列,极值可以标注、可以单独讨论,但不能在源头抹掉。PC28走势图也一样,如果只画主体区间,图上看着干净,可一旦遇到连续极端值,走势的转折点就被藏起来了。整理的目的不是让图好看,是让自己对加拿大数据的脾气有更准的感觉。
所以切掉还是保留,我的答案偏向保留,但保留不等于混在一起用。把极端值当成一类特殊记录,单独归置,需要看整体分布时放回去,需要看日常波动时拿出来。这样处理加拿大数据,既尊重了开奖记录本身的完整,也让后续的整理有层次。加拿大28的序列里,极值出现的次数少,可每一次都在提醒我,规律之外还有例外,而例外本身也是规律的一部分。PC28开奖记录看得越多,越觉得该留的留、该标的标,比简单切掉更经得起回头翻看。