Page 141 - 南京医科大学自然版
P. 141

第44卷第10期         丁 勇,张蓓蓓,吴       静. 基于配对检验的ARIMA模型在我国甲肝发病数预测中的应用[J].
                 2024年10月                    南京医科大学学报(自然科学版),2024,44(10):1456-1461                      ·1457 ·


                    甲型病毒性肝炎(简称甲肝)是由甲肝病毒                           移动平均阶数,Q为季节移动平均阶数。
               (hepatitis A virus,HAV)引起的,以肝脏损伤为特征                    对我国 2004 年 1 月—2021 年 12 月的甲肝月发
                的急性传染病,因摄入受到污染的食物、水或直接                            病数建立 ARIMA 时间序列模型,并应用该模型对
                接触感染者而致病,粪⁃口途径为甲肝的主要传播方                           2022年1—8月的发病数进行预测。
                                                   [2]
                式 。全球范围内甲肝发病呈散发趋势 ,2017年,                         1.2.2  预测能力检验
                 [1]
                全球新增病例 1.7 亿例。我国是甲肝的中⁃高流行                             一个优良的时间序列模型应具有较好的预测
                区,1988 年的上海甲肝大暴发,疫情造成罹患人数                         能力,本研究提出用配对检验的方法 对模型的预
                                                                                                   [5]
                达31万之多,带来了极大的社会恐慌和资产损失 。                          测能力进行统计检验。
                                                           [3]
                因此,探索甲肝发病流行特征,建立一个高精度的                                当同一个月发病数的模型预测值与实际值的
                预测模型,提出有效的模型预测评估方法,对我国                            差值服从正态分布时,使用配对 t 检验检验模型的
                甲肝传染病防控具有重要意义。                                    预测能力;当差值不服从正态分布时,使用配对样

                    目前,求和自回归移动平均(autoregressive inte⁃             本非参数检验的 Wilcoxon 符号秩检验进行预测能
                grated moving average,ARIMA)模型在传染病建模与             力检验。对给定的显著性水平(α=0.05),当接受
                预测研究中得到广泛应用。模型的拟合效果常采                             原假设时,认为模型的预测结果与实际结果无显
                             2
                用拟合优度 R 、正态化贝叶斯信息准则(Bayesian                      著性差异,模型具有预测能力,有实际应用价值;
                information criterion,BIC)、模型参数检验等相关指             否则模型的预测能力较差,没有实际应用价值。
                标和方法进行评价;预测效果一般采用误差分析进
                                                                  2 结    果
                行判断,例如绝对误差、相对误差等,用以确定预测
                值与实际值的差异,但这种预测效果判断缺乏客                             2.1 流行特征分析
                观、统一的评价标准,在一定程度上影响了 ARIMA                             我国 2004 年 1 月—2021 年 12 月的甲肝发病人
                预测模型的应用价值。本研究以我国的甲肝发病                             数时间序列如图 1 所示,我国甲肝的发病人数整体
                数为例,提出了将配对检验应用于ARIMA模型预测                          呈现下降趋势,由此可见,近年来我国甲肝的防治
                效果评价的方法,旨在解决时间序列模型预测效果                            工作卓有成效。甲肝发病具有季节性周期特征(周
                的评价问题,为完善时间序列模型的应用提供新思                            期 s=12 个月),通过时间序列的季节性分解 ,发病
                                                                                                         [6]
                路和方法。                                             数季节因子如图2所示,季节因子 < 0表示季节水平
                                                                  低于平均值,季节因子 > 0 表示高于平均值。通过
                1   资料和方法
                                                                  季节因子可知我国甲肝发病的流行特性周期性特
                1.1 资料                                            征为:1—2 月发病人数较少,其中 2 月发病人数最
                    甲肝的月发病数资料来源于中国疾病预防控制                          少;7—9月发病人数较多,是防控工作的重点,其中
                局 网 站(http://www.nhc.gov.cn/jkj/)2004 年 1 月 —     8 月发病人数最多,这可能与夏天气温高、雨水多,
                2022年8月的全国法定传染病疫情报告。                              暑期放假人员流动量大,病毒易于扩散有关。
                1.2 方法                                            2.2  建立预测模型
                    本文使用统计分析软件 SPSS27.0 进行数据整                         季节 ARIMA 模型建模要求时间序列是平稳
                理和分析。                                             的,而图1表明甲肝数据序列不平稳,通过对发病原
                1.2.1  模型建立                                       始时间序列进行自然对数转化和一阶差分(d=1)、
                    ARIMA模型是基于时间序列数据自身的特性,                        一阶季节差分(D=1)的变换,时间序列达到平稳
                通过对数据的自回归、移动平均和差分等变换,来                           (图 3),序列平稳性的扩展的迪基⁃富勒(augmented
                建立描述数据特征的预测模型,并应用该模型预测                            Dickey⁃Fuller,ADF)检验 显著性P < 0.01。
                                                                                       [7]
                                          [4]
                未来短期内的数据变化规律 。季节 ARIMA 模型                             根据甲肝发病时间序列的周期 s=12 及平稳化
                适用于由于季节性变化(包括季度、月度等)或其他                           差分处理(d=1,D=1),模型初定为 ARIMA(p,1,q)
                一些因素引起的周期性变化的时间序列。季节                             (P,1,Q) 12。由平稳化处理后序列的自相关、偏自相
                ARIMA 模型可表示为 ARIMA(p,d,q)(P,D,Q) s,其              关图的截尾情况,选取 p=1 和 q=1;根据已有研究成
                中 s 为季节的周期长度,d 为差分阶数,D 为季节差                       果可知   [8-9] ,P、Q 取值超过 2 阶的情形一般比较少
                分阶数,p 为自回归阶数,P 为季节自回归阶数,q 为                       见,本研究分别取 P、Q 为 0、1、2 进行计算,从而有
   136   137   138   139   140   141   142   143   144   145   146