Page 58 - 南京医科大学自然版
P. 58

第46卷第4期
               ·526 ·                            南 京    医 科 大 学 学         报                        2026年4月


                100                                             比(表2)。挑选准确度在90%以上的模型作为集成
                 90
                 80                                             学习的基模型,以保证基模型输入质量,避免集成
                 70
               Accuracy  60                                     模型性能受限。
                 50
                                                                     根据数据筛选,移除性能较差的 SqueezeNet、
                 40
                 30
                 20                                             GoogleNet、VGG19、Darknet19 网 络 ,选 择 Incep⁃
                 10                  10                  20
                  0                                             tionV3、 DenseNet201、 MobileNetV2、 ResNet18、
                   0     500   1 000  1 500  2 000  2 500
                                     Iteration                  ResNet50、ResNet101、Xception、InceptionResNetV2、
                 2.5
                  2                                             ShuffleNet、 NASNetMobile、 Darknet53、 Efficient⁃
                Ioss  1.5 1                                     NetB0、VGG16 共 13 个网络作为基模型进行集成学
                 0.5                 10                  20     习。进行集成学习时,通过投票法和堆叠法进行集
                  0
                   0     500   1 000  1 500  2 000  2 500       成,堆叠法元模型选用随机森林,投票法选用硬投
                                     Iteration
                                                                票进行集成。
                                                                     硬投票法是集成学习中一种简单的分类决策
                                   Optimize
                                                                方法,本研究的实现步骤如下:首先,调用筛选后的
                                                                各个单一分级模型作为基分类器,令每个基分类器
                 100
                 90                                             对测试集数据进行独立预测,并输出类别标签。然
                 80
                 70                                             后,对于每个待预测的样本,统计所有基分类器的
                Accuracy  60                                    预测结果,选择得票最多的类别作为最终的预测结
                 50
                 40
                 30                                             果。如果出现票数相同的情况,会随机选择其中一
                 20
                 10  1      2       3       4       5           个类别。
                  0
                   0   200   400  600   800  1 000  1 200  1 400
                                    Iteration                        集成学习中的堆叠法是一种通过组合多个基
                 0.7                                            模型的预测结果来训练一个元模型的方法。本研
                 0.6
                 0.5                                            究的实现步骤如下:首先,调用筛选后的各个单一
                Ioss  0.4
                 0.3
                 0.2                                            分级模型作为基模型,令基模型对验证基数据进行
                 0.1 1      2
                  0
                   0   200   400  600   800  1 000  1 200  1 400  预测,并生成预测概率向量。将所得的各个模型的
                                    Iteration
                                                                概率向量水平拼接,作为新的特征,组合成一个新
                  图5 Xception优化前后准确率曲线与损失曲线
                                                                的训练数据集。接下来,使用随机森林作为元模
              Figure 5  Accuracy and loss curves of Xception before and
                      after optimization                        型,用这些新的特征进行训练,学习如何结合基模型
                                                                的预测结果以最大化整体性能。最后,使用训练好的
                       1.0                                      元模型对测试集数据进行预测,生成最终的预测结
                       0.9
                                                                果。两种方式与平均单模型的性能对比见表3。
                       0.8
                                                                     经过训练与测试,发现集成学习方法对于单模
                       0.7
                                                                型来说有显著提升,硬投票法和随机森林的集成模
                       0.6
                      Sensitivity  0.5                          型相对于平均基模型,准确度提升 2.42%和 3.10%、
                                                                平均灵敏度提升 2.51%和 3.30%、平均特异度提升
                       0.4
                       0.3                                      0.80% 和 1.03% 、平 均 F1 分 数 提 升 2.52% 和
                       0.2                                      3.26%。随机森林为代表的堆叠法相对于以硬投
                                   CNN model(AUC=0.998)
                       0.1                                      票法为代表的投票法有较大的提升。以随机森
                                   Random guess
                        0
                         0    0.2   0.4  0.6   0.8  1.0         林的集成模型作为最终胃癌分级模型,其准确率
                                   1-specificity
                                                                为 95.06%、灵敏度为 94.77%、特异度为 98.36%、F1
                           图6 分类模型ROC曲线
                                                                分数为 94.82%。绘制多分类 ROC 曲线(图 7),良
                   Figure 6 ROC curve of the classification model
                                                                性AUC=0.999(95% CI:0.999~0.999),管状低分化腺
              便在已成熟的模型中筛选出所需的基模型,在集成                            癌 AUC=0.981(95% CI:0.979~0.983),管状中分化腺
              学习时进行快速调用。测试各个模型,完成性能对                            癌 AUC=0.990(95% CI:0.988~0.991,管状高分化腺
   53   54   55   56   57   58   59   60   61   62   63