Page 58 - 南京医科大学自然版
P. 58
第46卷第4期
·526 · 南 京 医 科 大 学 学 报 2026年4月
100 比(表2)。挑选准确度在90%以上的模型作为集成
90
80 学习的基模型,以保证基模型输入质量,避免集成
70
Accuracy 60 模型性能受限。
50
根据数据筛选,移除性能较差的 SqueezeNet、
40
30
20 GoogleNet、VGG19、Darknet19 网 络 ,选 择 Incep⁃
10 10 20
0 tionV3、 DenseNet201、 MobileNetV2、 ResNet18、
0 500 1 000 1 500 2 000 2 500
Iteration ResNet50、ResNet101、Xception、InceptionResNetV2、
2.5
2 ShuffleNet、 NASNetMobile、 Darknet53、 Efficient⁃
Ioss 1.5 1 NetB0、VGG16 共 13 个网络作为基模型进行集成学
0.5 10 20 习。进行集成学习时,通过投票法和堆叠法进行集
0
0 500 1 000 1 500 2 000 2 500 成,堆叠法元模型选用随机森林,投票法选用硬投
Iteration
票进行集成。
硬投票法是集成学习中一种简单的分类决策
Optimize
方法,本研究的实现步骤如下:首先,调用筛选后的
各个单一分级模型作为基分类器,令每个基分类器
100
90 对测试集数据进行独立预测,并输出类别标签。然
80
70 后,对于每个待预测的样本,统计所有基分类器的
Accuracy 60 预测结果,选择得票最多的类别作为最终的预测结
50
40
30 果。如果出现票数相同的情况,会随机选择其中一
20
10 1 2 3 4 5 个类别。
0
0 200 400 600 800 1 000 1 200 1 400
Iteration 集成学习中的堆叠法是一种通过组合多个基
0.7 模型的预测结果来训练一个元模型的方法。本研
0.6
0.5 究的实现步骤如下:首先,调用筛选后的各个单一
Ioss 0.4
0.3
0.2 分级模型作为基模型,令基模型对验证基数据进行
0.1 1 2
0
0 200 400 600 800 1 000 1 200 1 400 预测,并生成预测概率向量。将所得的各个模型的
Iteration
概率向量水平拼接,作为新的特征,组合成一个新
图5 Xception优化前后准确率曲线与损失曲线
的训练数据集。接下来,使用随机森林作为元模
Figure 5 Accuracy and loss curves of Xception before and
after optimization 型,用这些新的特征进行训练,学习如何结合基模型
的预测结果以最大化整体性能。最后,使用训练好的
1.0 元模型对测试集数据进行预测,生成最终的预测结
0.9
果。两种方式与平均单模型的性能对比见表3。
0.8
经过训练与测试,发现集成学习方法对于单模
0.7
型来说有显著提升,硬投票法和随机森林的集成模
0.6
Sensitivity 0.5 型相对于平均基模型,准确度提升 2.42%和 3.10%、
平均灵敏度提升 2.51%和 3.30%、平均特异度提升
0.4
0.3 0.80% 和 1.03% 、平 均 F1 分 数 提 升 2.52% 和
0.2 3.26%。随机森林为代表的堆叠法相对于以硬投
CNN model(AUC=0.998)
0.1 票法为代表的投票法有较大的提升。以随机森
Random guess
0
0 0.2 0.4 0.6 0.8 1.0 林的集成模型作为最终胃癌分级模型,其准确率
1-specificity
为 95.06%、灵敏度为 94.77%、特异度为 98.36%、F1
图6 分类模型ROC曲线
分数为 94.82%。绘制多分类 ROC 曲线(图 7),良
Figure 6 ROC curve of the classification model
性AUC=0.999(95% CI:0.999~0.999),管状低分化腺
便在已成熟的模型中筛选出所需的基模型,在集成 癌 AUC=0.981(95% CI:0.979~0.983),管状中分化腺
学习时进行快速调用。测试各个模型,完成性能对 癌 AUC=0.990(95% CI:0.988~0.991,管状高分化腺

