Page 54 - 南京医科大学自然版
P. 54

第46卷第4期
               ·522 ·                            南 京    医 科 大 学 学         报                        2026年4月


              系统的开发提供理论支持与技术方案。                                 BN)和 3 种不同分化的腺癌,分为管状高分化腺癌
                                                               (tubular well differentiated adenocarcinoma,TW)、管
              1  材料和方法
                                                                状中分化腺癌(tubular moderately differentiated ade⁃
              1.1  材料                                           nocarcinoma,TM)、管状低分化腺癌(tubular poorly
              1.1.1 数据来源与处理                                     differentiated adenocarcinoma,TP),本 研 究 中 取 其
                  本研究基于公开网络收集胃癌病理图像数据,                          全 部 数 据 集 作 为 训 练 数 据 ,包 含 TP 17 995 张,
              选取华威大学计算机科学系组织图像分析中心创                             TW 13 068 张,TM 16 456 张,良性 18 777 张。划分
              建的,用于泛癌肿瘤检测的大型病理学图像数据库                            后癌分级训练集样本量n=46 405、验证集样本量n=
                            [11]
              HISTOPANTUM     ,提取其中的胃癌数据集部分用                    9 943、测试集样本量n=9 948。
              于胃癌与正常组织分类识别诊断模型训练;选取由                                 在真实场景应用模拟时,从 TCGA 中挑选无标

              韩国首尔的 Kangbuk 三星医院提供的 KBSMC_gas⁃                  注的WSI进行切割与输入,以模拟真实场景的直接
              tric_cancer_grading_dataset 等 [12] 数据集用于胃癌分       输入,检测模型能力。在挑选时,已确认所用 WSI
              级识别模型训练。HISTOPANTUM数据集的构建基                        与HISTOPANTUM中数据无重复。
              于对 4 种不同癌症类型(结直肠癌、子宫癌、卵巢癌                              为提高训练速度,增强模型稳定性,并提升泛
              和胃癌)的全面采样。研究团队从癌症基因组图谱                            化能力,为模型训练提供更稳定的输入,训练前将
             (The Cancer Genome Atlas,TCGA)项目中获取了每              图像处理为 224×224 像素,并进行像素归一化。对
              种癌症类型的 40 张全切片图像(whole slide image,               图像采用随机旋转、随机平移、随机缩放、随机剪切
              WSI),并确保样本涵盖多种肿瘤亚型、性别、种族和                         变换等数据增强,缓解过拟合,提升模型的泛化能
              中心,以增强数据集的多样性。随后,经验丰富的                            力、鲁棒性、性能和适应性,提高成本效益(图 1)。
              病理学家对这些切片中的肿瘤和非肿瘤区域进行                             研究使用 MATLAB 中的 Augmented Image Data Store
              了细致标注,从而提取出肿瘤和非肿瘤的图像块,                            方法进行数据增强,在训练过程中实时生成增强图
              形成了包含 281 142 个图像块的 HISTOPANTUM 数                 像。增强后数据集样本量不变。
              据集。每个图像块的分辨率为512×512像素。本研                         1.1.2 模型框架选择
              究中取胃癌图像作为训练数据,包含胃正常组织图                                 为探究不同种类网络在病理图像识别中的效
              像15 323张,胃癌图像13 527张。划分后癌与非癌分                     果,尽可能全面评估不同架构的性能,本研究选用
              类训练集样本量n=20 194、验证集样本量n=4 327、测                   SqueezeNet、GoogleNet、InceptionV3、DenseNet201、
              试 集 样 本 量 n=4 329;KBSMC_gastric_cancer_grad⁃      MobileNetV2、ResNet18、ResNet50、ResNet101、Xcep⁃
              ing_dataset涵盖了2016—2020年收集的98例胃癌患                 tion、Inception ⁃ ResNetV2、ShuffleNet、NASNet ⁃ mo⁃
              者的WSI。这些图像经过40倍放大后,使用Aperio数                      bile、Darknet⁃19、Darknet⁃53、EfficientNetB0、VGG16、
              字切片扫描仪进行扫描。随后,图像被分割成大小                            VGG19等17种CNN网络进行训练测试。通过多模
              为 512×512 像素的补丁图像,以适应深度学习模型                       型横向对比确定胃癌分类诊断的最优架构。
              的输入要求。两位资深病理学家 Kim Kyungeun 和                          这些网络都拥有各自的特点,通过初步训练
              Song Boram对图像进行了标注,区分了良性(benign,                  后,不仅可以筛选出针对本项目的最优网络,同时









                                                    Pixel            Data
                                                 normalization    augmentation







                                                     图1  图像数据增强示例
                                            Figure 1 Example of image data augmentation
   49   50   51   52   53   54   55   56   57   58   59