Page 141 - 南京医科大学自然版
P. 141

第46卷第7期     黄润楸,徐飞佳,刘育宏,等. 从结构化分级到智能分级:人工智能与ACR⁃RADS融合的研究进展[J].
                  2026年7月                     南京医科大学学报(自然科学版),2026,46(7):1083-1091                      ·1087 ·


                98%,并提示,其作为第二读者应用时,可在保持可                          确率达 96.87%;在良恶性预测任务中,其 AUC 为
                接受特异度的前提下,改善结节检出表现与流程一                            0.82(95% CI:0.79~0.85),总体准确率 80.63%,灵敏
                致性。从方法流程上看,该类系统通常先对全肺区                            度 90.56%,特异度 73.51%    [58] 。这些结果提示,在输
                域进行自动定位与候选区域生成,随后通过逐级筛                            入要素明确、语义范围受控的条件下,基于 Trans⁃
                选与假阳性抑制,输出需关注的结节提示列表,由                            former 的语言模型可获得稳定且可量化的性能表
                医师在此基础上完成最终确认与随访分层。与上                             现。然而,在更贴近真实世界的跨语言、多中心验
                述分级增强不同,Lung⁃RADS 场景中的核心作用在                       证研究中,直接基于乳腺影像自由文本报告进行
                于前端检出与分流筛查,即通过降低漏检率来稳定                            BI⁃RADS赋值时,GPT⁃4 与人类专家之间的一致性
                随访入口,而非直接参与病灶分级本身                   [55] 。对于      仅为中等水平(Gwet AC1=0.52)。其中,18.1%的分
                Bone⁃RADS 所涉及的偶发骨病灶评估,目前相关证                       级差异可能引发临床管理路径改变,另有 10.6%可
                                                                                          [4]
                据主要来源于骨转移检出等任务的 AI 研究与系统                          能对管理决策产生不利影响 。上述结果提示,在缺
                综述,其结果提示AI可能在一定程度上提升检出效                           乏明确结构化输入与外部规则约束的条件下,Trans⁃
                率与读者表现,但不同模态与任务间性能异质性较                            former的语义推断不确定性仍可能在分级与管理层
                大,仍需更多多中心外部验证,并与分级框架进行                            面被放大。相比之下,Transformer 在 RADS 相关流
                        [56]
                严格对齐 。                                            程中的辅助性环节,尤其是在报告质量控制与差错
                    综合现有证据可见,在多个代表性 RADS 应用                       拦截方面,显示出更具可行性的安全性与效率优
                场景中,AI 在特定任务上已展现出稳定且良好的                           势。一项影像报告差错检测研究显示,基于 Trans⁃
                AUC表现,并在灵敏度、特异度、阅片一致性或流程                          former 的 GPT⁃4 对人为植入错误的检出率为 82.7%
                效率等方面带来可检测的改进。这表明,AI 与                           (124/150),与不同资历放射科医师的平均水平相
                RADS的融合正由概念验证阶段迈入具有实证基础                           当;其单份报告处理时间为(3.5±0.5)s,显著快于最
                的早期应用阶段,为进一步系统评估其泛化能力、                            快人类读者的(25.1±20.1)s,且单份报告纠错成本约
                可解释性及监管路径奠定了基础。                                   为0.03美元,明显低于成本效率最高的放射科医师
                                                                 (约 0.42 美元) 。此类任务侧重语义一致性与逻
                                                                               [59]
                4  LLM在RADS体系中的方法学角色与应用边界
                                                                  辑完整性的校验,与Transformer 在全局语义建模与
                    RADS体系的关键并不止于影像要素提取,而在                        模式识别方面的优势高度契合。因此,从近期应用
                于如何将这些发现转化为符合规范的语义表述并对                            角度看,Transformer 驱动的 RADS 更适合作为结构
                接分级规则。既往“影像发现⁃报告文本⁃RADS 分级”                       化信息抽取、分级一致性校正及差错控制模块嵌入
                之间缺乏可计算的语义接口。基于Transformer架构                      既有工作流程,在不改变分级框架的前提下提升报
                的 LLM 通过自注意力机制实现对长文本语境的整                          告的可重复性与执行一致性。中长期发展应侧重
                体建模,可将非结构化影像描述解析为标准化判读                            于将Transformer 与指南版本、机构本地流程及可追
                要素,并在既有RADS框架内完成分级推理,更符合                          溯证据体系进行系统对齐,通过指南检索增强、字
                RADS对综合征象判读的设计逻辑。相较传统规则                           段级校验及分级过程的可审计化设计,将潜在的一
                方法或浅层自然语言处理模型,Transformer 在复杂                     致性不足与管理漂移风险转化为可监管、可验证且
                语义建模方面具有明显优势,为影像报告的结构化                            可持续迭代的临床级工具。
                表达与分级推理提供了可靠支撑               [17-18,57] 。
                                                                  5  RADS 体系的演进原则、证据边界与 AI 的辅助
                    在此基础上,Transformer 与 RADS 的结合可理
                                                                  作用
                解为一种“语义处理与规则约束相结合”的工作方
                式:模型将非结构化影像文本转化为可计算的语义                                在当前由 ACR 推动并持续维护的体系中,
                表示,而RADS提供明确的分级与管理框架,对模型                          RADS 主要覆盖若干高频临床领域,其核心目标在
                输出进行规范化限定,使 Transformer 以语义层“计                    于通过标准化术语、结构化报告与分级评估,提升
                算工具”的形式服务于既有体系,而非替代专家判                            医患及跨学科沟通的一致性,并将影像结论与后续
                断。现有研究显示,该模式具有应用前景明确且风                            管理决策有效衔接。但不同体系及具体条目之间
                险边界相对清晰的特征。例如,在基于结构化输入                            的证据层级与稳定性仍存在差异,难以将其简单概
                的乳腺超声研究中,ChatGPT⁃4 的 BI⁃RADS 分级准                  括为“均已被充分证实”               。从这一角度看,尚未
                                                                                       [20-30]
   136   137   138   139   140   141   142   143   144   145   146