Page 141 - 南京医科大学自然版
P. 141
第46卷第7期 黄润楸,徐飞佳,刘育宏,等. 从结构化分级到智能分级:人工智能与ACR⁃RADS融合的研究进展[J].
2026年7月 南京医科大学学报(自然科学版),2026,46(7):1083-1091 ·1087 ·
98%,并提示,其作为第二读者应用时,可在保持可 确率达 96.87%;在良恶性预测任务中,其 AUC 为
接受特异度的前提下,改善结节检出表现与流程一 0.82(95% CI:0.79~0.85),总体准确率 80.63%,灵敏
致性。从方法流程上看,该类系统通常先对全肺区 度 90.56%,特异度 73.51% [58] 。这些结果提示,在输
域进行自动定位与候选区域生成,随后通过逐级筛 入要素明确、语义范围受控的条件下,基于 Trans⁃
选与假阳性抑制,输出需关注的结节提示列表,由 former 的语言模型可获得稳定且可量化的性能表
医师在此基础上完成最终确认与随访分层。与上 现。然而,在更贴近真实世界的跨语言、多中心验
述分级增强不同,Lung⁃RADS 场景中的核心作用在 证研究中,直接基于乳腺影像自由文本报告进行
于前端检出与分流筛查,即通过降低漏检率来稳定 BI⁃RADS赋值时,GPT⁃4 与人类专家之间的一致性
随访入口,而非直接参与病灶分级本身 [55] 。对于 仅为中等水平(Gwet AC1=0.52)。其中,18.1%的分
Bone⁃RADS 所涉及的偶发骨病灶评估,目前相关证 级差异可能引发临床管理路径改变,另有 10.6%可
[4]
据主要来源于骨转移检出等任务的 AI 研究与系统 能对管理决策产生不利影响 。上述结果提示,在缺
综述,其结果提示AI可能在一定程度上提升检出效 乏明确结构化输入与外部规则约束的条件下,Trans⁃
率与读者表现,但不同模态与任务间性能异质性较 former的语义推断不确定性仍可能在分级与管理层
大,仍需更多多中心外部验证,并与分级框架进行 面被放大。相比之下,Transformer 在 RADS 相关流
[56]
严格对齐 。 程中的辅助性环节,尤其是在报告质量控制与差错
综合现有证据可见,在多个代表性 RADS 应用 拦截方面,显示出更具可行性的安全性与效率优
场景中,AI 在特定任务上已展现出稳定且良好的 势。一项影像报告差错检测研究显示,基于 Trans⁃
AUC表现,并在灵敏度、特异度、阅片一致性或流程 former 的 GPT⁃4 对人为植入错误的检出率为 82.7%
效率等方面带来可检测的改进。这表明,AI 与 (124/150),与不同资历放射科医师的平均水平相
RADS的融合正由概念验证阶段迈入具有实证基础 当;其单份报告处理时间为(3.5±0.5)s,显著快于最
的早期应用阶段,为进一步系统评估其泛化能力、 快人类读者的(25.1±20.1)s,且单份报告纠错成本约
可解释性及监管路径奠定了基础。 为0.03美元,明显低于成本效率最高的放射科医师
(约 0.42 美元) 。此类任务侧重语义一致性与逻
[59]
4 LLM在RADS体系中的方法学角色与应用边界
辑完整性的校验,与Transformer 在全局语义建模与
RADS体系的关键并不止于影像要素提取,而在 模式识别方面的优势高度契合。因此,从近期应用
于如何将这些发现转化为符合规范的语义表述并对 角度看,Transformer 驱动的 RADS 更适合作为结构
接分级规则。既往“影像发现⁃报告文本⁃RADS 分级” 化信息抽取、分级一致性校正及差错控制模块嵌入
之间缺乏可计算的语义接口。基于Transformer架构 既有工作流程,在不改变分级框架的前提下提升报
的 LLM 通过自注意力机制实现对长文本语境的整 告的可重复性与执行一致性。中长期发展应侧重
体建模,可将非结构化影像描述解析为标准化判读 于将Transformer 与指南版本、机构本地流程及可追
要素,并在既有RADS框架内完成分级推理,更符合 溯证据体系进行系统对齐,通过指南检索增强、字
RADS对综合征象判读的设计逻辑。相较传统规则 段级校验及分级过程的可审计化设计,将潜在的一
方法或浅层自然语言处理模型,Transformer 在复杂 致性不足与管理漂移风险转化为可监管、可验证且
语义建模方面具有明显优势,为影像报告的结构化 可持续迭代的临床级工具。
表达与分级推理提供了可靠支撑 [17-18,57] 。
5 RADS 体系的演进原则、证据边界与 AI 的辅助
在此基础上,Transformer 与 RADS 的结合可理
作用
解为一种“语义处理与规则约束相结合”的工作方
式:模型将非结构化影像文本转化为可计算的语义 在当前由 ACR 推动并持续维护的体系中,
表示,而RADS提供明确的分级与管理框架,对模型 RADS 主要覆盖若干高频临床领域,其核心目标在
输出进行规范化限定,使 Transformer 以语义层“计 于通过标准化术语、结构化报告与分级评估,提升
算工具”的形式服务于既有体系,而非替代专家判 医患及跨学科沟通的一致性,并将影像结论与后续
断。现有研究显示,该模式具有应用前景明确且风 管理决策有效衔接。但不同体系及具体条目之间
险边界相对清晰的特征。例如,在基于结构化输入 的证据层级与稳定性仍存在差异,难以将其简单概
的乳腺超声研究中,ChatGPT⁃4 的 BI⁃RADS 分级准 括为“均已被充分证实” 。从这一角度看,尚未
[20-30]

