Page 141 - 南京医科大学自然版
P. 141

第45卷第4期            李进宇,赵太宏. 语音识别技术在孤独症谱系障碍诊断中的研究进展与应用展望[J].
                  2025年4月                    南京医科大学学报(自然科学版),2025,45(4):574-579,587                     ·577 ·


                ASD 患者的互动同步性密切相关。多模态模型在                           床场景中的应用还面临伦理和隐私保护问题,特
                诊断焦虑和抑郁共病时的AUC达到0.91,显著优于                         别是在语音数据的采集、存储与分析过程中,如何
                单一模态(语音:0.78;生理信号:0.83)。这些研究                      确保患者数据的安全性和隐私性,是技术推广中
                表明,语音和生理信号的融合分析不仅提升了情绪                            需要解决的重要难题。因此,要实现语音识别技
                障碍的诊断效能,还为理解ASD患者的情绪反应机                           术在 ASD 诊断中的广泛应用,亟需针对上述挑战
                制提供了新视角。                                          展开深入研究,以推动这一技术从实验室到临床
                1.4.3 语音与行为数据的融合                                  实践的转化。
                    ASD 患者的社交互动能力异常复杂,传统行为                        2.2  应用前景
                观察方法依赖主观判断,难以全面捕捉微妙特征。                                尽管面临上述挑战,语音识别技术在ASD诊断
                语音特征通过量化语言参数(如语速、停顿时间),                           中的应用前景依旧广阔。随着对前语言期和学龄
                为自动化评估提供了客观基础。Drimalla 等               [37] 通过    前期儿童发声特征的深入分析,语音识别系统有望
                模拟对话任务分析面部表情、注视行为和语音特                             实现更早期和更精准的ASD筛查,从而在关键干预
                征,表明这些多模态特征在检测 ASD 社交障碍时                          窗口期内提供及时支持。此外,针对ASD患者常见
                具有 73%的分类准确率。Zhao 等           [38] 结合语音特征         的情绪共病问题,如焦虑、抑郁和 ADHD,语音识别
               (如语速、音调)与注视行为数据,发现多模态模型                            技术的发展将推动多维度情绪识别模型的构建,助
                能够以 92.31%的准确率区分 ASD 儿童与典型发育                      力临床医生制定更个性化的治疗方案。在疾病严
                儿童,显著优于单一行为观察的诊断效能。进一                             重程度的评估方面,细化的语音特征分析将支持精
                步研究发现,语音停顿时间与行为指标(如目光接                            准分层管理。同时,多模态融合技术的进步,使语
                触频率)的相关性显著(r=0.65,P < 0.001),支持语                  音数据能够与脑影像、生理信号及行为数据有效整
                音与行为特征联合分析的科学价值。这些成果表                             合,提升诊断的全面性和准确性。未来研究需重点
                明,多模态融合不仅提升了对 ASD 社交能力的评                          解决数据整合和标准化的问题,并通过跨学科合
                估效能,还为探索其社交障碍的复杂机制提供了                             作,结合计算机科学、神经科学和心理学的优势,开
                重要工具。                                             发更先进的诊断工具。基于上述发展趋势,语音识
                                                                  别技术的闭环框架正逐步形成,涵盖语音采集、特
                2  应用挑战与前景
                                                                  征分析、模型构建、临床诊断及诊断支持5大核心环
                2.1  应用挑战                                         节(图1)。这一框架不仅展示了该技术在ASD诊断
                    尽管语音识别技术在 ASD 辅助诊断中展现出                        全流程应用中的潜力,也为未来研究和实践提供了
                显著潜力,但其应用仍面临诸多挑战。首先,语音                            系统化路径。特别是在基层医疗机构和偏远地区,
                识别技术的有效性依赖于高质量的数据支持,而现                            语音识别技术的便捷性和低成本特性将显著提升
                有研究中针对 ASD 患者语音特征的样本规模普遍                          ASD 诊断的可及性和公平性。总体而言,随着技术
                较小,尤其是在不同文化背景、语言环境及方言差                            的不断优化和多领域协作的深化,语音识别技术将
                异等方面的数据尚不充分,限制了模型的泛化能力                            在 ASD 的早期诊断、共病识别、症状评估及个性化
                和普适性。其次,语音识别技术的准确性和鲁棒性                            干预等方面发挥关键作用,最终提升ASD患者的生
                仍需进一步优化。例如,不同年龄段患者的语音特                            活质量和社会适应能力。
                征差异显著,如何在前语言期和学龄前期中建立统                                利益冲突声明:
                一而精确的诊断标准,是一个尚未完全解决的问                                 所有作者声明无利益冲突。
                题。此外,共病情绪问题如焦虑、抑郁及 ADHD 可                             Conflict of Interests:
                能对语音特征产生复杂影响,使得特征提取和识                                 The authors declare no conflict of interests.
                                                                      作者贡献声明:
                别更加困难。与此同时,尽管多模态融合技术虽
                                                                      李进宇负责文献阅读、整理和撰写。赵太宏负责方向选
                已初显成效,但其在实际应用中存在实现成本高、
                                                                  定、审阅和修改。
                技术门槛高以及跨模态数据集成难度大的问题。
                                                                      Author’s Contributions:
                尤其是在基层医疗机构和资源有限的地区,语音
                                                                      LI Jinyu was responsible for literature reading,organiza⁃
                识别技术与其他模态(如脑影像或生理信号)的整                            tion,and writing. ZHAO Taihong was responsible for selecting
                合应用尚存障碍。并且,语音识别技术在实际临                             the research direction,reviewing,and revising.
   136   137   138   139   140   141   142   143   144   145   146