Page 140 - 南京医科大学自然版
P. 140
第45卷第4期
·576 · 南 京 医 科 大 学 学 报 2025年4月
[14]
说,患者中焦虑症状有普遍性,为 40%~84% 。焦 括语速、基频和发声次数的显著异常(综合异常率
[27,29]
虑症状的语音特征异常与情绪激越状态密切相关, 83.5%) 。这些患者往往伴随语言能力的极大受
具体表现为语速加快、基频变化范围扩大以及语音 限或完全丧失。语音分析技术应用的重点在于定
节奏的不规则 [15-16] 。Weed 等 [17] 通过分析 26 例 ASD 量化评估语言能力的残余特征,为进一步的神经发育
患者的自然语音样本发现,合并焦虑的患者在语速 研究提供辅助信息,并与其他诊断工具互为补充。
和基频上的异常显著区别于单纯ASD患者,语音识 Patel等 [30] 研究指出,语音特征的层级变化不仅
别的区分准确率达 76.6%。这些研究表明,语音识 反映了患者语言能力的外在差异,还揭示了不同严
别技术能够提供客观的量化依据,有效辅助焦虑共 重程度 ASD 患者的神经网络损伤模式。轻度患者
病的诊断。 主要涉及基底神经节的轻微功能障碍,而重度患者
抑郁共病患者的语音特征则呈现截然不同的 则表现为广泛的语言生成和感知机制损伤。基于
模式,具体表现为语速减慢、基频降低以及停顿时 这些发现,语音特征分析技术为不同严重程度患者
长显著增加。这些特征与患者情绪低落和语言表 的精准诊断提供了科学依据,可进一步结合神经影
达迟缓的临床表现高度吻合 [18-20] 。Cohen 等 [21] 的研 像学数据,完善辅助诊断框架。
究进一步指出,基频稳定性和语音间歇是区分ASD 1.4 语音与多模态融合辅助诊断
是否共患抑郁的重要参数。 随着ASD研究的深入,单一模态的辅助诊断方
对于 ADHD 共病患者,其语音特征主要表现为 法已无法满足对疾病复杂多维特征的解析需求。
语速和节奏的显著波动、音强起伏大以及语音连贯 语音特征作为ASD患者语言、情绪及社交能力的重
性不足 [22] 。此外,Dixit等 [23] 利用Praat软件提取基频 要表征,与其他模态(如脑影像、生理信号和行为数
(F0),发现单纯ASD患者的F0的平均标准差显著高 据)的融合,不仅提升了诊断的全面性与精准性,还
于共患ADHD 组,且单纯ASD患者更倾向于高频发 揭示了ASD潜在的病理机制。
音和快速发音节奏,从而导致言语中更多停顿 [17] 。 1.4.1 语音与脑影像的融合
这些特征为区分单纯 ASD 与共患 ADHD 的状态提 ASD 患者的语音异常(如基频不稳定、语速较
供了重要的辅助诊断参考。 慢及音强波动)常反映语言调控的神经功能障碍,
1.3 疾病严重程度辅助诊断 而 这 类 障 碍 与 脑 功 能 网 络 的 改 变 密 切 相 关 。
ASD 患者的症状严重程度从轻度语言发育迟 Bhaumik 等 [31] 结合了来自多中心的数据,使用功能
缓到重度语言功能完全缺失不等,表现出显著的异 磁共振成像(functional magnetic resonance imaging,
质性 [24-25] 。语音识别技术通过量化不同严重程度患 fMRI)和机器学习方法,构建了诊断 ASD 的多模态
者的语音模式,为精准诊断和分层管理提供了量化 模型。结果显示,前额叶皮层和听觉皮层的功能连
依据。研究表明,语音特征分析技术能够捕捉不同 接显著中断,与语言障碍的严重程度相关。同时,
严重程度ASD患者的层级化语音特征,这种分层能 Kazeminejad等 [32] 通过分析表明,结合多模态数据的
力直接体现在语音参数的差异中 。 诊断模型可以在不同年龄组中准确分类 ASD 个体
[26]
轻度患者的语音异常较为轻微,主要表现为基 (最高准确率达 95%)。此外,Lombardo 等 [33] 发现,
频变异性增加(异常率 41.7%),语音调控的波动性 fMRI显示,ASD患者语言相关脑区(如颞上回)的激
较小,但仍在正常范围之外 [27] 。这一阶段,语音识 活模式显著影响其语言功能。多模态模型在预测
别技术可以通过捕捉这些细微变化,为精准诊断提 语 言 障 碍 严 重 程 度 时 表 现 出 更 高 的 准 确 率
供重要信息,支持疾病分层评估。 (86.3%),显著优于单一模态数据(72.4%)。
中度患者的语音特征异常逐步扩大,除基频变 1.4.2 语音与生理信号的融合
异外,还包括语速减慢和零交叉率异常(异常率分 语音特征和生理信号中均有ASD特征体现,这
[27-28]
别为65.2%和60.4%) 。语音分析技术能够通过 为多模态融合提供了新的诊断手段。Mohanta 等 [34]
综合测量这些声学参数,客观评估患者的语言节律 通过语音特征(如基频和信号能量)区分 ASD 和正
和表达能力下降的程度。该技术为不同严重程度 常儿童,分类准确率高达 97.1%。同时,Sarabadani
患者的症状量化提供了数据支持,从而提升诊断的 等 [35] 利用皮肤电活动和心率变异性等生理信号,准
全面性与精确度。 确区分正负情绪状态,准确率超过80%。此外,Ochi
重度患者的语音特征异常则覆盖多个维度,包 等 [36] 研究发现,语音特征的变化(如语速和音量)与

