华南理工大学学报(自然科学版)

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:44-1251/T

国际刊号:1000-565X

华南理工大学学报(自然科学版)杂志2026年第1期:一种基于时域全面注意力机制的单通道语音分离模型

发布日期:

作者:杨俊美, 张邦成, 杨璐, 曾徳炉

单位:华南理工大学 电子与信息学院,广东 广州 510640

关键词:深度学习,语音分离,Transformer模块,Conformer结构,全面注意力

基金:广东省自然科学基金项目(2023A1515011281)

单通道语音分离旨在从单一麦克风采集的混合语音中分离出目标说话人的纯净语音,在智能家居、会议系统和助听设备等场景具有重要应用价值。随着深度学习技术的快速发展,基于自注意力网络的单通道语音分离技术取得显著进展。尽管自注意力网络在捕捉长序列上下文信息方面表现优异,但其对实际语音场景中时间/频谱连续性、频谱结构和音色等细节特征的捕捉仍存在局限。此外,现有基于单一注意力范式的分离架构难以实现多尺度特征的有效融合。该文提出了一种时域全面注意力网络(TCANet)模型,通过局部与全局注意力模块的协同设计,针对性地解决单通道语音分离中的上述问题。局部建模采用S&C-SENet增强的Conformer结构,以精细提取语音频谱结构、音色等短时特征;全局建模则构建含相对位置嵌入的改进型Transformer模块,显式学习语音长时依赖关系;同时,TCANet通过维度变换机制实现局部块内特征与全局块间关联的跨尺度融合。在基准数据集LRS2-2Mix、Libri2Mix和EchoSet上的实验结果表明,该方法在尺度不变信噪比改善(SI-SNRi)和信号失真比改善(SDRi)指标上均优于现有端到端语音分离方法。

来源:2026年第1期

《华南理工大学学报(自然科学版)》期刊编辑部

查看华南理工大学学报(自然科学版)杂志2026年第1期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:广州五山 华南理工大学17号楼
  • 电话:020-87111794
  • E-mail:journal@scut.edu.cn

咨询工作人员