基于互信息特征解耦的情感一致性语音转换方法

August 1, 2024·
李渡渡
,
王少荣
,
甄怡宁
,
王春玲
· 4 min read
Type
Publication
第十九届全国人机语音通讯学术会议(NCMMSC 2024)
Status
Peer-reviewed
publications

主要贡献。 提出ECVC模型,通过vCLUB互信息最小化解耦内容、说话人、音高和情感四元特征,并引入情感一致性损失,实现情感保留的高质量语音转换

研究概述

现有基于VITS的语音转换模型仅解耦内容和说话人信息,忽略了音高和情感等非语言信息,导致转换语音情感泄漏。本文提出ECVC模型,采用vCLUB衡量并最小化风格/情感特征与其他特征间的互信息,实现内容、说话人身份、音高和情感四元特征的充分解耦。同时在联合训练的情感编码器中引入情感一致性损失,提高转换语音与源语音的情感相似度。

研究问题

基于VITS的语音转换模型(如FreeVC)的说话人编码器存在情感泄漏问题——目标说话人的情感信息会随说话人特征一起泄露给解码器,导致转换后语音情感特征歧义,无法保持源说话人的情感状态。

核心思路

通过vCLUB互信息最小化将内容、说话人、音高和情感四元特征相互解耦,消除特征间泄漏;在情感编码器中引入情感一致性损失(L1距离),惩罚源语音与转换语音情感特征差异,确保转换语音保留源说话人情感信息而非目标说话人情感。

关键组成

情感编码器 联合训练情感编码器与情感一致性损失
由预训练情感风格编码器、两个带Leaky ReLU的全连接层、额外全连接层及SoftMax层组成。情感一致性损失L_embed=||E_e(X_s)-E_e(X_t)||_1,惩罚源语音与转换语音情感特征差异。
vCLUB解耦 全局互信息最小化解耦
采用vCLUB作为互信息无偏估计,设计全局MI最小化方法,最小化内容/说话人/音高/情感四元特征两两之间的互信息,确保四者相互独立。
F0编码器 预训练F0编码器保持音高信息
引入预训练F0编码器提取音高特征Z_p=E_p(X),与内容特征Z_c、说话人特征Z_s、情感特征Z_e共同参与后验编码器编码,确保转换语音保留源语音的音高变化模式。
图1 FreeVC生成的说话人特征2D t-SNE图:说话人特征形成基于情感的不必要分组,存在情感泄漏
图1 FreeVC生成的说话人特征2D t-SNE图:说话人特征形成基于情感的不必要分组,存在情感泄漏

ECVC在FreeVC基础上改进:使用联合训练的情感编码器并引入情感一致性损失,同时使用互信息最小化解耦语音特征,还引入预训练F0编码器保持音高信息。说话人编码器和内容编码器遵循FreeVC,后验编码器、解码器和鉴别器遵循VITS。

图2 ECVC模型架构图:包含情感编码器、内容编码器、F0编码器、说话人编码器、后验编码器、解码器和鉴别器
图2 ECVC模型架构图:包含情感编码器、内容编码器、F0编码器、说话人编码器、后验编码器、解码器和鉴别器

情感编码器直接从语音中获取潜在情感特征,采用vCLUB互信息作为相关度量减少情感特征与其他特征依赖性。情感一致性损失在模型具备基本语音合成能力后引入,最小化源语音与转换语音情感特征的L1距离。

实验结果

Embedding MAE
29.5 x10^-2 (Angry)
vs FreeVC 90.3
情感保留提升67.4%
F0-PCC
0.865 Surprise
显著高于所有基线
音高相关性最优
SMOS
4.03±0.09 说话人相似度
优于FreeVC(3.80)
主观评测最优
N-MOS
4.25±0.09 自然度
优于所有基线
语音自然度最佳
MethodEmbedding MAE↓F0-PCC↑pMOS↑MCD↓
FreeVC90.30.8264.595.21
VQMIVC81.70.8032.596.98
Emo-StarGAN31.10.7763.864.75
ECVC (w/o SR)29.40.8234.323.94
ECVC27.10.8434.413.64

在ESD数据集上,ECVC在五种情感(Angry/Happy/Neutral/Sad/Surprise)的客观评测中Embedding MAE均显著优于FreeVC和Emo-StarGAN。F0-PCC在所有情感上均高于基线,验证了音高保留能力。主观评测中SMOS(4.03)、EMOS(4.05)和N-MOS(4.25)均为最优。消融实验表明情感一致性损失对情感保存贡献最大。

图3 5种不同情感下5位已知说话人特征的可视化:每种颜色代表不同说话人,表明ECVC获得了有效的说话人特征
图3 5种不同情感下5位已知说话人特征的可视化:每种颜色代表不同说话人,表明ECVC获得了有效的说话人特征
图4 4位已知说话人以5种不同情感说话时的情感特征可视化:不同情感被很好分开,同一情感中不同说话人混杂,表明获得了与说话人无关的有效情感特征
图4 4位已知说话人以5种不同情感说话时的情感特征可视化:不同情感被很好分开,同一情感中不同说话人混杂,表明获得了与说话人无关的有效情感特征

结论

ECVC通过vCLUB互信息最小化实现内容、说话人、音高和情感四元特征的充分解耦,消除说话人编码器的情感泄漏问题。联合训练的情感编码器配合情感一致性损失,确保转换语音保留源说话人情感信息。在ESD数据集上的主客观实验验证了ECVC在情感保留方面的优越性。

核心结论。 互信息最小化是解耦语音中纠缠特征的有效手段。vCLUB提供无偏的互信息估计,结合情感一致性损失可在保持说话人相似度的同时显著提升情感保留率。显式建模情感特征并约束其与说话人特征的正交性,是解决语音转换中情感泄漏问题的核心策略。

BibTeX

@inproceedings{li2024ecvc,
  title={基于互信息特征解耦的情感一致性语音转换方法},
  author={李渡渡 and 王少荣 and 甄怡宁 and 王春玲},
  booktitle={第十九届全国人机语音通讯学术会议(NCMMSC 2024)},
  year={2024}
}