技术文章 17

PASQA:专攻日语语音重音正确性的质量评估新范式

日本LY Corporation团队提出PASQA模型,专攻语音合成中日语声调重音的正确性评估。该模型基于自监督学习框架wav2vec 2.0,融合音节信息、排序损失、帧级错误检测和说话人不变训练四大策略。实验表明,传统MOS预测模型对重音错误的排序准确率仅13%至20%,而PASQA达到75%以上,与人类判断的相关系数达0.828,为TTS系统的精细质量评估开辟了全新路径。

PASQA:专注语音重音正确性的质量评估新方法

日本雅虎LY公司团队提出PASQA模型,专门评估语音合成中日语声调重音的正确性。该模型基于自监督学习框架wav2vec 2.0,融合音节信息、排序损失、帧级错误检测和说话人不变训练四大策略。实验证明,传统MOS预测模型对重音错误完全不敏感,而PASQA在排序准确率和人类判断一致性上均大幅领先,为TTS系统的精细质量评估开辟了新路径。

PASQA:专注重音质量评估的语音评估新模型——用合成语音训练出听感黄金耳朵

PASQA是首个专门针对重音正确性的语音质量评估模型。现有MOS预测模型对重音错误不敏感,而PASQA利用重音可控TTS合成训练数据,结合音节条件融合、排序损失、辅助错误定位和说话人不变训练四大技术,实现了高精度的重音质量评估,已被INTERSPEECH 2026接收。

PASQA:专攻声调重音的语音质量评估模型——让AI也能听出「味噌汤里放错了盐」

现有的语音质量评估模型对声调重音错误视而不见。PASQA用合成语音制造可控的声调错误来训练模型,让模型学会像日语母语者一样敏锐地捕捉重音位置偏差。该模型结合音拍条件融合、排序损失、辅助错误定位和说话人不变训练等多项技术,已被INTERSPEECH 2026接收。

PASQA:专攻声调重音的语音质量评估模型——让AI也能听出「味噌汤里放错了盐」

现有的语音质量评估模型对声调重音错误视而不见。PASQA用合成语音制造可控的声调错误来训练模型,让模型学会像日语母语者一样敏锐地捕捉重音位置偏差。该模型结合音拍条件融合、排序损失、辅助错误定位和说话人不变训练等多项技术,已被INTERSPEECH 2026接收。

PASQA:专攻日语声调重音的语音质量评估模型

东京大学与LINE联合研究团队提出PASQA,首个专门针对声调重音(pitch-accent)正确性的语音质量评估模型。该模型基于自监督语音表示,结合音拍条件融合、排序损失和重音错误定位任务,在日语合成语音上实现了对重音错误的精准检测,远超传统MOS预测模型。论文已被INTERSPEECH 2026接收。

PASQA:专攻日语声调重音的语音质量评估模型

东京大学与LINE联合研究团队提出PASQA,首个专门针对声调重音(pitch-accent)正确性的语音质量评估模型。该模型基于自监督语音表示,结合音拍条件融合、排序损失和重音错误定位任务,在日语合成语音上实现了对重音错误的精准检测,远超传统MOS预测模型。论文已被INTERSPEECH 2026接收。

PASQA:聚焦音高重音的语音质量评估模型——用合成语音训练出"重音听诊器"

日本LY Corporation团队提出PASQA模型,专门评估日语语音合成中的音高重音正确性。该模型通过可控TTS系统构建大规模重音错误数据集,结合自监督学习、音拍条件融合、排序损失和说话人不变训练等四项创新,在重音质量排序准确率和与人类判断的一致性上均显著超越传统MOS预测模型,并在域外GPT-4o-mini-TTS系统上保持鲁棒性能。

基于语音段落级表征学习的普通话认知障碍检测:自编码器与对比学习的融合方案

语音作为低成本无侵入的数字生物标志物,在认知障碍检测中潜力巨大。本研究提出段落级语音表征学习框架,结合自编码器与对比学习,在四个普通话数据集上验证了稳定性能,尤其在临床难度最高的三分类任务中表现突出,为资源受限的临床环境提供了可扩展的筛查方案。

PASQA:面向音高重音的语音质量评估模型——用合成语音训练出人类级别的重音判断能力

PASQA提出了一种专门针对音高重音正确性的语音质量评估模型。通过使用可控制重音的TTS系统构造带有重音错误的合成语音数据集,并结合音节条件融合、排序损失、重音错误定位辅助任务和说话人不变训练等技术,PASQA在重音正确性判断上显著超越了传统MOS预测模型,被Interspeech 2026接收。

Zero-VC:零前瞻流式语音转换——用说话人匿名化技术实现真正实时的声线变换

Zero-VC提出了一种全新的零前瞻流式语音转换方法,利用说话人匿名化(SA)作为扰动机制,解决了现有方法在音色泄露与音质保持之间的权衡难题。该方法采用严格因果架构,完全无需缓冲未来帧,实现了真正的零延迟实时语音转换,被Interspeech 2026接收。

个性化关键词检测新突破:ZP-KWS如何用155万参数实现说话人级精准唤醒

本文深入解读Interspeech 2026收录论文ZP-KWS——一个面向用户自定义关键词的轻量级个性化语音唤醒框架。该框架结合音素监督音频编码器与GE2E预训练说话人编码器(仅0.9M参数),通过乘性晚期融合赋予两个分支独立否决权,在155万参数预算内实现双重零样本检测,在LibriPhrase等数据集上将目标说话人FRR降低最高60%,为边缘设备的个性化语音交互开辟了新路径。

Zero-VC:零前瞻延迟的流式语音转换——用说话人匿名化突破实时变声的瓶颈

Zero-VC提出了一种零前瞻延迟的流式语音转换方法,创新性地将说话人匿名化(SA)作为扰动机制,在严格因果架构下实现高质量实时语音转换。该方法通过SA产生的鲁棒表征消除了模型对未来帧的依赖,在保持韵律完整性的同时避免音色泄漏,已被Interspeech 2026接收。

MixProLAP:混合音频的概率语言-音频预训练框架——让AI真正听懂复杂声场

MixProLAP提出了一种概率音频-语言预训练框架,通过将确定性嵌入替换为概率分布嵌入,并创新性地使用音频-文本混合策略来模拟真实的多声源场景。配合多层级包含损失约束语义层次关系,该方法在音频-文本检索基准上显著优于传统确定性方法,为复杂声场的AI理解提供了新范式。

FlowEdit:用联想记忆实现TTS终身发音自适应,让语音合成不再念错名字

FlowEdit为冻结的流匹配TTS系统引入终身发音修正框架,通过在文本嵌入空间中学习token级扰动并存储在现代Hopfield网络中,实现内容可寻址的记忆检索。在312个多语言专有名词基准上,目标词音素错误率降低92.7%,单GPU修正仅需约15秒。

FlowEdit:用联想记忆实现TTS终身发音自适应,92.7%的音素错误率降低

Flow-matching文本转语音系统虽然在零样本场景下表现出色,但部署后对专有名词的发音错误无法自动修正。本文解读Singh等人提出的FlowEdit框架,该框架将发音修正编码为潜空间条件扰动而非权重更新,并利用现代Hopfield网络作为内容寻址的情景记忆存储修正。在跨18个语系的312个多语言专有名词基准测试上,FlowEdit将目标词音素错误率降低了92.7%,单GPU仅需约15秒完成修正。

指令如何塑造语音?交叉注意力归因揭示风格描述TTS的内部机制

这篇论文首次将DAAM框架从图像迁移到语音扩散模型,提出了交叉注意力归因方法分析风格描述TTS系统。分析3,600组组合后发现:风格词元具有全局调制作用,风格注意力与基频和能量相关,风格调制在早期步骤和深层网络中达到峰值,注意力熵在第17层最小。这是首个研究自然语言如何影响语音扩散模型中交叉注意力的工作。