#tts
共 7 篇相关内容 · 安全漏洞、AI动态、技术文章
技术文章 3
PASQA:专注重音质量评估的语音评估新模型——用合成语音训练出听感黄金耳朵
PASQA是首个专门针对重音正确性的语音质量评估模型。现有MOS预测模型对重音错误不敏感,而PASQA利用重音可控TTS合成训练数据,结合音节条件融合、排序损失、辅助错误定位和说话人不变训练四大技术,实现了高精度的重音质量评估,已被INTERSPEECH 2026接收。
FlowEdit:用联想记忆实现TTS终身发音自适应,让语音合成不再念错名字
FlowEdit为冻结的流匹配TTS系统引入终身发音修正框架,通过在文本嵌入空间中学习token级扰动并存储在现代Hopfield网络中,实现内容可寻址的记忆检索。在312个多语言专有名词基准上,目标词音素错误率降低92.7%,单GPU修正仅需约15秒。
FlowEdit:用联想记忆实现TTS终身发音自适应,92.7%的音素错误率降低
Flow-matching文本转语音系统虽然在零样本场景下表现出色,但部署后对专有名词的发音错误无法自动修正。本文解读Singh等人提出的FlowEdit框架,该框架将发音修正编码为潜空间条件扰动而非权重更新,并利用现代Hopfield网络作为内容寻址的情景记忆存储修正。在跨18个语系的312个多语言专有名词基准测试上,FlowEdit将目标词音素错误率降低了92.7%,单GPU仅需约15秒完成修正。
情报动态 4
Resemble AI Chatterbox Multilingual v3 — MIT TTS免费通过NVIDIA NIM
Resemble AI发布Chatterbox Multilingual v3,MIT开源0.5B参数TTS模型,支持25种语言(含中文),内置PerTh水印技术。已在NVIDIA NIM平台提供免费推理(NIM 2026年起取消Credits改为纯速率限制)。训练数据从25.6k扩展到36.7k小时,支持零样本语音克隆。EU AI Act Article 50合规。
Braiv Speech:Beta期间完全免费TTS,80+语言无上限
Braiv Speech推出AI TTS API,Beta期间完全免费,无月度字符上限,无水印,支持80+语言。需关注Beta结束后的定价策略。
BosonAI Higgs Audio v3 TTS:免费公开预览,100+语言语音合成
BosonAI发布Higgs Audio v3 TTS,4B参数,支持100+语言,零样本语音克隆,内联控制情感/风格/韵律/停顿。API免费公开预览中(有速率限制)。在Seed-TTS/CV3/MiniMax-Multilingual等基准测试中超越所有竞品。
Gradium语音AI创业计划 — $2,000+免费额度6个月
Gradium为语音AI创业公司提供免费Startup Program:6个月M计划(5400万credits,价值$2,000+),覆盖TTS/STT/语音克隆,含工程支持和新模型抢先体验。