#nlp
共 10 篇相关内容 · 安全漏洞、AI动态、技术文章
技术文章 10
PASQA:专攻日语语音重音正确性的质量评估新范式
日本LY Corporation团队提出PASQA模型,专攻语音合成中日语声调重音的正确性评估。该模型基于自监督学习框架wav2vec 2.0,融合音节信息、排序损失、帧级错误检测和说话人不变训练四大策略。实验表明,传统MOS预测模型对重音错误的排序准确率仅13%至20%,而PASQA达到75%以上,与人类判断的相关系数达0.828,为TTS系统的精细质量评估开辟了全新路径。
PASQA:专注语音重音正确性的质量评估新方法
日本雅虎LY公司团队提出PASQA模型,专门评估语音合成中日语声调重音的正确性。该模型基于自监督学习框架wav2vec 2.0,融合音节信息、排序损失、帧级错误检测和说话人不变训练四大策略。实验证明,传统MOS预测模型对重音错误完全不敏感,而PASQA在排序准确率和人类判断一致性上均大幅领先,为TTS系统的精细质量评估开辟了新路径。
PASQA:专注重音质量评估的语音评估新模型——用合成语音训练出听感黄金耳朵
PASQA是首个专门针对重音正确性的语音质量评估模型。现有MOS预测模型对重音错误不敏感,而PASQA利用重音可控TTS合成训练数据,结合音节条件融合、排序损失、辅助错误定位和说话人不变训练四大技术,实现了高精度的重音质量评估,已被INTERSPEECH 2026接收。
FlowEdit:用联想记忆实现TTS终身发音自适应,让语音合成不再念错名字
FlowEdit为冻结的流匹配TTS系统引入终身发音修正框架,通过在文本嵌入空间中学习token级扰动并存储在现代Hopfield网络中,实现内容可寻址的记忆检索。在312个多语言专有名词基准上,目标词音素错误率降低92.7%,单GPU修正仅需约15秒。
你的鼠标和眼睛正在偷偷泄露你的偏好:用隐式反馈对齐大语言模型
研究者构建了IFLLM数据集,收集59名众包工人的鼠标轨迹和眼动数据来训练LLM奖励模型。实验表明,隐式反馈将奖励模型准确率从55%提升至64%,并使DPO对8个LLM的响应质量改善效果近似翻三倍。
FlowEdit:用联想记忆实现TTS终身发音自适应,92.7%的音素错误率降低
Flow-matching文本转语音系统虽然在零样本场景下表现出色,但部署后对专有名词的发音错误无法自动修正。本文解读Singh等人提出的FlowEdit框架,该框架将发音修正编码为潜空间条件扰动而非权重更新,并利用现代Hopfield网络作为内容寻址的情景记忆存储修正。在跨18个语系的312个多语言专有名词基准测试上,FlowEdit将目标词音素错误率降低了92.7%,单GPU仅需约15秒完成修正。
你的鼠标和眼神正在泄露你的真实偏好:基于隐式行为信号的大语言模型对齐研究
传统的大语言模型对齐依赖用户显式反馈(如点赞、评分),但这类数据稀缺且昂贵。本文解读Chang等人发表于arXiv的最新研究,该研究构建了IFLLM数据集,通过采集1336个多轮对话中59名众包工人的鼠标轨迹和眼动数据,首次系统量化了隐式行为信号对LLM对齐的价值。基于隐式反馈的奖励模型将准确率从55%提升至64%,在8个LLM上应用DPO后,响应质量的相对提升几乎翻了三倍。
少数视觉线索驱动了多模态大模型中大多数社会偏见:StylisticBias 深度解读
多模态大语言模型在判断人脸照片时,仅15个视觉属性(年龄、体型、时尚风格等)就能驱动80%以上的社会偏见变异。StylisticBias通过控制变量法生成约25K张照片级人脸图像,在6个MLLM上覆盖25个社会判断场景进行评估,发现年龄和体型的影响超过身份本身,时尚风格是属性层面最强的偏见驱动因素。研究为AI偏见缓解提供了精确的优先级清单。
少数视觉线索驱动了多模态大模型中大多数社会偏见:StylisticBias 深度解读
多模态大语言模型在判断人脸照片时,仅15个视觉属性(年龄、体型、时尚风格等)就能驱动80%以上的社会偏见变异。StylisticBias通过控制变量法生成约25K张照片级人脸图像,在6个MLLM上覆盖25个社会判断场景进行评估,发现年龄和体型的影响超过身份本身,时尚风格是属性层面最强的偏见驱动因素。研究为AI偏见缓解提供了精确的优先级清单。
指令如何塑造语音?交叉注意力归因揭示风格描述TTS的内部机制
这篇论文首次将DAAM框架从图像迁移到语音扩散模型,提出了交叉注意力归因方法分析风格描述TTS系统。分析3,600组组合后发现:风格词元具有全局调制作用,风格注意力与基频和能量相关,风格调制在早期步骤和深层网络中达到峰值,注意力熵在第17层最小。这是首个研究自然语言如何影响语音扩散模型中交叉注意力的工作。