论文研究 ·
新研究:音频LLM可识别自身转录失效场景
Audio LLMs Know When They Can't Hear You
75进行中1 条arXiv cs.AI
AI 解读
AI 生成推荐理由助力开发者提升语音交互类AI产品的输出稳定性与可靠性。
研究发现可从音频大模型编码器提取转录可靠性,轻量预测器效果超基线
发生了什么
针对音频大模型在输入录音质量不佳时易出现转录错误、且模型自身难以判断转录可靠性的问题,研究团队首先验证了现有检测方法的效果局限性,随后发现转录可靠性信号集中在冻结的音频编码器表征中,基于此设计了轻量预测器,可在生成前预判可靠性、触发用户澄清,无需修改底层音频大模型,检测精度远超现有方法,且可靠性标签可跨音频大模型家族迁移。
关键信息
- 研究问题
- 音频大模型无法自主判断语音转录可靠性,易因输入音质差产生错误回复
- 核心发现
- 转录可靠性信号在冻结音频编码器表征中存在强表达,可靠性标签可跨音频大模型家族迁移
- 提出方案
- 基于冻结音频编码器表征的轻量可靠性预测器,生成前判定转录可靠性,无需修改底层模型
- 检测效果
- 域内宏F1达81.10%,跨域宏F1达78.09%,较最强基线分别高10.33、11.93个百分点
背景
当前音频大模型已实现语音交互能力,但当输入录音清晰度不足、信噪比过低时,模型易转录错误内容并给出偏差回复;现有检测方法包括语音质量评估、生成不确定性判断、转录词错率估计等,对转录失败的检测信号有限,且模型自身对转录可靠性的判断准确率极低。
为什么重要
对音频大模型行业而言,该方案解决了语音交互场景下的无效输入识别难题,可大幅降低错误回复率;对开发者而言,轻量预测器无需改动底层模型的特性可大幅降低集成适配成本;对普通用户而言,系统可在语音输入无效时主动请求澄清,避免模型答非所问,提升语音交互的整体体验。
由 AI 根据原文生成,可能有疏漏,以原文为准。