论文研究 ·

新研究:音频LLM可识别自身转录失效场景

Audio LLMs Know When They Can't Hear You

75进行中1 条arXiv cs.AI

AI 解读

AI 生成

推荐理由助力开发者提升语音交互类AI产品的输出稳定性与可靠性。

研究发现可从音频大模型编码器提取转录可靠性,轻量预测器效果超基线

发生了什么

针对音频大模型在输入录音质量不佳时易出现转录错误、且模型自身难以判断转录可靠性的问题,研究团队首先验证了现有检测方法的效果局限性,随后发现转录可靠性信号集中在冻结的音频编码器表征中,基于此设计了轻量预测器,可在生成前预判可靠性、触发用户澄清,无需修改底层音频大模型,检测精度远超现有方法,且可靠性标签可跨音频大模型家族迁移。

关键信息

研究问题
音频大模型无法自主判断语音转录可靠性,易因输入音质差产生错误回复
核心发现
转录可靠性信号在冻结音频编码器表征中存在强表达,可靠性标签可跨音频大模型家族迁移
提出方案
基于冻结音频编码器表征的轻量可靠性预测器,生成前判定转录可靠性,无需修改底层模型
检测效果
域内宏F1达81.10%,跨域宏F1达78.09%,较最强基线分别高10.33、11.93个百分点

背景

当前音频大模型已实现语音交互能力,但当输入录音清晰度不足、信噪比过低时,模型易转录错误内容并给出偏差回复;现有检测方法包括语音质量评估、生成不确定性判断、转录词错率估计等,对转录失败的检测信号有限,且模型自身对转录可靠性的判断准确率极低。

为什么重要

对音频大模型行业而言,该方案解决了语音交互场景下的无效输入识别难题,可大幅降低错误回复率;对开发者而言,轻量预测器无需改动底层模型的特性可大幅降低集成适配成本;对普通用户而言,系统可在语音输入无效时主动请求澄清,避免模型答非所问,提升语音交互的整体体验。

由 AI 根据原文生成,可能有疏漏,以原文为准。

来源

  1. arXiv cs.AI ↗新研究:音频LLM可识别自身转录失效场景Audio LLMs Know When They Can't Hear You针对音频LLM在退化音频下的转录错误问题,提出模型转录可靠性评估框架。
返回 AI 热点