论文研究 ·
新论文提出ASR推理时目标说话人遗忘机制
Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition
77进行中1 条arXiv cs.CL
AI 解读
AI 生成推荐理由满足用户的语音隐私需求,提升ASR系统的合规性。
轻量可挂载模块实现ASR动态遗忘指定说话人,满足会议转写隐私需求
发生了什么
研究团队针对多说话人自动语音转写的隐私痛点,首次提出目标说话人遗忘ASR(TSU-ASR)任务,开发可挂载在冻结双流式语音LLM上的轻量注册条件门控模块,支持推理阶段动态加入未见过的退选说话人,不转写其语音但仍标注其活跃状态。在英文AMI、中文AliMeeting数据集测试显示,退选说话人对应内容的转写准确率分别从72.3%降至48.2%、从73.6%降至27.3%,其余说话人转写错误率基本保持不变。
关键信息
- 成果类型
- arXiv新发布的隐私保护型多说话人ASR方案
- 核心模块
- 可挂载于冻结双流式语音LLM的轻量注册条件门控(ECG)模块
- 测试数据集
- 英文AMI数据集、中文AliMeeting数据集
- 基准成绩
- 退选说话人转写准确率较基线分别降24.1、46.3个百分点,其余说话人转写错误率无明显变化
- 适配场景
- 在线视频会议平台的动态隐私转写需求
背景
当前主流多说话人ASR与说话人日志方案缺乏灵活的隐私保护能力,参会者若不想被自动转写往往需要主动退出会议,难以匹配每日海量在线会议的隐私交互需求。
为什么重要
对行业而言,该方案为大规模在线会议平台提供了可落地的转写隐私保护路径,补齐了现有智能会议产品的隐私短板;对开发者来说,轻量可挂载的模块无需改动原有冻结语音LLM即可快速集成;对普通用户来说,不用退出会议即可自主关闭AI转写权限,兼顾协作效率与隐私安全。
后续看点
可关注该模块在实际商用会议系统中的落地效果,以及对退选说话人隐私保护强度的进一步优化。
由 AI 根据原文生成,可能有疏漏,以原文为准。