论文研究 ·

新论文提出ASR推理时目标说话人遗忘机制

Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition

77进行中1 条arXiv cs.CL

AI 解读

AI 生成

推荐理由满足用户的语音隐私需求,提升ASR系统的合规性。

轻量可挂载模块实现ASR动态遗忘指定说话人,满足会议转写隐私需求

发生了什么

研究团队针对多说话人自动语音转写的隐私痛点,首次提出目标说话人遗忘ASR(TSU-ASR)任务,开发可挂载在冻结双流式语音LLM上的轻量注册条件门控模块,支持推理阶段动态加入未见过的退选说话人,不转写其语音但仍标注其活跃状态。在英文AMI、中文AliMeeting数据集测试显示,退选说话人对应内容的转写准确率分别从72.3%降至48.2%、从73.6%降至27.3%,其余说话人转写错误率基本保持不变。

关键信息

成果类型
arXiv新发布的隐私保护型多说话人ASR方案
核心模块
可挂载于冻结双流式语音LLM的轻量注册条件门控(ECG)模块
测试数据集
英文AMI数据集、中文AliMeeting数据集
基准成绩
退选说话人转写准确率较基线分别降24.1、46.3个百分点,其余说话人转写错误率无明显变化
适配场景
在线视频会议平台的动态隐私转写需求

背景

当前主流多说话人ASR与说话人日志方案缺乏灵活的隐私保护能力,参会者若不想被自动转写往往需要主动退出会议,难以匹配每日海量在线会议的隐私交互需求。

为什么重要

对行业而言,该方案为大规模在线会议平台提供了可落地的转写隐私保护路径,补齐了现有智能会议产品的隐私短板;对开发者来说,轻量可挂载的模块无需改动原有冻结语音LLM即可快速集成;对普通用户来说,不用退出会议即可自主关闭AI转写权限,兼顾协作效率与隐私安全。

后续看点

可关注该模块在实际商用会议系统中的落地效果,以及对退选说话人隐私保护强度的进一步优化。

由 AI 根据原文生成,可能有疏漏,以原文为准。

来源

  1. arXiv cs.CL ↗新论文提出ASR推理时目标说话人遗忘机制Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition提出TSU-ASR任务,可在推理时让多说话人ASR系统跳过指定退出用户的语音转录。
返回 AI 热点