论文研究 ·
BiMoGen:统一掩码离散扩散的动作文本双向生成
BiMoGen: Bidirectional Motion-Text Generation via Unified Masked Discrete Diffusion
61进行中1 条HF Daily Papers
AI 解读
AI 生成推荐理由为动作生成、数字人动画领域提供双向生成的新技术路径。
BiMoGen双向框架实现运动文本双向生成,跨模态一致性优于传统自回归方案
发生了什么
研究团队推出BiMoGen双向运动-文本生成统一框架,基于掩码离散扩散架构实现双向运动建模。为稳定训练,团队设计了解耦式单模态与跨模态训练方案:先通过掩码预训练在成对运动-文本序列上建立跨模态对应关系,再通过监督微调让模型适配双向生成任务;同时引入生成感知自校正机制,在训练中加入模型自身预测结果,在采样早期步骤修正已生成的不可靠token,缓解掩码扩散的推理误差累积问题。
关键信息
- 框架名称
- BiMoGen
- 核心架构
- 统一掩码离散扩散双向运动-文本生成框架
- 核心训练设计
- 解耦单/跨模态训练、生成感知自校正
- 测试基准
- HumanML3D、KIT-ML
- 项目页面
- https://wengwanjiang.github.io/BiMoGen-Page
背景
文本到动作生成、动作到文本标注是人体运动建模的两大核心基础任务,二者共享同一套运动-文本对应关系;现有统一方案多采用自回归建模,存在固定生成顺序的局限,难以适配语言与运动的双向依赖关系,早期预测错误会沿固定上下文持续传导,拉低时序连贯性与跨模态一致性。
为什么重要
对行业而言,该方案突破了自回归建模对运动-文本双向转换的顺序限制,为虚拟人、动作生成类应用提供了更优的跨模态技术底座;对开发者而言,可直接利用该框架同时实现动作驱动虚拟人、自动生成动作描述的双重功能,减少多套模型的维护成本;对普通用户而言,后续虚拟人数字人的动作生成将更自然、与文本指令的匹配度更高。
由 AI 根据原文生成,可能有疏漏,以原文为准。