论文研究 ·
新论文发现语码转换训练可实现小模型跨语言对齐
Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence
77进行中1 条arXiv cs.CL
AI 解读
AI 生成推荐理由为小模型多语言能力训练提供低成本的新方案。
代码切换课程训练可有效提升小模型跨语言对齐能力与多语言表现
发生了什么
研究人员针对小参数量解码器类Transformer模型,对比两类各1亿词规模的英、荷、中三语预训练语料(普通混合语料、经LLM生成的含词/句级代码切换的增强语料)开展对照实验,发现按词级代码切换-句级代码切换-单语文本递进的课程训练方案下,模型多语言表现优于无代码切换训练的基线,跨语言文本对齐效果在后续单语训练后仍可留存。
关键信息
- 预训练语料规模
- 单份1亿词,覆盖英、荷、中三种语言
- 评测基准
- BabyLM评测套件
- 开源交付物
- 配套代码、训练数据、预训练模型已在GitHub公开
- 论文编号
- arXiv预印本2609.30535v1
背景
此前多语言预训练的跨语言对齐效果常难以在后续单语训练中留存,尤其不同文字体系的语言对齐成本高、效果不稳定。
为什么重要
对开发者而言,这套代码切换课程训练方案提供了低成本多语言数据增强思路,无需依赖高价平行语料即可实现跨语言表示对齐,可降低小参数量多语言模型的训练成本;对普通用户,后续或能获得跨语言理解更顺畅、语码切换更自然的AI交互体验;对行业而言,也为低资源语言的模型适配提供了可参考的训练范式。
后续看点
后续可关注该训练方案在更大规模模型、更多语言场景下的适配效果,以及实际多语言产品中的落地表现。
由 AI 根据原文生成,可能有疏漏,以原文为准。