论文研究 ·

新论文发现语码转换训练可实现小模型跨语言对齐

Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence

77进行中1 条arXiv cs.CL

AI 解读

AI 生成

推荐理由为小模型多语言能力训练提供低成本的新方案。

代码切换课程训练可有效提升小模型跨语言对齐能力与多语言表现

发生了什么

研究人员针对小参数量解码器类Transformer模型,对比两类各1亿词规模的英、荷、中三语预训练语料(普通混合语料、经LLM生成的含词/句级代码切换的增强语料)开展对照实验,发现按词级代码切换-句级代码切换-单语文本递进的课程训练方案下,模型多语言表现优于无代码切换训练的基线,跨语言文本对齐效果在后续单语训练后仍可留存。

关键信息

预训练语料规模
单份1亿词,覆盖英、荷、中三种语言
评测基准
BabyLM评测套件
开源交付物
配套代码、训练数据、预训练模型已在GitHub公开
论文编号
arXiv预印本2609.30535v1

背景

此前多语言预训练的跨语言对齐效果常难以在后续单语训练中留存,尤其不同文字体系的语言对齐成本高、效果不稳定。

为什么重要

对开发者而言,这套代码切换课程训练方案提供了低成本多语言数据增强思路,无需依赖高价平行语料即可实现跨语言表示对齐,可降低小参数量多语言模型的训练成本;对普通用户,后续或能获得跨语言理解更顺畅、语码切换更自然的AI交互体验;对行业而言,也为低资源语言的模型适配提供了可参考的训练范式。

后续看点

后续可关注该训练方案在更大规模模型、更多语言场景下的适配效果,以及实际多语言产品中的落地表现。

由 AI 根据原文生成,可能有疏漏,以原文为准。

来源

  1. arXiv cs.CL ↗新论文发现语码转换训练可实现小模型跨语言对齐Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence实验发现用混合语码文本训练小型Transformer,可诱导跨语言对齐效果。
返回 AI 热点