
文章主要内容总结本文聚焦于多语言大语言模型(LLMs)在低资源语言(以印地语为例)中的性能差距问题,旨在通过基于LLM的选择性翻译技术提升模型在低资源语言上的对齐效果。研究背景指出,多语言LLMs在英语与非英语语言(尤其是低资源语言)间存在显著性能差异,核心瓶颈在于低资源语言缺乏高质量对齐数据。传统方法通过翻译英语对齐数据来补充,但常规翻译技术难以保留代码、数学表达式、JSON等非可翻译内容,导致数据失效。为此,本文提出基于LLM的选择性翻译:仅翻译文本中可翻译部分,同时保留非可翻译内容和句子结构。研究通过三个关键问题展开:与谷歌云翻译(GCP)等传统翻译相比,LLM选择性翻译的效果如何;混合英语原始数据与目标语言翻译数据的最优策略;过滤翻译噪声对模型性能的影响。实验以印地语为对象,使用Nemotron-4-Mini-Hindi-4B-Base模型,对比GCP翻译与Llama3.1-405B的选择性翻译结果,通过SFT(有监督微调)和DPO(直接偏好优化)训练,并在MTBench、IFEval、GSM8K等数据集上评估。结果表明:LLM选择性翻译显著优于传统翻译,混合英语数据能提升性能,过滤噪声可提高训练效率。创新点提出LLM-based选择性翻译技术:通过LLM的推理能力区分可翻译与非可翻译内容,解决传统翻译中代码、数学表达式等结构丢失的问题,保留数据功能完整性。系统研究翻译策略