
SinLlama相关总结与翻译一、文章主要内容(一)研究背景低资源语言(如僧伽罗语)常被开源大型语言模型(LLMs)忽视,现有多语言LLM(如Llama、Gemma)在低资源语言上表现欠佳,且部分支持僧伽罗语的模型(如MaLA-500、Aya-101)要么性能不如主流模型,要么规模过大、内存需求高,加剧了数字鸿沟。僧伽罗语作为仅约2000万人使用的印欧语系语言,被归为低资源语言,此前相关NLP技术多为规则式、统计式或早期深度学习方法,已显陈旧。(二)研究目标将现有多语言LLM(Llama-3-8B)进行扩展,提升其对僧伽罗语的支持,打造专门针对僧伽罗语、性能更优且资源需求合理的开源LLM。(三)研究过程模型选择:对比12种开源多语言LLM(如Llama-3-8B、MaLA-500等),基于多语言能力、参数规模(80亿以下)、僧伽罗语代表性及性能指标,选定Llama-3-8B作为基础模型。数据集构建预训练数据:融合MADLAD-400和CulturaX的僧伽罗语数据,经启发式过滤(如移除非僧伽罗语句子、URL等)和去重,得到含10730154个句子、303958959个token的数据集。微调数据:选取3个僧伽罗语文本分类公开数据集(新闻