ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models

Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models 文章主要内容和创新点主要内容本文针对现有指令遵循能力评估数据集多为单语(以英语为中心)或仅经机器翻译、缺乏多语言场景适用性的问题,提出了一个多语言指令遵循基准测试集Marco-Bench-MIF。该数据集扩展自IFEval,涵盖30种语言,通过“自动翻译+两轮人工验证”的混合流程实现本地化,解决了语言约束(如修改中文的大小写要求)和文化参考(如替换特定地区的公司名称)等问题。通过对20多个大语言模型(LLMs)的评估,发现以下关键结论:高资源语言与低资源语言的准确率差距为25-35%;模型规模对性能影响显著(70B+模型比8B模型准确率高45-60%),但仍存在脚本特定挑战(如阿拉伯语等);机器翻译数据比本地化数据低估7-22%的准确率。创新点构建了首个涵盖30种语言的细粒度本地化多语言指令遵循基准Marco-Bench-MIF,考虑语言和文化多样性;提出系统化的本地化框架,结合自动翻译与人工调整,解决多语言指令适配中的语言约束和文化适配问题;对20多个LLMs进行全面评估,揭示了模型规模、资源可用性、机器翻译数据局限性对多语言指令遵循能力的影响。翻译部分(摘要、引言、结论)摘要指令遵循能力已成为大型语言模型(LLMs)的核心评估能力之一(Brown等人,202
返回列表