
一、文章主要内容和创新点主要内容本文聚焦于不同问题类型(简答题SAQs、选择题MCQs、判断题TFQs)对大型语言模型(LLMs)在推理任务上表现的影响,通过定量推理(如数学应用题)和演绎推理(如逻辑推理题)两类任务,评估了5个LLM(2个闭源模型、3个开源模型)的表现,核心评估指标为推理步骤准确性(推理过程的正确性)和最终答案准确性(最终选择的正确性)。研究发现:不同问题类型下,LLM的表现存在显著差异;推理步骤准确性与最终答案准确性不一定相关;选择题的选项数量、用词,判断题中“正确答案为True还是False”等因素会影响LLM表现。创新点研究问题与实验设计创新:提出了5个未被充分研究的核心问题(如问题类型对推理准确性的影响、选择题/判断题的影响因素等),并设计了针对性实验(如包含“其他选项”的选择题、不同数量选项的对比、判断题的表述格式差异等),部分问题为首次系统研究。关键发现创新:通过对5个LLM的评估,发现不同问题类型对最终答案准确性的影响比推理准确性更显著;推理准确性与最终答案准确性的非相关性;选择题的选项数量、用词,判断题的答案类型(True/False)等具体因素的影响机制,为LLM基准测试设计和性能优化提供了新见解。摘要