ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning

Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning 文章主要内容和创新点主要内容本文聚焦于强化学习(RL)微调后的大型语言模型(LLMs)及大型视觉语言模型(LVLM)在非理想场景下的推理能力。现有研究多在理想、无噪声环境中评估模型推理能力,而本文提出三个具有实际意义的非理想场景:摘要推理:基于多个可能的正确选项进行分析并聚合为单一结论;细粒度噪声抑制:检测并移除细微干扰信息;上下文过滤:排除无关上下文以维持推理准确性。研究团队采用代表性的策略梯度算法(GRPO)对3个LLM(Llama 3.1、Mistral、Qwen3)和1个LVLM(Qwen 2.5-VL)进行微调,并在8个公开数据集上测试。结果显示:RL微调在理想场景下能提升模型推理性能,但在上述三个非理想场景中性能显著下降。尽管提出了针对性补救方法(如格式奖励、示例指导),但现有方法仍无法完全解决这些推理缺陷。本文强调,大模型的推理能力常被高估,需在非理想场景下进行更全面的评估。创新点新研究方向:受脑科学启发,首次系统探究RL微调大模型在非理想场景下的推理能力,填补了现有研究空白。实证发现:通过对4个模型及其变体在8个数据集上的评估,证实RL微调模型在非理想场景下性能显著下降,与理想场景形成鲜明对比。补救策略:设计了基于“
返回列表