ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Measuring and Analyzing Intelligence via Contextual Uncertainty in Large Language Models using In...

Measuring and Analyzing Intelligence via Contextual Uncertainty in Large Language Models using In... 文章主要内容总结本文聚焦大型语言模型(LLMs)的内在信息处理机制,提出了一种基于信息论的任务无关方法,通过量化“认知轮廓”(Cognitive Profile)分析模型的智能特征。核心思路是利用“熵衰减曲线”(Entropy Decay Curve)追踪模型的归一化预测不确定性随上下文长度的变化,并引入“信息增益跨度”(IGS)指数总结曲线特征。实验中,研究人员对Llama 3.3 70.6B、DeepSeek-R1 8.19B、Qwen 2.5 7.62B三个模型,在《爱丽丝梦游仙境》《尤利西斯》《康德判断力批判》三个语料上进行了分析,发现:模型规模显著影响认知轮廓:大模型(如Llama 3.3)的熵衰减曲线下降更剧烈,能从“发散思考”快速过渡到“精确推理”;小模型的曲线更平缓,长上下文下不确定性仍较高。文本复杂度影响模型表现:《爱丽丝梦游仙境》的预测不确定性最低(文本更易预测),而《尤利西斯》和《康德判断力批判》的不确定性更高(文本更复杂)。该方法可检测数据污染:Llama 3.3在《爱丽丝梦游仙境》的长上下文下不确定性接近零,暗示其可能记忆了该文本(数据污染)。文章创新点提出任务无关的认知轮廓分析框架:通过熵衰减曲线(追踪归一化不确定性随上下文长度的变化),量化模型的信息处理策略,超越了传统任务特定指标(如困惑度)。定义新的信息论指标:长度条件不确定性指数(
返回列表