ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models

When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models 文章总结与翻译一、文章主要内容本文聚焦多模态大型语言模型(MLLMs)中的“文本主导”问题,即模型在推理过程中过度依赖文本信息,而未充分利用图像、视频、音频、时间序列和图等其他模态信息。1. 研究背景与问题提出现有MLLMs虽在多模态任务中表现出色,但存在模态失衡问题,此前研究多聚焦于视觉-语言任务,将其归因于数据偏差或模型架构,却忽视了Transformer核心的注意力机制在多模态(如音频、时间序列、图)中的作用,因此需验证文本主导是否为MLLMs的根本性缺陷。2. 研究方法与评估指标评估框架:选取5种模态(图像、视频、音频、时间序列、图)的代表性数据集(如图像模态的MMMU-Pro、视频模态的MMBench-Video)和主流模型(如Qwen2.5-VL-7B、VideoLLaMA3-7B)展开实验。核心指标:提出两个量化指标以衡量模态失衡:模态主导指数(MDI):计算文本与非文本模态的平均每token注意力占比之比,MDI1表示文本主导,接近1则模态平衡。注意力效率指数(AEI):通过文本模态的注意力占比与token占比之比,衡量模态将token表示转化为注意力的效率,AEI1表示该模态注意力效率高。
返回列表