ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Awesome-Multimodal-Large-Language-Models 仓库指南:MLLM 技术全景、评测体系与资源清单详解

Awesome-Multimodal-Large-Language-Models 仓库指南:MLLM 技术全景、评测体系与资源清单详解 文档教程人工智能大模型多模态【免费下载链接】Awesome-Multimodal-Large-Language-Models:sparkles::sparkles:Latest Advances on Multimodal Large Language Models项目地址https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models点击查看免费下载本篇技术指南以 README.md 为骨架系统梳理多模态大语言模型MLLM领域的技术分类脉络从指令微调、幻觉缓解、上下文学习、思维链到 LLM 辅助视觉推理、基础模型、评测基准与多模态 RLHF同时详解该仓库配套的 NJU-MiG 系列综述、VITA 系列 Omni 模型与 MME 系列评测基准的关联关系并给出论文、数据集、代码与演示的检索使用方法。读完本文你将掌握如何在这份持续更新的资源清单中快速定位特定技术方向的代表工作理解其背后的评测方法论并学会复用仓库内的引用条目与评测工具链。MLLM 技术体系分类思维导图以 MLLM 为核心划分 M-IT多模态指令微调、M-ICL多模态上下文学习、M-CoT多模态思维链、LAVR语言辅助视觉推理四大方向仓库定位与整体结构Awesome-Multimodal-Large-Language-Models是一个面向 MLLM 领域的精选资源清单由南京大学 NJU-MiG南京大学媒体计算与图实验室相关团队维护其仓库描述为 Latest Advances on Multimodal Large Language Models即持续跟踪 MLLM 的最新进展。仓库顶层结构如下README.md核心索引文档包含 NJU-MiG 亮点工作、论文清单Awesome Papers与数据集清单Awesome Datasets三大部分images/存放综述配图、评测基准 Logo、微信交流群二维码以及引用条目BibTeX等资源文件。该文档的主干是两张资源大表这也是本文后续章节的展开依据清单主题覆盖的技术方向Awesome Papers论文清单MLLM 论文索引指令微调、幻觉、上下文学习、思维链、LLM 辅助视觉推理、基础模型、评测、多模态 RLHF、其他Awesome Datasets数据集清单数据集与基准索引预训练对齐、指令微调、上下文学习、思维链、RLHF、评测基准、其他每条论文条目统一以Title / Venue / Date / Code / Demo五列组织数据集条目则以Name / Paper / Link / Notes四列组织。这种表格 链接 徽章的组织方式使读者可以在同一视图中比较论文的发表信息、开源代码与在线演示的可用性。NJU-MiG 亮点工作从综述到 Omni 模型再到评测基准仓库顶部用三组区块集中展示了 NJU-MiG 团队自产的代表性工作它们与仓库的两大清单形成产出-索引闭环是理解仓库背景的关键1. MLLM 综述系列Surveys of MLLMsMME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMsarXiv 2025论文 PDF聚焦 MLLM评测维度的全面综述该工作的配套项目位于仓库的Benchmarks分支A Survey of Unified Multimodal Understanding and Generation: Advances and ChallengesarXiv 2025论文 PDF面向统一多模态理解与生成的综述配套项目位于仓库的Unified分支A Survey on Multimodal Large Language ModelsNSR 2024论文 PDF发表于National Science Review的 MLLM 综述是该仓库同名项目的核心论文之一。这三篇综述与仓库的关联可从引用文件得到印证仓库在 images/bib_survey.txt 中提供了一篇综述的标准 BibTeX 条目article{yin2024survey, title{A survey on multimodal large language models}, author{Yin, Shukang and Fu, Chaoyou and Zhao, Sirui and Li, Ke and Sun, Xing and Xu, Tong and Chen, Enhong}, journal{National Science Review}, volume{11}, number{12}, year{2024} }2. VITA 系列 Omni MLLM全模态模型VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech InteractionNeurIPS 2025 Highlight论文 PDF面向实时视觉与语音交互的全模态模型VITA: Towards Open-Source Interactive Omni Multimodal LLMarXiv 2024论文 PDF开源的交互式全模态 LLMVITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language ModelNeurIPS 2025论文 PDF面向高效语音-语言模型的交错跨模态 token 生成方案。这三项工作的代码分别在 VITA-MLLM/VITA。3. MME 系列评测基准BenchmarksVideo-MME-v2: Towards the Next Stage in Video Understanding Evaluation视频理解评测的下一代基准README 展示了其项目 Logoimages/video-mme-v2-logo.png并给出 Project Page、Paper、Dataset 与 Leaderboard 四类入口MME-Survey同上评测综述MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language ModelsNeurIPS 2025 DB Highlight论文 PDFVideo-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video AnalysisCVPR 2025论文 PDF首个面向视频分析场景的 MLLM 综合评测基准。评测是仓库的重要主线之一。README 的 Highlights 之外论文清单中的 Evaluation 小节与数据集清单中的 Benchmarks 小节共同构成了完整的评测资源索引详见下文评测体系一章。Awesome Papers论文清单的技术版图论文清单按研究方向划分为 9 个小节是理解 MLLM 领域技术版图的核心骨架。各小节主题与定位如下小节核心问题典型代表Multimodal Instruction Tuning ( Latest Works)如何让 LLM 通过指令微调获得视觉/多模态能力并持续收录最新工作LLaVA 系列、Qwen-VL 系列、InternVL 系列、VITA、Qwen3-Omni、Emu3.5 等Multimodal Hallucination如何评测与缓解 MLLM 的幻觉尤其是对象幻觉POPE、AMBER、Woodpecker、VCD、OPERA、RLHF-VMultimodal In-Context Learning如何让模型基于多模态示例进行少样本学习Flamingo、OpenFlamingo、Emu2、MMICL、OtterMultimodal Chain-of-Thought如何让模型逐步推理以提升复杂视觉问答能力Multimodal-CoT、Visual CoT、DDCoT、Insight-V、CantorLLM-Aided Visual Reasoning如何用 LLM 作为调度/规划器调用视觉工具完成推理Visual ChatGPT、MM-REACT、HuggingGPT、ViperGPT、ChameleonFoundation Models多模态基础模型的技术路线与能力边界GPT-4V、Gemini、GPT-4o、Llama 3.2、Emu3、Pixtral-12BEvaluation如何系统评测 MLLM 的综合能力MME、MMBench、Video-MME、MM-Vet、SEED-Bench、MathVistaMultimodal RLHF如何用人类/模型偏好对齐 MLLMLLaVA-RLHF、RLHF-V、Silkie、MM-RLHF、R1-RewardOthers不便于归入上述类目的其余工作SEED、VCoder、GILL、ContextDET、VLGuard指令微调从 LLaVA 到最新一代模型指令微调是 MLLM 的核心训练范式。该小节时间跨度从 2022 年一直延伸到 2026 年如表单所示既有奠基工作也有持续更新的最新成果奠基性工作Visual Instruction TuningNeurIPS 2023提出 LLaVA 范式MiniGPT-4、InstructBLIP、LLaVA-NeXT 等沿此路线演进系列化生态Qwen 家族的 Qwen-VL → Qwen2-VL → Qwen2.5-VL → Qwen3-VL 技术报告arXiv 2511.21631→ Qwen3-OmniarXiv 2509.17765InternVL 家族的 InternVL → InternVL3 → InternVL3.5arXiv 2508.18265Kimi 家族的 Kimi-VLarXiv 2504.07491与 Kimi K3GitHub 开放技术报告统一理解与生成Emu3Next-Token Prediction is All You Need、BLIP3-oarXiv 2505.09568、InternVL-UarXiv 2603.09877、Show-o2 等探索把理解与生成统一到单一模型Omni 交互VITA、VITA-1.5、Qwen2.5-Omni、MiniCPM-o、Qwen3.5-Omni、Baichuan-Omni-1.5、InteractiveOmni 等覆盖视觉-语音实时交互方向视频理解Video-ChatGPT、Video-LLaMA、LLaVA-OneVision、Long-VITA百万级 token 长上下文、VideoChat3arXiv 2607.14935完全开源等。使用该小节时建议按 Venue Date 过滤出目标时段的论文再结合 Code 列判断是否可直接复现带有徽章的项目通常开源代码仓库可直接点击进入查看权重、推理脚本与训练配置标注 Demo 的条目则提供在线体验入口。幻觉评测与缓解并重幻觉小节收录了从评测基准POPE、AMBER、FAITHSCORE、HaELM、R-Bench到缓解方法VCD、OPERA、Woodpecker、HALC、LRV-Instruction、RLHF-V、MM-RLHF的完整工作链条POPEEvaluating Object Hallucination in Large Vision-Language ModelsEMNLP 2023提出基于轮询探测的对象幻觉评测协议后续大量工作以其为基线指标WoodpeckerarXiv 2310.16045通过视觉感知、问题相关性与证据验证三步流水线对幻觉进行事后纠正VCDVisual Contrastive DecodingCVPR 2024在不额外训练的前提下通过视觉对比解码抑制对象幻觉RLHF-VarXiv 2312.00849从细粒度矫正性人工反馈出发把行为对齐用于构建可信 MLLM。上下文学习与思维链推理能力的两条路线Multimodal In-Context Learning以 FlamingoNeurIPS 2022为开端OpenFlamingo 提供开源训练框架Emu2、MMICL、Otter基于 MIMIC-IT 数据等继续推进多模态少样本学习Chameleon、HuggingGPT、MM-REACT 则把 ICL 与工具调用结合形成多模态推理 行动的 Agent 路线Multimodal Chain-of-Thought从 ScienceQANeurIPS 2022提出可解释的多模态思维链到 Multimodal-CoTarXiv 2302.00923实现图文两阶段的推理分解再到 Visual CoT、DDCoT、Cantor、Insight-VarXiv 2411.14432长链视觉推理等对推理链的深化。LLM 辅助视觉推理与基础模型LLM-Aided Visual ReasoningVisual ChatGPT、MM-REACT、HuggingGPT 展示了LLM 规划 视觉工具执行的 Agent 范式ViperGPT 将视觉推理转化为 Python 代码执行IdealGPT 迭代式分解视觉推理V*arXiv 2312.14135将引导式视觉搜索作为核心机制融入 MLLMFoundation Models收录 GPT-4V、GPT-4o、Gemini 系列、Claude 3、Llama 3.2、Pixtral-12B、Emu3 等基础模型其中开源权重模型如 Llama 3.2、Pixtral-12B、Emu3可在本地或 HuggingFace 上直接加载。Awesome Datasets数据集与基准清单预训练对齐数据集该小节按Caption / ASR / Hybrid类型与Image-Text / Video-Text / Audio-Text模态组合组织常见代表数据集类型模态用途COYO-700M、LAION-400M、SBU Captions、Conceptual Captions、MS-COCOCaptionImage-Text图文预训练对齐ShareGPT4V、ShareGPT4VideoCaptionImage/Video-Text高质量描述数据InternVid、MSR-VTT、Webvid10M、Youku-mPLUGCaptionVideo-Text视频-文本对齐WavCapsCaptionAudio-Text音频-文本对齐AISHELL-1 / AISHELL-2ASRAudio-Text中文语音识别语料AS-1BHybridImage-Text全景视觉标注指令微调数据集该小节规模最大覆盖图像、视频、3D、图表、医疗、文档等垂直场景。典型代表包括LLaVA-Instruct-150KGPT 生成的图文指令数据、SVIT4.2M 规模、MIMIC-IT多模态上下文指令、Video-ChatGPT100K 视频指令、Inst-IT21k 视频 51k 图像的细粒度实例标注、E.T. Instruct 164K时序敏感的视频理解、M3DBench3D 指令、LLaVA-Med生物医学指令、ChartLlama图表理解与生成。表格中的 Notes 列提供了每个数据集的核心用途说明可直接据此判断数据是否匹配自己的训练场景。评测基准与多模态 RLHF 数据集Benchmarks for Evaluation从 MME、MMBench、SEED-Bench、MM-Vet 等通用基准到 Video-MME、MVBench、TempCompass、TemporalBench 等视频基准再到 CharXiv、ChartMimic、MathVista 等图表/数学细分基准以及 MME-RealWorld真实世界高分辨率场景、OmniBench视觉-音频-文本三模态同时输入、MMGenBench文生图视角评测等新维度基准Multimodal RLHF收录 VLFeedbackAI 标注的视觉语言偏好数据集配套 Silkie 工作作为代表性偏好数据。评测体系MME / Video-MME / Video-MME-v2 的方法论脉络评测是仓库自产工作的重头戏。MME 系列构成了从图像到视频、再到下一代视频评测的完整演进**MMEarXiv 2306.13394article{fu2023mme, title{MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models}, author{Fu, Chaoyou and Chen, Peixian and Shen, Yunhang and Qin, Yulei and Zhang, Mengdan and Lin, Xu and Yang, Jinrui and Zheng, Xiawu and Li, Ke and Sun, Xing and others}, journal{arXiv preprint arXiv:2306.13394}, year{2023} }Video-MMEarXiv 2405.21075CVPR 2025首个面向视频分析的综合评测基准按视频时长、领域与时间跨度等维度组织评测任务**Video-MME-v2arXiv 2604.05015 展示了其鲁棒且可靠的视频评测定位数据集托管在 HuggingFaceMME-Benchmarks/Video-MME-v2并提供公开 Leaderboard 用于横向比较各模型表现。从源码结构看Video-MME-v2 的相关资源数据、评测流程、实验分析均由独立仓库/项目页维护本仓库仅提供入口链接与展示图实际使用时应以该基准项目页发布的使用说明为准。Video-MME-v2 评测基准项目页定位为鲁棒且可靠的视频评测展示数据、评估流程与实验分析等模块引用条目与社区资源的使用方法引用格式仓库在 images/bib_mme.txt 与 images/bib_survey.txt 中提供了 MME 基准与 NSR 综述的 BibTeX 条目可直接粘贴到 LaTeX/Overleaf 或参考文献管理工具中使用交流社区README 顶部提供了两个微信交流群入口MLLM 微信交流群二维码见 images/wechat-group.pngVITA 系列交流群入口见 VITA 项目仓库适合跟进仓库维护团队的讨论与更新分支工作区仓库通过分支组织不同主题的配套内容如Benchmarks分支承载 MME-Survey 项目、Evaluation分支承载 MME 评测工具、Unified分支承载统一多模态综述项目、Alignment分支承载 Aligning Multimodal LLM with Human Preference 综述项目——查阅这些分支可以获取对应工作的完整论文、代码与工具Star 徽章论文表格中的Star徽章实时展示对应开源仓库的 Star 数可用于快速判断项目热度与社区认可度。结语这份仓库的价值在于三点其一以九个技术方向组织论文清单是 MLLM 领域按图索骥的索引工具其二NJU-MiG 自产的综述、VITA 全模态模型与 MME 评测系列形成了综述-模型-评测的完整闭环可直接作为研究基线其三数据集清单按训练阶段与任务类型归类为数据选型提供了一站式参考。建议读者将本仓库作为跟踪 MLLM 进展的持续更新入口并结合各论文对应的开源代码仓库进行复现验证。赞分享文档教程人工智能大模型多模态【免费下载链接】Awesome-Multimodal-Large-Language-Models:sparkles::sparkles:Latest Advances on Multimodal Large Language Models项目地址https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models点击查看免费下载相关推荐Awesome-Multimodal-Large-Language-Models 使用指南Awesome Multimodal Large Language Models 使用指南 项目介绍 Awesome Multimodal Large Lang文档教程人工智能大模型多模态终极指南如何使用MME-RealWorld评估多模态大语言模型的真实场景能力终极指南如何使用MME RealWorld评估多模态大语言模型的真实场景能力 多模态大语言模型MLLM正在改变人工智能领域而GitHub_Trendin文档教程人工智能大模型多模态终极指南GitHub精选多模态大语言模型项目中的MM-RLHF技术详解终极指南GitHub精选多模态大语言模型项目中的MM RLHF技术详解 GitHub_Trending/aw/Awesome Multimodal Large文档教程人工智能大模型多模态上一篇告别PostGIS依赖DuckDB空间扩展让本地GIS分析提速10倍下一篇知识图谱学习终极指南gh_mirrors/kn/knowledge-graph-learning项目全面解析创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表