
Awesome-Multimodal-Large-Language-Models 速查指南3 步找到 MLLM 论文、数据集与评测基准【免费下载链接】Awesome-Multimodal-Large-Language-Models:sparkles::sparkles:Latest Advances on Multimodal Large Language Models项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models做多模态大语言模型研究时你想一次查清某个方向的论文、训练数据和评测集在哪里不必逐个翻实验室主页。无论是文献综述、找训练数据还是评测自研模型Awesome-Multimodal-Large-Language-Models 仓库都把数千篇 MLLM 论文、数据集和基准压缩进了一份可导航的 Markdown 表格按分类、按日期查链接直达代码。能力速览这个仓库提供什么这份清单由 NJU-MiG 团队维护覆盖四类资料论文清单指令微调、幻觉、上下文学习、思维链、视觉推理、基础模型、评测、RLHF 等 9 个分类每条含标题 / 会议 / 日期 / 代码 / Demo数据集清单预训练对齐、指令微调、上下文学习、CoT、RLHF、评测基准六类数据集带说明字段评测工具MME、Video-MME、Video-MME-v2、MME-Survey 等项目自研的基准与综述引用素材images/bib_mme.txt 与 images/bib_survey.txt 提供现成 BibTeX 条目适合需要做领域调研的研究者、找训练数据的学生以及想量化评测多模态大语言模型的工程师。图1MLLM 模型发展时间线2022-2024来源仓库 images/timeline.jpg图2MLLM 知识图谱四个分支为指令微调M-IT、思维链M-CoT、上下文学习M-ICL与视觉推理LAVR来源仓库 images/xmind.png只想看领域结构图2 已经够用想拿到资料本身先把仓库克隆下来。一键克隆与 README 导航方法仓库是纯文档无需安装依赖任何装有 git 的机器都能用。克隆后打开 README.md 即可开始# 克隆多模态大语言模型论文清单仓库 git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models cd Awesome-Multimodal-Large-Language-Models成功标志ls能看到根目录下的README.md与images/目录README.md 顶部是 Highlights 和 Table of Contents。导航以顶部目录为准全文分 Awesome Papers 与 Awesome Datasets 两个一级章节每个子节对应一张表点击锚点直达。克隆后最有用的动作就是善用这份目录下面三个场景对应最常见的查表需求。论文与数据集查找的三个实战场景场景一按方向查论文输入想调研 2023-2024 年的 MLLM 幻觉研究操作目录跳转 Multimodal Hallucination按 Date 列扫描Code 列标出哪些有开源实现输出一张从 POPE 到最新工作的表每条带代码与 Demo 链接可直接复制去读场景二按任务找训练数据输入准备做指令微调需要成规模的数据操作跳转 Datasets of Multimodal Instruction Tuning看 Notes 列的数据规模与用途说明输出SVIT420 万条、LLaVA-Instruct-150K 等条目各附下载链接场景三用基准评测模型输入想量化评估自训模型的视觉理解能力操作跳转 Benchmarks for Evaluation优先看 MME图像理解、MMBench综合能力、Video-MME视频理解三条目输出数据集下载与评测工具入口基准太多拿不准时参考下图的分类图3MLLM 评测基准的时间线与分布覆盖百余种 benchmark来源仓库 images/mme-survey.jpg查完表还有两类资料藏在主表之外容易漏掉。进阶用法分支资源与引用文件专题分支评测工具、基准综述、统一多模态理解与生成综述、RLHF 综述分别放在 Evaluation、Benchmarks、Unified、Alignment 等专题分支主表的 Paper / Project 条目会指向对应位置浏览用git checkout 分支名切换即可不要改动仓库内容引用文件引用 MME 或 survey 论文时直接复制 images/bib_mme.txt 或 images/bib_survey.txt避免从论文页手工转录造成版本偏差清单在持续更新新模型与论文按日期插入 Multimodal Instruction Tuning ( Latest Works) 表头找最新进展从这张表顶端开始即可。若使用中卡住下表覆盖了最高频的几种情况。踩坑速查4 个高频问题现象原因解法目录跳转到了错误小节Papers 与 Datasets 两部分都有 Others 小节区分 others 与 others-1 两个锚点对照目录列表确认目标小节论文条目没有代码链接该条 Code 列标注 Coming soon看 Date 列判断时效或按论文标题自行检索代码论文引用格式不准手工从论文页转录容易混版本直接复制仓库内的 bib_mme.txt / bib_survey.txt五十多种评测基准不知选哪个基准按年份混排从 MME、MMBench、Video-MME 三个最常用的入手按图3 分类收尾这个仓库把多模态大语言模型的论文 - 数据 - 评测三要素查找压进一张 Markdown 表省下的都是翻主页面的时间。上手后可以沿三条线深入想要完整评测方法论读 MME-Survey 条目与 MME 评测工具做视频理解看 Video-MME-v2 条目关注全模态交互看 VITA 系列条目。【免费下载链接】Awesome-Multimodal-Large-Language-Models:sparkles::sparkles:Latest Advances on Multimodal Large Language Models项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Multimodal-Large-Language-Models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考