VideoMMMU

Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos

Models scored

26

evaluated

Modality

multimodal

Category

healthcare

+3 more

Published

2025

arxiv.org

Citations

189

Semantic Scholar

Influential

34

citations

References

0

cited works

Venue

arXiv.org

published in

Abstract

Kairui Hu, Penghao Wu, Fanyi Pu, W. Xiao, et al. (+4)

Humans acquire knowledge through three cognitive stages: perceiving information, comprehending knowledge, and adapting knowledge to solve novel problems. Videos serve as an effective medium for this learning process, facilitating a progression through these cognitive stages. However, existing video benchmarks fail to systematically evaluate the knowledge acquisition capabilities in Large Multimodal Models (LMMs). To address this gap, we introduce Video-MMMU, a multi-modal, multi-disciplinary benchmark designed to assess LMMs' ability to acquire and utilize knowledge from videos. Video-MMMU features a curated collection of 300 expert-level videos and 900 human-annotated questions across six disciplines, evaluating knowledge acquisition through stage-aligned question-answer pairs: Perception, Comprehension, and Adaptation. A proposed knowledge gain metric, {\Delta}knowledge, quantifies improvement in performance after video viewing. Evaluation of LMMs reveals a steep decline in performance as cognitive demands increase and highlights a significant gap between human and model knowledge acquisition, underscoring the need for methods to enhance LMMs' capability to learn and adapt from videos.

healthcaremultimodalreasoningvision

Search

#ModelLabScore
01Gemini 3 ProGoogle88
02Gemini 3 FlashGoogle87
03Kimi K2.5Moonshot AI87
04GPT-5.2OpenAI86
05Qwen3.7-PlusAlibaba Cloud / Qwen Team85
06Gemini 3.1 Flash-LiteGoogle85
07MiniMax M3MiniMax85
08GPT-5OpenAI85
09Qwen3.6-27BAlibaba Cloud / Qwen Team84
10Qwen3.6 PlusAlibaba Cloud / Qwen Team84
11Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team84
12Gemini 2.5 Pro Preview 06-05Google84
13o3OpenAI83
14Qwen3.5-27BAlibaba Cloud / Qwen Team82
15Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team82
16Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team80
17Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team80
18Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team79
19Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team75
20Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team75
21Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team73
22Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team69
23Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team69
24Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team65
25GPT-4oOpenAI61
26Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team56

26 of 26 models · score normalized 0–100 where available

© 2026 NYSGPT2525 LLC