arXiv preprint 2025 ยท preprint

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

Figure: Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

Yolo Yunlong Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

Unified treatment of supervised fine-tuning, reinforcement learning, preference optimization and test-time scaling for Video-LMM reasoning.

My part. Co-authored a comprehensive survey of post-training methods for video-LLMs (chain-of-thought SFT, RLVR, test-time scaling).

Unified treatment of supervised fine-tuning, reinforcement learning, preference optimization and test-time scaling for Video-LMM reasoning.

All publications