AAAI Demonstration Track 2026, Best Demonstration Award Runner-up

Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

Figure: Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

Yolo Yunlong Tang, Jing Bi, Chao Huang, Susan Liang, Daiki Shimada, Hang Hua, Yunzhong Xiao, Yizhi Song, Pinxin Liu, Mingqian Feng, Junjia Guo, Zhuo Liu, Luchuan Song, Ali Vosoughi, Jinxi He, Liu He, Zeliang Zhang, Jiebo Luo, Chenliang Xu

Training-free object-centric video captioning with SAMURAI segmentation, TRACE-Uni temporal analysis and InternVL-2.5 captioning.

Training-free object-centric video captioning with SAMURAI segmentation, TRACE-Uni temporal analysis and InternVL-2.5 captioning.

All publications