Daily Paper Cast

E2074 - TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Published: July 22, 2026

Duration: 17:21

🤗 Upvotes: 144 | cs.CV

Authors:
Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

Title:
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Arxiv:
http://arxiv.org/abs/2607.17423v1

Abstract:
Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence int...