
E2086 - ReferTrack: Referring Then Tracking for Embodied Visual Tracking
Published: July 25, 2026
Duration: 20:48
🤗 Upvotes: 45 | cs.RO
Authors:
Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang
Title:
ReferTrack: Referring Then Tracking for Embodied Visual Tracking
Arxiv:
http://arxiv.org/abs/2607.20061v1
Abstract:
Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-language-action (VLA) policies unify target identification and trajectory planning, their chain-of-thought (CoT) reasoning often operates in abstract spatial latents that are difficult to supervise and wea...