Daily Paper Cast

E2086 - ReferTrack: Referring Then Tracking for Embodied Visual Tracking

Published: July 25, 2026

Duration: 20:48

🤗 Upvotes: 45 | cs.RO

Authors:
Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

Title:
ReferTrack: Referring Then Tracking for Embodied Visual Tracking

Arxiv:
http://arxiv.org/abs/2607.20061v1

Abstract:
Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-language-action (VLA) policies unify target identification and trajectory planning, their chain-of-thought (CoT) reasoning often operates in abstract spatial latents that are difficult to supervise and wea...