Daily Paper Cast

E2057 - SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Published: July 18, 2026

Duration: 19:16

🤗 Upvotes: 71 | cs.CL

Authors:
Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

Title:
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

Arxiv:
http://arxiv.org/abs/2607.14777v1

Abstract:
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between epi...