ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用
机构 * MiroMind ; NTU(国立台湾大学) ; HKU(香港大学) ; HKUST(GZ)(香港科技大学(广州)) ; THU(清华大学) ; LMMs-Lab(LMMs实验室)
专题命中 工具调用 :agentic(title,abstract);tool use(title);agent(abstract);multi-agent(abstract)
AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。
Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/