arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Beihang University(北京航空航天大学)

2026-03-02 至 2026-03-02 共收录 3
2602.24110 2026-03-02 cs.AI cs.CL

Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance

回收失败:通过细粒度反策略指导在RLVR中恢复探索

Yanwei Ren, Haotian Zhang, Likang Xiao, Xikai Zhang, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州国际创新研究院) University of Leicester, Leicester, United Kingdom(莱斯特大学) Nanyang Technological University, Singapore(南洋理工大学) The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学)

AI总结 SCOPE通过细粒度反策略指导在RLVR中恢复探索,提高轨迹多样性13.5%,在数学推理和分布外推理任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23876 2026-03-02 cs.AI cs.LG

RF-Agent: Automated Reward Function Design via Language Agent Tree Search

RF-Agent: 通过语言代理树搜索实现自动奖励函数设计

Ning Gao, Xiuhui Zhang, Xingyu Jiang, Mukang You, Mohan Zhang, Yue Deng

机构 * Beihang University(北航大学)

AI总结 RF-Agent通过语言代理树搜索实现自动奖励函数设计,利用蒙特卡洛树搜索和LLMs的上下文推理能力,提升低层控制任务的奖励函数设计效率和效果。

Comments 39 pages, 9 tables, 11 figures, Project page see https://github.com/deng-ai-lab/RF-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23681 2026-03-02 cs.AI

ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference

ODAR:通过主动推断实现LLM推理的原理性自适应路由

Siyuan Ma, Bo Gao, Xiaojun Jia, Simeng Qin, Tianlin Li, Ke Ma, Xiaoshuang Jia, Wenqi Ren, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) Northeast University (Qinhuangdao Campus)(东北大学(秦皇岛校区)) Beihang University(北航) University of the Chinese Academy of Sciences(中国科学院大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学)

AI总结 ODAR通过主动推断实现LLM推理的原理性自适应路由,优化精度-效率权衡,提升计算匹配下的准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏