arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-08-03 至 2026-08-03 共收录 3
2607.29246 2026-08-03 cs.AI 新提交

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化

Ruiming Liang, Yi Zhong, Yizhen Yuan, Yinan Zheng, Tianyi Tan, Tianyue Wang, Haiyun Guo, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)

AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29211 2026-08-03 cs.CL 新提交

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

何时该放弃:诊断与训练大语言模型以中止无效推理

Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Fandong Meng

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Weixin AI, Tencent Inc(腾讯微信人工智能)

AI总结 该研究针对大语言模型在超能力任务上产生无效推理的问题,提出CaRL方法对齐模型行为与能力边界,实验验证其可减少无效推理且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29011 2026-08-03 cs.RO 新提交

DART: Dual-Axis Airborne Reachability-Gated Torque-Reaction for Off-Road Vehicle Jumps

DART:用于越野车辆跳跃的双轴机载可达性门控扭矩反应

Yu Hu, Fangzhou Zhao, Mingyuan Sang, Cheng Min, Liang Chen, Wei Li, Wenyu Kuang, Shican Chen, Jinwei Li, Baolei Chen

机构 * Research Center for Intelligent Computing Systems, Institute of Computing Technology, CAS(中国科学院计算技术研究所智能计算系统研究中心) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Dong Feng Off-Road Vehicle Co., Ltd(东风越野车有限公司)

AI总结 该研究针对越野车辆腾空着陆的碰撞风险,提出DART双轴机载控制方法,通过起飞前速度整形和飞行中扭矩调节提升着陆成功率,仿真中其性能优于RW-PD和TOBB方法。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏