arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Edinburgh(爱丁堡大学)

2026-07-08 至 2026-07-08 共收录 3
2607.06388 2026-07-08 cs.RO cs.CV cs.LG 新提交

Learning to Throw Objects Safely in Multi-Obstacle Environments

学习在多障碍物环境中安全投掷物体

Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei

机构 * University of Groningen(格罗宁根大学) University of Edinburgh(爱丁堡大学)

AI总结 研究在多障碍物环境中安全投掷物体的问题,引入势场状态表示,结合动觉演示初始化,用SAC等算法优化,经模拟和真实机器人实验,该表示在成功率和扩展性上表现出色,实现了模拟到真实的可靠迁移。

Comments This paper has been presented at the IEEE International Conference on Robotics & Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05294 2026-07-08 cs.CL 版本更新

Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations

真实还是编造?利用因果归因减轻解释中的奖励作弊

Pedro Ferreira, Wilker Aziz, Ivan Titov

机构 * Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学) Institute for Language, Cognition and Computation (ILCC), University of Edinburgh(语言、认知与计算研究所(ILCC),爱丁堡大学)

AI总结 研究大语言模型解释中因奖励模型导致的奖励作弊问题,提出用预测的因果归因丰富奖励模型输入的方法,该方法能减少大语言模型生成误导性解释的倾向,提升解释忠实度。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏