arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-08 至 2026-07-08 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 7 篇

2606.20031 2026-07-08 cs.RO cs.AI 新提交 81%

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems

一种用于机器人移动履行系统高效路径规划的神经形态强化学习框架

Junzhe Xu, Zecui Zeng, Lusong Li, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 提出SDQN-RMFS框架,通过ANN到SNN的转换和硬标签知识蒸馏,在神经形态芯片上实现超低功耗路径规划,相比GPU能耗降低11281倍,延迟减少近一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19990 2026-07-08 cs.AI 新提交 79%

Reward as An Agent for Embodied World Models

奖励作为具身世界模型的智能体

Pu Li, Zhigang Lin, Qiang Wu, Yongxuan Lv, Fei Wang, Shan You

机构 * ACE Robotics(ACE机器人)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI

AI总结 提出奖励智能体框架和动态感知 rollout 多样化方法,通过鲁棒验证支持更广泛探索,缓解奖励黑客问题,提升世界模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16595 2026-07-08 cs.RO cs.LG 版本更新 73%

HERB: Human-augmented Efficient Reinforcement learning for Bin-packing

HERB:用于装箱的人类增强高效强化学习

Gojko Perovic, Nuno Ferreira Duarte, Atabak Dehban, Gonçalo Teixeira, Egidio Falotico, José Santos-Victor

机构 * BioRobotics Institute, Scuola Superiore Sant’Anna, Pisa, Italy, and with the Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna, Pisa, Italy(生物机器人研究所,圣安娜高等学院,意大利比萨,以及与机器人与人工智能卓越部门,圣安娜高等学院,意大利比萨) Institute for Systems and Robotics, Instituto Superior Técnico, Universidade de Lisboa(系统与机器人研究所,技术高等学院,里斯本大学)

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究针对不规则物体装箱问题,提出HERB人类增强RL框架,结合人类示范与RL探索确定物体放置,实验表明该方法在效率、延迟上优于其他方法,且策略更稳定、似人类,还验证了现实可行性。

Comments 8 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06388 2026-07-08 cs.RO cs.CV cs.LG 新提交 69%

Learning to Throw Objects Safely in Multi-Obstacle Environments

学习在多障碍物环境中安全投掷物体

Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei

机构 * University of Groningen(格罗宁根大学) University of Edinburgh(爱丁堡大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

AI总结 研究在多障碍物环境中安全投掷物体的问题,引入势场状态表示,结合动觉演示初始化,用SAC等算法优化,经模拟和真实机器人实验,该表示在成功率和扩展性上表现出色,实现了模拟到真实的可靠迁移。

Comments This paper has been presented at the IEEE International Conference on Robotics & Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05391 2026-07-08 cs.AI cs.CL cs.LG cs.MA cs.RO 新提交 67%

LLM-as-a-Verifier: A General-Purpose Verification Framework

LLM-as-a-Verifier:一种通用验证框架

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(英伟达研究院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。

Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 62%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02965 2026-07-08 cs.LG cs.SY eess.SP eess.SY stat.ML 版本更新 57%

Joint Energy Management and Coordinated AIGC Workload Scheduling for Distributed Data Centers: A Diffusion-Aided Reward Shaping Approach

分布式数据中心的联合能源管理与协同AIGC工作负载调度:一种扩散辅助奖励塑造方法

Yang Fu, Peng Qin, Liming Chen, Zihao Zhang, Hao Yu, Yifei Wang

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对AIGC在数据中心带来的能源管理与工作负载调度挑战,提出联合调度框架,考虑多种能源资源,制定系统效用最大化问题。因奖励稀疏限制DRL算法,开发扩散模型辅助奖励塑造方法,实验表明该方案能有效适应波动和异质性,实现高效学习收敛和系统效用。

详情

展开后加载摘要…

URL PDF HTML 收藏