arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 60891 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 858 篇

1108.4698 2026-06-03 cs.RO cs.SY eess.SY math.OC 57%

Least Squares Temporal Difference Actor-Critic Methods with Applications to Robot Motion Control

最小二乘时序差分演员-评论家方法及其在机器人运动控制中的应用

Reza Moazzez Estanjini, Xu Chu Ding, Morteza Lahijanian, Jing Wang, Calin A. Belta, Ioannis Ch. Paschalidis

专题命中 机器人学习 :robotics(abstract);分类 cs.RO

AI总结 针对最大化到达某些状态同时避免其他状态的概率的马尔可夫决策过程问题,提出一种基于最小二乘时序差分学习的演员-评论家近似动态规划算法,并证明其收敛到参数空间中的驻点。

Comments Technical report accompanying an accepted paper to CDC 2011

详情

展开后加载摘要…

URL PDF HTML 收藏
1103.4342 2026-06-03 cs.RO cs.SY eess.SY math.OC 57%

MDP Optimal Control under Temporal Logic Constraints

时序逻辑约束下的MDP最优控制

Xu Chu Ding, Stephen L. Smith, Calin Belta, Daniela Rus

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 针对马尔可夫决策过程(MDP),提出一种在给定线性时序逻辑(LTL)规范下自动生成控制策略的方法,并引入优化命题以最小化期望成本,通过动态规划算法合成最优或次优策略。

Comments Technical report accompanying the CDC2011 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31075 2026-06-01 cs.CV 57%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 机器人学习 :embodied agent(abstract);分类 cs.CV

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25326 2026-05-26 cs.CV 57%

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

感知-然后-规划:以布局为策略的单目3D场景布局估计

Junwei Zhou, Yu-Wing Tai

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院)

专题命中 机器人学习 :manipulation(abstract);分类 cs.CV

AI总结 提出Perceive-then-Plan框架,通过视觉语言模型将单目3D布局估计转化为感知与迭代规划问题,以布局为策略(LaP)学习动作序列逐步优化场景假设,生成更物理一致且与观测对齐的3D布局。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24922 2026-05-26 cs.RO 57%

MuJoCoUni:Persistent Batched Runtime Primitives for MuJoCo

MuJoCoUni:MuJoCo的持久化批处理运行时原语

Yufei Jia, Junzhe Wu

机构 * Tsinghua University(清华大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 提出MuJoCoUni,一个用于在线机器人学习和批处理物理评估的MuJoCo下游发行版,通过BatchEnvPool提供有状态环境执行的运行时原语,支持高吞吐并行执行并保持上游语义。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23856 2026-05-25 cs.RO 57%

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

专题命中 机器人学习 :robot policy(abstract);分类 cs.RO

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 57%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 机器人学习 :world model(abstract);分类 cs.AI

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17001 2026-05-14 cs.RO 57%

Unify Robot Actions in Camera Frame

在摄像机坐标系中统一机器人动作

Sicheng Xie, Lingchen Meng, Zijie Diao, Haidong Cao, Zhiying Du, Shuyuan Tu, Jiaqi Leng, Qiuyue Wang, Mingsheng Li, Shuai Bai, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 本文提出CalibAll方法,通过摄像机外参标注统一不同机器人平台的动作表示,提升跨平台学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00775 2026-05-13 cs.RO cs.SY eess.SY 57%

SAGAS: Semantic-Aware Graph-Assisted Stitching for Offline Temporal Logic Planning

SAGAS:语义感知的图辅助拼接用于离线时序逻辑规划

Ruijia Liu, Ancheng Hou, Xiang Yin

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 SAGAS结合符号合成的组成性和从离线轨迹学习的数据驱动可达结构,实现零样本泛化,无需任务特定奖励或在线交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03600 2026-05-12 cs.RO 57%

Scalable and Efficient Continual Learning from Demonstration via a Hypernetwork-generated Stable Dynamics Model

通过超网络生成的稳定动力学模型实现可扩展且高效的示范学习

Sayantan Auddy, Jakob Hollenstein, Matteo Saveriano, Antonio Rodríguez-Sánchez, Justus Piater

机构 * Faculty of Electrical Engineering and Computer Science, Technical University of Berlin(电气工程与计算机科学系,柏林技术大学) Department of Computer Science, University of Innsbruck(计算机科学系,因斯布鲁克大学) Digital Science Center (DiSC), University of Innsbruck(数字科学中心(DiSC),因斯布鲁克大学) Department of Industrial Engineering, University of Trento(工业工程系,特伦托大学) Singular Research Center on Intelligent Systems (CiTIUS), University of Santiago de Compostela(智能系统研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种稳定的持续学习方法,利用超网络生成轨迹学习动力学模型和Lyapunov函数,提升稳定性与准确性,通过任务嵌入减少训练时间,实验证明其在多任务学习中优于现有方法。

Comments To appear in IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22449 2026-05-12 cs.AI 57%

Emergence of Physical Intelligence via Controllable Information Production

通过可控信息生成实现物理智能的涌现

Tristan Shah, Stas Tiomkin

机构 * Department of Computer Science(计算机科学系) Texas Tech University(德克萨斯技术大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.AI

AI总结 本文提出可控信息生成框架,将内在动机与最优控制统一,揭示价值函数结构与柯莫哥罗夫-辛恩熵的联系,展现物理智能源于可控混沌边缘的驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01234 2026-05-05 cs.CV 57%

TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

TT4D:一个用于从单目视频中进行乒乓球4D重建的流水线和数据集

Nima Rahmanian, Daniel Kienzle, Thomas Gossard, Dvij Kalaria, Rainer Lienhart, Shankar Sastry

机构 * University of California, Berkeley(加州大学伯克利分校) University of Augsburg(奥格斯堡大学) University of Tübingen(图宾根大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 本文提出TT4D数据集,通过创新的重建流水线实现大规模高精度乒乓球比赛重建,解决单目视频中遮挡和视角变化带来的重建难题,支持虚拟回放和机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14897 2026-04-28 cs.CV 57%

Seer: Language Instructed Video Prediction with Latent Diffusion Models

Seer:基于潜在扩散模型的语言指导视频预测

Xianfan Gu, Chuan Wen, Weirui Ye, Jiaming Song, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai AI Lab(上海人工智能实验室) NVIDIA

专题命中 机器人学习 :robot policy(abstract);分类 cs.CV

AI总结 Seer通过扩展预训练文本到图像扩散模型的时间轴,提出高效模型以实现文本条件视频预测,提升机器人未来预测能力,实验表明其在多个数据集上性能优越。

Comments 31 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11988 2026-04-21 cs.CV 57%

CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

CARI4D:类别无关的人-物体交互4D重建

Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield

机构 * NVIDIA University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 CARI4D提出了一种无需假设物体类别即可从单目RGB视频中重建人-物体交互的4D模型,通过姿态假设选择算法和渲染-比较方法提升重建精度与物理一致性。

Comments CVPR2026 camera ready version. Project page: https://nvlabs.github.io/CARI4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11251 2026-04-20 cs.RO 57%

CLAW: Composable Language-Annotated Whole-body Motion Generation

CLAW:可组合的语言标注全身运动生成

Jianuo Cao, Yuxin Chen, Masayoshi Tomizuka

机构 * Nanjing University(南京大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 CLAW通过结合运动规划和模板引擎,为Unitree G1人形机器人生成可扩展的语言标注全身运动数据,提供实时键盘模式和时间轴序列编辑器,实现物理可行的运动轨迹生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19054 2026-04-16 cs.LG 57%

RANDPOL: Parameter-Efficient End-to-End Quadruped Locomotion via Randomized Policy Learning

RANDPOL: 通过随机策略学习实现参数高效的端到端四足运动

Zhuochen Liu, Rahul Jain, Quan Nguyen

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明希德电气与计算机工程系,南加州大学) Department of Aerospace & Mechanical Engineering, University of Southern California(航空航天与机械工程系,南加州大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出RANDPOL,一种通过随机初始化隐藏层实现参数高效端到端四足运动控制的方法,相比PPO在参数量、计算效率和性能-复杂度平衡上表现更优。

Comments 6 pages main, 7 pages total, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19029 2026-03-20 cs.RO 57%

ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning

ATG-MoE:基于混合专家的自主轨迹生成用于装配技能学习

Weihang Huang, Chaoran Zhang, Xiaoxin Deng, Hao Zhou, Zhaobo Xu, Shubo Cui, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Faculty of Engineering, Imperial College London(伦敦帝国理工学院工程学院)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出ATG-MoE,通过混合专家架构实现多技能整合,解决传统方法在多阶段设计和多技能整合能力上的不足,实验显示其在模拟和实际应用中均表现优异。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17141 2026-03-17 cs.RO 57%

History-Aware Visuomotor Policy Learning via Point Tracking

基于点跟踪的视觉-运动政策学习:历史感知

Jingjing Chen, Hongjie Fang, Chenxi Wang, Shiquan Wang, Cewu Lu

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于点跟踪的对象中心历史表示,通过压缩历史信息提升视觉-运动策略性能,有效解决记忆需求中的任务阶段识别、空间记忆和动作计数等多方面问题。

Comments accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01480 2026-03-03 cs.RO 57%

Towards Robot Skill Learning and Adaptation with Gaussian Processes

基于高斯过程的机器人技能学习与适应

A K M Nadimul Haque, Fouad Sukkar, Sheila Sujipto, Cedric Le Gentil, Marc G. Carmichael, Teresa Vidal-Calleja

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于高斯过程的机器人技能适应框架,通过优化、行为克隆和强化学习方法,在模拟和硬件上实现高成功率和运动学轮廓保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14255 2026-02-17 cs.RO 57%

A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots

面向工业机器人视觉-运动策略学习的延迟感知框架

Daniel Ruan, Salma Mozaffari, Sigrid Adriaenssens, Arash Adel

机构 * Princeton University(普林斯顿大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种面向工业机器人视觉-运动策略学习的延迟感知框架,通过优化执行策略以应对延迟问题,提升策略在现实环境中的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19391 2026-02-16 cs.CV 57%

Fibottention: Inceptive Visual Representation Learning with Diverse Attention Across Heads

Fibottention: 基于多头注意力的视觉表征学习

Ali K. Rahimian, Manish K. Govind, Subhajit Maity, Dominick Reilly, Christian Kümmerle, Srijan Das, Aritra Dutta

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Central Florida(佛罗里达大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 Fibottention通过引入稀疏自注意力机制,实现高效视觉表征学习,减少计算复杂度并提升表示多样性。

Comments The complete implementation, including source code and evaluation scripts, is publicly available at: https://github.com/Charlotte-CharMLab/Fibottention

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11393 2026-02-13 cs.RO 57%

Human Preference Modeling Using Visual Motion Prediction Improves Robot Skill Learning from Egocentric Human Video

通过视觉运动预测建模的人类偏好改进从第一人称人类视频中学习机器人技能

Mrinal Verghese, Christopher G. Atkeson

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 通过视觉运动预测建模人类偏好,改进机器人从第一人称视频学习技能

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10109 2026-02-11 cs.RO 57%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03188 2026-02-04 cs.RO 57%

Hierarchical Proportion Models for Motion Generation via Integration of Motion Primitives

基于运动原语整合的分层比例模型用于运动生成

Yu-Han Shu, Toshiaki Tsuji, Sho Sakaino

机构 * Intelligent and Mechanical Interaction Systems(智能与机械交互系统) University of Tsukuba(东京大学) Science and Engineering(科学与工程) Saitama University(上野大学) Systems and Information Engineering(系统与信息工程)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 本文提出了一种基于运动原语整合的分层比例模型,通过整合比例基于的运动合成提升机器人运动生成的效率和适应性。

Comments 6 pages, 9 figures. Accepted for publication in IEEE AMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00350 2026-02-03 cs.CV 57%

ReLAPSe: Reinforcement-Learning-trained Adversarial Prompt Search for Erased concepts in unlearned diffusion models

ReLAPSe: 通过强化学习训练的对抗性提示搜索消除未学习扩散模型中的擦除概念

Ignacy Kolton, Kacper Marzol, Paweł Batorski, Marcin Mazur, Paul Swoboda, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 机器人学习 :manipulation(abstract);分类 cs.CV

AI总结 ReLAPSe通过强化学习训练对抗性提示搜索,有效恢复扩散模型中被移除的概念,提供高效的去学习测试工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17253 2025-12-22 cs.CV 57%

Mitty: Diffusion-based Human-to-Robot Video Generation

Mitty:基于扩散的Human-to-Robot视频生成

Yiren Song, Cheng Liu, Weijia Mao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15715 2025-12-18 cs.CV 57%

In Pursuit of Pixel Supervision for Visual Pre-training

追寻像素监督用于视觉预训练

Lihe Yang, Shang-Wen Li, Yang Li, Xinjie Lei, Dong Wang, Abdelrahman Mohamed, Hengshuang Zhao, Hu Xu

机构 * FAIR, Meta(Meta研究院)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 Pixio通过增强的掩码自编码器实现像素监督的视觉预训练,表现优异于DINOv3,适用于多种下游任务。

Comments Project page: https://github.com/facebookresearch/pixio

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13707 2025-12-16 cs.RO 57%

Human-Like Robot Impedance Regulation Skill Learning from Human-Human Demonstrations

类人机器人阻抗调节技能从人与人示范中学习

Chenzui Li, Xi Wu, Yiming Chen, Tao Teng, Xuefeng Zhang, Sylvain Calinon, Darwin Caldwell, Fei Chen

机构 * Department of Mechanical and Automation Engineering, T-Stone Robotics Institute, The Chinese University of Hong Kong(机械与自动化工程系,T-Stone机器人研究院,香港中文大学) College of Science and Technology, Ningbo University(科学与技术学院,宁波大学) Idiap Research Institute(Idiap研究机构)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出HIImpRSL框架,通过模仿学习和LSTM模块实现机器人在多人协作任务中类人阻抗调节与适应能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23823 2025-12-10 cs.RO 57%

Control Your Robot: A Unified System for Robot Control and Policy Deployment

掌控你的机器人:一种统一的机器人控制与策略部署系统

Tian Nian, Weijie Ke, Shaolong Zhu, Bingshan Hu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) University of Shanghai for Science and Technology(上海科学技术大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 Control Your Robot提出了一种统一的机器人控制与策略部署框架,通过模块化设计和标准化流程,实现跨平台的数据收集与策略学习,提升机器人学习的可扩展性和可重复性。

Comments Code: https://github.com/Tian-Nian/control_your_robot

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14434 2025-11-19 cs.RO cs.LO 57%

Achieving Safe Control Online through Integration of Harmonic Control Lyapunov-Barrier Functions with Unsafe Object-Centric Action Policies

Marlow Fawn, Matthias Scheutz

机构 * Human-Robot Interaction Laboratory(人机交互实验室) Tufts University(塔夫茨大学) MA 02155, USA(马萨诸塞州02155, 美国)

专题命中 机器人学习 :robot policy(abstract);分类 cs.RO

Comments In Proceedings FMAS 2025, arXiv:2511.13245

Journal ref EPTCS 436, 2025, pp. 69-79

详情

展开后加载摘要…

URL PDF HTML 收藏