arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-30 至 2026-04-30 共收录 53 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 2 篇

2502.05907 2026-04-30 cs.RO 83%

EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks

EvolvingAgent: 基于持续世界模型的课程自进化代理用于长周期任务

Tongtong Feng, Xin Wang, Zekai Zhou, Ren Wang, Yuwei Zhan, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology, Tsinghua University(计算机科学与技术系,北京信息科学与技术国家研究中心,清华大学) Department of Computer Science, University of Sydney(计算机科学系,悉尼大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 本文提出EvolvingAgent,通过持续世界模型实现自主完成长周期任务,采用任务规划、动作控制和反思模块,提升Minecraft和Atari环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26934 2026-04-30 cs.CV 79%

World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

World2VLM: 将世界模型的想象能力蒸馏到VLM中以实现动态空间推理

Wanyue Zhang, Wenxiang Wu, Wang Xu, Jiaxin Luo, Helu Zhi, Yibin Huang, Shuo Ren, Zitao Liu, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出World2VLM框架,通过蒸馏生成式世界模型的空间想象能力到VLM中,提升动态空间推理性能,优于基线模型和测试时世界模型耦合方法。

Comments The code is available at https://github.com/WanyueZhang-ai/World2VLM. The dataset is available at https://huggingface.co/datasets/WanyueZhang/World2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 1 篇

2510.08049 2026-04-30 cs.CL cs.AI 57%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 3 篇

2602.08373 2026-04-30 cs.AI cs.LG 84%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 人机交互与遥操作 :embodied AI(title,abstract);embodied agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26473 2026-04-30 cs.RO 70%

Alter-Art: Exploring Embodied Artistic Creation through a Robot Avatar

Alter-Art:通过机器人拟人化探索具身艺术创作

Do Won Park, Samuele Bordini, Giorgio Grioli, Manuel G. Catalano, Antonio Bicchi

机构 * Soft Robotics for Human Cooperation and Rehabilitation(人类协作与康复软机器人) Istituto Italiano di Tecnologia(意大利技术研究院) Dipartimento di Ingegneria dell’Informazione(信息工程学院)

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 通过机器人拟人化探索具身艺术创作,研究艺术家如何通过远程操控或成为机器人来突破物理限制,影响创作身份与环境互动。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22227 2026-04-30 cs.CY cs.AI cs.HC cs.NE 57%

A Co-Evolutionary Theory of Human-AI Coexistence: Mutualism, Governance, and Dynamics in Complex Societies

人类与人工智能共存的共进化理论:互惠、治理与复杂社会中的动态

Somyajit Chakraborty

机构 * School of Chemistry and Chemical Engineering(化学与化工学院)

专题命中 人机交互与遥操作 :embodied AI(abstract);分类 cs.AI

AI总结 本文提出在治理下的人机共存互惠框架,通过共进化关系设计人类与AI的共存,强调互惠、可逆性、心理安全和社会合法性,通过动态系统模型分析共存条件与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 10 篇

2601.09107 2026-04-30 cs.CV cs.RO 84%

Vision Foundation Models for Domain Generalisable Cross-View Localisation in Planetary Ground-Aerial Robotic Teams

行星地面-空中机器人团队中的域可推广跨视图局部化视觉基础模型

Lachlan Holden, Feras Dayoub, Alberto Candela, David Harvey, Tat-Jun Chin

机构 * AI for Space Group and 3 Andy Thomas Centre for Space Resources, The University of Adelaide(AI空间组和安迪·托马斯太空资源中心,阿德莱德大学) Jet Propulsion Laboratory, California Institute of Technology, Pasadena, CA 91109, USA(喷气推进实验室,加州理工学院,帕萨迪纳,CA 91109,美国) California Institute of Technology(加州理工学院)

专题命中 机器人数据与评测 :robotic(title,abstract);robotics(abstract,comments);分类 cs.RO、cs.CV

AI总结 本文提出基于跨视图局部化的双编码深度神经网络,利用语义分割和合成数据缩小域差距,实现地面车在空中地图中的精准定位。

Comments 7 pages, 10 figures. Presented at the International Conference on Space Robotics (iSpaRo) 2025 in Sendai, Japan. Dataset available: https://doi.org/10.5281/zenodo.17364038

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00209 2026-04-30 eess.IV cs.AI cs.CV cs.RO 82%

SurgiSR4K: A High-Resolution Endoscopic Video Dataset for Robotic-Assisted Minimally Invasive Procedures

SurgiSR4K:一种用于机器人辅助微创手术的高分辨率内窥镜视频数据集

Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Ruixing Liang, Yuxin Chen, Adi Chola Venkatesh, Jason Culman, Tiantian Wu, Lirong Shao, Wenqing Sun, Cong Gao, Hallie McNamara, Jingpei Lu, Omid Mohareri

机构 * Intuitive Surgical, Inc.(Intuitive Surgical公司) Johns Hopkins Medicine Neurosurgery(约翰霍普金斯医学神经外科) Johns Hopkins University Electrical and Computer Engineering(约翰霍普金斯大学电气与计算机工程) University of British Columbia Electrical and Computer Engineering(不列颠哥伦比亚大学电气与计算机工程) Wilford & Kate Bailey Small Animal Teaching Hospital(威尔福德与凯蒂·贝利小动物教学医院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出SurgiSR4K数据集,用于提升微创手术的视觉清晰度和计算机辅助导航精度,包含4K分辨率的手术视频,涵盖镜面反射、工具遮挡等挑战性场景,支持超分辨率、烟雾去除等多任务研究。

Journal ref Machine Learning for Biomedical Imaging, Vol. 3, 2025, pp. 875-885

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09346 2026-04-30 cs.AI cs.RO 81%

Speech-Gesture GAN: Gesture Generation for Robots and Embodied Agents

语音-手势 GAN:面向机器人和具身智能体的手势生成

Carson Yu Liu, Gelareh Mohammadi, Yang Song, Wafa Johal

机构 * Faculty of Engineering, School of Computer Science and Engineering, University of New South Wales(新南威尔士大学工程学院计算机科学与工程学院)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于条件GAN的框架,通过语音文本和语音音频生成手势序列,提升机器人与人类交互的质量和效果。

Comments RO-MAN'23, 32nd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), August 2023, Busan, South Korea

Journal ref In Proc. 2023 32nd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26569 2026-04-30 cs.RO 74%

LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models

LLM-Flax:通过大规模语言模型的神经符号方法实现通用机器人任务规划

Seongmin Kim, Daegyu Lee

机构 * Department of Physical AI Engineering(物理人工智能工程系) Faculty of Department of Advanced Defense Technology and Industry(高级国防技术与产业学院)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 LLM-Flax通过神经符号方法实现通用机器人任务规划,利用本地部署的大语言模型,无需手动编写规则或训练数据,三个阶段框架显著提升了任务规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03992 2026-04-30 cs.CV cs.AI 73%

Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness

基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法

Hanwen Wan, Zexin Lin, Yixuan Deng, Xiaoqiang Ji

机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20714 2026-04-30 cs.CV cs.AI 73%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 62%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26453 2026-04-30 cs.CV 57%

Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints

基于属性引导的多模态深度伪造检测:跨模态取证指纹

Wasim Ahmad, Wei Zhang, Xuerui Mao

机构 * School of Interdisciplinary Science, Beijing Institute of Technology, Beijing 100081, China(交叉学科学院,北京理工大学,北京100081,中国)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AMDD框架,通过跨模态取证指纹一致性损失,引导模型学习生成器特定的取证特征,提升多模态深度伪造检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26067 2026-04-30 cs.CV 57%

RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments

RADIO-ViPE:面向动态环境的在线紧密耦合多模态融合用于开放词汇语义SLAM

Zaid Nasser, Mikhail Iumanov, Tianhao Li, Maxim Popov, Jaafar Mahmoud, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机电学与高效能机器人实验室,ITMO大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 RADIO-ViPE通过在线多模态融合实现动态环境中开放词汇语义SLAM,无需校准RGB-D输入,结合视觉与语言嵌入提升地图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25963 2026-04-30 cs.RO 57%

A Scaled Three-Vehicle Platooning Platform

一个缩放的三车编队平台

Kaiyue Lu, Qiaoxuan Zhang, Yukun Lu

机构 * Dept. of Mechanical Engineering, University of New Brunswick(新不伦瑞克大学机械工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一个缩放的三车编队平台,用于研究协同控制与人机协同自主性,通过控制和可重复的实验提升编队稳定性与路径跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他机器人 7 篇

2504.18662 2026-04-30 cs.RO cs.AI 84%

M2R2: MultiModal Robotic Representation for Temporal Action Segmentation

M2R2:多模态机器人表示用于时序动作分割

Daniel Sliwowski, Dongheui Lee

机构 * Autonomous Systems Lab, Technische Universität Wien (TU Wien)(自主系统实验室,维也纳技术大学) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电研究所,德国航空航天中心)

专题命中 其他机器人 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出M2R2多模态特征提取器,结合本体感知和体外感知信息,解决时序动作分割中多模态特征复用难题,并在三个机器人数据集上取得新突破。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10816 2026-04-30 cs.RO 74%

Dynamically Extensible and Retractable Robotic Leg Linkages for Multi-task Execution in Search and Rescue Scenarios

可动态扩展和收回的多功能救援机器人腿部连杆机构

William Harris, Lucas Yager, Syler Sylvester, Elizabeth Peiros, Micheal C. Yip

机构 * Mechanical and Aerospace Engineering Department, University of California, San Diego(加州大学圣地亚哥分校机械与航空航天工程系) Electrical and Computer Engineering Department, University of California, San Diego(加州大学圣地亚哥分校电气与计算机工程系)

专题命中 其他机器人 :robotic(title);分类 cs.RO

AI总结 本文提出了一种可动态扩展和收回的机器人腿部连杆机构,用于在搜索和救援任务中实现地形适应和高力输出。通过几何变换实现腿部配置的机械切换,实验验证了其在步长、力输出和稳定性方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26822 2026-04-30 cs.NE 71%

Population Dynamics in ARIEL Robotics Systems Featuring Embodied Evolution via Spatial Mating Mechanisms

ARIEL机器人系统中群体动力学的研究:通过空间交配机制实现的具身进化

Victoria Peterson, Akshat Srivastava, Raghav Prabhakar

专题命中 其他机器人 :robotics(title)

AI总结 本文研究了空间结构对进化动态的影响,通过空间嵌入进化算法探讨了空间交配机制对机器人群体稳定性的作用,发现能量选择机制存在相变,并揭示了解耦机制与确定性选择的稳定性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21983 2026-04-30 cs.RO cs.AI 66%

Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning

混合扩散用于同时符号化和连续规划

Sigmund Hennum Høeg, Aksel Vaaler, Chaoqi Liu, Olav Egeland, Yilun Du

机构 * Department of Mechanical and Industrial Engineering, Norwegian University of Science and Technology (NTNU)(挪威科学技术大学机械与工业工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)

AI总结 本文提出混合扩散方法,结合离散变量扩散和连续扩散,提升机器人长周期任务规划性能,实现符号计划与连续轨迹生成的协同优化。

Comments 10 pages, 11 figures. This work has been submitted to the IEEE for possible publication. See https://sigmundhh.com/hybrid_diffusion/ for the project website

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 4, pp. 4489-4496, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19179 2026-04-30 cs.RO cs.SY eess.SY 61%

Distributional Stability of Tangent-Linearized Gaussian Inference on Smooth Manifolds

光滑流形上 tangent-线性化高斯推断的分布稳定性

Junghoon Seo, Hakjin Lee, Jaehoon Sim

机构 * AI Robot Team, PIT IN Corp.(AI机器人团队,PIT IN公司)

专题命中 其他机器人 :robotics(abstract,comments);分类 cs.RO

AI总结 研究光滑流形上 tangent-线性化高斯推断的分布稳定性,推导出非渐近的W2稳定性界,提供闭式诊断方法以切换单图表线性化到多图表或采样推断。

Comments To appear in IEEE Robotics and Automation Letters (IEEE RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19543 2026-04-30 cs.RO 61%

A Virtual Mechanical Interaction Layer Enables Resilient Human-to-Robot Object Handovers

虚拟机械交互层实现人机物体传递的鲁棒性

Omar Faris, Sławomir Tadeja, Fulvio Forni

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出虚拟模型控制层和增强现实技术,提升人机物体传递过程中对物体姿态变化的适应能力,并通过实验验证了其在复杂不确定性下的鲁棒性。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26261 2026-04-30 cs.CV 57%

Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

多一致的2D-3D映射用于鲁棒的零样本3D视觉定位

Yufei Yin, Jie Zheng, Qianke Meng, Zhou Yu, Minghao Chen, Jiajun Ding, Min Tan, Yuling Xi, Zhiwen Chen, Chengfei Lv

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(Inria巴黎-鲁克蒙特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

专题命中 其他机器人 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出MCM-VG框架,通过建立多一致的2D-3D映射实现鲁棒的零样本3D视觉定位,解决开放词汇3D提案质量差的问题,提升目标定位和推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏