arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-13 至 2026-03-13 共收录 57 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 11 篇

2511.20823 2026-03-13 cs.CV cs.AI cs.LG 67%

RefTr: Recurrent Refinement of Confluent Trajectories for 3D Vascular Tree Centerlines

RefTr: 基于连通轨迹的3D血管树中心线递归细化

Roman Naeem, David Hagerman, Jennifer Alvén, Fredrik Kahl

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 RefTr通过递归细化连通轨迹生成3D血管树中心线,采用Transformer架构提升精度并减少参数,实验显示其在性能、速度和参数数量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08420 2026-03-13 cs.RO cs.AI cs.HC 62%

Human-Aware Robot Behaviour in Self-Driving Labs

具有人类意识的自主驾驶实验室中的机器人行为

Satheeshkumar Veeramani, Anna Kisil, Abigail Bentley, Hatem Fakhruldeen, Gabriella Pizzuto, Andrew I. Cooper

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于AI的具身感知方法,通过预测人类意图实现自主驾驶实验室中机器人与人类的主动交互,提升实验室自动化流程的效率和协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11658 2026-03-13 cs.RO 57%

Coupling Tensor Trains with Graph of Convex Sets: Effective Compression, Exploration, and Planning in the C-Space

张量张量与凸集图的耦合:在C空间中实现有效的压缩、探索与规划

Gerhard Reinerth, Riddhiman Laha, Marcello Romano

机构 * Technical University of Munich(慕尼黑技术大学) Northeastern University(东北大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 TANGO通过结合张量压缩与图优化,在C空间中实现高效、几何感知的运动规划,提升轨迹生成的质量和效率。

Comments 8 pages, 10 figures, accepted paper for ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00783 2026-03-13 cs.RO cs.SY eess.SY 57%

When Semantics Connect the Swarm: LLM-Driven Fuzzy Control for Cooperative Multi-Robot Underwater Coverage

当语义连接群体:由LLM驱动的模糊控制用于协作多机器人水下覆盖

Jingzehua Xu, Weihang Zhang, Yangyang Li, Hongmiaoyi Zhang, Guanwen Xie, Jiwei Tang, Shuai Zhang, Yi Li

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种由LLM驱动的模糊控制框架,用于实现多机器人水下协作覆盖,通过语义引导实现高效导航和探索。

Comments Withdrawal for further improvement. The final version will be released in a few months

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11303 2026-03-13 cs.HC 50%

Bridging the Cognitive Gap: Co-Designing and Evaluating a Voice-Enabled Community Chatbot for Older Adults

弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人

Feng Chen, Luna Xingyu Li, Ray-Yuan Chung, Wenyu Zeng, Yein Jeon, Yizhou Hu, Oleg Zaslavsky

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 2 篇

2502.00622 2026-03-13 cs.RO cs.CV cs.LG 87%

Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling

生成式预测控制:通过预测世界建模增强推理时间的机器人策略

Han Qi, Haocheng Yin, Aris Zhu, Yilun Du, Heng Yang

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 GPC通过预测世界建模在推理时间提升机器人策略,结合生成先验与前瞻性预测,实现测试时间适应,优于行为克隆并与其他基线方法相媲美。

Comments Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR 57%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2603.11080 2026-03-13 cs.RO 77%

SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly

SELF-VLA: 一种增强技能的代理视觉-语言-动作框架用于接触丰富的拆解

Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 SELF-VLA是一种整合显式拆解技能的代理视觉-语言-动作框架,通过实验在接触丰富的拆解任务中优于现有端到端VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 7 篇

2509.11125 2026-03-13 cs.RO cs.CV 88%

ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations

ManiVID-3D: 通用的视角不变强化学习用于机器人操作的解耦3D表示

Zheng Li, Pei Qu, Yufei Jia, Shihui Zhou, Haizhou Ge, Jiahang Cao, Jinni Zhou, Guyue Zhou, Jun Ma

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 ManiVID-3D通过解耦3D表示实现视角不变的强化学习,提升机器人操作在视角变化下的鲁棒性和效率。

Comments Accepted to RA-L. Project website: https://zheng-joe-lee.github.io/manivid3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11110 2026-03-13 cs.RO cs.AI 86%

ResWM: Residual-Action World Model for Visual RL

ResWM:基于视觉强化学习的残差动作世界模型

Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)

专题命中 模仿学习与强化学习 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。

Comments Submit KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11470 2026-03-13 cs.RO 79%

NFPO: Stabilized Policy Optimization of Normalizing Flow for Robotic Policy Learning

NFPO:归一化流在机器人策略学习中的稳定策略优化

Diyuan Shi, Yiqi Tang, Zifeng Zhuang, Donglin Wang

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出NFPO方法,利用归一化流作为策略参数化,解决在线强化学习中训练不稳定问题,通过实验展示其在机器人学习任务中的稳健性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11351 2026-03-13 cs.RO cs.AI 62%

Novelty Adaptation Through Hybrid Large Language Model (LLM)-Symbolic Planning and LLM-guided Reinforcement Learning

通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应

Hong Lu, Pierrick Lorang, Timothy R. Duggan, Jivko Sinapov, Matthias Scheutz

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Austrian Institute of Technology GmbH(奥地利技术研究所)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12087 2026-03-13 cs.LG 57%

Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics

跨领域策略优化 via 域间Bellman一致性与混合批评者

Ming-Hong Chen, Kuan-Chen Pan, You-De Huang, Xi Liu, Ping-Chun Hsieh

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文提出QAvatar方法,通过域间Bellman一致性与混合批评者解决跨领域RL中的可转移性问题,实现可靠的知识迁移。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11433 2026-03-13 cs.AI cs.CR 57%

Adversarial Reinforcement Learning for Detecting False Data Injection Attacks in Vehicular Routing

对抗性强化学习用于检测车联网中的虚假数据注入攻击

Taha Eghtesad, Yevgeniy Vorobeychik, Aron Laszka

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出基于对抗性强化学习的方法,用于检测车联网中的虚假数据注入攻击,通过纳什均衡策略优化检测效果,提升交通网络的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11582 2026-03-13 eess.SY cs.MA cs.SY 50%

Multi-Agent Reinforcement Learning for UAV-Based Chemical Plume Source Localization

基于无人机的化学烟雾源定位的多智能体强化学习

Zhirun Li, Derek Hollenbeck, Ruikun Wu, Michelle Sherman, Sihua Shao, Xiang Sun, Mostafa Hassanalian

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本研究提出基于多智能体深度强化学习的框架,用于无人机在化学烟雾源定位中的高效检测与精准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2511.19113 2026-03-13 cs.NI 50%

Agent Discovery in Internet of Agents: Challenges and Solutions

在智能体互联网中的智能体发现:挑战与解决方案

Shaolong Guo, Yuntao Wang, Zhou Su, Yanghe Pan, Qinnan Hu, Tom H. Luan

专题命中 人机交互与遥操作 :embodied agent(abstract)

AI总结 本文提出了一种两阶段能力发现框架,通过自主能力声明和任务驱动的发现机制,提升智能体互联网中智能体能力发现的性能与可扩展性。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Network, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 8 篇

2603.12193 2026-03-13 cs.RO cs.CV 87%

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotics(title);分类 cs.RO、cs.CV

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11106 2026-03-13 cs.CV cs.RO 87%

RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测

Shijie Zhou, Bin Zhu, Jiarui Yang, Xiangyu Zhao, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Singapore Management University(新加坡国立大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.CV

AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11634 2026-03-13 cs.RO 83%

Diversity You Can Actually Measure: A Fast, Model-Free Diversity Metric for Robotics Datasets

可衡量的多样性:一种快速、无模型的机器人数据集多样性度量方法

Sreevardhan Sirigiri, Nathan Samuel de Lara, Christopher Agia, Florian Shkurti, Fabio Ramos

专题命中 机器人数据与评测 :robotics(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出FAKTUAL算法,通过计算演示数据集的熵来提升机器人模仿学习中数据集的多样性,从而提高下游任务的成功率,同时具有较高的计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09175 2026-03-13 cs.RO 79%

STONE Dataset: A Scalable Multi-Modal Surround-View 3D Traversability Dataset for Off-Road Robot Navigation

STONE数据集:一个可扩展的多模态周围视图3D可通行性数据集用于越野机器人导航

Konyul Park, Daehun Kim, Jiyong Oh, Seunghoon Yu, Junseo Park, Jaehyun Park, Hongjae Shin, Hyungchan Cho, Jungho Kim, Jun Won Choi

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 STONE数据集通过大规模多模态数据和自动标注流程,为越野机器人导航中的3D可通行性预测提供了可扩展的地面真实值和基准测试平台。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16667 2026-03-13 cs.RO cs.CV 73%

ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance

ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成

Zhuohao Li, Yinghao Li, Jian-Jian Jiang, Lang Zhou, Tianyu Zhang, Jiadong Yin, Mu Lin, Yi-Lin Wei, Wei-Shi Zheng

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11554 2026-03-13 cs.CV cs.AI cs.RO 67%

MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

MANSION: 多楼层语言到3D场景生成用于长周期任务

Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su

机构 * Tsinghua University(清华大学) AgiBot McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11400 2026-03-13 cs.RO cs.AI cs.LG 67%

Deployment-Time Reliability of Learned Robot Policies

部署时学习机器人策略的可靠性

Christopher Agia

机构 * STANFORD UNIVERSITY(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究了如何通过部署时机制提升学习机器人策略的可靠性,提出运行时监控、数据驱动的可解释性框架及长周期任务执行方法,以应对部署中的分布偏移、误差叠加和复杂依赖性问题。

Comments Stanford University PhD dissertation, 2026. 182 pages, 37 figures. Available from Stanford Digital Repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07791 2026-03-13 cs.CV 57%

GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models

GTR-Bench:评估视觉-语言模型中的地理时间推理

Qinghongbing Xie, Zhaoyuan Xia, Feng Zhu, Lijun Gong, Ziyue Li, Rui Zhao, Long Zeng

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Peking University(北京大学) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。

Comments ICLR 2026, 31 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 3 篇

2603.11320 2026-03-13 cs.CV 57%

UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

UniCompress: 用于统一视觉-语言理解和生成的标记压缩

Ziyao Wang, Chen Chen, Jingtao Li, Weiming Zhuang, Jiabo Huang, Ang Li, Lingjuan Lyu

专题命中 其他机器人 :embodied AI(abstract);分类 cs.CV

AI总结 UniCompress通过引入可学习的全局元标记引导的插件压缩和解压缩机制,显著减少视觉标记数量,同时保持图像理解和生成任务的性能,为资源受限场景下的统一多模态建模提供高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13799 2026-03-13 eess.SY cs.SY 50%

Linear viscoelastic rheological FrBD models

线性粘弹性 rheological FrBD 模型

Luigi Romano, Ole Morten Aamo, Jan Åslund, Erik Frisk

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出基于广义Maxwell和广义Kelvin-Voigt模型的FrBD框架,用于构建速率和状态依赖的摩擦模型,并探讨其在控制设计中的应用。

Comments 6 pages, 3 figures. Under review at IEEE LCSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14386 2026-03-13 eess.SY cs.SY 50%

Exploiting Over-The-Air Consensus for Collision Avoidance and Formation Control in Multi-Agent Systems

利用空中共识实现多智能体系统的避障与编队控制

Michael Epp, Fabio Molinari, Joerg Raisch

专题命中 其他机器人 :robotic(abstract)

AI总结 本文提出利用空中共识技术实现多智能体系统的高效编队与避障控制,通过利用无线信道干扰提升通信效率,展现了在大规模智能体场景下的优越性能。

Comments Submitted to CDC 2024

Journal ref 2024 IEEE 63rd Conference on Decision and Control (CDC), pp. 5417-5423

详情

展开后加载摘要…

URL PDF HTML 收藏