arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-14 至 2026-07-14 共收录 142 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 10 篇

2607.09836 2026-07-14 gr-qc astro-ph.HE astro-ph.SR 新提交 50%

Compact stars in a large-tension braneworld: mildly negative Weyl coupling consistent with NICER and gravitational-wave data

大张力膜世界中的致密星:与NICER和引力波数据一致的轻度负外尔耦合

Samuel Isidoro dos Santos Júnior, Rafael Camargo Rodrigues de Lima, Pedro Henrique Ribeiro da Silva Moraes

专题命中 具身推理 :world model(abstract)

AI总结 该研究利用多信使观测的贝叶斯推断,在唯象膜世界模型中约束致密星参数空间,结合多种观测进行分析,得出大张力膜世界中轻度负外尔耦合与现有数据一致,无需大幅偏离广义相对论的结论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 4 篇

2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 80%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 机器人基础模型 :robotics(abstract,abstract_cn);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10655 2026-07-14 cs.RO 新提交 79%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 75%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 62%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 8 篇

2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 82%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 79%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09866 2026-07-14 cs.RO cs.AI 新提交 73%

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Robo-ValueRL:离线到在线强化学习的可靠价值估计

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Beijing Forestry University(北京林业大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。

Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新 62%

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05559 2026-07-14 cs.LG cs.ET math.PR physics.optics 版本更新 57%

Autocorrelation effects in a stochastic-process model for solving two-armed bandit problems

在基于时间序列的决策模型中自相关效应的影响

Tomoki Yamagami, Mikio Hasegawa, Takatomo Mihana, Ryoichi Horisaki, Atsushi Uchida

机构 * Department of Information and Computer Sciences, Saitama University(Saitama大学信息与计算机科学系) Department of Electrical Engineering, Tokyo University of Science(东京科学大学电气工程系) Department of Information Physics and Computing, The University of Tokyo(东京大学信息物理与计算系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本研究通过分析基于时间序列的决策模型,揭示了自相关性质在多臂老虎机问题中的影响,发现环境依赖性及自相关对决策性能的关键作用。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09331 2026-07-14 cs.RO cs.MA 版本更新 57%

CoRL-MPPI: Enhancing MPPI With Learnable Behaviours For Efficient And Provably-Safe Multi-Robot Collision Avoidance

CoRL-MPPI: 通过可学习行为增强MPPI以实现高效且可证明安全的多机器人避障

Stepan Dergachev, Artem Pshenitsyn, Aleksandr Panov, Alexey Skrynnik, Konstantin Yakovlev

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 CoRL-MPPI通过结合协同强化学习与MPPI,提升多机器人避障的效率与安全性。

Comments Comments: 8 pages, 6 figures. Substantially revised version. The manuscript, algorithm description, and figures have been extensively updated. The experimental evaluation has been redesigned with new scenarios, ablation study and an additional car-like motion model

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15353 2026-07-14 stat.AP cs.LG stat.ML 版本更新 57%

Reinforcement Learning in the Real World: A Survey of Statistical Challenges and Future Directions

现实世界中的强化学习:统计挑战与未来方向综述

Asim H. Gazi, Yongyi Guo, Daiqi Gao, Ziping Xu, Kelly W. Zhang, Susan A. Murphy

机构 * Department of Computer Science, Harvard University(哈佛大学计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系) Department of Statistics, Harvard University(哈佛大学统计学系) School of Data Science and Society, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校数据科学与社会学院) Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文综述现实世界强化学习应用,指出其研究与部署存在差距及两大挑战。将应用框架化为三部分过程,回顾应对统计挑战的进展,涵盖在线、离线方法及持续改进设计,还概述受应用启发的未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10830 2026-07-14 cs.CR 新提交 50%

Automated Stealthy Wear-Out Attack on Digital Twins With Deep Reinforcement Learning

基于深度强化学习的数字孪生自动隐身磨损攻击

Joshua Haworth, Aryan Pasikhani, George Pavlides, Prosanta Gope, John Clark

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 研究利用深度强化学习对数字孪生进行隐身磨损攻击,通过操纵控制信号加速特定关节磨损并躲避检测。测试多种算法发现SAC性能最佳,在工业环境中用UR10e机器人手臂评估,证明攻击有效,强调了该攻击对数字孪生环境的风险及防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 3 篇

2607.11792 2026-07-14 cs.RO eess.AS 新提交 84%

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

将所有内容都转换为在线 API 服务?关于在机器人系统中集成本地化语音识别模型的综述

Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova

机构 * Institute of Science Tokyo(东京科学研究所) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 人机交互与遥操作 :robotic(title,abstract);robotics(abstract,comments);分类 cs.RO

AI总结 综述自动语音识别技术在机器人系统中的集成,涵盖其从传统到深度学习模型的演变、相关数据集与工具包,介绍基于 ASR 模型家族等的部署策略及实际平台,指出挑战与未来方向,助力社交机器人研究人员探索人机交互领域。

Comments accepted in 18th International Conference on Social Robotics (ICSR + ART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10811 2026-07-14 cs.MA cs.AI 新提交 79%

Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

分布式智能体系统:具身智能体间的容错协作

Kai Yu, Lu Chen, Hanqi Li

专题命中 人机交互与遥操作 :embodied agent(title,abstract);分类 cs.AI

AI总结 针对人工智能工程中智能体驱动任务执行面临的可靠性挑战,提出分布式智能体系统(DAS)框架,重新定义智能体可靠性,构建两层容错架构,为工业场景中异构具身智能体可靠协作提供实用工程途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10372 2026-07-14 cs.RO cs.CV 新提交 76%

Robotic Contextual Awareness for Human-Robot Collaboration and Environmental Understanding

用于人机协作和环境理解的机器人上下文感知

Federico Rollo

机构 * Università di Trento(特伦托大学) Istituto Italiano di Tecnologia(意大利技术研究院) Leonardo Spa(莱昂纳多公司)

专题命中 人机交互与遥操作 :robotic(title);分类 cs.RO、cs.CV

AI总结 针对自主移动机器人缺乏上下文感知的问题,本文探索两个互补方向:一是人类重新识别与跟踪以改善人机协作,二是增强机器人对环境的几何和语义感知能力,提升语义理解,推动机器人更具上下文感知,实现安全共存与高效协作。

Comments Ph.D. thesis 2026. Officially published in the IRIS institutional repository of the University of Trento (https://hdl.handle.net/11572/482510) and deposited in the Italian National Legal Deposit for Ph.D. theses

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 27 篇

2607.11643 2026-07-14 cs.RO cs.AI 新提交 86%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 机器人数据与评测 :robotics(title,abstract);manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03953 2026-07-14 cs.RO cs.AI cs.CV 版本更新 85%

RVN-Bench: A Benchmark for Reactive Visual Navigation

RVN-Bench: 一种用于反应式视觉导航的基准测试

Jaewon Lee, Jaeseok Heo, Gunmin Lee, Howoong Jun, Jeongwoo Oh, Songhwai Oh

机构 * Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Department of Electrical and Computer Engineering, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI)(电气与计算机工程系,首尔国立大学(SNU)和自动化与系统研究所(ASRI)) Interdisciplinary Program in Artificial Intelligence, Seoul National University (SNU) and Automation and Systems Research Institute (ASRI) and Sequor Robotics Inc.(人工智能跨学科项目,首尔国立大学(SNU)和自动化与系统研究所(ASRI)以及Sequor机器人公司) Sequor Robotics Inc.(Sequor机器人公司)

专题命中 机器人数据与评测 :navigation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RVN-Bench是一种针对室内移动机器人安全视觉导航的碰撞感知基准测试,通过高保真度场景和标准化工具,支持在线和离线学习,提升导航任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09792 2026-07-14 cs.RO cs.AI 新提交 84%

A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation

具身视觉与语言导航的全面综述与系统真实世界评估

Liuyi Wang, Kai Sheng, Zongtao He, Jinlong Li, Yongrui Qin, Haojie Dai, Xiangyi Wang, Jingwei Yang, Qingqing Yan, Chengju Liu, Qijun Chen

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 机器人数据与评测 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 综述具身视觉与语言导航研究,按动作和模型范式组织方法并分析优缺点,在物理机器人平台对代表性配置进行真实世界评估,揭示模拟与真实部署的性能差距,强调未来研究在感知、决策和控制方面的关键挑战。

Comments This paper has been accepted by IEEE TASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07459 2026-07-14 cs.RO cs.CV 版本更新 84%

EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI

EmbodiedGen V2:用于具身人工智能的具有智能体特性、可用于模拟的3D世界引擎

Xinjie Wang, Liu Liu, Taojun Ding, Andrew Choi, Chaodong Huang, Mengao Zhao, Ziang Li, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Wei Xu, Zhizhong Su

机构 * Horizon Robotics(地平线机器人) WuwenAI(悟文智能)

专题命中 机器人数据与评测 :embodied AI(title);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究提出EmbodiedGen V2这个用于具身智能的3D世界引擎,通过统一表示解决资产组装问题。其生成环境支持多种任务,评估中资产管道表现良好,强化学习提升了模拟成功率,确立了它作为可扩展模拟基础设施的地位。

Comments Minor revisions to presentation; technical content and results remain unchanged. Project page: horizonrobotics.github.io/EmbodiedGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11004 2026-07-14 cs.RO cs.AI 新提交 81%

Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion

基于文本目标和通过实到模拟图像转换实现从模拟到现实泛化的基于可供性的操纵规划

Solvi Arnold, Rin Karashima, Tadashi Adachi, Takafumi Mochizuki, Kimitoshi Yamazaki

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究提出基于可供性识别与动作效果预测的操纵规划系统,通过多模态目标匹配模块评估候选计划,能跟踪遮挡物体位置。还用图像转换模块辅助,分别评估模块性能并展示集成系统在模拟与硬件上的规划能力。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21001 2026-07-14 cs.GT 版本更新 78%

Do Large Language Model Voters Strategize? An Oracle-Based Benchmark for Manipulation under Voting Rules

大语言模型选民会策略投票吗?一个基于预言机的投票规则操纵基准测试

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 机器人数据与评测 :manipulation(title,abstract)

AI总结 本文提出一个基于预言机的基准测试,通过枚举所有可行报告并计算真实结果,评估大语言模型选民能否发现并执行策略投票,覆盖多种投票规则和提示条件。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11779 2026-07-14 cs.RO 新提交 77%

A Compact Top-Loading Robot for Endovascular Interventions: Design, Control and Evaluation

一种用于血管内介入的紧凑型顶部加载机器人:设计、控制与评估

Jonas Fischer, Lennart Karstensen, Franziska Mathis-Ullrich

机构 * Laboratory for Surgical Planning and Robot Cognition (SPARC)(外科规划与机器人认知实验室)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对血管内介入现有系统问题,提出紧凑型顶部加载机器人系统,通过主从控制策略实现连续运动,经实验评估其运动轮廓平滑,在体外条件下具技术可行性,紧凑设计利于临床整合,未来将改进相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新 74%

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

专题命中 机器人数据与评测 :world model(title);分类 cs.CV

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11397 2026-07-14 cs.RO 新提交 70%

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作

Jiahao Liu, Zhongpu Xia, Shuai Tian, Huangrui Li, Yuhang Zheng, Ning Ma, Xin Fu, Xiaotian Liu, Jing Li, Yixian Li, ShangQing Zhou, Zebin Xing, Linbo Wang, Chaoyue Li, Haoran Li, Dongbin Zhao

机构 * CASIA(中国科学院自动化所) Anyverse Dynamics(Anyverse动力学公司) UCAS(中国科学院大学) NUS(新加坡国立大学) XJYLU(西安交通大学利物浦大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。

Comments Project page: https://liujiahao2077.github.io/WALA.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10892 2026-07-14 cs.RO 新提交 70%

A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

用于多任务块推的单扩散策略控制器,具有零样本模拟到现实转移

Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究旨在用强化学习从零训练单扩散策略用于多任务块推,提出含简单策略损失函数的框架,结合反向课程生成等应对探索挑战,评估其在不同条件下零样本从模拟到现实的转移能力,证明该流程有效。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 70%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV 70%

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09785 2026-07-14 cs.CV cs.AI 新提交 62%

Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models

终身表示:视觉模型持续自监督学习综述

Sergi Masip, Alicja Dobrzeniecka, Jonathan Swinnen, Joachim Collin, Bartłomiej Twardowski, Szymon Łukasik, Tinne Tuytelaars

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 综述视觉领域持续自监督学习(CSSL),分析现有评估协议问题,探讨自监督目标抗灾难性遗忘原因,基于遗忘缓解策略对方法分类,识别如可扩展性等挑战,提出推进CSSL需转向大规模持续预训练范式。

Comments This work has been accepted for publication in IEEE EAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06279 2026-07-14 cs.CV cs.RO eess.IV 版本更新 62%

Can we Trust Unreliable Voxels? Exploring 3D Semantic Occupancy Prediction under Label Noise

我们能信任不可靠的体素吗?在标签噪声下的3D语义占用预测探索

Wenxin Li, Kunyu Peng, Di Wen, Junwei Zheng, Jiale Wei, Mengfei Duan, Yuheng Zhang, Rui Fan, Kailun Yang

机构 * School of Artificial Intelligence and Robotics(人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心) Institute for Anthropomatics and Robotics(人机一体化与机器人研究所) Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) INSAIT College of Electronic and Information Engineering(电子与信息学院) Shanghai Institute of Intelligent Science and Technology(智能科学与技术上海研究院) Shanghai Research Institute for Intelligent Autonomous Systems(智能自主系统上海研究院) Shanghai Key Laboratory of Intelligent Autonomous Systems(智能自主系统上海重点实验室) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DPR-Occ框架,通过双源部分标签推理解决3D语义占用预测中的标签噪声问题,实验表明其在高噪声环境下仍能保持性能。

Comments Accepted to IROS 2026. The benchmark and source code will be made publicly available at https://github.com/mylwx/OccNL

详情

展开后加载摘要…

URL PDF HTML 收藏