arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-06 至 2026-08-06 共收录 22 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 5 篇

2608.03387 2026-08-06 cs.RO 版本更新 79%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18066 2026-08-06 cs.RO cs.AI cs.LG q-bio.QM 版本更新 67%

Arnold: A multi-task, multi-embodiment muscle transformer policy

Arnold:一种多任务、多 embodiment 的肌肉 Transformer 策略

Boshi An, Alberto Silvio Chiappa, Merkourios Simos, Chengkun Li, Alexander Mathis

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究开发了基于 Transformer 的肌肉控制策略 Arnold,结合行为克隆与强化学习,实现多任务多 embodiment 控制,性能优于单任务策略,还揭示了肌肉协同作用的任务特异性等特性。

Comments B.A., A.S.C. and M.S. contributed equally. Code is available at https://github.com/amathislab/arnold

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15890 2026-08-06 cs.CV 版本更新 57%

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02915 2026-08-06 cs.RO 版本更新 57%

Zero-shot Sim2Real Transfer for Magnet-Based Tactile Sensor on Insertion Tasks

基于磁敏触觉传感器的零样本仿真到真实迁移在插入任务中的应用

Beining Han, Abhishek Joshi, Jia Deng

机构 * Princeton University(普林斯顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对磁敏触觉传感器的仿真到真实差距问题,提出新型GCS技术,实现了盲插入任务中基于原始触觉读数的RL策略零样本仿真到真实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10153 2026-08-06 quant-ph 版本更新 50%

An Interpretation of Bunched Logic for Reasoning about Heap-Manipulating Quantum Programs

用于推理堆操作量子程序的束逻辑解释

Bonan Su, Li Zhou, Yuan Feng, Mingsheng Ying

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文针对堆操作量子程序的正确性推理挑战,提出了一种束逻辑的量子解释,首次给出分离蕴涵的量子解释,构建了支持局部推理且相对完备的量子分离逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 4 篇

2606.29123 2026-08-06 cs.RO 版本更新 79%

On the Identifiability of Aided Inertial Navigation Under Measurement Delays: A Geometric Approach

关于测量延迟下辅助惯性导航的可辨识性:一种几何方法

Jonathan Kelly

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对辅助惯性导航中未知恒定时间延迟问题,采用几何分析揭示了退化轨迹导致延迟与状态不可辨识的连续对称性。

Comments Technical Report STARS-2026-001, University of Toronto Institute for Aerospace Studies (26 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22014 2026-08-06 cs.MA cs.RO 版本更新 79%

DM$^3$-Nav: Decentralized Multi-Agent Multimodal Multi-Object Semantic Navigation

DM$^3$-Nav:去中心化多智能体多模态多目标语义导航

Amin Kashiri, Atharva Jamsandekar, Yasin Yazıcıoğlu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Northeastern University(东北大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 DM$^3$-Nav是一种去中心化的多智能体语义导航系统,支持多模态开放词汇目标指定和多目标任务,通过局部通信实现自主协调,验证了在真实办公环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17430 2026-08-06 cs.RO 版本更新 57%

SafeLand: Safe Autonomous Landing in Unknown Environments with Bayesian Semantic Mapping

SafeLand: 在未知环境中使用贝叶斯语义映射实现安全自主着陆

Markus Gross, Andreas Greiner, Sai Bharadhwaj Matha, Felix Soest, Daniel Cremers, Henri Meeß

机构 * Fraunhofer IVI Autonomous Aerial Systems(弗劳恩霍夫IVI自主航空系统) TU Munich Computer Vision Group(慕尼黑工业大学计算机视觉组) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出SafeLand系统,通过深度学习语义分割构建在线语义地面地图,结合贝叶斯概率过滤和行为树实现安全自主着陆,通过200次模拟和60次实地测试,展示零误报的人类检测率和亚秒响应延迟。

Journal ref ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04670 2026-08-06 cs.HC 版本更新 50%

Who Responds When the Driver Is Gone? A Framework for Holistic Passenger Intent Understanding

当驾驶员离开时谁来做出反应?一种人类意图理解框架

Xuewen Luo, Ding Fan, Ruiqi Chen, Ye Cao, Xiujin Liu, Bo Yu, Fengze Yang, Chenxi Liu

专题命中 具身导航 :navigation(abstract)

AI总结 研究无人驾驶时谁理解并回应乘客,提出Intent2Drive框架,将意图建模为潜在认知状态,构建数据集和推理器,引入分层规划器,提升意图推理等能力,迈向响应乘客的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 1 篇

2604.21686 2026-08-06 cs.CV 版本更新 79%

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

WorldMark:交互式视频世界模型的统一基准套件

Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Yongtao Ge, Kaipeng Zhang

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2510.17640 2026-08-06 cs.RO cs.AI cs.LG 版本更新 88%

RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation

RESample:通过探索性采样构建鲁棒数据增强框架用于机器人操控

Yuquan Xue, Guanxing Lu, Zhenyu Wu, Chuanrui Zhang, Bofang Jia, Zhengyi Gu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出RESample框架,通过探索性采样机制提升VLA训练数据分布覆盖,有效解决分布外场景下的能力瓶颈问题,实验证明在LIBERO基准和真实机器人任务中性能提升12%。

Comments 8 pages, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2603.12408 2026-08-06 cs.RO cs.LG 版本更新 62%

Imitation Learning from Human Motion Alone Does Not Guarantee Biomechanically Plausible Gait Kinetics

超越动作模仿:仅有人体动作数据是否足以解释步态控制与生物力学?

Xinyi Liu, Jangwhan Ahn, Edgar Lobaton, Jennie Si, He Huang

机构 * Joint Department of Biomedical Engineering, University of North Carolina - Chapel Hill(北卡罗来纳大学教堂山分校联合生物医学工程系) Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电气与计算机工程系) School of Electrical, Computer and Energy Engineering, Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本研究探讨了在基于强化学习的动作模仿框架中,加入足-地面相互作用测量对人类步态运动学和运动动力学估计的影响,发现仅准确再现运动学不足以保证生物力学合理性,需引入动力学约束以提升步态表示的物理一致性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20985 2026-08-06 cs.LG 版本更新 57%

Distributional Active Inference

分布式主动推断

Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种将主动推断整合到分布式强化学习框架中的形式抽象,以提升复杂环境机器人系统最优控制的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04902 2026-08-06 cs.DB 版本更新 50%

AegisTS: An Agent-Driven Hierarchical Reinforcement Learning System for Multivariate Time Series Data Cleaning

AegisTS: 一种基于强化学习的层次化智能体系统用于多变量时间序列数据清洗

Yuhan Shi, Yuanyuan Yao, Lu Chen, Mourad Khayati, Yushuai Li, Tianyi Li

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对多变量时间序列中同时存在的多种质量问题,提出基于强化学习的层次化智能体系统AegisTS,通过联合优化问题处理顺序和清洗模型选择,实现无需真值的高效数据清洗。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 7 篇

2511.20853 2026-08-06 cs.CV cs.AI cs.LG eess.IV 版本更新 67%

MODEST: Multi-Optics Depth-of-Field Stereo Dataset

MODEST:多光学深度景深立体数据集

Nisarg K. Trivedi, Vinayaka A. Belludi, Li-Yun Wang

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出首个高分辨率立体DSLR数据集,涵盖18000张图像,系统变化焦距和光圈,用于研究单目和立体深度估计及景深渲染等任务。

Comments Website, dataset and software tools now available for purely non-commercial, academic research purposes. Significant new contributions. Project page: https://modest-dataset.netlify.app/ Huggingface: https://huggingface.co/datasets/independent-vision-lab/MODEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14833 2026-08-06 cs.RO cs.AI cs.LG 版本更新 67%

Curiosity-Diffuser: Curiosity Guide Diffusion Models for Reliability

Curiosity-Diffuser:引导扩散模型提升可靠性的好奇心机制

Zihao Liu, Xing Liu, Yuhang Dong, Haitao Chang, Zhengxiong Liu, Panfeng Huang

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对机器人神经网络模型不稳定的问题,提出Curiosity-Diffuser方法,结合RND好奇心模块与分类器引导扩散提升策略可靠性,经仿真与真实实验验证有效

Comments Accepted for publication in Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02150 2026-08-06 cs.CV cs.AI 版本更新 62%

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。

Comments 15pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14006 2026-08-06 cs.CV cs.RO 版本更新 62%

ResPlan: A Large-Scale Vector-Graph Dataset of 17,000 Residential Floor Plans

ResPlan:包含17000张住宅平面图的大规模矢量图数据集

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 ResPlan是含17000张住宅平面图的矢量图数据集,具备功能空间标注与四类图边,相比RPLAN、MSD有更高质量单元布局,含相关代码与三个基准任务基线,可公开获取。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28276 2026-08-06 cs.RO 版本更新 57%

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

SimFoundry: 用于策略学习和评估的模块化自动化场景生成

Nadun Ranawaka, Josiah Wong, Wei-Lin Pai, Wei-Teng Chu, Tianyuan Dai, Masoud Moghani, Hang Yin, Yunfan Jiang, Wesley Durbano, Brandon Huynh, Yu Fang, Danfei Xu, Ruohan Zhang, Li Fei-Fei, Linxi Fan, Bowen Wen, Ajay Mandlekar, Yuke Zhu

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出SimFoundry系统,从视频零样本构建仿真场景,支持对象、场景和任务编辑,生成数字孪生与数字表亲,提升策略在真实世界的泛化能力,实验显示仿真评估与真实性能高度相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09659 2026-08-06 cs.RO 版本更新 57%

SACK : Safe Active Continual Koopman Learning for Uncertain Systems with Contractive Guarantees

ASACK : 适应性安全主动持续Koopman学习用于具有收缩保证的不确定系统

Chandan Kumar Sah, Rajpal Singh, Jishnu Keshavan

机构 * Department of Mechanical Engineering, Indian Institute of Science(机械工程系,印度科学研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出ASACK框架,通过合同适应律和主动学习策略实现非线性系统安全高效的持续适应,结合理论误差界与鲁棒MPC提供形式安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07453 2026-08-06 cs.LG stat.ML 版本更新 57%

Data-Aware and Scalable Sensitivity Analysis for Decision Tree Ensembles

面向数据的可扩展敏感性分析用于决策树集成

Namrita Varshney, Ashutosh Gupta, Arhaan Ahmad, Tanay V. Tayal, S. Akshay

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(计算机科学与工程系,印度理工学院班加罗尔)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出了一种数据感知的敏感性分析框架,用于评估决策树集成的鲁棒性和公平性,通过混合整数线性规划和SMT编码提高效率,并在大规模集成上实现了显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 1 篇

2508.21414 2026-08-06 math.OC 版本更新 50%

Stochastic Online Feedback Optimization for Networks of Non-Compliant Agents

面向非合规智能体网络的随机在线反馈优化

Caio Kalil Lauand, Andrey Bernstein

专题命中 其他机器人 :robotic(abstract)

AI总结 本研究针对非合规智能体网络,将在线反馈优化(OFO)框架扩展至随机场景,推导了算法的均方误差界并将其应用于电力系统。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏