arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-17 至 2026-06-17 共收录 14 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 14 篇

2606.18180 2026-06-17 cs.CV 新提交 83%

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

EgoCS-400K:面向世界模型的自我中心游戏数据集

Rongjin Guo, Dong Liang, Yuhao Liu, Fang Liu, Tianyu Huang, Gerhard P. Hancke, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学)

专题命中 机器人数据与评测 :world model(title,abstract);robotic(abstract);分类 cs.CV

AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17520 2026-06-17 cs.RO cs.CV 新提交 82%

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments

GASE:基于高斯溅射的自动化系统用于重建具身仿真环境

Jiawei Zhang, Yiming Yan, Chao Liang, Nuo Xu, Seson Sun, Qichen Zhang, Yuhao Xu, Yantai Yang, Yingqiao Wang, Qin Jin, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学SAI学院AutoLab实验室) AIM3 Lab, School of Information, Renmin University of China(中国人民大学信息学院AIM3实验室) Research Lab, Anyverse Dynamics(Anyverse Dynamics研究实验室)

专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);manipulation(abstract);navigation(abstract)

AI总结 提出GASE系统,利用全景相机阵列和多视图视频流,通过相机位姿策略提取前景物体并修复场景,独立重建后导入物理仿真器,实现高效高保真仿真环境构建,分割精度提升超10%,真实机器人部署性能差距小于10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18189 2026-06-17 cs.RO 新提交 80%

Beyond Failure Recovery: An Engagement-Aware Human-in-the-loop Framework for Robotic Systems

超越故障恢复:一种面向机器人系统的参与感知人在回路框架

Jiaying Fang, Joyce Yang, Zhanxin Wu, Bohan Yang, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :robotic(title);robotics(abstract,journal_ref);分类 cs.RO

AI总结 提出一种参与感知模型预测控制(E-MPC)方法,通过规划交互频率和类型来维持用户参与度并控制工作负荷,在机器人辅助进食系统中验证了其提升用户体验且不降低任务成功率的效果。

Comments Project website at https://emprise.cs.cornell.edu/empc

Journal ref Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18097 2026-06-17 cs.RO 新提交 79%

WireCraft: A Simulation Benchmark for Industrial DLO Manipulation

WireCraft:工业DLO操作仿真基准

Chongyu Zhu, Ramy ElMallah, Hyegang Kim, Zachary Tang, Jiachen Rao, Artem Arutyunov, Seungyeon Ha, Chi-Guhn Lee

机构 * Department of Mechanical and Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) CREFLE Inc.(CREFLE公司)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO

AI总结 针对工业中可变形线性物体(DLO)操作缺乏统一基准的问题,提出WireCraft仿真基准,支持可配置难度和资产,涵盖三种任务族,并评估强化学习、模仿学习和视觉-语言-动作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19098 2026-06-17 cs.RO 版本更新 79%

SimTO: A two-stage, simulation-driven topology optimization framework for bespoke soft robotic grippers

SimTO:一种面向定制软体机器人夹爪的两阶段仿真驱动拓扑优化框架

Kurt Enkera, Josh Pinskier, Marcus Gallagher, David Howard

机构 * CSIRO Robotics(CSIRO机器人研究所) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 提出SimTO框架,通过两阶段仿真驱动拓扑优化自动提取接触载荷,为特征丰富物体定制软体夹爪,实验证明其抓取力优于传统方法且泛化性强。

Comments 15 pages, 9 figures. Published in Structural and Multidisciplinary Optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17391 2026-06-17 cs.CL cs.AI cs.LG 新提交 76%

NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama

NarrativeWorldBench:面向长程共创音频剧的前沿饱和基准与潜在世界模型

Logan Mann, Abdur Rahman, Mohammad Saifullah, Taaha Kazi, Vasu Sharma

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Pocket FM

专题命中 机器人数据与评测 :world model(title);分类 cs.AI、cs.LG

AI总结 提出NarrativeWorldBench基准,在九种叙事结构指标上评估21个模型,并引入N-VSSM变分状态空间模型,通过Mamba-2骨干和事件条件后验在200集以上维持结构化潜在状态,在长弧一致性和可控性上超越Claude Opus 4.5。

Comments 10 pages. Accepted to the ICML 2026 Workshops on High-dimensional Learning Dynamics (HiLD) and Culture x AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-06-17 cs.RO cs.AI cs.CV 新提交 75%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-06-17 cs.CV cs.AI cs.RO 版本更新 67%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00241 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

Mordal: Automated Pretrained Model Selection for Vision Language Models

Mordal: 面向视觉语言模型的自动化预训练模型选择

Shiqi He, Insu Jang, Mosharaf Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 62%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17978 2026-06-17 cs.AI 新提交 57%

MoCo-AIS: A Contrastive Learning Framework for Similarity Computation of Vessel Trajectories

MoCo-AIS: 一种用于船舶轨迹相似度计算的对比学习框架

Ruixin Song, Md Mahbub Alam, Zahra Sadeghi, Amilcar Soares, José F. Rodrigues-Jr, Gabriel Spadon

机构 * Dalhousie University(达尔豪斯大学) Linnaeus University(林奈大学) University of Sao Paulo(圣保罗大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出基于动量对比(MoCo)的统一对比学习框架MoCo-AIS,通过正负轨迹对学习嵌入,在真实AIS数据集上评估多种深度学习模型,显著提升轨迹相似度学习性能。

Comments Under review at SIGSPATIAL'26

Journal ref arXiv preprint arXiv:2606.17978, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17935 2026-06-17 cs.CV 新提交 57%

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization

MoonSplat: 基于Sim(3)全局优化的单目在线高斯泼溅

Guo Pu, Yixuan Han, Haofeng Li, Yao Zhang, Hui Zhou, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Beijing Hydrogen Intelligent Tech. Co., Ltd.(北京氢元智能科技有限公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出一种结合Sim(3)全局优化的在线体素化3DGS框架,通过颜色残差学习策略加速收敛,实现鲁棒的相机跟踪和全局闭环,在室内外数据集上达到SOTA性能。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17309 2026-06-17 cs.RO 新提交 57%

Abstention-Aware Personalized Object Rearrangement via Uncertainty-Guided LLM Assistance

基于不确定性引导的LLM辅助的弃权感知个性化物体重排

Sam Collin, Ali Ayub

机构 * Concordia University(康考迪亚大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出APOLLO框架,结合轻量级个性化嵌入模型与选择性大语言模型辅助,通过不确定性估计在模糊决策时调用LLM,实现高效、隐私保护的弃权感知物体重排。

Comments Accepted at the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏