arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-26 至 2026-05-26 共收录 26 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 26 篇

2605.25874 2026-05-26 cs.CV 83%

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

WBench:面向交互式视频世界模型评估的综合多轮基准

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

机构 * Fudan University(复旦大学) Meituan Longcat Team(美团Longcat团队)

专题命中 机器人数据与评测 :world model(title,abstract);navigation(abstract);分类 cs.CV

AI总结 提出WBench,一个包含五个维度、289个测试用例和1058轮交互的综合多轮基准,用于系统评估交互式世界模型,并发现现有模型在不同维度上表现不一。

Comments Technical report of WBench. Homepage: https://meituan-longcat.github.io/WBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24339 2026-05-26 cs.RO 83%

IsaacIPC: Coupling High-Fidelity Simulation and Realistic Rendering for Contact-Rich Robotic Systems

IsaacIPC: 面向高接触度机器人系统的高保真仿真与逼真渲染耦合框架

Qixin Liang, Zhongqing Han

机构 * Anker Humanoid Lab(安ker人形实验室) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出IsaacIPC框架,通过耦合GPU加速增量势接触(IPC)与IsaacSim/Lab,实现仿真与视觉网格间的变形映射,并引入几何砂浆接触势(GMCP)改善触觉传感中的接触压力分布,支持刚柔耦合机器人仿真。

Comments This is a tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24074 2026-05-26 cs.CV cs.RO 80%

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

WideDepth: 用于鱼眼深度估计的毫米级精度基准

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

机构 * Robotics Center(机器人中心) AXXX Trusted AI Research Center, RAS(可信人工智能研究中心,俄罗斯科学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出首个室内鱼眼深度估计数据集WideDepth,包含101个场景的5K高分辨率立体对和毫米级真值,并引入基于LiDAR的立体鱼眼图像生成方法,评估多种模型,微调后性能提升高达62%。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16435 2026-05-26 cs.RO cs.CL cs.HC 79%

What Questions Should Robots Be Able to Answer? A Dataset of User Questions for Explainable Robotics

机器人应该能够回答哪些问题?一个用于可解释机器人的用户问题数据集

Lennart Wachowiak, Andrew Coles, Gerard Canal, Oya Celiktutan

机构 * King's College London, CDT in Safe and Trusted AI(国王学院伦敦大学,安全与可信人工智能中心) King's College London(国王学院伦敦大学)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO

AI总结 本文通过收集100名参与者的1893个问题,构建了一个面向家用机器人的用户问题数据集,涵盖12个类别和70个子类别,旨在帮助机器人学家确定机器人需要回答的关键问题类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24931 2026-05-26 cs.RO 77%

Learning High-Frequency Continuous Action Chunks in Latent Space

在潜在空间中学习高频连续动作块

Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) National University of Singapore, Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Fudan University, Shanghai, China(复旦大学)

专题命中 机器人数据与评测 :robotics(abstract,abstract_cn);robotic(abstract);分类 cs.RO

AI总结 本文提出通过变分自编码器将高频动作学习从动作空间转移到潜在空间,并引入Reuse-then-Refine块级精炼策略,以提升高频控制的时间与空间一致性,实现复杂接触任务的平滑执行。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25401 2026-05-26 cs.RO 74%

Path Following Control System of Line-of-Sight Guidance for Robotic Dolphin with Multi-Link Mechanism in Underwater Simulator

水下模拟器中多连杆机构仿生海豚的视线导引路径跟踪控制系统

Takumi Asada, Takao Oki, Hideo Furuhashi, Kenta Tabata, Renato Miyagusuku, Koichi Ozaki

机构 * Utsunomiya University(乌山大学) Aichi Institute of Technology(爱知技术大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 针对多连杆仿生自主水下航行器(BAUV),提出了一种基于视线导引的路径跟踪控制系统,并在水下模拟器中进行了参数确定和控制方法评估。

Journal ref 2026 IEEE/SICE International Symposium on System Integration (SII). IEEE, 2026. p. 844-849

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO 73%

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML 73%

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09458 2026-05-26 cs.RO 70%

Stein Variational Ergodic Surface Coverage with SE(3) Constraints

Stein变分遍历曲面覆盖与SE(3)约束

Jiayun Li, Yufeng Jin, Sangli Teng, Dejian Gong, Georgia Chalvatzaki

机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) Honda Research Institute Europe GmbH(本田欧洲研究院) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种基于预条件SE(3) Stein变分梯度下降的采样即优化方法,用于生成满足SE(3)约束的遍历轨迹,实现复杂3D点云曲面的高质量覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 70%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24965 2026-05-26 cs.CV cs.AI cs.LG 67%

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection

视觉基础模型在面部深度伪造检测中的跨域泛化极限

Ibrahim Delibasoglu

机构 * Department of Software Engineering, Faculty of Computer and Information Sciences(软件工程系,计算机与信息科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文通过系统评估三种视觉基础模型(RoPE-ViT、DINOv3、NVIDIA C-RADIOv4-H)在DF40基准上的线性探测性能,揭示了它们在面部深度伪造检测中的跨域泛化极限,发现基础模型对全脸合成保持高判别力,但对局部编辑技术存在根本性边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07039 2026-05-26 cs.RO cs.AI 62%

AEROS: A Single-Agent Operating Architecture with Embodied Capability Modules

AEROS:一种具有具身能力模块的单智能体操作架构

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃森大学马来西亚分校数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出AEROS架构,将机器人建模为单一持久智能主体,通过可安装的具身能力模块扩展能力,实现模块化可扩展性、可组合能力执行和一致的系统级安全。

Comments Submitted to Engineering Applications of Artificial Intelligence (EAAI). 48 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24562 2026-05-26 cs.CV cs.AI 62%

PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction

PEDESTRIANQA: 面向行人意图与轨迹预测的视觉-语言模型基准

Naman Mishra, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad, India(IIIT-海得拉巴计算机视觉与智能技术研究所,印度)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出大规模视频数据集PedestrianQA,将行人意图和轨迹预测转化为带结构化理由的问答任务,通过微调视觉-语言模型显著提升预测准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03983 2026-05-26 cs.RO cs.CV 62%

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

通过静态-动态解耦实现高效长程视觉-语言-动作模型

Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

机构 * Yale University(耶鲁大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DySta框架,通过将视觉输入解耦为多级静态和动态令牌,减少上下文长度并复用KV缓存,实现高效多帧集成和推理,在基准测试和真实任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24052 2026-05-26 cs.LG cs.AI 62%

Truthful Online Preference Aggregation for LLM Fine-Tuning in Mobile Crowdsourcing

移动众包中用于LLM微调的诚实在线偏好聚合

Shugang Hao, Lingjie Duan

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 针对移动众包中工人可能策略性谎报偏好反馈的问题,提出一种动态贝叶斯博弈模型和在线加权聚合机制,确保工人诚实反馈并实现次线性遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19846 2026-05-26 cs.CV cs.AI cs.CL 62%

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24728 2026-05-26 cs.AI 57%

Hylos: Operability Contracts for Model-Native Spatial Intelligence

Hylos: 面向模型原生空间智能的可操作性契约

Christopher Da Silva

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 提出Hylos系统架构,通过契约约束和空间事务管理,确保生成或编辑的3D内容具备可操作性,支持CAD、机器人等下游应用。

Comments 27 pages, 7 figures. Systems/position preprint with focused artifact study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25598 2026-05-26 cs.CV 57%

SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation

SurfSurg6D:面向无纹理手术器械位姿估计的几何一致密集对应

Daiyun Shen, Shuojue Yang, Chang Han Low, Qian Li, Mengya Xu, Qi Dou, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对无纹理手术器械位姿估计中的数据稀缺和几何一致性挑战,本文构建了SynSurg6D数据集并提出SurfSurg6D密集对应框架,在多个数据集上实现了优于现有方法的RGB-only位姿估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25373 2026-05-26 cs.CV 57%

Physics-Aware 3D Gaussian Editing for Driving Scene Generation

物理感知的三维高斯编辑用于驾驶场景生成

Feng Zhou, Jian Zhang, Yuhang Sun, He Wang, Qiong Wen, Debao Kong, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与生物力学国家重点实验室) China FAW Group Co., Ltd.(中国第一汽车集团有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出RoVES系统,通过单图像驱动的道路几何插入和4-DOF半车动力学模型,实现物理感知的驾驶场景编辑与车辆姿态校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25308 2026-05-26 cs.CV 57%

Stabilizing Streaming Video Geometry via Dynamic Feature Normalization

通过动态特征归一化稳定流视频几何

Xiaoyang Lyu, Muxin Liu, Xiaoshan Wu, Ruicheng Wang, Yi-Hua Huang, Yang-Tian Sun, Shaoshuai Shi, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) USTC(中国科学技术大学) Voyager Research, Didi Chuxing(滴滴出行 Voyager 研究)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 针对流式RGB输入中单目几何模型的时间不一致问题(主要表现为尺度-偏移漂移),提出轻量级因果循环模块DyFN,通过动态调制特征统计量实现稳定几何估计,仅微调2%参数即可达到SOTA时间稳定性。

Comments 16 pages, 9 Figures, page: https://shawlyu.github.io/DyFN

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24760 2026-05-26 cs.RO 57%

Geometric Workspace Analysis and Transmission-Aware Dynamics of a Serial Spherical Tool for Microsurgery

显微外科用串行球形工具的几何工作空间分析与传动感知动力学

Anestis Mablekos-Alexiou, Lyndon da Cruz, Christos Bergeles

机构 * Moorfields Eye Hospital NHS Foundation Trust(莫尔菲兹眼科医院 NHS 基础信托) King’s College London(国王学院伦敦)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出一种用于显微外科的串行球形机构(带额外平移自由度)的运动学与传动感知设计框架,通过解析工作空间公式和传动感知动力学方法实现快速设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24691 2026-05-26 cs.CV 57%

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery

AdaFuse-Det: 自适应跨模态融合事件相机用于低光照RGB图像中的鲁棒目标检测

Raju Imandi, Chethana B, Bharatesh Chakravarthi, Yong-Guk Kim, Manipriya S, Pavan Kumar B N

机构 * SRM University AP, India(印度SRM大学AP分校) Aptiv, Bengaluru, India(印度Aptiv公司,班加罗尔) Arizona State University, USA(美国亚利桑那州立大学) Sejong University, South Korea(韩国世宗大学) Indian Institute of Information Technology Sri City, India(印度Sri City信息学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出AdaFuse-Det双流框架,通过基于最小方差线性估计的自适应跨模态融合模块融合CLAHE增强RGB与事件数据,在低光照下实现鲁棒目标检测,在LLE-VOS基准上召回率65.54%、精确率53.85%、F1分数59.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26043 2026-05-26 eess.SY cs.SY 50%

Robust Tracking of Curvature-Constrained Paths for Uncertain Dubins Systems

不确定Dubins系统的曲率约束路径鲁棒跟踪

Xingjian Xue, Sze Zheng Yong

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 针对具有不确定Dubins动力学的车辆/机器人,提出基于滑模控制的鲁棒跟踪控制器,保证横向和航向误差在有限扰动下收敛到零。

Comments 6 pages, 3 figures. Accepted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25155 2026-05-26 q-bio.QM 50%

Automated multi-dataset INST $^{13}$C metabolic flux analysis at microliter scale reveals robust fluxes but variable metabolite pools in $Corynebacterium~glutamicum$

自动化多数据集微升级INST $^{13}$C代谢通量分析揭示谷氨酸棒杆菌中稳健的通量但可变的代谢物池

Jochen Nießer, Anton Stratmann, Martin Beyß, Wolfgang Wiechert, Katharina Nöh, Stephan Noack

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本文提出一种微型化、自动化的多数据集INST $^{13}$C-MFA工作流程,在微升级别实现并行通量分析,揭示了谷氨酸棒杆菌在乙醇底物上生长时通量稳健但代谢物池大小可变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17780 2026-05-26 eess.SY cs.SY 50%

Data-Driven Predictive Control for Stochastic Descriptor Systems: An Innovation-Based Approach Handling Non-Causal Dependencies

随机描述系统的数据驱动预测控制:一种处理非因果依赖性的创新方法

Yunxiang Ma, Yibo Wang, Zhongmei Li, Chao Shang

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 针对随机描述系统中非因果依赖性问题,提出一种基于创新驱动的数据驱动预测控制框架,通过将快子系统分解为噪声驱动和输入驱动部分,并结合慢子系统定义创新卡尔曼滤波器,实现无需系统矩阵的预测控制。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24134 2026-05-26 cs.MA 50%

ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents

ProofAgent Harness:用于AI智能体对抗性评估的开放基础设施

Fouad Bousetouane

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 提出ProofAgent Harness开放基础设施,通过对抗性多轮试验、轨迹捕获和多评委评分,实现可扩展、可审计的AI智能体对抗性评估。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏