arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-21 至 2026-05-21 共收录 19 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 19 篇

2605.20544 2026-05-21 cs.RO cs.CV 86%

The Yes-Man Syndrome: Benchmarking Abstention in Embodied Robotic Agents

顺从综合征:具身机器人代理中的退避基准测试

Doguhan Yeke, Elif Su Temirel, Ananth Shreekumar, Brandon Lee, Dongyan Xu, Z Berkay Celik

机构 * Purdue University(普渡大学) Bilkent University(比尔肯特大学)

专题命中 机器人数据与评测 :robotic(title);robotics(abstract,abstract_cn);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种用于具身机器人代理的退避基准测试框架RoboAbstention,通过五种机器人数据集中的图像生成退避指令,评估了多个前沿VLMs在退避任务中的表现,并探讨了改进退避性能的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24138 2026-05-21 cs.CV cs.AI 81%

Multimodal Optimal Transport for Training-free Temporal Segmentation in Surgical Robotics

多模态最优传输用于手术机器人中的无训练时序分割

Omar Mohamed, Edoardo Fazzari, Ayah Al-Naji, Hamdan Alhadhrami, Khalfan Hableel, Saif Alkindi, Ivan Laptev, Cesare Stefanini

机构 * Dept. of Robotics, Mohamed bin Zayed University of AI(机器人系,Mohamed bin Zayed人工智能大学)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种无需标注的手术时序分割框架TASOT,通过结合时间对齐的文本描述和视觉信息,在统一的不平衡Gromov-Wasserstein最优传输目标下融合视觉和语义线索,实现了在多个公开手术数据集上的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16530 2026-05-21 cs.CV 79%

SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation

SWoMo:用于白内障手术模拟的神经符号世界模型

Ssharvien Kumar Sivakumar, Akwele Johnson, Anirudh Dhingra, Yannik Frisch, Ghazal Ghazaei, Anirban Mukhopadhyay

机构 * Technical University Darmstadt(德累斯顿技术大学) Carl Zeiss AG(蔡司股份有限公司) AICM, Medical Faculty of Heidelberg University(海德堡大学医学院)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.CV

AI总结 本文提出SWoMo,一种用于白内障手术模拟的神经符号世界模型,通过分离运动生成与视觉真实性,结合规则基模拟器和场景图表示来建模运动动态和工具-组织交互,同时使用扩散模型生成逼真的视觉效果,从而提升手术模拟的真实性和临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03209 2026-05-21 cs.RO 79%

Depth Completion in Unseen Field Robotics Environments Using Extremely Sparse Depth Measurements

在未见过的田间机器人环境中使用极稀疏深度测量进行深度补全

Marco Job, Thomas Stastny, Eleni Kelasidi, Roland Siegwart, Michael Pantic

机构 * Autonomous Systems Lab, ETH Zürich(瑞士苏黎世联邦理工学院自主系统实验室) Field Robotics Lab, NTNU(挪威特罗姆瑟大学场 robotics 实验室)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO

AI总结 本研究提出了一种深度补全模型,通过合成数据训练和极稀疏的深度传感器测量,在未见过的田间机器人环境中预测密集的度量深度,解决了低成本相机在田间机器人中应用受限的问题。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20774 2026-05-21 cs.RO 70%

VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

VLA-REPLICA: 一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准

Alex S. Huang, Jiahui Zhang, Shiqing Tang, Yu Xiang

机构 * Intelligent Robotics and Vision Lab, University of Texas at Dallas(德克萨斯大学达拉斯分校智能机器人与视觉实验室) Allen High School(艾伦高中)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出VLA-REPLICA,一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准,通过使用现成组件构建,提供一致的环境用于政策评估,并包含多样化的操作任务和小规模演示数据集,用于目标域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20856 2026-05-21 cs.RO cs.AI cs.LG 67%

DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

DISC: 通过策略生成解耦指令与状态条件控制

Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) TranscEngram

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 DISC通过策略生成解耦指令与状态条件控制,解决了任务状态耦合导致的观察泄漏问题,并在多个基准测试中表现出色,证明了语言生成的策略参数驱动行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20971 2026-05-21 cs.CV cs.AI cs.CR 62%

Comparative Evaluation of Deep Learning Models for Fake Image Detection

深度学习模型在虚假图像检测中的比较评估

Akhitha Pakala, Mohammed Mahir Rahman, Shahzad Memon, Tauseef Ahmed

机构 * University of East London(东伦敦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本研究通过统一的预处理和训练流程比较了四个预训练的CNN架构在虚假图像检测中的性能,发现VGG16在准确性上表现最佳,但EfficientNetB0在检测虚假图像时的敏感性较高,但对真实图像的可靠性较低,研究指出需要平衡数据集、高级增强和公平性意识训练来开发可靠的虚假图像检测系统。

Comments Accepted at ICCIIoT26 and waiting to be indexed

Journal ref 6th International Conference on Computational Intelligence & Internet of Things (ICCIIoT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20837 2026-05-21 cs.CV cs.AI 62%

ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models

ArchSIBench: 评估视觉-语言模型的建筑空间智能

Qirui Shen, Wenda Wang, Jiachen Lu, Zilong Huang, Jin Bai, Lei He, Hongxuan Chen, Weixin Huang

机构 * School of Architecture, Tsinghua University(清华大学建筑学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ArchSIBench,一个基于建筑学、认知科学和心理学视角的建筑空间智能评估基准,通过17个细粒度子任务和3000个问题-答案对,评估多种VLMs在建筑空间感知、推理、导航、转换和配置方面的性能,发现大多数模型在空间转换和配置推理上仍与有建筑训练的人类评估者存在差距。

Comments 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09180 2026-05-21 cs.CV cs.RO 62%

Multimodal Fusion for Sim2real Transfer in Visual Reinforcement Learning

多模态融合用于视觉强化学习中的仿真到现实迁移

Zichun Xu, Jingdong Zhao, Chenyu Guo, Qianxue Zhang, Liao Zhang, Xiao Zhang, Yiming Ren, Lian Zhang, Zengren Zhao

机构 * Medical Artificial Intelligence Lab, The First Hospital of Hebei Medical University, Hebei Medical University(医学人工智能实验室,河北医科大学第一医院,河北医科大学) State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于视觉变换器的多模态融合框架,通过融合RGB和深度信息提升泛化能力,并设计对比学习方案和课程式域随机化方案以提高样本效率和迁移性能,实验结果表明该方法在现实任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20822 2026-05-21 cs.CV 61%

TERDNet: Transformer Encoder-Recurrent Decoder Network for Scene Change Detection

TERDNet: 用于场景变化检测的Transformer编码器-递归解码器网络

Jiae Yoon, Ue-Hwan Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,全州科学技术院(GIST))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV;robotics(comments)

AI总结 本文提出TERDNet,一种用于场景变化检测的Transformer编码器-递归解码器网络,通过多级特征提取、特征融合模块、递归解码器和上采样模块,提升了场景变化检测的精度和鲁棒性。

Comments 8 pages, 4 figures. Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20566 2026-05-21 cs.RO 57%

Conflict-Aware Active Perception and Control in 3D Gaussian Splatting Fields via Control Barrier Functions

基于控制屏障函数的3D高斯点云场中冲突感知与控制

Amirhossein Mollaei Khass, Athanasios Cosse, Vivek Pandey, Nader Motee

机构 * Department of Mechanical Engineering and Mechanics, Lehigh University(机械工程与力学系,莱恩大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于控制屏障函数的冲突感知与控制框架,用于在3D高斯点云场环境中安全导航并获取信息以减少地图不确定性,通过统一的安全关键和感知感知二次规划程序解决安全与感知目标的冲突。

Comments Project website: https://sircesoc.github.io/Conflict_Aware_Active_Perception/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20561 2026-05-21 cs.RO 57%

Fault-Tolerant, Rigidity-Preserving Control of Inflatable Truss Robots

容错、保持刚性的可膨胀桁架机器人控制

James Wade, Isaac Weaver, Mihai Stanciu, Nathan Usevitch

机构 * Ira A. Fulton School of Engineering, Mechanical Engineering Department, Brigham Young University(伊拉·A·福林工程学院,机械工程系, Brigham Young 大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种容错控制框架,用于可膨胀机器人桁架,能够在电机故障的情况下保持功能,通过三个关键贡献:扩展运动学优化以处理任意电机故障组合,引入离散时间控制屏障函数约束以保证结构刚性,以及利用 onboard 编码器反馈和基于正向运动学的状态估计器实现闭环位置控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17776 2026-05-21 cs.RO 57%

CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪

Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CosFly-Track数据集,用于无人机视觉跟踪任务,通过多约束轨迹优化生成大规模多模态数据,提升了动态目标跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15305 2026-05-21 cs.GR cs.LG 57%

WorldParticle: Unified World Simulation of Lagrangian Particle Dynamics via Transformer

WorldParticle:通过Transformer实现拉格朗日粒子动力学的统一世界模拟

Caoliwen Wang, Minghao Guo, Siyuan Chen, Heng Zhang, Mengdi Wang, Xingyu Ni, Hanson Sun, Kunyi Wang, Zherong Pan, Kui Wu, Lingjie Liu, Yin Yang, Chenfanfu Jiang, Taku Komura, Wojciech Matusik, Peter Yichen Chen

机构 * University of British Columbia(不列颠哥伦比亚大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Georgia Institute of Technology(佐治亚理工学院) Inria(法国国家信息与自动化技术研究院) Meta Independent Researcher(独立研究者) University of Pennsylvania(宾夕法尼亚大学) University of Utah(犹他大学) University of California Los Angeles(加州大学洛杉矶分校) University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出基于Transformer架构的粒子模拟器,能够统一模拟布料、弹性固体、牛顿流体、非牛顿流体、颗粒材料和分子动力学等不同物理现象,通过预测-校正设计和粒子表示,实现高效的模拟与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21179 2026-05-21 cs.CE 50%

KSOS-BO: Improving Sampling in Bayesian Optimization via Kernel Sum of Squares

KSOS-BO: 通过核平方和改进贝叶斯优化中的采样

Buqing Ou, Frederike Dümbgen

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出KSOS-BO,一种基于核的无导数框架,用于优化贝叶斯优化的获取函数,通过将获取函数优化建模为半正定规划问题,实现了结构化的全局搜索,并在多个基准函数上表现出色,平均改进了81.16%的 regrets,尽管计算成本较高,但收敛速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20869 2026-05-21 cond-mat.mes-hall 50%

The Topography Trap: Sifting Interlayer Excitons from Strain-Related Artifacts in Real-World 2D Hetrostructures

地形陷阱:在真实世界二维异质结构中区分异层激子与应变相关伪影

Pablo Hernández López, Luka Pirker, Astrid Weston, Arijit Kayal, Rafael Nadas, Adrián Dewambrechies Fernández, Álvaro Rodríguez, Roman Gorbachev, Kirill I. Bolotin, Otakar Frank, Sebastian Heeg

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 该研究提出了一种决策树协议,通过层内激子淬灭评估异层耦合,并将光致发光与原子力显微镜相关联,以正确分配TMDC异质结构的室温PL特征。研究发现MoS2-MoSe2和MoS2-WSe2异质结构中存在MoMomentum-直接异层激子(KK-IX),而先前报告的明亮、动量间接、与扭角无关的ΓK-IX则被证明源于界面拓扑不均质处的局部应变。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20833 2026-05-21 cs.CL 50%

MemGym: a Long-Horizon Memory Environment for LLM Agents

MemGym: 一种长时间跨度的记忆环境用于LLM智能体

Wujiang Xu, Yu Wang, Kai Mei, Kaiqu Liang, Zhenting Wang, Mingyu Jin, Han Zhang, Shi-Xiong Zhang, Wenyue Hua, Sambit Sahu, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学) Capital One Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出MemGym,一种用于评估LLM智能体记忆能力的基准测试环境,通过统一现有智能体 gym 和内部记忆基础管道,提供一个记忆推理接口。MemGym 包含五个评估赛道,涵盖四个智能体领域,能够独立评估记忆性能,排除推理、检索和工具使用能力的干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05897 2026-05-21 cs.CR cs.SE 50%

How Reliable Are FOSS Popularity Metrics? Analyzing the Effort Required for Spoofing Common Software Popularity Metrics

开源软件流行度指标有多可靠?分析伪造常见软件流行度指标所需的努力

Ben Swierzy, Timo Pohl, Marc Ohm, Michael Meier

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文研究了开源软件流行度指标的可靠性,分析了伪造这些指标所需的努力,并指出许多指标类别,如提交数据、问题跟踪器活动、下载量、仓库内容和依赖关系,可以被低至中等程度地操纵,揭示了npm上的一个涉及影响奖励机制的Sybil攻击。

Comments Short Version of arXiv:2505.05897v1, Full paper accepted at ARES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09620 2026-05-21 cs.HC 50%

MiXR: Harvesting and Recomposing Geometry from Real-World Objects for In-Situ 3D Design

MiXR: 从现实物体中采集和重组几何结构用于现场3D设计

Faraz Faruqi, Demircan Tas, Arthur Caetano, Niccolò Meniconi, Oğuz Arslan, Misha Sra, Ruofei Du, Stefanie Mueller, Mustafa Doga Dogan

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出MiXR系统,通过从环境中采集几何结构并进行重组,实现现场3D设计,结合生成式AI合成连贯模型,使用户能明确定义空间结构并利用生成模型进行几何优化,实验表明其在设计精度和用户控制感方面优于传统方法。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏