arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-13 至 2026-05-13 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 12 篇

2603.15759 2026-05-13 cs.RO cs.AI cs.LG 89%

Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation

模拟蒸馏:在模拟中预训练世界模型以实现快速真实世界适应

Jacob Levy, Tyler Westenbroek, Kevin Huang, Fernando Palafox, Patrick Yin, Shayegan Omidshafiei, Dong-Ki Kim, Abhishek Gupta, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) FieldAI

专题命中 机器人数据与评测 :world model(title,abstract);robot learning(abstract);manipulation(abstract);robotic(abstract)

AI总结 本文提出SimDist框架,利用物理模拟器生成大量动作条件机器人经验,通过蒸馏结构先验提升世界模型性能,实现高效真实世界适应。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 79%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21625 2026-05-13 cs.RO 70%

Tacmap: Bridging the Tactile Sim-to-Real Gap via Geometry-Consistent Penetration Depth Map

Tacmap: 通过几何一致的穿透深度图弥合触觉仿真到现实的差距

Lei Su, Zhijie Peng, Renyuan Ren, Shengping Mao, Juan Du, Kaifeng Zhang, Xuezhou Zhu

机构 * Sharpa HKUST(香港科技大学) NVIDIA(英伟达)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 Tacmap通过统一的变形地图表示弥合触觉仿真与现实的差距,利用体积穿透深度实现高保真且高效的触觉仿真,验证了在抓取任务中仿真政策的零样本迁移能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 70%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11265 2026-05-13 cs.CV cs.AI cs.LG 67%

DenseTRF: Texture-Aware Unsupervised Representation Adaptation for Surgical Scene Dense Prediction

DenseTRF: 基于纹理的无监督表示适应用于外科场景密集预测

Guiqiu Liao, Matjaž Jogan, Daniel A. Hashimoto

机构 * GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) PCASO Laboratory, Department of Surgery, University of Pennsylvania(宾夕法尼亚大学外科PCASO实验室) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出DenseTRF框架,通过基于纹理的关注机制学习纹理感知的表示,提升外科场景密集预测的跨分布泛化能力。

Comments Accepted to 29th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11224 2026-05-13 cs.CV cs.AI 62%

ABRA: Agent Benchmark for Radiology Applications

ABRA:放射学应用代理基准测试

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo

机构 * School of Computing(计算学院) Dublin City University(都柏林城市大学) School of Medicine(医学院) University College Dublin(都柏林大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 ABRA是一个放射学代理基准测试,通过21个功能调用工具操作OHIF查看器和Orthanc DICOM服务器,包含655个生成任务,评估代理在规划、执行和结果方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-05-13 cs.RO cs.AI 62%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24577 2026-05-13 cs.CV cs.AI 62%

EndoVGGT: GNN-Enhanced Depth Estimation for Surgical 3D Reconstruction

EndoVGGT:基于图神经网络的手术3D重建中的深度估计

Falong Fan, Yi Xie, Arnis Lektauers, Bo Liu, Jerzy Rozenblit

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出EndoVGGT框架,通过DeGAT模块动态构建语义图谱,提升手术3D重建的几何连续性和非刚性变形恢复能力,实验表明其在PSNR和SSIM上优于现有方法,并具备跨数据集泛化能力。

Comments We withdraw this submission due to significant errors in the presentation and logical structure of the paper. We found that the current version does not accurately convey the research findings and requires a major overhaul of the manuscript's methodology description and results analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08571 2026-05-13 cs.RO 57%

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON:通过最佳努力适应进行跨领域生成机器人策略的协同训练

Antong Zhang, Han Qi, Heng Yang

机构 * Department of Computer Science, Brown University(布朗大学计算机科学系) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 BEACON提出一种理论驱动框架,通过大量源演示和有限目标演示训练生成机器人策略,通过跨领域协同训练提升鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12443 2026-05-13 eess.SY astro-ph.IM cs.MS cs.SE cs.SY 50%

Basilisk and Docker for Reproducible GN&C Simulation: A Workflow Reference

Basilisk和Docker用于可重复的GN&C模拟:一个工作流参考

Anubhav Gupta

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出基于Docker的Basilisk工作流,提供可重复和可移植的GN&C模拟环境,涵盖从轨道动力学到姿态动力学的复杂模拟场景。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12243 2026-05-13 cs.CL 50%

PreScam: A Benchmark for Predicting Scam Progression from Early Conversations

PreScam:一个用于从早期对话预测诈骗进展的基准测试

Weixiang Sun, Shang Ma, Yiyang Li, Tianyi Ma, Zehong Wang, Colby Nelson, Xusheng Xiao, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Arizona State University(亚利桑那州立大学)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出PreScam基准测试,通过分析用户提交的诈骗报告,构建了11573个涵盖20类诈骗的对话实例,评估了语言模型在实时终止预测和诈骗者行为预测任务中的表现,揭示了模型在捕捉诈骗进展方面的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11557 2026-05-13 quant-ph 50%

Wavelet Variance Equipartition as a Threshold for World-Model Quality and Quantum Kernel TN-Simulability

小波方差等分作为世界模型质量的阈值及量子核TN可模拟性

Chon-Fai Kam, Xavier Cadet, Miloud Bessafi, Frederic Cadet

专题命中 机器人数据与评测 :world model(abstract)

AI总结 本文基于小波方差等分提出世界模型质量评估标准,并揭示量子核经典模拟性的临界条件,通过张量网络理论证明潜在空间相变,结合VideoMAE分析展现空间与特征通道的二元性,最终推导出量子机器学习可扩展性的限制因素。

详情

展开后加载摘要…

URL PDF HTML 收藏