arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-24 至 2026-03-24 共收录 135 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 29 篇

2510.01641 2026-03-24 cs.CV 57%

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

FideDiff:高效的高保真图像运动去模糊扩散模型

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Harvard University(哈佛大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出FideDiff,一种高效的单步扩散模型,用于高保真图像运动去模糊。通过将运动去模糊转化为扩散过程,结合Kernel ControlNet和自适应时间步预测,提升了去模糊性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/xyLiu339/FideDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20310 2026-03-24 cs.CV cs.GR 57%

GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems

GraphiContact: 人体-场景鲁棒接触感知用于交互系统

Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao

机构 * Tsinghua University, China(清华大学, 中国) XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国) Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国) University of Chinese Academy of Sciences, China(中国科学院大学, 中国) National University of Singapore, Singapore(新加坡国立大学, 新加坡)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出GraphiContact框架,结合单图像3D人体网格重建,利用重建的体几何结构进行接触推理,通过引入SIMU训练策略提升鲁棒性,在五个基准数据集上实现了接触预测和3D人体重建的提升。

Comments 15 pages, 9 figures, Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20225 2026-03-24 cs.CY cs.AI 57%

The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks

AGI的来临?专家人设是否超越专家基准?

Drake Mullens, Stella Shen

机构 * Tarleton State University(塔尔顿州立大学) University of Texas at Tyler(德克萨斯大学泰勒分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究探讨专家人设是否能提升语言模型性能,发现其效果受多种机制限制,通过控制实验揭示了人设在特定任务中的表现及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17016 2026-03-24 cs.RO 57%

Efficient and Reliable Teleoperation through Real-to-Sim-to-Real Shared Autonomy

通过实-仿-实共享自主性实现高效可靠的远程操作

Shuo Sha, Yixuan Wang, Binghao Huang, Antonio Loquercio, Yunzhu Li

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种实-仿-实共享自主框架,利用k近邻人类代理模拟操作员行为,通过模型无关强化学习训练残差陪练策略,提升新手操作成功率和经验操作者执行效率,同时提高下游模仿学习的演示质量。

Comments Project Page: https://residual-copilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19740 2026-03-24 cs.CV 57%

LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings

LEMON:一个大规模内窥镜单目数据集和用于手术场景感知的基础模型

Chengan Che, Chao Wang, Tom Vercauteren, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera

机构 * Department of Informatics, King’s College London, UK(伦敦国王学院信息学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出LEMON数据集,通过新型聚合管道收集4K手术视频,提供938小时高质量内容,包含两项新任务。基于该数据集的LemonFM基础模型在多个任务中表现优异,显著提升手术识别和分割性能。

Comments Accepted at CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18529 2026-03-24 cs.CL 50%

Instructional Text Across Disciplines: A Survey of Representations, Downstream Tasks, and Open Challenges Toward Capable AI Agents

跨学科指令文本:对表示、下游任务和有能力AI代理的综述

Abdulfattah Safa, Tamta Kapanadze, Arda Uzunoğlu, Gözde Gül Şahin

机构 * KUIS AI Lab, Koç University, Istanbul, Türkiye(KUIS AI实验室,科克大学,伊斯坦布尔,土耳其) Koç University, Istanbul, Türkiye(科克大学,伊斯坦布尔,土耳其) Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学,巴尔的摩,美国) Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany(埃尔兰根-纽伦堡弗里德里希-亚历山大大学,德国)

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文综述了指令文本的表示方法、下游任务及挑战,旨在为AI代理提供统一视角,填补不同研究方向间的空白。

Comments Pre-CoLI print. Accepted for publication in Computational Linguistics (MIT Press). Advance online publication. March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08455 2026-03-24 cs.CL 50%

Bot Meets Shortcut: How Can LLMs Aid in Handling Unknown Invariance OOD Scenarios?

机器人与捷径:大型语言模型如何帮助处理未知不变性OOD场景?

Shiyan Zheng, Herun Wan, Minnan Luo, Junhang Huang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文研究了现有社交机器人检测器在真实场景中的鲁棒性不足问题,提出基于大语言模型的缓解策略,通过对抗数据增强提升模型在捷径学习场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 8 篇

2603.21496 2026-03-24 cs.RO cs.AI physics.optics 84%

A Framework for Closed-Loop Robotic Assembly, Alignment and Self-Recovery of Precision Optical Systems

精密光学系统闭环机器人组装、对齐与自我恢复框架

Seou Choi, Sachin Vaidya, Caio Silva, Shiekh Zia Uddin, Sajib Biswas Shuvo, Shrish Choudhary, Marin Soljačić

机构 * Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室) NSF Institute for Artificial Intelligence and Fundamental Interactions (IAIFI) and the Department of Physics, Massachusetts Institute of Technology(国家科学基金会人工智能与基本相互作用研究所(IAIFI)和麻省理工学院物理系) Nokia Bell Labs(诺基亚贝尔实验室) School of Electrical, Computing and Energy Engineering, Arizona State University(亚利桑那州立大学电气、计算与能源工程学院)

专题命中 其他机器人 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一个机器人框架,实现精密光学系统的自动构建、对齐与维护,通过层级计算机视觉、优化和定制工具实现闭环自主操作,展示了桌面激光腔的全自动构建及自我恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22174 2026-03-24 cs.HC cs.RO 79%

Feasibility of Augmented Reality-Guided Robotic Ultrasound with Cone-Beam CT Integration for Spine Procedures

增强现实引导的机器人超声与锥束CT整合在脊柱手术中的可行性

Tianyu Song, Felix Pabst, Feng Li, Yordanka Velikova, Miruna-Alexandra Gafencu, Yuan Bi, Ulrich Eck, Nassir Navab

机构 * Chair for Computer Aided Medical Procedures(CAMP), Technical University of Munich(TUM)(计算机辅助医疗程序系(CAMP),慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种基于光学透视增强现实的机器人系统,结合锥束CT与超声成像,提升脊柱手术中针具定位的准确性和效率,降低认知负荷。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17657 2026-03-24 cs.CV 70%

SPACE-CLIP: Spatial Perception via Adaptive CLIP Embeddings for Monocular Depth Estimation

SPACE-CLIP:通过自适应CLIP嵌入实现空间感知的单目深度估计

Taewan Cho, Taeryang Kim, Andrew Jaeyong Choi

机构 * School of Computing, Gachon University(加尔文大学计算机学院)

专题命中 其他机器人 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 SPACE-CLIP提出了一种仅解码器的深度框架,通过冻结的CLIP视觉编码器直接读取几何线索,无需文本编码器,实现了高效的单目深度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21854 2026-03-24 cs.AI 57%

Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

推理还是修辞?对大型语言模型中道德推理解释的实证分析

Aryan Kasat, Smriti Singh, Aman Chadha, Vinija Jain

机构 * TCS AI Practice(TCS人工智能实践) UT Austin(德克萨斯大学奥斯汀分校) Amazon GenAI(亚马逊生成人工智能) Google GenAI(谷歌生成人工智能)

专题命中 其他机器人 :robotic(abstract);分类 cs.AI

AI总结 研究通过分析LSTM对道德困境的回应,探讨其是否具备道德发展阶段的真正进展,发现其表现出后常规推理,且存在道德解耦现象,揭示了对成熟道德推理的修辞模仿。

Comments 32 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09278 2026-03-24 cs.CV 57%

LoGoColor: Local-Global 3D Colorization for 360° Scenes

LoGoColor: 本地-全局 3D 色彩化用于 360 度场景

Yeonjin Chang, Juhwan Cho, Seunghyeon Seo, Wonsik Shin, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 其他机器人 :robotics(abstract);分类 cs.CV

AI总结 本文提出 LoGoColor 方法,通过本地-全局策略生成一致的 3D 色彩化结果,提升复杂 360 度场景的色彩多样性与一致性。

Comments Project page is available at: https://yeonjin-chang.github.io/LoGoColor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20619 2026-03-24 cs.AI cs.CY 57%

Where can AI be used? Insights from a deep ontology of work activities

AI可以应用在哪里?来自工作活动深度本体的洞察

Alice Cai, Iman YeckehZaare, Shuo Sun, Vasiliki Charisi, Xinru Wang, Aiman Imran, Robert Laubacher, Alok Prakash, Thomas W. Malone

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Mens, Manus, and Machina, Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术机构)

专题命中 其他机器人 :robotic(abstract);分类 cs.AI

AI总结 本文通过构建工作活动的深度本体,系统分析AI的应用领域,发现高价值AI市场集中在信息类活动,揭示了AI在不同工作活动中的分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12918 2026-03-24 cs.CV 57%

VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation

VIRD:通过双轴变换实现视图不变表示的跨视图姿态估计

Juhye Park, Wooju Lee, Dasol Hong, Changki Sung, Youngwoo Seo, Dongwan Kang, Hyun Myung

机构 * Urban Robotics Lab, School of Electrical Engineering, KAIST(首尔国立大学电气工程学院智能城市机器人实验室) Hanwha Aerospace(韩华航空航天)

专题命中 其他机器人 :robotics(abstract);分类 cs.CV

AI总结 本文提出VIRD方法,通过双轴变换构建视图不变表示,解决地面与卫星视图间显著视角差异问题,提升跨视图姿态估计精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22507 2026-03-24 cs.NI cs.MA eess.SP 50%

A Unified Cloud-Edge-Terminal Framework for Multimodal Integrated Sensing and Communication

多模态感知与通信一体化的统一云-边-终端框架

Yubo Peng, Luping Xiang, Kun Yang, Feibo Jiang, Kezhi Wang, Christos Masouros

专题命中 其他机器人 :embodied AI(abstract)

AI总结 本文提出统一云-边-终端框架,通过多模态感知与通信融合,解决异构融合、通信开销和系统扩展性等挑战,提升任务导向的多模态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏