arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-17 至 2026-03-17 共收录 178 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 44 篇

2603.14450 2026-03-17 eess.SY cs.SY 67%

Surgi-HDTMR: Closing the Sensorimotor Loop in Bimanual Microsurgery via Haptics, Digital Twin, and Mixed Reality

Surgi-HDTMR:通过触觉、数字孪生和混合现实闭合双手微手术的传感器运动环路

Songming Ping, Shaoyue Wen, Junhong Chen, Wen Fan, Lan Wei, Dandan Zhang

专题命中 机器人操作 :navigation(abstract);robotic(abstract)

AI总结 本文提出Surgi-HDTMR系统,结合触觉、数字孪生和混合现实技术,提升微手术训练的沉浸感和触觉反馈,缩短任务时间并提高手术安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12101 2026-03-17 cs.RO cs.AI cs.LG 67%

Decoupled Action Expert: Confining Task Knowledge to the Conditioning Pathway

解耦动作专家:将任务知识限制在条件路径中

Jian Zhou, Sihao Lin, Shuai Fu, Zerui Li, Gengze Zhou, Qi WU

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出解耦训练方法,将任务知识限制在条件路径中,使动作主干网络无任务依赖,通过Diffusion Policy验证,证明动作专家编码较少任务特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14401 2026-03-17 cs.RO cs.CV 62%

OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer

OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习

Kuanning Wang, Ke Fan, Yuqian Fu, Siyu Lin, Hu Luo, Daniel Seita, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。

Comments Project page: https://sressers.github.io/OCRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14004 2026-03-17 cs.CV cs.AI 62%

U-Face: An Efficient and Generalizable Framework for Unsupervised Facial Attribute Editing via Subspace Learning

U-Face: 一种高效的、可泛化的基于子空间学习的无监督面部属性编辑框架

Bo Liu, Xuan Cui, Run Zeng, Wei Duan, Chongwen Liu, Jinrui Qian, Lianggui Tang, Hongping Gan

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出U-Face框架,通过子空间学习方法解决无监督面部属性编辑中的解耦难题,引入正交非负约束和属性边界向量提升控制能力,采用AIDC算法实现高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15614 2026-03-17 cs.CV 57%

Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion

Tri-Prompting:具有统一场景、主体和运动控制的视频扩散

Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao, Haitian Zheng, Qing Liu, He Zhang, Zhe Lin, Yuqian Zhou, Jiebo Luo

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 Tri-Prompting提出统一框架,整合场景、多视角主体一致性和运动控制,提升视频生成的可控性和真实感。

Comments Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15527 2026-03-17 cs.AI cs.CY 57%

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

对LLM对齐中的困境和冲突是否可解?一种优先图的视角

Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) New York University(纽约大学) National University of Singapore(新加坡国立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15226 2026-03-17 cs.AI 57%

SCAN: Sparse Circuit Anchor Interpretable Neuron for Lifelong Knowledge Editing

SCAN:稀疏电路锚定神经元用于终身知识编辑

Yuhuan Liu, Haitian Zhong, Xinyuan Xia, Qiang Liu, Shu Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR)、多模态人工智能系统国家重点实验室(MAIS)、自动化研究所、中国科学院) Cuiying Honors College, Lanzhou University(cuiying荣誉学院、兰州大学) Research Institute of Intelligent Complex Systems, Fudan University(智能复杂系统研究院、复旦大学) Zhongguancun Academy(中关村学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 SCAN通过构建稀疏电路实现知识编辑,有效解决连续编辑中的灾难性遗忘问题,保持模型完整性。

Comments 21pages, 7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15220 2026-03-17 cs.AI 57%

InterPol: De-anonymizing LM Arena via Interpolated Preference Learning

InterPol:通过插值偏好学习解密LM Arena

Minsung Cho, Jaehyung Kim

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 InterPol通过插值偏好学习框架,利用模型插值和自适应课程学习策略,显著提升模型区分能力,揭示LM Arena中匿名性不足的现实威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 57%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13388 2026-03-17 cs.CV 57%

VeloEdit: Training-Free Consistent and Continuous Instruction-Based Image Editing via Velocity Field Decomposition

VeloEdit: 无需训练的一致且连续的基于指令的图像编辑 via 速度场分解

Zongqing Li, Zhihui Liu, Yujie Xie, Shansiyuan Wu, Hongshen Lv, Songzhi Su

机构 * Xiamen University(厦门大学) Truesight

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 VeloEdit通过速度场分解实现无需训练的一致且连续的基于指令的图像编辑,通过动态识别编辑区域并采用速度插值控制编辑强度,提升视觉一致性和编辑连续性。

Comments 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05594 2026-03-17 cs.LG 57%

Anticipating Gaming to Incentivize Improvement: Guiding Agents in (Fair) Strategic Classification

预见游戏以激励改进:引导在(公平的)战略分类中的智能体

Sura Alhanouti, Parinaz Naghizadeh

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究探讨算法设计者如何通过战略分类系统引导智能体在改进与欺骗之间的选择,分析公平性影响及最优策略设计。

Comments 41 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15058 2026-03-17 math.NA cs.NA 50%

Well-posedness and instability of free electron quantum tomography

自由电子量子成像的适定性与不稳定性

Florian Oberender

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究自由电子量子成像的适定性与不稳定性,通过正定约束的正则化效应证明问题的适定性,同时展示无全局稳定性估计及估计器收敛速度极慢,进一步提供不稳定性的界并验证约束问题的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14878 2026-03-17 hep-ex 50%

Dressed-State Spectroscopy of Proton Spins in Water Beyond the Rotating-Wave Approximation

水中原子氢核自旋的 dressed-state 光谱学超越旋转波近似

Ivo Schulthess, Anastasio Fratangelo, Patrick Hautle, Philipp Heil, Gjon Markaj, Marc Persoz, Ciro Pistillo, Jacob Thorne, Florian M. Piegsa

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用强磁场实现水中原子氢核自旋的 dressed-state 光谱学,验证了量子 Rabi 模型预测的高阶共振现象,拓展了核磁共振精度测量的应用前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14838 2026-03-17 cs.CL 50%

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

检索增强生成中意识形态话语的影响:以新冠治疗方案为例

Elmira Salari, Maria Claudia Nunes Delfino, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Alan Davoust, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) Pontifícia Universidade Católica de São Paulo(圣保罗天主教大学) Institut national de la recherche scientifique(国家科学研究中心) Université du Québec en Outaouais(魁北克大学Outaouais)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究检索到的意识形态文本对大语言模型输出的影响,通过新冠治疗方案案例,探讨意识形态在RAG框架中的识别与影响,揭示意识形态偏见与潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01985 2026-03-17 cond-mat.mes-hall nlin.AO physics.class-ph quant-ph 50%

Dynamical Phase Transitions Across Slow and Fast Regimes in a Two-Tone Driven Duffing Resonator

在双频驱动Duffing谐振子中跨越慢和快 regime的动力学相变

Soumya S. Kumar, Javier del Pino, Letizia Catalini, Alexander Eichler, Oded Zilberberg

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究双频驱动Duffing谐振子中慢拍 regime的动力学相变,通过引入循环平均振幅作为序参量,揭示蓝移与红移的不对称性,为非线性驱动系统的控制提供框架。

Comments 15 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21550 2026-03-17 cs.NI cs.OS cs.PL 50%

A Target-Agnostic Protocol-Independent Interface for the Transport Layer

面向传输层的无目标协议接口协议

Pedro Mizuno, Kimiya Mohammadtaheri, Linfan Qian, Joshua Johnson, Danny Akbarzadeh, Chris Neely, Mario Baldi, Nachiket Kapre, Mina Tahmasbi Arashloo

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出传输程序,一种独立于目标的抽象,用于精确捕捉传输协议对相关传输事件的反应,实现高性能传输栈的可移植性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13630 2026-03-17 cs.NI 50%

SAIL: Unsupervised Spatial-Angular Interpretable Feature Learning for RF Map Synthesis

SAIL:无监督空间-角度可解释特征学习用于射频地图合成

Sopan Sarkar, Marwan Krunz

专题命中 机器人操作 :manipulation(abstract)

AI总结 SAIL通过生成对抗网络学习可解释的潜在变量,实现无监督射频地图合成,提升合成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 38 篇

2603.14216 2026-03-17 cs.RO cs.HC 85%

Navigation beyond Wayfinding: Robots Collaborating with Visually Impaired Users for Environmental Interactions

超越导航的导航:机器人与视障用户协作进行环境互动

Shaojun Cai, Nuwan Janaka, Ashwin Ram, Janidu Shehan, Yingjia Wan, Kotaro Hara, David Hsu

专题命中 具身导航 :navigation(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种人机协作方法,结合机器人感知与用户物理操作能力,提升视障者环境互动导航的安全性与效率。

Comments Accepted to ACM/IEEE HRI 2026, 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14182 2026-03-17 cs.RO cs.HC 84%

Towards Equitable Robotic Furnishing Agents for Aging-in-Place: ADL-Grounded Design Exploration

迈向老年人独立生活中的公平机器人家具代理:基于日常活动的设计探索

Hansoo Lee, Changhee Seo, Subin Park, Sonya S. Kwak

专题命中 具身导航 :robotic(title,abstract);robotics(abstract,comments);分类 cs.RO

AI总结 本文探讨了在老年人独立生活背景下,通过基于日常活动的设计探索,开发公平的机器人家具代理,以减少认知和身体负担,提升老年人福祉。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026 Workshop: Equitable Robotics for Wellbeing (Eq-RW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15186 2026-03-17 cs.RO 83%

NavGSim: High-Fidelity Gaussian Splatting Simulator for Large-Scale Navigation

NavGSim: 高保真度高斯点扩散模拟器用于大规模导航

Jiahang Liu, Yuanxing Duan, Jiazhao Zhang, Minghan Li, Shaoan Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(中国人工智能研究院)

专题命中 具身导航 :navigation(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 NavGSim基于高斯点扩散框架,生成高保真度大规模导航环境,通过高斯点扩散切片技术提取可导航区域,提供多GPU支持的API,提升视觉-语言-动作模型的场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14586 2026-03-17 cs.HC cs.AI cs.CY 83%

The Scenic Route to Deception: Dark Patterns and Explainability Pitfalls in Conversational Navigation

通往欺骗的风景路线:对话导航中的暗模式与可解释性陷阱

Ilya Ilyankou, Stefano Cavazzi, James Haworth

专题命中 具身导航 :navigation(title,abstract);manipulation(abstract);分类 cs.AI

AI总结 研究探讨了生成式AI在行人导航中的应用,揭示了对话接口可能带来的操纵风险,并提出神经符号架构作为提升可信任度的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 82%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18188 2026-03-17 cs.CV cs.AI 81%

\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation

NaVIDA:基于逆动力学增强的视觉-语言导航

Weiye Zhu, Zekai Zhang, Xiangchen Wang, Hewei Pan, Teng Wang, Tiantian Geng, Rongtao Xu, Feng Zheng

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 NaVIDA通过引入逆动力学监督,增强视觉动态建模,提升导航稳定性与一致性,实验表明其在参数更少的情况下表现优于现有方法。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14276 2026-03-17 cs.CV cs.AI 81%

All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation

全天多场景终身视觉-语言导航与Tucker适应

Xudong Wang, Gan Li, Zhiyu Liu, Yao Wang, Lianqing Liu, Zhi Han

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出Tucker适应方法,解决视觉-语言导航在多场景下的持续学习问题,通过高阶张量分解实现知识解耦,提升长期部署灵活性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05530 2026-03-17 cs.RO cs.CV 81%

ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation

ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理

Wei Xue, Mingcheng Li, Xuecheng Wu, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00613 2026-03-17 cs.RO cs.SY eess.SY 80%

Complete and Near-Optimal Robotic Crack Coverage and Filling in Civil Infrastructure

全面且近最优的基础设施civil基础设施机器人裂缝覆盖与填充

Vishnu Veeraraghavan, Kyle Hunte, Jingang Yi, Kaiyan Yu

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出了一种同时基于传感器的检查和足迹覆盖(SIFC)规划与控制设计,用于自主机器人裂缝映射与填充。该方法通过在线构建目标地图实现未知目标信息的处理,并通过实验验证了算法在减少机器人行驶距离、保证完整感知覆盖和近最优足迹覆盖方面的有效性。

Journal ref IEEE Trans. Robotics, vol. 40, pp. 2850-2867, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12908 2026-03-17 cs.RO 79%

GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation

GoalSwarm:多无人机语义协调用于开放词汇物体导航

MoniJesu Wonders James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出GoalSwarm框架,通过轻量语义地图构建、零样本目标检测和去中心化协调策略,实现多无人机在未知环境中的开放词汇物体导航。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14397 2026-03-17 cs.RO 79%

eNavi: Event-based Imitation Policies for Low-Light Indoor Mobile Robot Navigation

eNavi:基于事件的模仿策略用于低光室内移动机器人导航

Prithvi Jai Ramesh, Kaustav Chanda, Krishna Vinod, Joseph Raj Vishal, Yezhou Yang, Bharatesh Chakravarthi

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出eNavi,通过结合RGB和事件数据的多模态策略提升低光环境下机器人导航的鲁棒性,实验显示融合模型在未见低光条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏