arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-18 至 2026-03-18 共收录 22 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22 篇

2603.16086 2026-03-18 cs.RO cs.AI cs.CV cs.SD 87%

Towards the Vision-Sound-Language-Action Paradigm: The HEAR Framework for Sound-Centric Manipulation

迈向视觉-声音-语言-动作范式:用于以声音为中心的操作的HEAR框架

Chang Nie, Tianchen Deng, Guangming Wang, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Shanghai Key Laboratory of Navigation and Location Based Services(自动化与智能感知学院,上海交通大学,导航与基于位置的服务重点实验室) Department of Engineering, Cambridge University(工程系,剑桥大学)

专题命中 机器人操作 :manipulation(title,abstract);embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出HEAR框架,通过整合声音、视觉、语言和本体感知,解决实时声音中心操作中的关键声音遗漏问题,强调因果持续性和显式时间学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13644 2026-03-18 cs.RO cs.AI cs.CV 85%

World Models for Learning Dexterous Hand-Object Interactions from Human Videos

为从人类视频学习灵巧手-物体交互构建世界模型

Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, Yann LeCun

机构 * FAIR at Meta(Meta 的 FAIR 部门) New York University(纽约大学)

专题命中 机器人操作 :world model(title,abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DexWM模型,通过手部关键点提取实现对精细手部动作的建模,提升未来状态预测和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09021 2026-03-18 cs.RO cs.CV 84%

$χ_{0}$: Resource-Aware Robust Manipulation via Taming Distributional Inconsistencies

$χ_{0}$:通过驯服分布不一致性实现资源感知的鲁棒操作

Checheng Yu, Chonghao Sima, Gangcheng Jiang, Hai Zhang, Haoguang Mai, Hongyang Li, Huijie Wang, Jin Chen, Kaiyang Wu, Li Chen, Lirui Zhao, Modi Shi, Ping Luo, Qingwen Bu, Shijia Peng, Tianyu Li, Yibo Yuan

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出$χ_{0}$框架,通过模型算术、阶段优势和训练部署对齐三个技术支柱,解决人示范分布、策略学习偏倚与测试分布之间的分布不一致性问题,实现长周期衣物操作的高可靠性自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO 83%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15541 2026-03-18 cs.RO 83%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16772 2026-03-18 cs.RO cs.HC 77%

Beyond Cybathlon: On-demand Quadrupedal Assistance for People with Limited Mobility

超越Cybathlon:为行动受限者提供按需四足辅助系统

Carmen Scheidemann, Andrei Cramariuc, Changan Chen, Jia-Ruei Chiu, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Robotic Systems Lab(机器人系统实验室)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种按需四足辅助机器人系统,结合半自主任务执行与人机协作,通过语义导航和碰撞感知实现环境移动与拾取放置任务,验证了其在日常生活中帮助行动受限者提高独立性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV 75%

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16853 2026-03-18 cs.RO cs.GR 70%

BrickSim: A Physics-Based Simulator for Manipulating Interlocking Brick Assemblies

BrickSim:一种基于物理的操纵互锁砖块组的模拟器

Haowei Wen, Ruixuan Liu, Weiyi Piao, Siyu Li, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 BrickSim通过紧凑的力基力学模型和凸二次规划解决互锁砖块的snap-fit机制,实现高保真的实时模拟,支持机器人构建和结构坍塌仿真,具有开源特性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV 70%

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16609 2026-03-18 cs.RO 61%

Dexterous grasp data augmentation based on grasp synthesis with fingertip workspace cloud and contact-aware sampling

基于指尖工作空间云和接触感知采样的灵巧抓取数据增强

Liqi Wu, Haoyu Jia, Kento Kawaharazuka, Hirokazu Ishida, Kei Okada

机构 * The Department of Mechano-Informatics, Graduate School of Information Science and Technology, The University of Tokyo(机械信息学系,信息科学与技术研究生院,东京大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出基于远程操作的框架,通过FSG生成抓取姿态数据,结合AutoWS自动生成指尖工作空间云,提升抓取数据生成效率与鲁棒性。

Comments Accepted to Advanced Robotics, GitHub: https://github.com/W567/FSG, YouTube: https://youtu.be/rFCDl9SxSSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16444 2026-03-18 cs.CV 57%

Fast-HaMeR: Boosting Hand Mesh Reconstruction using Knowledge Distillation

Fast-HaMeR: 通过知识蒸馏提升手形重建

Hunain Ahmed Jillani, Ahmed Tawfik Aboukhadra, Ahmed Elhayek, Jameel Malik, Nadia Robertini, Didier Stricker

机构 * RPTU(鲁尔大学) DFKI-AV(达姆施塔特德国研究院-人工智能实验室) UPM(乌拉尔理工大学) NUST-SEECS(纳全国科技大学-信息与电子工程学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 本文提出Fast-HaMeR,通过轻量神经网络与知识蒸馏提升3D手形重建效率,采用MobileNet等轻量模型替代原ViT-H,并验证了输出级和特征级蒸馏策略的有效性,实现速度提升1.5倍且精度损失仅0.4mm。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16218 2026-03-18 cs.RO 57%

Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward

通过时间离散和时间连续速度前馈实现视觉-语言-动作模型中的动态跟踪

Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard

机构 * Siemens Foundational Technologies(西门子基础技术) Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出两种方法提取VLAs中的速度目标,通过有限差分和连续三次B样条空间,改进VLA策略以解决合规性与响应性之间的权衡,提升任务执行速度和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15863 2026-03-18 cs.HC cs.AI 57%

Interpretative Interfaces: Designing for AI-Mediated Reading Practices and the Knowledge Commons

解释性界面:为AI中介的阅读实践和知识公共领域进行设计

Gabrielle Benabdallah

机构 * University of Washington(华盛顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文探讨通过设计解释性界面促进用户与AI模型的交互,使非专家用户能干预语言模型的表示空间,通过直接操作观察和注释模型内部表示的变化,从而推动AI解释性作为交互设计而非纯技术问题。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22579 2026-03-18 cs.RO cs.SE 57%

Metamorphic Testing of Vision-Language Action-Enabled Robots

视觉-语言-动作机器人元测试

Pablo Valle, Sergio Segura, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙达龙大学) University of Seville(塞维利亚大学) Simula Research Laboratory(Simula研究实验室)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文探讨元测试能否缓解视觉-语言-动作机器人测试 oracle 问题,提出两种关系模式和五种关系,通过实验证明其有效性,并展示其在不同任务和机器人上的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19142 2026-03-18 cs.RO 57%

BiGraspFormer: End-to-End Bimanual Grasp Transformer

BiGraspFormer:端到端双臂抓取Transformer

Kangmin Kim, Seunghyeok Back, Geonhyup Lee, Sangbeom Lee, Sangjun Noh, Kyoobin Lee

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,全州科学技术学院(GIST)) Department of AI Machinery, Korea Institute of Machinery & Materials (KIMM)(人工智能机械系,韩国机械材料研究院(KIMM))

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出BiGraspFormer,一种端到端的双臂抓取Transformer框架,通过单引导双臂策略生成协调的双臂抓取方案,有效解决现有方法在协调性和效率上的不足。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03992 2026-03-18 cs.RO 57%

GeoFIK: A Fast and Reliable Geometric Solver for the IK of the Franka Arm based on Screw Theory Enabling Multiple Redundancy Parameters

GeoFIK:基于螺旋理论的Franka臂逆运动学快速可靠求解器

Pablo C. Lopez-Custodio, Yuhe Gong, Luis F. C. Figueredo

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 本文提出GeoFIK,一种基于螺旋理论的Franka臂逆运动学求解器,通过几何方法处理冗余参数,解决复杂逆运动学问题,验证了其速度、鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15809 2026-03-18 cs.MA cs.AI 57%

Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks

不要信任固执的邻居:代理网络的安全框架

Samira Abedini, Sina Mavali, Lea Schönherr, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多代理系统中恶意代理传播虚假信息的风险,提出理论框架并通过实验验证了增加良性代理、提升固执度或降低对敌方信任可增强系统安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15695 2026-03-18 physics.flu-dyn 50%

Non-inertial hydrodynamics of manipulating particle transport

非惯性流体中操控粒子运输的流体动力学

Partha Kumar Das

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究非惯性流体中微流体操控粒子轨迹的机制,探讨障碍物对粒子轨迹影响的物理原理,揭示流体动力学效应在粒子偏转中的作用。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02750 2026-03-18 quant-ph nucl-ex 50%

Coupling of a Nuclear Transition to a Surface Acoustic Wave

核态跃迁与表面声波的耦合

Albert Nazeeri, Chiara Brandenstein, Chengjie Jia, Lorenzo Magrini, Giorgio Gratta

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过高效耦合富集的$^{57}$Fe薄膜与97.9MHz表面声波,实现远高于核线宽的高频控制,产生莫塞莱谱中的吸收侧带,展示最高频率的机械驱动莫塞莱共振。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16405 2026-03-18 cs.CR 50%

Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation

污染像素:重新审视语义分割中的后门攻击

Guangsheng Zhang, Huan Tian, Leo Zhang, Tianqing Zhu, Ming Ding, Wanlei Zhou, Bo Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了语义分割中的后门攻击,提出四种粗粒度攻击向量和两种细粒度攻击向量,通过BADSEG框架验证攻击有效性,并发现现有防御措施无法有效缓解攻击,揭示了语义分割的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15996 2026-03-18 physics.acc-ph 50%

Advanced Control of Electron Beams: Tailoring X-ray Production with Programmable Laser Shaping

电子束高级控制:通过可编程激光成型定制X射线产生

Jack Hirschman, Randy Lemons, Hao Zhang, Razib Obaid, River Robles, Paris Franz, Benjamin Mencer, Nicole Neveu, Matthew Britton, David Cesar, Nicolas Sudar, Zhen Zhang, Justin Baker, Chad Pennington, Kurtis Borne, Taran Driver, Kirk A. Larsen, Veronica Guo, Yuantao Ding, Gabriel Just, Feng Zhou, James Cryan, Joseph Robinson, Ryan Coffee, Agostino Marinelli, Sergio Carbajo

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出通过可编程激光成型实现电子束控制,以定制X射线产生。利用非线性频率转换与空间光调制器结合的架构,生成用户定义的时间结构,并通过高分辨率时间域诊断观察其对电子束的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00996 2026-03-18 stat.ME 50%

Generalized Geographically Weighted Regression Model within a Modularized Bayesian Framework

基于模块化贝叶斯框架的广义地理加权回归模型

Yang Liu, Robert J. B. Goudie

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出基于模块化贝叶斯框架的广义地理加权回归模型,解决传统GWR模型在处理部分模型不规范性时的局限性,通过地理加权核和KL散度优化实现空间数据的高效处理。

Comments 34 pages, 11 figures

Journal ref Bayesian Anal. (2024) 19(2):465-500

详情

展开后加载摘要…

URL PDF HTML 收藏