arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-16 至 2026-03-16 共收录 57 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 23 篇

2603.12553 2026-03-16 cs.RO cs.CV 92%

Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation

超越密集未来:世界模型作为机器人操作的结构化规划器

Minghao Jin, Mozheng Liao, Mingfei Han, Zhihui Li, Xiaojun Chang

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12967 2026-03-16 cs.RO 88%

Language-Grounded Decoupled Action Representation for Robotic Manipulation

基于语言的解耦动作表示用于机器人操作

Wuding Weng, Tongshu Wu, Liucheng Chen, Siyu Xie, Zheng Wang, Xing Xu, Jingkuan Song, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出LaDA框架,通过自然语言连接感知与控制,引入可解释的动作原始语义,提升动作生成的鲁棒性和泛化能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12730 2026-03-16 cs.RO 88%

AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation

AnchorVLA4D: 一种基于锚点的时空视觉-语言-动作模型用于机器人操作

Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong

机构 * PrimeBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出AnchorVLA4D,通过引入锚点图像和轻量级空间编码器,提升机器人操作中的时空推理能力,实现在Simpler WidowX基准测试中提升13.6%,并在真实任务中达到80%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12717 2026-03-16 cs.RO cs.AI cs.LG 88%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12940 2026-03-16 cs.RO 83%

Coordinated Manipulation of Hybrid Deformable-Rigid Objects in Constrained Environments

在受限环境中协调操控混合变形-刚性物体

Anees Peringal, Anup Teejo Mathew, Panagiotis liatsis, Federico Renda

机构 * Department of Mechanical and Nuclear Engineering, Khalifa University(卡利法大学机械与核工程系) Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心) Department of Computer Science, Khalifa University(卡利法大学计算机科学系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于准静态优化的操控规划器,利用应变基的Cosserat杆模型处理混合变形-刚性物体,实现通过约束环境中的任务空间目标,实验验证了其在受限环境中的有效性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12488 2026-03-16 cs.RO 83%

COAD: Constant-Time Planning for Continuous Goal Manipulation with Compressed Library and Online Adaptation

COAD:基于压缩库和在线适应的连续目标操纵的常数时间规划

Adil Shiyas, Zhuoyun Zhong, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯特理工学院(WPI))

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 COAD通过压缩库和在线适应实现连续目标参数化任务空间的常数时间规划,减少运动库规模并提升规划效率与路径质量。

Comments Adil Shiyas and Zhuoyun Zhong contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18396 2026-03-16 cs.RO 83%

AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation

AOMGen: 为关节物体操控生成逼真、物理一致的演示

Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出AOMGen框架,通过单次真实扫描、演示和数字资产库生成逼真训练数据,提升机器人操控任务的成功率。

Comments Accepted by CVPR Findings2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12260 2026-03-16 cs.RO 79%

HumDex: Humanoid Dexterous Manipulation Made Easy

HumDex: 人形机器人灵活操控的便捷实现

Liang Heng, Yihe Tang, Jiajun Xu, Henghui Bao, Di Huang, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(USC物理超智能实验室) WorldEngine AI

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出HumDex系统,通过IMU运动追踪和学习导向方法,实现人形机器人灵活操控的高效数据采集与精准执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09696 2026-03-16 physics.optics 78%

Structures resistant to Manipulation by all Wavefronts in two dimensions

二维平面中对所有波前具有抗操纵性的结构

Asher Sabbagh, Michael Horodynski, Rida Khan, Brian Shi, Marin Soljačić

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文通过二维逆设计揭示了对所有波前具有抗操纵性的结构,展示了最大拉力和捕获刚度的显著降低,为微机电系统的发展提供了新的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12480 2026-03-16 cs.RO cs.AI 73%

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

一步流策略:用于快速视觉-运动策略的自蒸馏

Shaolong Li, Lichao Sun, Yongchao Chen

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12949 2026-03-16 eess.IV cs.CR cs.MM 71%

Editing Away the Evidence: Diffusion-Based Image Manipulation and the Failure Modes of Robust Watermarking

去除证据:基于扩散的图像篡改与鲁棒水印的失效模式

Qian Qi, Jiangyun Tang, Jim Lee, Emily Davis, Finn Carter

专题命中 机器人操作 :manipulation(title)

AI总结 本文分析了基于扩散的图像编辑对鲁棒水印的影响,指出非对抗性编辑可能无意中降低或消除水印,提出水印信号与噪声比和互信息的界限,揭示信息论上无法恢复的条件。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12772 2026-03-16 cs.CV cs.LG cs.RO 67%

PVI: Plug-in Visual Injection for Vision-Language-Action Models

PVI:插件式视觉注入用于视觉-语言-动作模型

Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(Lionrock人工智能实验室) China Merchants Group(中国商人集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12620 2026-03-16 cs.HC 67%

Leveraging Head Movement for Navigating Off-Screen Content on Large Curved Displays

利用头部运动导航大曲面显示屏上的非屏幕内容

A K M Amanat Ullah, David Ahlström, Khalad Hasan

专题命中 机器人操作 :manipulation(abstract);navigation(abstract)

AI总结 本文研究利用头部运动控制大曲面显示屏外屏内容导航,通过多项式速率控制函数实现高效访问,优于传统控制器方法。

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, Spain, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00016 2026-03-16 cs.RO cs.AI cs.HC 62%

Beyond Static Instruction: A Multi-agent AI Framework for Adaptive Augmented Reality Robot Training

超越静态指令:一种多智能体AI框架用于自适应增强现实机器人训练

Nicolas Leins, Jana Gonnermann-Müller, Malte Teichmann, Sebastian Pokutta

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出多智能体AI框架,用于增强现实机器人训练中的动态适应,通过多模态输入预处理和LLM自主推理实现个性化学习环境调整。

Journal ref Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (2026) 989-993

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06553 2026-03-16 eess.IV cs.CV cs.LG 62%

Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning

标签不准确和图像噪声对全景放射影像中牙齿分割的影响:使用联邦学习、集中学习和本地学习

Johan Andreas Balle Rubak, Khuram Naveed, Sanyam Jain, Lukas Esterle, Alexandros Iosifidis, Ruben Pauwels

机构 * Department of Dentistry and Oral Health(牙科与口腔健康系) Aarhus University(奥胡斯大学) Department of Electrical- and Computer Engineering(电气与计算机工程系) Faculty of Information Technology and Communications Sciences(信息科技与通讯科学学院) Tampere University(塔尔库大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 研究比较了联邦学习、集中学习和本地学习在不同数据损坏场景下对全景放射影像中牙齿分割的性能,发现联邦学习在隐私保护下表现优异,且能有效检测异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 57%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11139 2026-03-16 cs.LG 57%

H2LooP Spark Preview: Continual Pretraining of Large Language Models for Low-Level Embedded Systems Code

H2LooP Spark Preview:为低级嵌入式系统代码进行大语言模型的持续预训练

Amit Singh, Vedant Nipane, Pulkit Agrawal, Jatin Kishnani, Sairanjan Mishra

机构 * H2LooP.ai

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本文提出H2LooP Spark Preview,通过持续预训练方法,利用BF16 LoRA技术将OLMo-3-7B模型适应于嵌入式系统领域,显著降低困惑度并提升代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12864 2026-03-16 cs.CV 57%

Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation

通过解耦控制合成驾驶世界以生成对抗性场景

Yifan Zhan, Zhengqing Chen, Qingjie Wang, Zhuo He, Muyao Niu, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Horizon Robotics University of Glasgow(格拉斯哥大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CompoSIA,通过解耦交通因素实现对对抗性驾驶场景的精细控制,提升生成质量并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12577 2026-03-16 cs.CL cs.CV 57%

Expert Pyramid Tuning: Efficient Parameter Fine-Tuning for Expertise-Driven Task Allocation

专家金字塔调优:面向专家驱动任务分配的高效参数微调

Jia-Chen Zhang, Zhen-Wei Yan, Yu-Jie Xiong, Chun-Ming Xia

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出专家金字塔调优(EPT),通过多尺度特征金字塔概念提升参数高效微调性能,实现任务复杂度分层建模,实验表明其在多任务基准上优于现有MoE-LoRA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17908 2026-03-16 cs.RO 57%

WHED: A Wearable Hand Exoskeleton for Natural, High-Quality Demonstration Collection

WHED:一种可穿戴手外骨骼用于自然、高质量示范收集

Mingzhang Zhu, Alvin Zhu, Jose Victor S. H. Ramos, Beom Jun Kim, Yike Shi, Yufeng Wu, Ruochen Hou, Quanyou Wang, Eric Song, Tony Fan, Yuchen Cui, Dennis W. Hong

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出WHED可穿戴手外骨骼,通过可穿戴性和自由移动拇指耦合设计,解决多指手自然高质量示范收集难题,展示抓取与操作序列的可行性。

Comments This manuscript is withdrawn because the work is being substantially revised for submission to a peer-reviewed venue. The current version may be incomplete or misleading

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08116 2026-03-16 cs.RO 57%

From Ellipsoids to Midair Control of Dynamic Hitches

从椭球到空中动态绳结控制

Jiawei Xu, Subhrajit Bhattacharya, David Saldaña

机构 * Autonomous and Intelligent Robotics Laboratory (AIRLab)(自主与智能机器人实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于椭球的运动学模型,用于连接由两根绳索形成的绳结几何特性与四架空中机器人驱动的绳结动力学,揭示系统控制仿射形式,并设计QP控制器实现精确跟踪和安全约束。

Journal ref The 2026 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10254 2026-03-16 physics.optics 50%

High-Fidelity and High-Speed Wavefront Shaping by Leveraging Complex Media

利用复杂介质实现高保真和高速波前整形

Li-Yu Yu, Sixian You

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过利用复杂介质的稀疏到随机转换,克服了空间光调制器件的维度限制,实现了高保真和高速的波前整形,提升了投影精度和散射抑制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04009 2026-03-16 cs.GT cs.DS 50%

On the Complexity of the Two-Stage Majoritarian Rule

两阶段多数决规则的复杂性

Yongjie Yang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了两阶段多数决规则在议程控制、联盟操纵等八个选举控制问题上的复杂性,揭示了该规则在不同决策场景下的计算复杂性。

Comments Accepted to Autonomous Agents and Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 10 篇

2512.01550 2026-03-16 cs.RO cs.CV 90%

NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction

NavForesee: 一种统一的视觉-语言世界模型用于分层规划和双时间尺度导航预测

Fei Liu, Shichao Xie, Minghua Luo, Zedong Chu, Junjun Hu, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 NavForesee通过统一的视觉-语言模型实现分层规划和双时间尺度导航预测,结合任务分解与环境预测,提升复杂场景下的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12574 2026-03-16 cs.RO 85%

From Woofs to Words: Towards Intelligent Robotic Guide Dogs with Verbal Communication

从Woofs到Words:迈向具备言语交流的智能机器人导盲犬

Yohei Hayamizu, David DeFazio, Hrudayangam Mehta, Zainab Altaweel, Jacqueline Choe, Chao Lin, Jake Juettner, Furui Xiao, Jeremy Blackburn, Shiqi Zhang

专题命中 具身导航 :robotic(title,abstract);robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出了一种新型对话系统,通过LLM实现导航计划和场景的言语化,以提升导盲犬在动态环境中的空间感知与人类操作者的协作决策能力。

Comments 10 pages, 6 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12460 2026-03-16 cs.RO 79%

Predictive and adaptive maps for long-term visual navigation in changing environments

预测性与自适应地图用于变化环境中的长期视觉导航

Lucie Halodova, Eliska Dvorakova, Filip Majer, Tomas Vintr, Oscar Martinez Mozos, Feras Dayoub, Tomas Krajnik

机构 * Artificial Intelligence Center, Czech Technical University(捷克技术大学人工智能中心) Technical University of Cartagena, Spain(西班牙卡塔加纳技术大学) Australian Centre for Robotic Vision, QUT(澳大利亚机器人视觉中心,昆士兰大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文比较了不同地图管理技术用于变化环境中的长期视觉导航,提出策略通过建模环境外观的周期性变化以提升机器人定位精度。

Journal ref IROS 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12994 2026-03-16 cs.RO 70%

Route Fragmentation Based on Resource-centric Prioritisation for Efficient Multi-Robot Path Planning in Agricultural Environments

基于资源优先的路线碎片化方法用于农业环境中高效多机器人路径规划

James R. Heselden, Gautham P. Das

机构 * Lincoln Centre for Autonomous Systems, University of Lincoln, UK(林肯自主系统中心,林肯大学,英国) Lincoln Institute for Agri-food Technology, University of Lincoln, UK(林肯农业食品技术研究所,林肯大学,英国)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于资源优先的路线碎片化方法,用于农业环境中高效多机器人路径规划,通过部分路线进展减少二进制等待影响,提升任务吞吐量。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12663 2026-03-16 cs.CV cs.RO 68%

Learning Geometric and Photometric Features from Panoramic LiDAR Scans for Outdoor Place Categorization

从全景LiDAR扫描中学习几何和光度特征用于户外场所分类

Kazuto Nakashima, Hojung Jung, Yuki Oto, Yumi Iwashita, Ryo Kurazume, Oscar Martinez Mozos

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院) Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学部) Technical University of Cartagena(卡塔赫纳技术大学)

专题命中 具身导航 :navigation(abstract);robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 本文提出利用CNN处理LiDAR获取的全景深度/反照率图像,通过构建MPO数据集实现户外场所分类,优于传统方法,验证了深度与反照率模态的联合使用有效性。

Comments Published in Advanced Robotics on 31 Jul 2018

Journal ref Advanced Robotics, 32(14):750-765, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.04285 2026-03-16 cs.RO 61%

Warped Hypertime Representations for Long-term Autonomy of Mobile Robots

扭曲的超时间表示用于移动机器人的长期自主性

Tomas Krajnik, Tomas Vintr, Sergi Molina, Jaime P. Fentanes, Grzegorz Cielniak, Tom Duckett

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University(人工智能中心,电气工程系,捷克技术大学) Lincoln Centre for Autonomous Systems, University of Lincoln(自主系统林肯中心,林肯大学) Technical University of Cartagena(卡塔赫纳技术大学)

专题命中 具身导航 :robotics(abstract,journal_ref);分类 cs.RO

AI总结 本文提出了一种将时间引入移动机器人中离散和连续空间表示的新方法,通过建模由人类活动引起的长期伪周期性变化。该方法通过扩展空间模型,引入一组扭曲维度以表示观测到的变化的周期性,从而实现对离散和连续空间表示未来状态的预测。

Journal ref Robotics and Automation Letters, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12904 2026-03-16 cs.RO 57%

Consistent and Efficient MSCKF-based LiDAR-Inertial Odometry with Inferred Cluster-to-Plane Constraints for UAVs

一致且高效的基于MSCKF的无人机激光雷达-惯性里程计与推断的簇到平面约束

Jinwen Zhu, Xudong Zhao, Fangcheng Zhu, Jun Hu, Shi Jin, Yinian Mao, Guoquan Huang

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种针对无人机的高效紧密耦合LIO框架,通过推断的平面特征构建共面约束,利用空域投影消除状态向量中的特征参数依赖,提升一致性与效率,实现实时运行于资源受限平台。

详情

展开后加载摘要…

URL PDF HTML 收藏