arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-16 至 2026-03-16 共收录 23 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 23 篇

2603.12553 2026-03-16 cs.RO cs.CV 92%

Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation

超越密集未来:世界模型作为机器人操作的结构化规划器

Minghao Jin, Mozheng Liao, Mingfei Han, Zhihui Li, Xiaojun Chang

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12967 2026-03-16 cs.RO 88%

Language-Grounded Decoupled Action Representation for Robotic Manipulation

基于语言的解耦动作表示用于机器人操作

Wuding Weng, Tongshu Wu, Liucheng Chen, Siyu Xie, Zheng Wang, Xing Xu, Jingkuan Song, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出LaDA框架,通过自然语言连接感知与控制,引入可解释的动作原始语义,提升动作生成的鲁棒性和泛化能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12730 2026-03-16 cs.RO 88%

AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation

AnchorVLA4D: 一种基于锚点的时空视觉-语言-动作模型用于机器人操作

Juan Zhu, Zhanying Shao, Xiaoqi Li, Ethan Morgan, Jiadong Xu, Hongwei Fan, Hao Dong

机构 * PrimeBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出AnchorVLA4D,通过引入锚点图像和轻量级空间编码器,提升机器人操作中的时空推理能力,实现在Simpler WidowX基准测试中提升13.6%,并在真实任务中达到80%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12717 2026-03-16 cs.RO cs.AI cs.LG 88%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12940 2026-03-16 cs.RO 83%

Coordinated Manipulation of Hybrid Deformable-Rigid Objects in Constrained Environments

在受限环境中协调操控混合变形-刚性物体

Anees Peringal, Anup Teejo Mathew, Panagiotis liatsis, Federico Renda

机构 * Department of Mechanical and Nuclear Engineering, Khalifa University(卡利法大学机械与核工程系) Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心) Department of Computer Science, Khalifa University(卡利法大学计算机科学系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于准静态优化的操控规划器,利用应变基的Cosserat杆模型处理混合变形-刚性物体,实现通过约束环境中的任务空间目标,实验验证了其在受限环境中的有效性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12488 2026-03-16 cs.RO 83%

COAD: Constant-Time Planning for Continuous Goal Manipulation with Compressed Library and Online Adaptation

COAD:基于压缩库和在线适应的连续目标操纵的常数时间规划

Adil Shiyas, Zhuoyun Zhong, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯特理工学院(WPI))

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 COAD通过压缩库和在线适应实现连续目标参数化任务空间的常数时间规划,减少运动库规模并提升规划效率与路径质量。

Comments Adil Shiyas and Zhuoyun Zhong contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18396 2026-03-16 cs.RO 83%

AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation

AOMGen: 为关节物体操控生成逼真、物理一致的演示

Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出AOMGen框架,通过单次真实扫描、演示和数字资产库生成逼真训练数据,提升机器人操控任务的成功率。

Comments Accepted by CVPR Findings2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12260 2026-03-16 cs.RO 79%

HumDex: Humanoid Dexterous Manipulation Made Easy

HumDex: 人形机器人灵活操控的便捷实现

Liang Heng, Yihe Tang, Jiajun Xu, Henghui Bao, Di Huang, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(USC物理超智能实验室) WorldEngine AI

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出HumDex系统,通过IMU运动追踪和学习导向方法,实现人形机器人灵活操控的高效数据采集与精准执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09696 2026-03-16 physics.optics 78%

Structures resistant to Manipulation by all Wavefronts in two dimensions

二维平面中对所有波前具有抗操纵性的结构

Asher Sabbagh, Michael Horodynski, Rida Khan, Brian Shi, Marin Soljačić

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文通过二维逆设计揭示了对所有波前具有抗操纵性的结构,展示了最大拉力和捕获刚度的显著降低,为微机电系统的发展提供了新的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12480 2026-03-16 cs.RO cs.AI 73%

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

一步流策略:用于快速视觉-运动策略的自蒸馏

Shaolong Li, Lichao Sun, Yongchao Chen

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12949 2026-03-16 eess.IV cs.CR cs.MM 71%

Editing Away the Evidence: Diffusion-Based Image Manipulation and the Failure Modes of Robust Watermarking

去除证据:基于扩散的图像篡改与鲁棒水印的失效模式

Qian Qi, Jiangyun Tang, Jim Lee, Emily Davis, Finn Carter

专题命中 机器人操作 :manipulation(title)

AI总结 本文分析了基于扩散的图像编辑对鲁棒水印的影响,指出非对抗性编辑可能无意中降低或消除水印,提出水印信号与噪声比和互信息的界限,揭示信息论上无法恢复的条件。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12772 2026-03-16 cs.CV cs.LG cs.RO 67%

PVI: Plug-in Visual Injection for Vision-Language-Action Models

PVI:插件式视觉注入用于视觉-语言-动作模型

Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(Lionrock人工智能实验室) China Merchants Group(中国商人集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12620 2026-03-16 cs.HC 67%

Leveraging Head Movement for Navigating Off-Screen Content on Large Curved Displays

利用头部运动导航大曲面显示屏上的非屏幕内容

A K M Amanat Ullah, David Ahlström, Khalad Hasan

专题命中 机器人操作 :manipulation(abstract);navigation(abstract)

AI总结 本文研究利用头部运动控制大曲面显示屏外屏内容导航,通过多项式速率控制函数实现高效访问,优于传统控制器方法。

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, Spain, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00016 2026-03-16 cs.RO cs.AI cs.HC 62%

Beyond Static Instruction: A Multi-agent AI Framework for Adaptive Augmented Reality Robot Training

超越静态指令:一种多智能体AI框架用于自适应增强现实机器人训练

Nicolas Leins, Jana Gonnermann-Müller, Malte Teichmann, Sebastian Pokutta

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出多智能体AI框架,用于增强现实机器人训练中的动态适应,通过多模态输入预处理和LLM自主推理实现个性化学习环境调整。

Journal ref Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (2026) 989-993

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06553 2026-03-16 eess.IV cs.CV cs.LG 62%

Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning

标签不准确和图像噪声对全景放射影像中牙齿分割的影响:使用联邦学习、集中学习和本地学习

Johan Andreas Balle Rubak, Khuram Naveed, Sanyam Jain, Lukas Esterle, Alexandros Iosifidis, Ruben Pauwels

机构 * Department of Dentistry and Oral Health(牙科与口腔健康系) Aarhus University(奥胡斯大学) Department of Electrical- and Computer Engineering(电气与计算机工程系) Faculty of Information Technology and Communications Sciences(信息科技与通讯科学学院) Tampere University(塔尔库大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 研究比较了联邦学习、集中学习和本地学习在不同数据损坏场景下对全景放射影像中牙齿分割的性能,发现联邦学习在隐私保护下表现优异,且能有效检测异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 57%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11139 2026-03-16 cs.LG 57%

H2LooP Spark Preview: Continual Pretraining of Large Language Models for Low-Level Embedded Systems Code

H2LooP Spark Preview:为低级嵌入式系统代码进行大语言模型的持续预训练

Amit Singh, Vedant Nipane, Pulkit Agrawal, Jatin Kishnani, Sairanjan Mishra

机构 * H2LooP.ai

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本文提出H2LooP Spark Preview,通过持续预训练方法,利用BF16 LoRA技术将OLMo-3-7B模型适应于嵌入式系统领域,显著降低困惑度并提升代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12864 2026-03-16 cs.CV 57%

Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation

通过解耦控制合成驾驶世界以生成对抗性场景

Yifan Zhan, Zhengqing Chen, Qingjie Wang, Zhuo He, Muyao Niu, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Horizon Robotics University of Glasgow(格拉斯哥大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CompoSIA,通过解耦交通因素实现对对抗性驾驶场景的精细控制,提升生成质量并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12577 2026-03-16 cs.CL cs.CV 57%

Expert Pyramid Tuning: Efficient Parameter Fine-Tuning for Expertise-Driven Task Allocation

专家金字塔调优:面向专家驱动任务分配的高效参数微调

Jia-Chen Zhang, Zhen-Wei Yan, Yu-Jie Xiong, Chun-Ming Xia

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出专家金字塔调优(EPT),通过多尺度特征金字塔概念提升参数高效微调性能,实现任务复杂度分层建模,实验表明其在多任务基准上优于现有MoE-LoRA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17908 2026-03-16 cs.RO 57%

WHED: A Wearable Hand Exoskeleton for Natural, High-Quality Demonstration Collection

WHED:一种可穿戴手外骨骼用于自然、高质量示范收集

Mingzhang Zhu, Alvin Zhu, Jose Victor S. H. Ramos, Beom Jun Kim, Yike Shi, Yufeng Wu, Ruochen Hou, Quanyou Wang, Eric Song, Tony Fan, Yuchen Cui, Dennis W. Hong

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出WHED可穿戴手外骨骼,通过可穿戴性和自由移动拇指耦合设计,解决多指手自然高质量示范收集难题,展示抓取与操作序列的可行性。

Comments This manuscript is withdrawn because the work is being substantially revised for submission to a peer-reviewed venue. The current version may be incomplete or misleading

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08116 2026-03-16 cs.RO 57%

From Ellipsoids to Midair Control of Dynamic Hitches

从椭球到空中动态绳结控制

Jiawei Xu, Subhrajit Bhattacharya, David Saldaña

机构 * Autonomous and Intelligent Robotics Laboratory (AIRLab)(自主与智能机器人实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出基于椭球的运动学模型,用于连接由两根绳索形成的绳结几何特性与四架空中机器人驱动的绳结动力学,揭示系统控制仿射形式,并设计QP控制器实现精确跟踪和安全约束。

Journal ref The 2026 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10254 2026-03-16 physics.optics 50%

High-Fidelity and High-Speed Wavefront Shaping by Leveraging Complex Media

利用复杂介质实现高保真和高速波前整形

Li-Yu Yu, Sixian You

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文通过利用复杂介质的稀疏到随机转换,克服了空间光调制器件的维度限制,实现了高保真和高速的波前整形,提升了投影精度和散射抑制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04009 2026-03-16 cs.GT cs.DS 50%

On the Complexity of the Two-Stage Majoritarian Rule

两阶段多数决规则的复杂性

Yongjie Yang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了两阶段多数决规则在议程控制、联盟操纵等八个选举控制问题上的复杂性,揭示了该规则在不同决策场景下的计算复杂性。

Comments Accepted to Autonomous Agents and Multi-Agent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏