arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-30 至 2026-06-30 共收录 163 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 47 篇

2606.29379 2026-06-30 cs.CV cs.AI cs.GR 62%

DR-GS: Physically-Based Deformable and Relightable 2D Gaussians

DR-GS: 基于物理的可变形与可重光照的2D高斯泼溅

Jiaxin Li, Tong Wu, Yi Wei, Tailin Wu, Li Zhang

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 提出DR-GS框架,通过显式解耦几何、光照和材质,实现可变形物体的物理一致重光照与后编辑,在静态重建、动态变形和重光照中达到领先视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28813 2026-06-30 cs.RO cs.AI 62%

Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning

Human2Any: 通过约束感知的组合规划实现人到机器人的迁移

Shuo Cheng, Chuye Zhang, Alfred Cueva, Caelan Garrett, Ajay Mandlekar, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA Corporation(英伟达公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出Human2Any框架,从人类视频学习可重用的物体中心交互先验,结合机器人端可行性推理与运动规划,实现无需目标任务真实机器人数据的跨实体、场景和任务迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09076 2026-06-30 cs.MA cs.AI cs.LG 62%

Robust Multi-Agent LLMs under Byzantine Faults

在拜占庭故障下鲁棒的多智能体大语言模型

Haejoon Lee, Vincent-Daniel Yun, Dimitra Panagou, Sai Praneeth Karimireddy

机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08057 2026-06-30 cs.RO cs.CV 62%

See and Switch: Vision-Based Branching for Interactive Robot-Skill Programming

看见并切换:基于视觉的交互式机器人技能编程分支方法

Petr Vanc, Jan Kristof Behrens, Václav Hlaváč, Karla Stepanova

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 See & Switch通过视觉输入实现机器人技能编程的条件分支,通过决策状态实现任务分支选择,提升机器人在现实环境中的适应能力。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30136 2026-06-30 cs.LG cs.GT 57%

Robust Strategic Classification under Decision-Dependent Cost Uncertainty

决策依赖成本不确定性下的鲁棒策略分类

Sura Alhanouti, Güzin Bayraksan, Parinaz Naghizadeh

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 针对策略分类中成本依赖决策的现实问题,提出两阶段鲁棒优化框架,利用决策依赖不确定集建模,减少博弈行为并降低不确定性。

Comments 29 pages, 7 figures, accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29940 2026-06-30 cs.RO 57%

WARP: Whole-Body Retargeting for Learning from Offline Human Demonstrations

WARP: 从离线人类演示中学习的全身重定向

Zhenyang Chen, Chuizheng Kong, Chuye Zhang, Yuanshao Yang, Lawrence Y. Zhu, Shreyas Kousik, Danfei Xu

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出WARP离线管线,通过闭式肩-肘-腕几何求解器精确跟踪末端执行器并保持全身结构意图,实现从人类演示到机器人动作的零样本全身移动操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29924 2026-06-30 cs.CV 57%

DCGrasp: Distance-aware Controllable Grasp Generation

DCGrasp: 距离感知的可控抓取生成

Hiroyasu Akada, Jesús Pérez, Emre Aksan, Vasileios Choutas, Cristian Romero, Alberto Garcia-Garcia, Vladislav Golyanik, Christian Theobalt, Thabo Beeler

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出DCGrasp系统,利用距离感知抓取能量项生成高质量、物理合理的3D手-物交互,支持灵活用户控制并泛化到多样物体和手形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29513 2026-06-30 cs.CV cs.GR 57%

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

场景即对象,而非基元:来自无位姿视图的实例结构化3D标记化

Mijin Yoo, In Cho, Subin Jeon, Jiwoo Lee, Eunbyung Park, Seon Joo Kim

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出一种前馈框架,直接从无位姿多视图图像将场景分解为实例结构化的3D标记组,实现重建、分割和操作,无需3D标注。

Comments Project page: https://yoomimi.github.io/instok3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29030 2026-06-30 cs.AI cs.ET 57%

Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering

LLM代理中的记忆作为攻击面:多项选择题回答研究

Shahnewaz Karim Sakib, Anindya Bijoy Das

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究LLM代理中外部记忆组件在多项选择题回答中的脆弱性,通过插入误导记忆进行攻击,实验表明简单记忆操纵即可显著影响答案准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28604 2026-06-30 cs.CV 57%

IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion

IMU-HOI:通过接触感知惯性融合实现连贯的人-物交互与运动捕捉的共生框架

Lizhou Lin, Songpengcheng Xia, Zengyuan Lai, Lan Sun, Jiarui Yang, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出IMU-HOI框架,利用稀疏IMU同时恢复全身人体姿态和物体6-DoF轨迹,通过推断手-物接触并融合运动学与惯性推理,实现无漂移的人-物交互运动捕捉。

Comments 10 pages, 5 figures. Accepted by CVPR 2026

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2026, pp. 42901-42910

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09781 2026-06-30 cs.CV 57%

Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

基于闭环VLM代理的文本引导的6D物体姿态重排

Sangwon Baik, Gunhee Kim, Mingi Choi, Hanbyul Joo

机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14152 2026-06-30 cs.CV 57%

SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation

SK-Adapter:基于骨架的结构控制用于原生3D生成

Anbang Wang, Yuzhuo Ao, Shangzhe Wu, Chi-Keung Tang

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SK-Adapter框架,通过将3D骨架作为第一类控制信号,实现原生3D生成的精确结构控制,同时保留几何与纹理质量,优于现有基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07744 2026-06-30 cs.RO 57%

AeroPlace-Flow: Language-Grounded Object Placement for Aerial Manipulators via Visual Foresight and Object Flow

AeroPlace-Flow:基于视觉前瞻和物体流的语言引导空中机械臂物体放置

Sarthak Mishra, Rishabh Dev Yadav, Naveen Nair, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad, India(印度IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系) Newcastle University, UK(英国新castle大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出AeroPlace-Flow框架,通过视觉前瞻和3D几何推理实现语言引导的空中物体放置,无需预设姿态或任务特定训练,在多样化的空中场景中实现75%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00654 2026-06-30 cs.CV 57%

Seed-to-Seed: Unpaired Image Translation in Diffusion Seed Space

种子到种子:扩散种子空间中的无配对图像翻译

Or Greenberg, Eran Kishon, Dani Lischinski

机构 * General Motors R&D(通用汽车研发中心) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种结合GAN和扩散模型的无配对图像翻译方法,通过利用预训练扩散模型的种子空间语义信息,实现复杂汽车场景的结构保持翻译,优于现有方法。

Comments British Machine Vision Conference (BMVC) 2025. Official proceedings: https://bmvc2025.bmva.org/proceedings/154/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18423 2026-06-30 cs.RO 57%

RetrDex: Efficient Object Retrieval in Cluttered Scenes with a Dexterous Hand

RetrDex: 在杂乱场景中利用灵巧手高效检索物体

Fengshuo Bai, Yu Li, Jie Chu, Tawei Chou, Runchuan Zhu, Ying Wen, Yaodong Yang, Yuanpei Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出RetrDex框架,通过大规模并行强化学习和空间感知表示,使灵巧臂手系统在杂乱场景中高效检索物体,展示出在多种配置下的强性能和零样本迁移能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30510 2026-06-30 cond-mat.mes-hall 50%

GaAs/AlAs Acoustic Nanocavities for Coherent GHz-THz Phonon Engineering

用于相干GHz-THz声子工程的GaAs/AlAs声学纳米腔

S. Sandeep, E. R. Cardozo de Oliveira, E. Mehdi, N. D. Lanzillotti-Kimura

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文综述了GaAs/AlAs声学纳米腔在GHz-THz声子工程中的进展,重点介绍了基于DBR的微柱谐振器实现三维声子限制和光声场共定位,以及超快光学技术对纳米尺度声子动力学的探测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30285 2026-06-30 cs.DL cs.CY cs.GT 50%

Submission Responsibility Matters: Role-Aware Submission Quotas under Coauthorship

提交责任重要:合著关系下的角色感知提交配额

Furkan Mumcu, Yasin Yilmaz

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对同行评审负载控制,提出角色感知的提交配额框架,区分主要作者、合著者和导师角色,避免对称配额对独立作者和学生论文的不利影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29765 2026-06-30 cond-mat.mtrl-sci 50%

Ferron Hall effect: Transverse accumulation of polarization driven by thermal gradients in ferroelectrics

铁电体中的铁子霍尔效应:热梯度驱动的极化横向积累

Daniel A. Bustamante Lopez, Verena Brehm, Dominik M. Juraschek

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文理论证明,在铁电材料中,霍尔效应偏转的晶格激发(铁子)携带电偶极矩,其横向运动导致极化积累,称为铁子霍尔效应,并在BaTiO3中通过原子晶格动力学验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28983 2026-06-30 cond-mat.mtrl-sci 50%

Structural properties of one-dimensional $\mathrm{Cs}_2\mathrm{CoCl}_4$ confined within single-walled carbon nanotubes

一维Cs₂CoCl₄在单壁碳纳米管中受限的结构性质

Jaskaran S. Mangat, Yu Lei, Matthew Weyland, Yisong Han, Kiran Bal, Martin R. Lees, Craig I. Hiley, Piotr Dłużewski, Sławomir Kret, Peng Wang, Richard I. Walton, Jeremy Sloan

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过透射电镜和模拟发现,Cs₂CoCl₄在单壁碳纳米管径向压缩下结晶为四方和正交相,并保持磁性质,展示一维受限作为结构调控工具。

Comments Thirteen pages including Supplementary Information. Four figures in the main text, and seven figures in the Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28935 2026-06-30 cond-mat.mes-hall quant-ph 50%

Optically Switched Phonon Superradiance of Surface Acoustic Wave in Diamond

金刚石中表面声波的光控声子超辐射

Zhiwei Chen, Changyong Lei, Jie Ren

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过光学驱动氮空位中心能级跃迁增强自旋-声子耦合,在弱耦合区域触发表面声波声子超辐射相变,实现可调控的固态量子器件。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28766 2026-06-30 quant-ph 50%

Linear and nonlinear optical torque in multi-level atomic systems driven by counter-rotating orbital angular momentum fields

由反向旋转轨道角动量场驱动的多能级原子系统中的线性和非线性光学扭矩

Dharma P. Permana, Mažena Mackoit Sinkevičienė, Viačeslav Kudriašov, Julius Ruseckas, Gediminas Juzeliünas, Hamid R. Hamedi

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究矢量涡旋光束在Λ型和三脚架型原子系统中产生的光学扭矩,发现原子相干性(包括初始布居差和相对相位)可控制扭矩,即使两分量振幅相等也能产生非零扭矩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17624 2026-06-30 physics.optics 50%

Global Self-Attention with Exact Fourier Propagation for Phase-Only Far-Field Holography

全局自注意力与精确傅里叶传播用于相位-only 远场全息成像

Dilawer Singh, Antoni J. Wojcik, Timothy D. Wilkinson

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出利用自注意力机制建模远场全息成像中的全局耦合结构,实现单次拍摄高保真相位全息生成,并结合相机-in-the-loop训练和可学习相位校正器实现适应性光波控制。

Comments 19 pages, 9 figures. Proof-of-concept physics-in-the-loop self-attention framework for phase-only far-field holography

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 39 篇

2606.29934 2026-06-30 cs.RO 85%

RoamFlow: Reinforcement-Aligned One-Step Action MeanFlow Policy for Image-Goal Navigation

RoamFlow: 用于图像目标导航的强化对齐一步动作均值流策略

Zixuan Zhang, Yuqi Chen, Junjie Gao, Siyuan Song, Yongzhou Pan, Beichen Wang, Mir Feroskhan

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RoamFlow框架,利用均值流预测平均速度场实现轨迹合成,结合专家模仿和强化学习两阶段训练,在仿真和真实机器人上实现高效推理和强导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29908 2026-06-30 cs.RO cs.AI 84%

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

沉思之道:面向具身导航的空间感知世界动作模型

Hong Chen, Daqi Liu, Zehan Zhang, Haiguang Wang, Tianhao Lu, Longfei Yan, Haiyang Sun, Fangzhen Li, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Yihua Tan

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.AI

AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30404 2026-06-30 cs.RO 83%

HUMEMBR: Learning Human Routines for Predictive Embodied Navigation

HUMEMBR:学习人类日常行为以进行预测性具身导航

Samira Huber, Klaas Pelzer, Duc M. Nguyen, Xuesu Xiao, Sören Pirk

机构 * Kiel University, Germany(德国基尔大学) George Mason University, USA(美国乔治·马歇尔大学)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 提出HUMEMBR系统,通过连续记忆构建与并行检索机制,实现基于人类日常行为的具身问答和导航,相比全上下文LLM基线在长时推理上更高效。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28691 2026-06-30 cs.RO 83%

DRIVE-Nav: Directional Reasoning, Inspection, and Verification for Efficient Open-Vocabulary Navigation

DRIVE-Nav: 方向推理、检查与验证以实现高效的开放词汇导航

Maoguo Gao, Zejun Zhu, Zhiming Sun, Zhengwei Ma, Longze Yuan, Zhongjing Ma, Zhigang Gao, Jinhui Zhang, Suli Zou

机构 * Beijing Institute of Technology(北京理工大学) DeepBlue College(深蓝学院) The National Key Laboratory of Autonomous Intelligent Unmanned Systems (KAIUS), School of Automation(自主智能无人系统全国重点实验室(KAIUS),自动化学院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 DRIVE-Nav通过方向化探索框架提升开放词汇导航效率,通过方向检查和验证减少冗余路径,实验显示在HM3D-OVON等数据集上性能优越。

Comments 8 pages, 4 figures. Project page: https://coolmaoguo.github.io/drive-nav-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18608 2026-06-30 cs.RO cs.AI 82%

End-to-End Crop Row Navigation via LiDAR-Based Deep Reinforcement Learning

端到端的激光雷达深度强化学习用于作物行导航

Ana Luiza Mineiro, Francisco Affonso, Marcelo Becker

机构 * University of São Paulo (USP)(圣保罗大学)

专题命中 具身导航 :navigation(title,abstract);robotics(comments,journal_ref);分类 cs.RO、cs.AI

AI总结 本文提出基于激光雷达的端到端导航系统,通过深度强化学习直接将3D激光雷达数据映射到控制指令,解决农业环境中GNSS不可靠、行内杂乱和光照变化的问题。

Comments Accepted to the 22nd International Conference on Advanced Robotics (ICAR 2025). 7 pages

Journal ref 22nd International Conference on Advanced Robotics (ICAR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28397 2026-06-30 cs.CV cs.AI 81%

CLOSER-VLN: Closed-Loop Self-Verified Retrieval-Augmented Reasoning for Aerial Vision-Language Navigation

CLOSER-VLN:面向空中视觉语言导航的闭环自验证检索增强推理

Shaoxuan Li, Xiangyu Dong, Xiaoguang Ma, Junfeng Chen, Haoran Zhao, Yaoming Zhou

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 提出CLOSER方法,通过闭环的推理、验证、检索和纠正机制,解决空中VLN中开放循环决策导致的误差累积问题,在CityNav基准上取得32.01% SR和21.28% SPL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05377 2026-06-30 cs.RO cs.CV 81%

OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

OpenFrontier: 基于视觉-语言基础的通用导航

Esteban Padilla-Cerdio, Boyang Sun, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) University of Bonn(波恩大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03142 2026-06-30 cs.RO cs.CV 81%

MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning

MM-Nav:基于多专家学习的多视角VLA模型用于鲁棒视觉导航

Tianyu Xu, Jiawei Chen, Jiazhao Zhang, Wenyao Zhang, Zekun Qi, Minghan Li, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出MM-Nav模型,通过多专家学习从合成数据中学习多样化的导航能力,展示模型在合成环境中的强泛化能力,并在现实世界实验中验证其有效性。

Comments Project page: https://pku-epic.github.io/MM-Nav-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏