arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-02 至 2026-07-02 共收录 24 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 7 篇

2603.17720 2026-07-02 cs.RO 版本更新 83%

VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning

VolumeDP: 用于操作策略学习的体积表示建模

Tianxing Zhou, Feiyang Xue, Zhangchen Ye, Tianyuan Yuan, Hang Zhao, Tao Jiang

机构 * IIIS, Tsinghua University(清华大学智能产业研究院) Galaxea AI

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出VolumeDP策略架构,通过体积表示显式3D推理解决2D-3D不匹配问题,在LIBERO基准上达到88.8%平均成功率,比最强基线提升14.8%。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26284 2026-07-02 cs.RO 版本更新 70%

PhyPush: One Push is All You Need for Sensorless Physical Property Estimation with Physics-Guided Transformers

PhyPush:基于物理引导的Transformer,一次推动即可实现无传感器物理属性估计

Koyo Fujii, Luis Figueredo, Praminda Caleb-Solly, Ivan Boschi, Edoardo Ida', Marco Carricato, Aly Magassouba

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Dept. of Industrial Engineering, University of Bologna(博洛尼亚大学工业工程系)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出PhyPush框架,利用物理引导的Transformer从单次推动的末端执行器速度估计物体质量和摩擦系数,通过牛顿第二定律和库仑摩擦模型约束提升物理一致性和泛化能力。

Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19124 2026-07-02 cs.RO 版本更新 70%

Tendon-Actuated Robots with a Tapered, Flexible Polymer Backbone: Design, Fabrication, and Modeling

具有锥形柔性聚合物背架的肌腱驱动机器人:设计、制造与建模

Harald Minde Hansen, Nandita Gallacher, Nicholas B. Andrews, Kristin Y. Pettersen, Jan Tommy Gravdahl, Mario di Castro

机构 * Mechatronics, Robotics and Operation Section, European Organization for Nuclear Research (CERN)(欧洲核子研究组织(CERN)机电学、机器人学与操作部门) Department of Aeronautics and Astronautics, University of Washington(华盛顿大学航空与航天系) Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(挪威科学技术大学(NTNU)工程 cybernetics 部门)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种3D打印的肌腱驱动连续机器人,采用柔性锥形背架,通过几何锥形设计实现高曲率和增强的末端合规性,支持多种合规性机器人检测和操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03591 2026-07-02 cs.RO cs.SY eess.SY 版本更新 70%

Manifold-constrained Hamilton-Jacobi Reachability Learning for Decentralized Multi-Agent Motion Planning

流形约束的 Hamilton-Jacobi 可达性学习用于去中心化多智能体运动规划

Qingyi Chen, Ruiqi Ni, Junyoung Kim, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出流形约束的 HJR 学习框架,通过求解流形约束下的 HJR 问题获取任务感知安全条件,并集成到去中心化轨迹优化规划器中,实现安全且任务可行的多智能体运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30552 2026-07-02 cs.RO cs.CV 版本更新 62%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14679 2026-07-02 cs.CV 版本更新 57%

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) Yonsei University(延世大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14660 2026-07-02 cs.CR cs.AI cs.CL 版本更新 57%

NeuroFilter: Activation-Based Guardrails for Privacy-Conscious LLM Agents

NeuroFilter: 基于激活的隐私意识LLM智能体防护栏

Saswat Das, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出基于激活探测的隐私过滤器,高效检测LLM智能体在单轮和多轮对话中的不当信息泄露,首次系统研究对话轨迹中的模型内部状态变化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 3 篇

2512.11173 2026-07-02 cs.RO 版本更新 83%

Learning Category-level Last-meter Navigation from RGB Demonstrations of a Single-instance

从单实例RGB演示中学习类别级最后米导航

Tzu-Hsien Lee, Fidan Mahmudova, Karthik Desingh

机构 * University of Minnesota, Twin Cities(明尼苏达大学 Twin Cities 分校)

专题命中 具身导航 :navigation(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出面向对象的模仿学习框架,利用RGB观测实现四足移动机械臂在最后米阶段的精确导航,无需深度或地图先验,在类别级泛化中达到高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12887 2026-07-02 cs.IR cs.AI 版本更新 57%

EcoGEO: Trajectory-Aware Evidence Ecosystems for Web-Enabled LLM Search Agents

EcoGEO:基于轨迹的证据生态系统用于网络增强的大语言模型搜索代理

Hengwei Ye, Jiasheng Mao, Zhenhan Guan, Zheng Tian

机构 * ShanghaiTech University(上海科技大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出EcoGEO,一种基于轨迹的证据生态系统,用于研究网络增强的大语言模型搜索代理在多步骤浏览中的证据获取过程,通过协调导航页面与支持页面提升产品推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04140 2026-07-02 cs.AI cs.CL 版本更新 57%

Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

选择性专家引导实现强化学习中有效且多样的探索

Zishang Jiang, Jinyi Han, Tingyun Li, Xinyi Wang, Sihang Jiang, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 提出MENTOR框架,仅在关键决策点提供专家引导,平衡探索的有效性与多样性,提升LLM在可验证奖励强化学习中的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 4 篇

2605.01896 2026-07-02 cs.CV 版本更新 79%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 79%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23164 2026-07-02 cs.LG 版本更新 79%

MetaOthello: A Controlled Study of Multiple World Models in Transformers

MetaOthello: Transformer中多个世界模型的控制研究

Aviral Chawla, Galen Hall, Juniper Lovato

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 通过引入共享语法但规则或分词不同的Othello变体套件,训练小型GPT处理混合数据,发现Transformer不划分容量为孤立子模型,而是收敛于跨变体因果转移的共享棋盘状态表示。

Comments Camera-ready version. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12009 2026-07-02 cs.CV 版本更新 57%

Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale

Affogato: 基于大规模自动数据生成的开词汇可操作区域定位

Junha Lee, Eunha Park, Chunghyun Park, Dahyun Kang, Minsu Cho

机构 * Pohang University of Science and Engineering (POSTECH)(浦项科技大学) SqueezeBits RLWLRD

专题命中 具身推理 :embodied agent(abstract);分类 cs.CV

AI总结 提出Affogato框架,通过自动化流程生成750K 3D可操作区域热力图与自然语言查询对,解决数据瓶颈,实现开词汇可操作区域定位,并验证其跨架构迁移能力。

Comments ECCV 2026, Project page: https://junha-l.github.io/affogato/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2407.15283 2026-07-02 cs.LG cs.AI cs.RO 版本更新 67%

Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms

通过强化学习策略梯度算法增强机器的硬件容错能力

Sheila Schoepp, Mehran Taghian, Shotaro Miwa, Yoshihiro Mitsuka, Shadan Golestan, Osmar Zaïane

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute(阿尔伯塔机器智能研究所) Advanced Technology R&D Center, Mitsubishi Electric Corporation(三菱电机株式会社先进技术研发中心) Information Technology R&D Center, Mitsubishi Electric Corporation(三菱电机株式会社信息技术研发中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文首次系统比较PPO和SAC两种强化学习算法在硬件故障容错中的表现,并研究四种知识迁移策略,实验表明算法能快速恢复故障并存在性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10263 2026-07-02 cs.RO cs.LG 版本更新 62%

From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning

从先验到专家:通过分布收缩强化学习微调实现高效技能掌握

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2603.25418 2026-07-02 cs.RO 版本更新 57%

Visualizing Impedance Control in Augmented Reality for Teleoperation: Design and User Evaluation

增强现实中阻抗控制的可视化用于遥操作:设计与用户评估

Gijs van den Brandt, Femke van Beek, Elena Torta

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 人机交互与遥操作 :manipulation(abstract);分类 cs.RO

AI总结 针对低成本无触觉反馈遥操作中力感知困难的问题,提出增强现实可视化阻抗控制器目标位姿及其与末端执行器位移的方法,实验表明该可视化使力关键提升任务完成时间减少24%。

Comments 6 pages, 5 figures. Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 6 篇

2505.20857 2026-07-02 cs.RO 版本更新 79%

Multi-Embodiment Robotic Retargeting via Guided Diffusion Model

基于引导扩散模型的多体机器人重定向

Zhefeng Cao, Ben Liu, Shunpeng Yang, Sen Li, Wei Zhang, Hua Chen

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟校区联合学院) LimX Dynamics

专题命中 机器人数据与评测 :robotic(title);robotics(abstract);分类 cs.RO

AI总结 提出统一图条件扩散框架,利用图结构编码不同机器人拓扑几何特征,通过基于能量的引导损失训练,实现跨异构体的运动重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 75%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01001 2026-07-02 cs.CV cs.AI 版本更新 73%

EgoSim: Egocentric World Simulator for Embodied Interaction Generation

EgoSim:用于具身交互生成的视角世界模拟器

Jinkun Hao, Mingda Jia, Ruiyan Wang, Hongrui Zhu, Jiafei Cao, Xihui Liu, Ran Yi, Lizhuang Ma, Jiangmiao Pang, Xudong Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 EgoSim通过建模可更新的世界状态,解决现有视角模拟器在3D grounding和动态更新上的不足,生成空间一致的交互视频并支持跨具身迁移。

Comments Project Page: egosimulator.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 62%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新 57%

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28517 2026-07-02 cs.HC 版本更新 50%

Drag, Infer, Reproject: Grounding LLMs through Spatial Interaction for Image Clustering

拖拽、推断、重投影:通过空间交互为图像聚类的LLM基础

Yang Liu, Xuxin Tang, Jiahao Xu, Chris North

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 提出CriterionSI方法,利用大语言模型从用户拖拽交互中推断聚类标准,并引导重投影,实现渐进式标准对齐的图像聚类布局。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 1 篇

2601.06598 2026-07-02 cond-mat.soft physics.class-ph 版本更新 50%

Snapping and Switching of Elastic Arches with Patterned Preferred Curvature

具有图案化优先曲率的弹性拱的 snapping 与 switching

Michał Zmyślony, Ammar Khan, John S. Biggins

专题命中 其他机器人 :robotics(abstract)

AI总结 结合弹性杆理论和光力学实验,研究具有时空变化优先曲率的主动拱的力学行为,通过将优先曲率分解为欧拉屈曲模式,揭示了 snapping 和 switching 的控制机制,并设计了最大能量释放和最低刺激的 snapping 模式及对称/非对称 switching 路径。

Comments 7 pages, 5 figures main text; 15 pages, 16 figures supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏