arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-11 至 2026-06-11 共收录 56 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 17 篇

2606.11396 2026-06-11 cs.RO 新提交 88%

PLUME: Probabilistic Latent Unified World Modeling and Parameter Estimation for Multi-Finger Manipulation

PLUME: 多指操作的概率潜在统一世界建模与参数估计

Abhinav Kumar, Soshi Iba, Rana Soltani Zarrin, Dmitry Berenson

机构 * University of Michigan(密歇根大学) Honda Research Institute USA(本田美国研究所)

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 提出PLUME世界模型,联合学习参数信念演化与条件动力学,通过在线参数推断实现零样本迁移,在螺丝刀旋转等任务中优于现有方法。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11372 2026-06-11 cs.RO 新提交 88%

HiPi: Reproducible High-Fidelity Piezoresistive Sensors for Robotic Manipulation

HiPi: 用于机器人操作的可复现高保真压阻传感器

Changyi Lin, Raihan Haque, Hui-Ping Wang, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) General Motors(通用汽车)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 提出HiPi系统,通过低串扰读出原理和可复现硬件设计,在双机械臂四阵列2048触觉点场景下实现220Hz读出,将接触几何IoU从0.428提升至0.797。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11525 2026-06-11 cs.RO cs.LG 新提交 86%

Learning Object Manipulation from Scratch via Contrastive Interaction

通过对比交互从零开始学习物体操作

Tongle Shen, Caleb Chuck, Fan Feng, Biwei Huang

机构 * UC San Diego(加州大学圣地亚哥分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对对比强化学习在交互密集操作任务中表现不佳的问题,提出交互加权重采样方法,通过保留模式边界提升多模态分段非线性可达性表示,在仿真和真实机器人空气曲棍球任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11818 2026-06-11 cs.RO 新提交 83%

Human-Guided Co-Manipulation of Carbon Fiber Plies

碳纤维铺层的人机协同操作

Rami Ojanen, James Fant-Male, Roel Pieters

机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。

Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12402 2026-06-11 cs.RO cs.AI cs.CV 新提交 80%

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

DIRECT: 在具身规划器中何时何地分配测试时计算?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达)

专题命中 机器人操作 :embodied agent(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 79%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11771 2026-06-11 cs.IT math.IT 新提交 78%

Segment-Wise Soft Robotics Inspired Flexible Antenna Arrays: Design and Optimization

分段式软体机器人柔性天线阵列:设计与优化

Shuaishuai Han, Konstantinos Ntougias, Elio Faddoul, Ioannis Krikidis

专题命中 机器人操作 :robotics(title);robotic(abstract)

AI总结 提出分段式软体机器人天线系统,通过独立控制分段运动实现天线位置重构,并设计两种部署方案及优化算法,显著提升和速率。

Comments Summitted to IEEE transaction journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 75%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12048 2026-06-11 cs.RO 新提交 74%

Point Cloud Segmentation for Autonomous Clip Positioning in Laparoscopic Cholecystectomy on a Phantom

用于腹腔镜胆囊切除术中自动夹子定位的点云分割(在体模上)

Balázs Gyenes, Nikolai Franke, Paul Maria Scheikl, Pit Henrich, Rayan Younis, Gerhard Neumann, Martin Wagner, Franziska Mathis-Ullrich

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) HIDSS4Health - Helmholtz Information and Data Science School for Health(亥姆霍兹信息与数据科学健康学校) Friedrich-Alexander-University, Erlangen-Nuremberg(弗里德里希-亚历山大大学埃尔朗根-纽伦堡) University Hospital Carl Gustav Carus and Centre for Tactile Internet with Human-in-the-loop (CeTI), Dresden University of Technology(卡尔·古斯塔夫·卡鲁斯大学医院及德累斯顿工业大学触觉互联网人机共融卓越中心)

专题命中 机器人操作 :robotics(abstract,comments);robotic(abstract);分类 cs.RO

AI总结 提出首个在腹腔镜手术体模上实现自主夹子定位的机器人系统,通过点云分割和样条插值提取目标位置,利用合成数据预训练和两种数据增强克服数据稀缺,达到0.75mm精度和100%成功率。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 8, August 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11628 2026-06-11 cs.RO cs.AI 新提交 73%

LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition

LUCID:从非结构化人类视频学习与具身无关的意图模型以实现可扩展的灵巧机器人技能获取

Harsh Gupta, Guanya Shi, Wenzhen Yuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出LUCID两阶段框架,从互联网规模的非结构化人类视频学习任务意图,并在大规模并行仿真中学习机器人控制,实现零样本迁移到不同具身和场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11982 2026-06-11 cs.LG 新提交 70%

PAWS: Preference Learning with Advantage-Weighted Segments

PAWS: 基于优势加权片段的首选学习

Aleksandar Taranovic, Onur Celik, Niklas Freymuth, Ge Li, Serge Thilges, Huy Le, Tai Hoang, Rania Rayyes, Gerhard Neumann

机构 * University of Freiburg(弗莱堡大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 针对偏好强化学习中训练与推理分布不匹配导致时间信用分配退化的问题,提出PAWS方法,利用片段级优势函数直接进行策略更新,在机器人操作和运动任务上优于现有方法。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12200 2026-06-11 cs.LG cs.AI 新提交 62%

Implicit Neural Representations of Individual Behavior

个体行为的隐式神经表示

Andrew Kang, Priya Narasimhan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人操作 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出Behavioral INR模型,用隐式神经表示从无标签多策略行为数据中学习策略表示,通过FiLM层调节策略函数,实现无监督策略识别,在连续状态-动作空间中提升策略可识别性。

Comments ICML 2026, Structured Probabilistic Inference & Generative Modeling Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11826 2026-06-11 cs.RO 新提交 57%

Modular Anthropomorphic Hand Design via Multi-Parameter Finger Benchmarking and Selection

模块化拟人手设计:基于多参数手指基准测试与选择

Yu Zhang, Huijiang Wang, Josie Hughes

机构 * The CREATE Lab, Institute of Mechanical Engineering, Swiss Federal Institute of Technology in Lausanne (EPFL)(瑞士洛桑联邦理工学院机械工程研究所CREATE实验室)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 提出一种模块化拟人手设计框架,通过多参数基准测试优化手指设计,实现整手性能提升,并在多物体抓取和灯泡旋拧任务中验证有效性。

Comments 14 pages, 13 figures. Submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11446 2026-06-11 cs.CV cs.GR 新提交 57%

3D-CBM: A Framework for Concept-Based Interpretability in Generative 3D Modeling

3D-CBM:生成式3D建模中基于概念可解释性的框架

Ahmad Al-Kabbany

机构 * Yubree Labs Multimedia Interaction and Communication Lab, Arab Academy for Science and Technology(阿拉伯科学技术学院多媒体交互与通信实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出将概念瓶颈模型(CBM)融入3D生成架构,通过多层级可解释原语和功能属性映射,实现语义可操控的3D生成,实验验证了高概念预测精度和交互式纠错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11588 2026-06-11 eess.SP 新提交 50%

Antenna Coding and Digital Precoding for Limited Feedback MIMO Systems Using Pixel Antennas

基于像素天线的有限反馈MIMO系统的天线编码与数字预编码

Zhetong Li, Hongyu Li

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对像素天线带来的信道状态信息获取开销问题,提出基于码本和索引反馈的有限反馈MIMO系统,联合设计天线编码器和数字预编码器,并开发低复杂度离线码本构建算法,性能优于传统固定配置天线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12122 2026-06-11 cond-mat.mtrl-sci 新提交 50%

All-electric picosecond field-free spin-orbit torque switching in magnetic trilayers

磁性三层结构中的全电皮秒无场自旋轨道矩翻转

Xinhou Chen, Shishun Zhao, Yuchen Pu, Qu Yang, Hyunsoo Yang

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过全电片上纳等离子体脉冲发生器实现6.4皮秒脉冲,在磁性三层结构中实现超快无场自旋轨道矩翻转,写入能量降低2-3个数量级,为高速低功耗SOT-MRAM提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11370 2026-06-11 cond-mat.mtrl-sci 新提交 50%

Reconfigurable Strain Gradient Polarity in Crystalline Oxide Nanomembranes for Controlled Bending of Functional Materials

可重构应变梯度极性在晶态氧化物纳米膜中用于功能材料的受控弯曲

Tiffany C. Wang, Minyong Han, Varun Harbola, Harold Y. Hwang

专题命中 机器人操作 :manipulation(abstract)

AI总结 利用单晶锰矿纳米膜制备可切换双稳态纳米鼓,通过控制应变梯度极性实现0.01%至1%的应变变化,为氧化物膜应用提供机械框架。

Journal ref ACS Appl. Nano Mater. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 8 篇

2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交 81%

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.LG

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11636 2026-06-11 cs.RO 新提交 79%

SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning

SAFER-Nav: 通过分割感知微调增强视觉机器人导航的安全性

Geonyeong Ko, Giung Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(西江大学电子工程系) Dept. of Computer Science, Rice University(莱斯大学计算机科学系) Vertical Labs, Co., Ltd.(Vertical Labs 有限公司)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 提出SAFER-Nav方法,通过分割感知微调将障碍物边界和可通行空间结构直接融入导航策略,降低碰撞频率并保持目标到达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11535 2026-06-11 cs.RO 新提交 79%

Adversarial Attacks on Learned Policies for Surgical Robotic Tasks

针对手术机器人任务学习策略的对抗攻击

Shutong Jin, Ziyang Chen, Preethi Satish, Paavan Gupta, Florian T. Pokorny, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 具身导航 :robotic(title);robotics(abstract);分类 cs.RO

AI总结 研究学习型策略在机器人辅助手术中易受对抗攻击的脆弱性,提出破坏性和引导性攻击方法,实验表明攻击可使手术子任务成功率平均降低61%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12027 2026-06-11 cs.RO 新提交 70%

Learning Unions of Convex Sets via Invertible Latent Decomposition for Path Planning

通过可逆潜在分解学习凸集并集用于路径规划

Taerim Yoon, Dongho Kang, Kisang Park, Junha Cha, Stelian Coros, Sungjoon Choi

机构 * Korea University(高丽大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 具身导航 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 提出ILD框架,联合学习可逆映射和潜在空间中的显式凸多面体并集,实现路径规划,并通过可见性引导采样保持凸集连通性,在多种环境中取得更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12306 2026-06-11 cs.RO 新提交 57%

UGV-Conditioned Multi-UAV Informative Planning on a Shared Exposure Belief

基于共享暴露信念的UGV条件多无人机信息规划

Lars Oerlemans, Moji Shi, Marija Popovic

机构 * MAVLab, Faculty of Aerospace Engineering, TU Delft(马文实验室,航空航天工程学院,代尔夫特理工大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出一种协调无人机编队降低地面车辆在未知威胁区导航风险的方法,通过共享暴露信念引导感知并减少冗余覆盖,仿真显示累积暴露降低38%,冗余覆盖从38.8%降至3.7%。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11489 2026-06-11 cs.RO 新提交 57%

Steering Multirobot Behavior via Closed-Loop Affine Activation Editing

通过闭环仿射激活编辑引导多机器人行为

Satyajeet Das, Darren Chiu, Shashank Hegde, Gaurav S. Sukhatme

机构 * University of Southern California(南加州大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出CLAE框架,在推理时通过编辑冻结策略的中间激活来引导多机器人行为,无需微调或重训练,并在多四旋翼导航任务中验证了速度控制、编队保持和规避监控等新行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11442 2026-06-11 cs.SE cs.PL 新提交 50%

Web-Native Graphical EMF Model Editors

Web原生图形化EMF模型编辑器

Susanne Göbel, Ralf Lämmel

专题命中 具身导航 :navigation(abstract)

AI总结 提出纯Web框架EMFular,基于Ecore模型自动生成图形编辑器,支持EMF一致性操作与Angular扩展,实现低代码生成、高可定制与无后端部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11747 2026-06-11 physics.atom-ph 新提交 50%

Ambiguity-Free Inertial Measurement with Multi-Wavelength Atom Interferometry

多波长原子干涉仪的无模糊惯性测量

Wei-Chen Jia, Yue Xin, Ke Shen, Yan-Ying Feng

专题命中 具身导航 :navigation(abstract)

AI总结 通过多波长原子干涉合成包络实现无模糊惯性测量,实验演示了双轴旋转与加速度传感,并解决了传统原子干涉仪的相位模糊问题。

Comments 10 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 4 篇

2606.12072 2026-06-11 cs.CV 新提交 85%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11482 2026-06-11 cs.SI cs.CL 新提交 78%

Building Social World Models with Large Language Models

用大型语言模型构建社会世界模型

Haofei Yu, Yining Zhao, Guanyu Lin, Jiaxuan You

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 具身推理 :world model(title,abstract)

AI总结 提出社会世界模型(SWM)框架,利用LLM从社会数据中挖掘时间模式,学习社会信念的状态转移函数,无需人工标注或普查数据,在预测市场基准上超越时序基础模型。

Comments 9 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12316 2026-06-11 cs.CV 新提交 74%

Slots, Transitions, Loops: Learning Composable World Models for ARC

槽、转换、循环:学习可组合的ARC世界模型

Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 提出Loop-OWM架构,通过颜色原型槽、演示条件任务摘要和循环转换模型,学习ARC任务中的视觉符号规则,在ARC-1和ARC-2上超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11417 2026-06-11 cs.LG cs.AI stat.ML 新提交 62%

Signed Compression Progress on a Sealed Audit is Goodhart-Resistant

密封审计上的有符号压缩进展是古德哈特抵抗的

Ayush Mittal, Dhruv Gupta

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出有符号压缩进展作为内在动机,证明其累积奖励等于审计改进,且对有限审计面板具有假阳性预算,抵抗古德哈特定律。

Comments 16 pages, 7 figures. Lean 4 (Mathlib) mechanized core and ARC-TGI experiment code: https://github.com/Zetetic-Dhruv/audit-compression-progress

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 6 篇

2606.11618 2026-06-11 cs.IT math.IT 新提交 88%

Vision-Language-Action Models Meet World Models: Embodied Agentic AI for Low-Altitude Wireless Networks

视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Cunhua Pan, Dong In Kim, Naofal Al-Dhahir

专题命中 机器人基础模型 :embodied agent(title,abstract);world model(title,abstract)

AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。

详情

展开后加载摘要…

URL PDF HTML 收藏