arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-08 至 2026-06-08 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 20 篇

2606.07217 2026-06-08 cs.RO cs.CV cs.LG 新提交 85%

Robotic Policy Adaptation via Weight-Space Meta-Learning

通过权重空间元学习实现机器人策略自适应

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca Rigazio, Fabio Galasso, Luca Franco

机构 * ItalAI University of Verona(威尼斯大学) Sapeinza University of Rome(罗马萨佩因扎大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出WIZARD框架,通过权重空间元学习从语言指令和演示视频生成任务特定LoRA参数,无需微调即可适应新任务,在LIBERO上性能提升高达14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06627 2026-06-08 cs.RO cs.AI cs.CV cs.LG 新提交 83%

What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?

在日常生活人类视频上协同训练机器人操作策略时什么因素重要?

Richard Li, Aditya Prakash, Andrew Wen, Saurabh Gupta, Yilun Du, Pulkit Agrawal

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究利用日常互联网视频协同训练机器人操作策略时,手部姿态质量和运动差距对迁移的影响,提出一种协同训练方法,在低机器人数据场景下六个操作任务中绝对成功率提升29.7%。

Comments The project website is here: https://richardrl.github.io/what-matters-cotraining-human-videos/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11740 2026-06-08 cs.RO 版本更新 83%

From Pixels to Shelf: An Integrated Robotic System for Autonomous Supermarket Stocking with a Mobile Manipulator

从像素到货架:基于移动操作臂的自主超市补货集成机器人系统

Davide Peron, Victor Nan Fernandez-Ayala, Lukas Segelmark

机构 * Department of Information Engineering, University of Padova(帕多瓦大学信息工程系) Division of Decision and Control Systems, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(皇家理工学院电气工程与计算机科学学院决策与控制系统系) Animum AB(Animum公司)

专题命中 机器人操作 :robotic(title,abstract);navigation(abstract);分类 cs.RO

AI总结 提出一种集成商用硬件与ROS2的模块化机器人系统,利用行为树规划、视觉检测和两步MPC控制,在700多次补货实验中实现98%以上的抓取成功率,但性能仍逊于人类工人。

Comments Preprint for CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06761 2026-06-08 cs.RO cs.AI 新提交 82%

AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation

AxisGuide: 在RGB观测中接地机器人动作坐标系以实现鲁棒的视觉运动操控

Jiyun Jang, Yujin Sung, Woosung Joung, Daewon Chae, Sangwon Lee, Sohwi Kim, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) University of Michigan(密歇根大学) KT R&D Center(KT研发中心) Kakao Mobility(Kakao移动)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 针对视觉运动策略在分布偏移下动作执行失败的问题,提出AxisGuide方法,通过渲染机器人基座坐标系轴并叠加提示通道,增强动作坐标理解,显著提升泛化性能。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08903 2026-06-08 cs.RO cs.AI 81%

3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning

面向机器人任务规划的3D grounded视觉-语言框架:自动化提示合成与监督推理

Guoqin Tang, Qingxuan Jia, Zeyuan Huang, Gang Chen, Ning Ji, Zhipeng Yao

机构 * Tsinghua University(清华大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出融合2D提示合成模块和小语言模型的框架,提升机器人3D场景理解与任务执行能力,实验显示任务成功率高达96.0%。

Journal ref Engineering Applications of Artificial Intelligence, vol. 164, p. 113268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06569 2026-06-08 cs.RO 新提交 79%

PhyRoGen: Synthetic Generation of Physical Robot Manipulation Puzzles Using Procedural Content Generation

PhyRoGen:使用程序化内容生成物理机器人操作谜题的合成生成

Lennart Julian Droß, Andreas Orthey, Marc Toussaint

机构 * Technical University of Berlin(柏林技术大学) Robotics Institute Germany(德国机器人研究所)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出PhyRoGen框架,利用程序化内容生成自动创建机器人操作谜题的合成数据集,生成的24个谜题可在1-300秒内求解,并在物理仿真中验证可操作性。

Comments 8 pages, accepted at CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09580 2026-06-08 cs.RO cs.LG 版本更新 73%

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERNF: 通过动作块评论家和归一化流实现样本高效的真实世界灵巧策略微调

Chenyu Yang, Denis Tarasov, Davide Liconti, Romain Guntz, Hehui Zheng, Robert K. Katzschmann

机构 * Soft Robotics Lab, D-MAVT(软机器人实验室,D-MAVT) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出SERNF框架,结合归一化流策略和动作块评论家,实现真实世界灵巧操作策略的样本高效微调,解决多模态动作分布和信用分配问题。

Comments https://srl-ethz.github.io/SERNF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07304 2026-06-08 cs.RO 新提交 70%

CAPE: Contrastive Action-conditioned Parallel Encoding for Embodied Planning

CAPE: 用于具身规划的条件对比动作并行编码

Cong Chen, Haowen Wang, Zhixiang Zhang, Pei Ren, Zhengping Che

专题命中 机器人操作 :embodied agent(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出CAPE框架,通过对比学习区分不同动作序列的未来结果,实现高效视觉动力学建模,在真实世界和零样本迁移任务中显著提升规划性能并降低推理成本。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06704 2026-06-08 cs.RO 新提交 70%

Optimal Control Approach for Non-prehensile Ball Juggling Using a 7-DoF Manipulator

使用7自由度机械臂进行非抓取式抛球的最优控制方法

Joel Ramadani, Vasilije Rakčević, Riddhiman Laha, Arne Sachtler, Valentin Le Mesle, Achim J. Lilienthal, Sami Haddadin

机构 * Technical University of Munich(慕尼黑技术大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) German Aerospace Center (DLR), Institute of Robotics and Mechatronics(德国航空航天中心(DLR)机器人与机电机构研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种基于模型的两阶段最优控制框架,用于7自由度机械臂使用工具进行非抓取式抛球,生成周期性抛球轨迹并通过离线计算实现实时误差校正。

Comments 8 pages, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06601 2026-06-08 cs.CV cs.AI cs.LG 新提交 67%

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

通过分解视觉代理实现直接3D感知物体插入

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

机构 * Google(谷歌) Black Forest Labs(黑森林实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出DIRECT框架,通过分解外观、几何和上下文引导,实现可控制3D姿态的物体插入,在几何可控性和视觉质量上优于现有方法。

Comments ICML 2026; Project Page: https://gong1130.github.io/DIRECT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06872 2026-06-08 cs.CV cs.AI 新提交 62%

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

EgoPressDiff: 用于自我中心UV域手部压力估计的多模态视频扩散模型

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 提出EgoPressDiff,一种条件视频扩散框架,通过多模态条件策略(手部姿态、3D网格顶点和深度信息)从视觉输入生成UV压力图,解决了现有方法中的量化误差和时间不一致问题,在EgoPressure数据集上实现SOTA,Volumetric IoU相对提升34%以上。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06660 2026-06-08 cs.AI cs.PF cs.RO 新提交 62%

AEGIS: A Backup Reflex for Physical AI

AEGIS:物理AI的备份反射

Josef Chen

机构 * KAIKAKU

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出AEGIS方法,通过在弱策略的冻结激活上使用轻量级探针检测高风险步骤,仅在必要时切换到强策略,在LIBERO-Spatial上恢复了弱策略损失的10.1%轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05220 2026-06-08 cs.LG cs.AI 版本更新 62%

MidSteer: Optimal Affine Framework for Steering Generative Models

MidSteer:用于引导生成模型的最优仿射框架

Tatiana Gaintseva, Andrew Stepanov, Ziquan Liu, Martin Benning, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * University of Basel(巴塞尔大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交 57%

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07005 2026-06-08 cs.CR 新提交 50%

The Sound of Malware: A Memory Forensics Approach for Android Malware Analysis via Audio Signals

恶意软件之声:通过音频信号进行Android恶意软件分析的内存取证方法

Silvia Lucia Sanna, Massimo Palozzi, Leonardo Regano, Riccardo Lazzeretti, Giorgio Giacinto

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出一种内存取证框架,将Android恶意软件的静态字节码和内存快照转换为音频波形,利用频谱描述符、CNN和Transformer嵌入实现高达98.0%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06914 2026-06-08 cs.CR 新提交 50%

DPAgent-in-the-Middle: Agentic Defense and Repair Against AI-Groomed Deceptive Patterns

中间DPAgent:针对AI诱导欺骗模式的代理防御与修复

Zewei Shi, Ruoxi Sun, Haoyang Li, Seong Oun Hwang, Feng Liu, Minhui Xue, Xingliang Yuan

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对网络界面中的隐私欺骗模式,提出DPAgent框架,通过四个专门代理结合潜在空间净化与防御性提示,主动检测并修复欺骗性界面,检测率达90.98%,修复率77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06788 2026-06-08 cs.CL cs.HC 新提交 50%

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

像对五岁小孩一样解释或随我选择:评估语言模型响应的交互潜力

Indu Panigrahi, Tal August

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出基于语言复杂度的交互评估框架,测试GPT-5.1等模型生成不同复杂度响应的能力,发现最佳模型仅46%时间正确调整复杂度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07306 2026-06-08 quant-ph 新提交 50%

Vacuum fluctuation induced quantum resource harvesting in triple-layer graphene

三层石墨烯中真空涨落诱导的量子资源提取

Yassine Dakir, Abdallah Slaoui, Rachid Ahl Laamara

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究平面微腔中三层石墨烯系统的非马尔可夫动力学及量子相干与纠缠生成,发现受限电磁场通过可调参数(如截止模式数、层间旋转角等)有效控制量子资源。

Journal ref Journal of Physics: Condensed Matter, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07234 2026-06-08 physics.app-ph physics.class-ph 新提交 50%

Resonance-induced frequency splitting and evanescent modes at temporal interfaces in elastic metamaterials

弹性超材料中时间界面引起的共振诱导频率分裂和倏逝模式

Cong Chen, Kaijun Yi, Gengkai Hu

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过突然激活弹性超材料中的局域共振器形成时间界面,研究非共振到共振色散的转变,揭示频率分裂现象和一种新的时间倏逝模式,为时变固体中的波操控提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11377 2026-06-08 quant-ph cond-mat.str-el 50%

TensorMixedStates: a Julia library for simulating pure and mixed quantum states using matrix product states

TensorMixedStates: 一个基于Julia的库,用于使用矩阵积状态模拟纯态和混合态量子态

Jérôme Houdayer, Grégoire Misguich

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出TensorMixedStates库,利用矩阵积状态模拟具有耗散的量子系统,支持混合态的MPS表示、基于Lindblad方程的时间演化以及与ITensor的高效底层张量操作相结合的用户友好接口。

Comments v2: 26 pages, 9 figures. To appear in SciPost Physics Codebases

Journal ref SciPost Phys. Codebases 72 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏