arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-26 至 2026-06-26 共收录 84 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 2 篇

2606.27146 2026-06-26 cs.RO 新提交 70%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 6 篇

2606.26154 2026-06-26 cs.RO cs.LG physics.bio-ph 新提交 81%

Reinforcement Learning Enables Autonomous Microrobot Navigation and Intervention in Simulated Blood Capillaries

强化学习实现模拟毛细血管中自主微机器人导航与干预

Jannik Drotleff, Samuel Tovey, Paul Hohenberger, Christoph Lohrmann, Julian Hoßbach, Konstantin Nikolaou, Christian Holm

机构 * Institute for Computational Physics, University of Stuttgart(斯图加特大学计算物理研究所)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 开发基于物理的毛细血管网络仿真,利用深度强化学习训练微机器人通过趋化性导航,发现多种通用策略并实现靶向血流阻塞与恢复。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26955 2026-06-26 cs.RO 新提交 79%

RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction

RobOralScan:面向机器人牙科重建的主动口内扫描学习

Jinhyung Lee, Haeun Yun, Siwon Kim, Gihyun Baek, Sungho Moon, Sehyun Hwang, Sunghoon Im

机构 * DGIST(大邱庆北科学技术院)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 提出基于强化学习的机器人自动口内扫描方法RobOralScan,通过几何记忆观测空间和牙齿级覆盖学习,提升全弓扫描的覆盖率和均匀性,实现高精度重建。

Comments 24 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27374 2026-06-26 cs.RO cs.CV 新提交 79%

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

世界行动模型通过循环生成重放实现持续模仿学习

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.CV

AI总结 提出循环生成重放(REGEN)框架,利用世界行动模型(WAM)生成伪重放轨迹,使机器人策略在不存储原始演示的情况下复习先前任务,在仿真和真实实验中减少50%灾难性遗忘,接近真实重放性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26341 2026-06-26 cs.RO 新提交 70%

Scaling Nonlinear Optimization: Many Problems One GPU

扩展非线性优化:多问题单GPU

John Viljoen, Johanna Haffner, Masayoshi Tomizuka, Negar Mehr

机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系) Department of Biosystems Science and Engineering, ETH Zürich(苏黎世联邦理工学院生物系统科学与工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 提出首个基于JAX的GPU批处理NLP求解器jaxipm,通过异构迭代融合和迭代级批处理实现多问题并发求解,在四旋翼控制任务中吞吐量提升达32.85倍。

Comments 8 pages, 6 figures, ieeeconf style, submission for RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26574 2026-06-26 cs.LG 新提交 57%

Revisiting Action Factorization for Complex Action Spaces

重新审视复杂动作空间的动作分解

Timothy Flavin, Sandip Sen

机构 * The University of Tulsa(塔尔萨大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文对多种动作分解方法在PPO、SAC、DQN算法和离散、混合、连续动作空间上进行了横截面研究,提出了VDN-PPO和PPO-MIX,并发现分支决斗架构在计算和性能之间取得了最佳平衡。

Comments 53 Pages, 37 Figures, 6 Tables, Target Journal/Venue: ACM Transactions on Autonomous and Adaptive Systems TAAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01849 2026-06-26 cs.CL 版本更新 50%

From Guessing to Placeholding: A Cost-Theoretic Framework for Uncertainty-Aware Code Completion

从猜测到占位:一种基于代价理论的不确定性感知代码补全框架

Liang Zhu, Haolin Chen, Lidong Zhao, Xian Wu

机构 * Tencent, Shenzhen, China(腾讯深圳公司)

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对硬补全范式在不确定上下文中生成错误代码的问题,提出自适应占位补全框架,在高熵位置输出占位符,理论证明其期望代价低于硬补全,实验显示编辑代价降低19%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 3 篇

2606.26213 2026-06-26 cs.RO cs.CY 新提交 79%

RoboTales: ROBOTic Anthropomorphic LEarning Systems

RoboTales: 机器人拟人化学习系统

Andrew Chen, Ju-Hung Chen, Phurinat Pinyomit, Alexis E. Block

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 人机交互与遥操作 :robotic(title,abstract);分类 cs.RO

AI总结 提出低成本机器人讲故事系统RoboTales,通过表达性袜子木偶动画叙事,在Baxter机器人上实现自主表演,实验表明木偶式讲故事比仅手势模式更优,提升参与度和叙事理解。

Comments 4 pages, 4 figures, HRI Companion '26: Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction, Student Design Challenge

详情
URL PDF HTML 收藏
2606.26382 2026-06-26 cs.CL cs.AI cs.DL cs.HC cs.RO 新提交 62%

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

绘制社会-物理人机交互(spHRI)的增长:由小型语言模型增强的系统综述流程

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block

机构 * MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Case Western Reserve University(凯斯西储大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对社会-物理人机交互领域术语碎片化和方法不一致的问题,本文评估了小型语言模型(<1.5B参数)在标题和摘要筛选中的辅助能力,发现其虽未达到人类水平,但能快速筛选并发现人类遗漏的论文,表明SLM可增强而非取代专家评审。

Comments 5 pages, 3 figures, 2 tables, Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25393 2026-06-26 cs.RO 新提交 57%

Large-Scale Tunnel Air-Ground Collaboration With FLISP: Fast LiDAR-IMU Synchronized Path Planner

大规模隧道空地协同与FLISP:快速LiDAR-IMU同步路径规划器

Fenghe Guo, Runjie Shen, Chenyang Sun, Junrui Zhang, Quanxi Zhan, Yongchun Wang, Junjie Zhang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University(同济大学自主智能无人系统全国重点实验室) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 提出FLISP框架,通过UGV搭载的LiDAR-IMU实现无地图的UGV-UAV协同隧道检测,采用萤火虫算法和动态迭代优化器分别规划路径,在1.2公里隧道中实现100%成功率与~7ms延迟。

Comments 24 pages, 31 figures, 5 tables. Author accepted manuscript. This work was supported by the State Key Laboratory of Autonomous Intelligent Unmanned Systems. The authors also thank the KinaMind Society for its inspiring environment and support

Journal ref IEEE Transactions on Field Robotics, vol. 3, pp. 494-517, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 12 篇

2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 82%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03939 2026-06-26 cs.RO 79%

Deep Learning-Enhanced Robotic Subretinal Injection with Real-Time Retinal Motion Compensation

深度学习增强的机器人视网膜注射与实时视网膜运动补偿

Tianle Wu, Mojtaba Esfandiari, Peiyao Zhang, Russell H. Taylor, Peter Gehlbach, Iulian Iordachita

机构 * Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) Johns Hopkins University(约翰霍普金斯大学) Wilmer Eye Institute(威尔默眼科研究所)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种全自动机器人视网膜注射系统,结合术中光学相干断层扫描和深度学习运动预测,实现针头运动与视网膜位移同步,实验验证了其在视网膜微手术中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25212 2026-06-26 cs.RO 新提交 70%

RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation

RigPI: 通过VLM种子可微仿真进行刚体动力学参数辨识

Xincheng He, Rongrong Zhang, Wei Jiang, Wenqiang Xu

机构 * Way-Robotics(Way-机器人)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RigPI框架,结合视觉语言模型初始化和可微物理仿真梯度优化,两步策略实现刚体与多连杆刚体动力学参数精确辨识,实验验证了其鲁棒性和预测有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 62%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26575 2026-06-26 cs.RO cs.AI 新提交 62%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22062 2026-06-26 cs.RO cs.LG 新提交 62%

How Should a Simulation-to-Reality Transfer Budget Be Spent?

模拟到现实迁移预算应如何分配?

Syed Hamzah Rizvi, Yash Vardhan Tomar

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO、cs.LG

AI总结 研究在模拟到现实迁移中,系统辨识与域随机化之间的预算分配权衡,发现少量辨识数据即可弥合大部分迁移差距,且基于估计参数训练优于宽随机化。

Comments Both authors contributed equally and share first authorship. Submitted to IEEE IROS First Workshop on Sim2Real and Classical Control 2026. Code is available: https://github.com/YTomar79/sim2real_budget

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 57%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26829 2026-06-26 cs.CV 新提交 57%

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

识别未知:面向机器人-物体交互的无提示开放词汇异常识别

Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

机构 * University of Hamburg(汉堡大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出AnomNOVIC框架,结合掩码自编码器与无提示开放词汇分类器,实现机器人对未知物体的实时识别,在多个数据集上显著超越现有基线。

Comments International Conference on Artificial Neural Networks 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19274 2026-06-26 cs.RO 版本更新 57%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 50%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13300 2026-06-26 cs.CL 版本更新 50%

OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准

Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15908 2026-06-26 cs.GR 50%

SPHaptics: A Real-Time Bidirectional Haptic Interaction Framework for Coupled Rigid-Soft Body and Lagrangian Fluid Simulation in Virtual Environments

SPHaptics:一种用于虚拟环境耦合刚体-软体和拉格朗日流体模拟的实时双向触觉交互框架

William Baumgartner, Gizem Kayar-Ceylan

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出SPHaptics框架,通过整合SPH与双向力耦合,实现刚体、变形体和拉格朗日流体的实时触觉交互,提升虚拟环境中的沉浸感。

Comments 9 pages, 9 figures

Journal ref The Visual Computer 42 (2026) 288

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他机器人 2 篇

2606.26821 2026-06-26 astro-ph.IM 新提交 78%

Characterizing robotic positioners under the influence of changing gravity vectors for future spectroscopic surveys

表征未来光谱巡天中重力矢量变化对机器人定位器的影响

Johannes Wüthrich, Guandi Zhao, Banan Yamani, Léonard Lebrun, Sean MacBride, Andrin Fazan, Felipe Andrade-Oliveira, Marcelle Soares-Santos

专题命中 其他机器人 :robotic(title,abstract)

AI总结 针对未来第五阶段光谱巡天的高精度需求,提出一种自动望远镜模拟测试台,通过改变定位器方向模拟重力变化,验证其位置稳定性(1微米)、焦点稳定性(5微米)和倾斜变化(<0.4度),并展示Orbray原型模块的初步测试结果。

Comments Submitted as proceedings to SPIE Astronomical Telescopes + Instrumentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26841 2026-06-26 cs.CR 新提交 50%

SpikeTimer: Exploring Active Copyright Protection in Spiking Neural Networks via Temporal Backdoor Regularization

SpikeTimer: 通过时间后门正则化探索脉冲神经网络中的主动版权保护

Xiao Yang, Gaolei Li, Jun Wu, Jianhua Li, Zhiquan Liu

专题命中 其他机器人 :robotics(abstract)

AI总结 提出SpikeTimer框架,利用时间后门学习将授权令牌嵌入特定时间片,实现脉冲神经网络版权保护,在授权数据上仅损失1.5%精度,非授权数据精度降至约10%。

Comments This paper has been accepted for IEEE TIFS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏