arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-23 至 2026-07-23 共收录 24 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 7 篇

2607.19479 2026-07-23 cs.RO cs.AI 新提交 84%

ModPack: An Extensible Teleoperation Interface for Bimanual Mobile Manipulation

ModPack:一种用于双边移动操作的可扩展遥操作接口

Joshua Citron, Renee Zbizika, Zeyi Liu, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对现有遥操作系统扩展性和适应性不足的问题,提出ModPack可扩展遥操作系统,以统一框架支持多样机器人形式和任务,通过背包集成多种功能,经实验验证其灵活性和可复用性,并开源软硬件设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19804 2026-07-23 cs.RO 新提交 83%

V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits

V2F:用于枣果损伤感知机器人处理的视觉辅助抓握力预测

Shahd Shami, Obadah Wali, Eric Feron, Shinkyu Park

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 研究针对枣果处理难题,开发V2F框架,结合计算机视觉与物理信息残差神经网络,将视觉描述符和品种元数据映射来预测抓握力,平均验证性能\(R^2 \approx 0.7\),实验表明可稳定操作枣果,实现更安全的机器人处理。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20399 2026-07-23 cs.RO cs.HC cs.LG 新提交 81%

Towards Miniature Humanoid Tele-Loco-Manipulation Using Virtual Reality and Reinforcement Learning

利用虚拟现实和强化学习实现微型仿人机器人的远程定位操作

Nicolas Kosanovic, Jordan Dowdy, Jean Chagas Vaz

机构 * University of Louisville(路易斯维尔大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 研究针对微型仿人机器人缺乏类似全尺寸机器人控制堆栈的问题,利用虚拟现实和强化学习开发了控制堆栈,经实验验证能实现一定速度行走及远程定位操作,展现了微型仿人机器人远程定位操作的潜力。

Comments 8 pages, 6 figures. Accepted manuscript. Published in the 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids), pp. 1233-1240

Journal ref 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids), pp. 1233-1240 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19630 2026-07-23 physics.optics 新提交 78%

Controllable localization and manipulation of optical hollow traps by means of optical-vortex diffraction

通过光学涡旋衍射实现光学空心陷阱的可控定位与操纵

O. V. Angelsky, A. Y. Bekshaev, C. Y. Zenkova, I. I. Mokhun, X. Zhang

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究通过光学涡旋衍射实现光学空心陷阱可控定位与操纵,基于入射LG光束模型,通过改变屏幕边缘位置控制衍射场中OV核心位置,可实现亚纳米精度运动,分析了相关影响因素及微物体捕获操纵的有利条件。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19633 2026-07-23 cs.RO 新提交 70%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20293 2026-07-23 cs.CV 新提交 57%

Evolving Cache Schedules for Fast Diffusion Policy Inference

用于快速扩散策略推理的演进缓存调度

Siying Wang, Kangye Ji, Di Wang, Fei Cheng

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究针对扩散策略实时部署计算需求大的问题,提出演进缓存调度(EVO)框架,通过进化搜索全局调度缓存刷新,引入冗余感知初始化和目标条件早期停止,大幅减少计算量并保留性能,实现动作生成加速和FLOPs降低。

Comments 15 pages, 3 figures, supplementary material included. Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20207 2026-07-23 cs.RO 新提交 57%

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp:复杂场景中多实体语言引导抓取

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of British Columbia(英属哥伦比亚大学) Google Deepmind(谷歌DeepMind)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 5 篇

2607.19850 2026-07-23 cs.RO 新提交 84%

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏

Xinyu Zhang, Zishuo Wang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。

Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19530 2026-07-23 cs.RO 新提交 83%

Milo, a Fully Autonomous Indoor/Outdoor Robotic Guide Dog

米洛,一款完全自主的室内/室外机器人导盲犬

Florian Golemo, Joanna Wolski, Joel Ruben Antony Moniz, Christopher Pal

机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Polytechnique Montreal(蒙特利尔理工大学)

专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究旨在开发机器人导盲犬平台,核心方法是构建含改装机器人、感知与导航堆栈的系统,主要贡献是实现完全自主、室内外可用的米洛平台,开源软硬件,且导航表现优于基线。

Comments Submitted to CoRL 2026. The Milo project website is available here: https://fgolemo.github.io/milo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 81%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-07-23 cs.RO cs.CV 新提交 62%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: https://dpt2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20232 2026-07-23 cs.RO 新提交 57%

DINS-IO: Learned Inertial Odometry via Differentiable INS Consistency

DINS-IO:通过可微惯性导航系统一致性实现的学习惯性里程计

Hao Qiao, Yan Wang, Jian Kuang, Xiaoji Niu

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究提出DINS-IO,直接从原始IMU流学习惯性里程计。利用INS速度递推约束,转化为滑动窗口最小二乘问题求解,以残差为自监督损失。设计高频网络并校准速度,在标准基准测试中,预训练自监督并微调的DINS-IO表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 3 篇

2607.19876 2026-07-23 cs.RO cs.CV 新提交 84%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19809 2026-07-23 cs.MA cs.LG 新提交 79%

Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning

Dreamer-CPC:用于去中心化多智能体强化学习的基于世界模型的消息学习

Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究生院) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 研究针对多智能体强化学习中通信问题,提出Dreamer-CPC方法,将基于CPC的消息学习集成到DreamerV3世界模型,各智能体据此独立维护模型与模块并交换消息,实验表明该方法在多种环境下优于现有方法,能有效支持去中心化决策。

Comments 15 pages, 6 figures. Under review at ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 70%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2607.19749 2026-07-23 cs.LG cs.AI 新提交 81%

The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL

世界模型记忆,智能体遗忘:基于持续模型的强化学习中的梦境排练

Gurp Nijjer

机构 * Quantegra Research(Quantegra研究公司)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究 DreamerV3 家族智能体在任务序列训练时的遗忘问题,通过组件级探测发现是通道问题,提出分级梦境排练方法,能产生无任务标签、参数恒定的持续学习者,在多任务链保留上表现优异。

Comments 11 pages, 2 figures. Code, pre-registration trail, and run data: https://github.com/gurpnijjer/dream-rehearsal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19628 2026-07-23 cs.LG 新提交 57%

HypEMBER: Hypernetwork-based Ensemble for Robust Policy Learning of Parametrized Dynamical Systems

HypEMBER:基于超网络的集成方法用于参数化动态系统的稳健策略学习

Nicolò Botteghi, Gabriele Pascali, Urban Fasel, Andrea Manzoni

机构 * MOX, Department of Mathematics Politecnico di Milano(米兰理工大学数学MOX系) Department of Aeronautics Imperial College London(伦敦帝国理工学院航空系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究在测量和模型不确定下参数化动态系统的稳健控制,提出基于超网络与集成学习结合的HypEMBER框架,通过超网络表示策略和价值函数实现参数泛化,用逼近器集成量化不确定性,实验表明该框架能提升训练稳定性等,增强对不确定性的稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2607.19827 2026-07-23 cs.RO cs.CY 新提交 57%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 3 篇

2607.19919 2026-07-23 cs.RO cs.LG 新提交 81%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20352 2026-07-23 cs.RO 新提交 74%

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

具有安全保障的自重构机器人船分布式运动规划

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

机构 * KU Leuven(鲁汶大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) SMART(新加坡制造技术研究院) SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19865 2026-07-23 cs.AI cs.CL cs.LG 新提交 62%

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

DocOps:复杂文档操作中自主智能体的可验证基准

Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin, Shuaiqiang Wang, Dawei Yin, Xianpei Han, Le Sun

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他机器人 3 篇

2607.19893 2026-07-23 cs.DC 新提交 50%

Odin: Primitive-Level Synchronization for Distributed Point-Based Neural Rendering

奥丁:基于点的分布式神经渲染的原语级同步

Zhenxiang Ma, Zeyu He, Yuanzhen Zhou, Zhenyu Yang, Yuchang Zhang, Miao Tao, Rong Fu, Jidong Zhai, Hengjie Li

专题命中 其他机器人 :embodied AI(abstract)

AI总结 研究基于点的神经渲染中的同步问题,提出奥丁分布式训练系统,用原语级同步取代全局屏障,有质量优先和吞吐量优先路径。在多个场景和GPU上实验,提升了吞吐量,减少关键路径等待时间,如在矩阵城市案例中比格伦德尔提高了1.89倍。

Comments Accepted at HPDC 26 (Poster), further submission in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19881 2026-07-23 cs.AR 新提交 50%

Revisiting Hardware Priority Queue Architectures

重新审视硬件优先级队列架构

Qihang Wu, Austin Rovinski

专题命中 其他机器人 :robotics(abstract)

AI总结 本文针对硬件优先级队列面临的基础架构相关性存疑及缺乏不同架构全面比较的问题,在现代FPGA平台上实现并评估多种代表性架构,提供定量分析以指导未来设计,填补研究空白。

Comments In 2025 Open-Source Computer Architecture Research Workshop (OSCAR), June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19775 2026-07-23 astro-ph.SR astro-ph.EP 新提交 50%

A Search for Exoplanets around Northern Circumpolar Stars X. The origin of radial velocity variations in the evolved star HD 216595

对北天极恒星周围系外行星的搜索X. 演化恒星HD 216595径向速度变化的起源

Sang-Hee Kim, Byeong-Cheol Lee, Shenghong Gu, Jae-Rim Koo, Beomdu Lim, Myeong-Gu Park, Huan-Yu Teng, Yeon-Ho Choi, David Mkrtichian, Tae-Yang Bang, Hyeong-Ill Oh, Heon-Young Chang

专题命中 其他机器人 :robotic(abstract)

AI总结 研究AGB恒星HD 216595长周期、低振幅径向速度变化起源,利用约16年高分辨率光谱数据,发现567天周期性信号,与恒星活动指标无强关联,RV变化可能源于恒星固有过程,后续需改进诊断和建模区分信号。

Comments 11 pages, 6 figures

Journal ref JKAS 59, 2 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏