arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-23 至 2026-07-23 共收录 43 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 13 篇

2607.18709 2026-07-23 cs.RO 版本更新 92%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19479 2026-07-23 cs.RO cs.AI 新提交 84%

ModPack: An Extensible Teleoperation Interface for Bimanual Mobile Manipulation

ModPack:一种用于双边移动操作的可扩展遥操作接口

Joshua Citron, Renee Zbizika, Zeyi Liu, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对现有遥操作系统扩展性和适应性不足的问题,提出ModPack可扩展遥操作系统,以统一框架支持多样机器人形式和任务,通过背包集成多种功能,经实验验证其灵活性和可复用性,并开源软硬件设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06636 2026-07-23 cs.RO 84%

Design, Control, and Motion Strategy for DELTA: Transformable Multilink Multirotor for Air-Ground Hybrid Locomotion and Manipulation

DELTA:可变形多连杆多旋翼飞行器的设计、控制与运动策略——用于空地混合运动与操作

Kazuki Sugihara, Moju Zhao, Takuzumi Nishio, Kei Okada, Masayuki Inaba

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 本文提出一种新型多连杆多旋翼机器人DELTA,通过在每个连杆上安装推进器并利用关节驱动,实现了地面滚动、空中飞行及多种环境下的操作能力,并设计了基于非线性优化的实时控制方法和考虑接触约束的运动策略。

Comments 20 pages, 31 figures

Journal ref IEEE Transactions on Robotics, vol. 42, pp. 2765-2785, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19804 2026-07-23 cs.RO 新提交 83%

V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits

V2F:用于枣果损伤感知机器人处理的视觉辅助抓握力预测

Shahd Shami, Obadah Wali, Eric Feron, Shinkyu Park

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 研究针对枣果处理难题,开发V2F框架,结合计算机视觉与物理信息残差神经网络,将视觉描述符和品种元数据映射来预测抓握力,平均验证性能\(R^2 \approx 0.7\),实验表明可稳定操作枣果,实现更安全的机器人处理。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20399 2026-07-23 cs.RO cs.HC cs.LG 新提交 81%

Towards Miniature Humanoid Tele-Loco-Manipulation Using Virtual Reality and Reinforcement Learning

利用虚拟现实和强化学习实现微型仿人机器人的远程定位操作

Nicolas Kosanovic, Jordan Dowdy, Jean Chagas Vaz

机构 * University of Louisville(路易斯维尔大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 研究针对微型仿人机器人缺乏类似全尺寸机器人控制堆栈的问题,利用虚拟现实和强化学习开发了控制堆栈,经实验验证能实现一定速度行走及远程定位操作,展现了微型仿人机器人远程定位操作的潜力。

Comments 8 pages, 6 figures. Accepted manuscript. Published in the 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids), pp. 1233-1240

Journal ref 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids), pp. 1233-1240 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19630 2026-07-23 physics.optics 新提交 78%

Controllable localization and manipulation of optical hollow traps by means of optical-vortex diffraction

通过光学涡旋衍射实现光学空心陷阱的可控定位与操纵

O. V. Angelsky, A. Y. Bekshaev, C. Y. Zenkova, I. I. Mokhun, X. Zhang

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究通过光学涡旋衍射实现光学空心陷阱可控定位与操纵,基于入射LG光束模型,通过改变屏幕边缘位置控制衍射场中OV核心位置,可实现亚纳米精度运动,分析了相关影响因素及微物体捕获操纵的有利条件。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19633 2026-07-23 cs.RO 新提交 70%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04401 2026-07-23 cs.RO cs.CV 版本更新 62%

Quantile Transfer for Reliable Operating Point Selection in Visual Place Recognition

视觉地点识别中可靠操作点选择的分位数迁移

Dhyey Manish Rajani, Michael Milford, Tobias Fischer

机构 * QUT Centre for Robotics(昆士兰理工大学机器人中心) School of Electrical Engineering and Robotics(电气工程与机器人学院) Queensland University of Technology(昆士兰理工大学)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出一种通过分位数归一化迁移阈值的方法,自动选择视觉地点识别系统的操作点,在100%精度下最大化召回率,无需手动调参。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20293 2026-07-23 cs.CV 新提交 57%

Evolving Cache Schedules for Fast Diffusion Policy Inference

用于快速扩散策略推理的演进缓存调度

Siying Wang, Kangye Ji, Di Wang, Fei Cheng

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究针对扩散策略实时部署计算需求大的问题,提出演进缓存调度(EVO)框架,通过进化搜索全局调度缓存刷新,引入冗余感知初始化和目标条件早期停止,大幅减少计算量并保留性能,实现动作生成加速和FLOPs降低。

Comments 15 pages, 3 figures, supplementary material included. Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20207 2026-07-23 cs.RO 新提交 57%

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp:复杂场景中多实体语言引导抓取

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of British Columbia(英属哥伦比亚大学) Google Deepmind(谷歌DeepMind)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新 57%

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15124 2026-07-23 physics.flu-dyn cond-mat.soft 50%

Bubble-assisted micromixing via thermally excited intrinsic air within microfluidic systems

通过微流体系统中热激发的内在空气产生气泡辅助微混合

Seyed Shahriar Riazi, Seyed Mostafa Hosseinalipour

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出了一种基于热激发内在空气产生长气泡的微流体微混合方法,通过低功耗实现高效均匀混合,适用于多种微流体应用。

Comments 41 pages, 15 figures

Journal ref Microfluid. Nanofluidics. 30 (2026) 37

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07608 2026-07-23 cond-mat.mtrl-sci 版本更新 50%

Orbital Hall Effect Enables Field-Free Magnetization Reversal in Ferrimagnets without Additional Conversion Layer

轨道霍尔效应实现了无需额外转换层的亚铁磁体无场磁化反转

Zelalem Abebe Bekele, Kun Lei, Xiukai Lan, Xiangyu Liu, Hui Wen, Weihao Li, Yongcheng Deng, Wenkai Zhu, Kaiming Cai, Kaiyou Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用Mo/CoGd器件中Mo层的局域轨道霍尔电流,通过面内对称性破缺产生z极化阻尼类扭矩,CoGd兼具转换与自开关功能,实现无场电流诱导的亚铁磁确定性开关,突出轨道霍尔电流在节能磁化开关上的潜力。

Comments We are withdrawing this manuscript because our current analysis has revealed serious analytical issues that render the main conclusions invalid. We intend to thoroughly revise the methodology and submit a corrected version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 9 篇

2607.19850 2026-07-23 cs.RO 新提交 84%

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav:用于视觉语言社交导航的选择性在线策略蒸馏

Xinyu Zhang, Zishuo Wang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术研究生院)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 针对大规模视觉语言模型难部署、轻量级模型社交推理能力不足的问题,提出SOPD-SocialNav方法,通过基于熵的令牌选择机制及温度控制的散度目标,将社交导航知识从大型教师模型转移到轻量级学生模型,实验证明该方法有效。

Comments This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19530 2026-07-23 cs.RO 新提交 83%

Milo, a Fully Autonomous Indoor/Outdoor Robotic Guide Dog

米洛,一款完全自主的室内/室外机器人导盲犬

Florian Golemo, Joanna Wolski, Joel Ruben Antony Moniz, Christopher Pal

机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Polytechnique Montreal(蒙特利尔理工大学)

专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究旨在开发机器人导盲犬平台,核心方法是构建含改装机器人、感知与导航堆栈的系统,主要贡献是实现完全自主、室内外可用的米洛平台,开源软硬件,且导航表现优于基线。

Comments Submitted to CoRL 2026. The Milo project website is available here: https://fgolemo.github.io/milo

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01429 2026-07-23 cs.RO 81%

Sem-NaVAE: Semantically-Guided Outdoor Mapless Navigation via Generative Trajectory Priors

Sem-NaVAE: 基于语义引导的室外无地图导航通过生成式轨迹先验

Gonzalo Olguín, Javier Ruiz-del-Solar

机构 * Department of Electrical Engineering & the Advanced Mining Technology Center (AMTC), Universidad de Chile(电气工程系及先进采矿技术中心(AMTC)、智利大学)

专题命中 具身导航 :navigation(title,abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 提出Sem-NaVAE方法,结合条件变分自编码器生成多样化轨迹和轻量视觉语言模型进行语义选择,实现室外无地图实时导航,在未见环境中达到90%成功率。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 5 figures

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9335-9342, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 81%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新 73%

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :robotics(abstract);embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19971 2026-07-23 cs.RO cs.CV 新提交 62%

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

通过冲突感知不相交参数训练实现统一预测与规划

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

机构 * DGIST(韩国科学技术院大邱庆北校区) KAIST(韩国科学技术院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究社交机器人在拥挤环境中统一预测与规划问题,提出基于模型合并的不相交参数训练框架DPT,通过分布式参数学习减轻技能冲突,稀疏合并提升性能,在标准基准测试中验证其在机器人导航上通用且有效。

Comments Accepted at ECCV 2026. 38 pages, 14 figures. Project page: https://dpt2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05458 2026-07-23 cs.RO 版本更新 61%

Counterfactual Reasoning and Environment Design for Active Preference Learning

主动偏好学习的反事实推理与环境设计

Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robot learning(comments)

AI总结 研究机器人主动偏好学习中现有方法的不足,提出CRED方法,通过联合优化环境设计和轨迹选择,利用反事实推理生成轨迹,经实验验证该方法能改善奖励学习并在不同环境有效泛化。

Comments RSS 2025 Workshop on Human-in-the-Loop Robot Learning: Teaching, Correcting, and Adapting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20232 2026-07-23 cs.RO 新提交 57%

DINS-IO: Learned Inertial Odometry via Differentiable INS Consistency

DINS-IO:通过可微惯性导航系统一致性实现的学习惯性里程计

Hao Qiao, Yan Wang, Jian Kuang, Xiaoji Niu

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究提出DINS-IO,直接从原始IMU流学习惯性里程计。利用INS速度递推约束,转化为滑动窗口最小二乘问题求解,以残差为自监督损失。设计高频网络并校准速度,在标准基准测试中,预训练自监督并微调的DINS-IO表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22649 2026-07-23 cs.CV 版本更新 57%

Interactive Medical-SAM2 GUI: A Napari-based semi-automatic annotation tool for medical images

交互式医学-SAM2 GUI:基于Napari的半自动标注工具用于医学图像

Woojae Hong, Jong Ha Hwang, Jiyong Chung, Joongyeon Choi, Hyunggun Kim, Yong Hwy Kim

机构 * Department of Biomechatronic Engineering, Sungkyunkwan University(生物机电工程系,全州大学) Department of Neurosurgery, Seoul National University Hospital, Seoul National University College of Medicine(神经外科,首尔国立大学医院,首尔国立大学医学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 交互式医学-SAM2 GUI 提供基于Napari的本地工作流,实现高效的3D医学图像半自动标注与导出功能。

Comments Planning to submit JOSS (Journal of Open Source Software)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 4 篇

2607.19876 2026-07-23 cs.RO cs.CV 新提交 84%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-07-23 cs.CV cs.LG 版本更新 84%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV、cs.LG

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19809 2026-07-23 cs.MA cs.LG 新提交 79%

Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning

Dreamer-CPC:用于去中心化多智能体强化学习的基于世界模型的消息学习

Taisuke Takayama, Naoto Yoshida, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究生院) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 研究针对多智能体强化学习中通信问题,提出Dreamer-CPC方法,将基于CPC的消息学习集成到DreamerV3世界模型,各智能体据此独立维护模型与模块并交换消息,实验表明该方法在多种环境下优于现有方法,能有效支持去中心化决策。

Comments 15 pages, 6 figures. Under review at ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 70%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 2 篇

2602.02533 2026-07-23 cs.RO cs.LG 62%

HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models

HMVLA:超几何多模态融合用于视觉-语言-动作模型

Kun Wang, Xiao Feng, Mingcheng Qu, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究 institute) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。

Comments 5 pages,5 figures,ICASSP

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27355 2026-07-23 cs.RO 版本更新 57%

RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools

RouterVLA:将冒烟测试转化为异构VLA选择的监督信号

Xingyu Ren, Chugang Yi, Youran Sun

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland, College Park(马里兰大学 College Park 分校) Tsinghua University(清华大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。

Comments v2: revised title, updated author list, restructured the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 2 篇

2607.19749 2026-07-23 cs.LG cs.AI 新提交 81%

The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL

世界模型记忆,智能体遗忘:基于持续模型的强化学习中的梦境排练

Gurp Nijjer

机构 * Quantegra Research(Quantegra研究公司)

专题命中 模仿学习与强化学习 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究 DreamerV3 家族智能体在任务序列训练时的遗忘问题,通过组件级探测发现是通道问题,提出分级梦境排练方法,能产生无任务标签、参数恒定的持续学习者,在多任务链保留上表现优异。

Comments 11 pages, 2 figures. Code, pre-registration trail, and run data: https://github.com/gurpnijjer/dream-rehearsal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19628 2026-07-23 cs.LG 新提交 57%

HypEMBER: Hypernetwork-based Ensemble for Robust Policy Learning of Parametrized Dynamical Systems

HypEMBER:基于超网络的集成方法用于参数化动态系统的稳健策略学习

Nicolò Botteghi, Gabriele Pascali, Urban Fasel, Andrea Manzoni

机构 * MOX, Department of Mathematics Politecnico di Milano(米兰理工大学数学MOX系) Department of Aeronautics Imperial College London(伦敦帝国理工学院航空系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究在测量和模型不确定下参数化动态系统的稳健控制,提出基于超网络与集成学习结合的HypEMBER框架,通过超网络表示策略和价值函数实现参数泛化,用逼近器集成量化不确定性,实验表明该框架能提升训练稳定性等,增强对不确定性的稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏