arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-11 至 2026-05-11 共收录 79 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 12 篇

2605.06298 2026-05-11 cs.CV cs.AI 81%

Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement

渲染,而非解码:具有潜在结构解耦的权重空间世界模型

Roussel Desmond Nzoyem, Mauro Comi

机构 * Department of Computer Science(计算机科学系) University of Manchester(曼彻斯特大学) University of Bristol(布里斯托大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出NOVA框架,通过权重和偏置构建隐式神经表示,实现高效且可解释的世界模型,支持结构场景组件的解耦与编辑。

Comments 35 pages, 30 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03454 2026-05-11 cs.CV cs.AI 81%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00932 2026-05-11 cs.SE cs.AI 79%

Code World Model Preparedness Report

代码世界模型准备性报告

Daniel Song, Peter Ney, Cristina Menghini, Faizan Ahmad, Aidan Boyd, Nathaniel Li, Ziwen Han, Jean-Christophe Testud, Saisuke Okabayashi, Maeve Ryan, Jinpeng Miao, Hamza Kwisaba, Felix Binder, Spencer Whitman, Jim Gust, Esteban Arcaute, Dhaval Kapil, Jacob Kahn, Ayaz Minhas, Tristan Goodman, Lauren Deason, Alexander Vaughan, Shengjia Zhao, Summer Yue

机构 * MSL Preparedness Team(MSL准备团队) AI Security Team(AI安全团队)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 报告评估了Meta的代码世界模型在潜在灾难性风险领域的准备情况,发现其风险与现有AI生态无异,因此作为开源模型发布。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11758 2026-05-11 cs.RO 79%

HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model

HAIC:通过动态感知世界模型实现人形敏捷物体交互控制

Dongting Li, Xingyu Chen, Qianyang Wu, Bo Chen, Sikai Wu, Hanyu Wu, Guoyao Zhang, Liang Li, Mingliang Zhou, Diyun Xiang, Jianzhu Ma, Qiang Zhang, Renjing Xu

机构 * Tsinghua University(清华大学) HKUST(Guangzhou)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Xiaomi Robotics Lab(小米机器人实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。

Comments RSS 2026. Webpage: https://haic-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07390 2026-05-11 cs.CV 79%

ST-Gen4D: Embedding 4D Spatiotemporal Cognition into World Model for 4D Generation

ST-Gen4D:将4D时空认知嵌入世界模型以实现4D生成

Haonan Wang, Hanyu Zhou, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出ST-Gen4D框架,通过4D时空认知世界模型实现4D生成,结合时空表示、认知、推理和生成四大设计,提升4D生成的结构合理性和拓扑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07326 2026-05-11 cs.CV 79%

GEM: Generating LiDAR World Model via Deformable Mamba

GEM: 通过可变形Mamba生成LiDAR世界模型

Yang Wu, Zhaojiang Liu, Qiang Meng, Youquan Liu, Renliang Weng, Jianjun Qian, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建师范大学) NTU(南京理工大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 GEM通过可变形Mamba架构提升LiDAR世界模型的逼真度与想象力,解决点云无序和动态静态区分难题,实现空间时间感知与自主探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07199 2026-05-11 cs.AI cs.LG 76%

Three-in-One World Model: Energy-Based Consistency, Prediction, and Counterfactual Inference for Marketing Intervention

三位一体世界模型:用于营销干预的能量一致性、预测和反事实推断

Junichiro Niimi

机构 * Meijo University(名古屋大学)

专题命中 具身推理 :world model(title);分类 cs.AI、cs.LG

AI总结 本文提出三位一体世界模型,利用深度玻尔兹曼机学习消费者特征,通过轻量任务适配器实现一致性评估、预测和反事实推断,展示其在营销干预中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03490 2026-05-11 cs.LG q-bio.NC 57%

Path Integration and Object-Location Binding Emerge in an Action-Conditioned Predictive Sequence Network

路径整合与物体-位置绑定在动作条件预测序列网络中出现

Linda Ariel Ventura, Victoria Bosch, Tim C Kietzmann, Sushrut Thorat

机构 * Sorbonne University(索邦大学) Institute of Cognitive Science(认知科学研究所) Osnabrück University(奥斯纳布吕克大学)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 研究探讨了动作条件预测序列网络如何通过上下文学习提升预测准确性,并揭示了路径整合和动态绑定在结构化表示中的作用。

Comments 8 pages, 4 figures; accepted at CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 57%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 7 篇

2512.15840 2026-05-11 cs.RO cs.CV 82%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 机器人基础模型 :robotics(abstract);robot learning(abstract);robot foundation model(abstract);robotic(abstract)

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 81%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 机器人基础模型 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06175 2026-05-11 cs.RO 70%

VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts

VLA-GSE: 提升VLA中基于通用和专用专家的参数高效微调

Yuhua Jiang, Junjie Lu, Xinyao Qin, Xiaoyu Chen, Kaixin Wang, Feifei Gao, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 VLA-GSE通过通用和专用专家机制提升VLA在机器人控制中的参数高效微调效果,保留预训练知识的同时提高适应能力,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07088 2026-05-11 cs.CR 67%

Membership Inference Attacks on Vision-Language-Action Models

针对视觉-语言-动作模型的成员推断攻击

Yuefeng Peng, Mingzhe Li, Kejing Xia, Renhao Zhang, Amir Houmansadr

专题命中 机器人基础模型 :embodied AI(abstract);robotic(abstract)

AI总结 本文首次系统研究了针对视觉-语言-动作(VLA)模型的成员推断攻击(MIAs),提出了样本级和轨迹级的攻击设置,并展示了在多个VLA基准和模型上,攻击方法在黑盒环境下表现出色,揭示了VLA模型在隐私方面的高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07474 2026-05-11 cs.CV cs.AI 62%

ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

ForgeVLA:无需语言标注的联邦视觉-语言-动作学习

Yuhao Zhou, Yunpeng Zhu, Yang Zhou, Jindi Lyu, Jian Lan, Zhangyuan Wang, Dan Si, Thomas Seidl, Qing Ye, Jiancheng Lyu

机构 * Sichuan University(四川大学) Zhejiang University(浙江大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Lenovo Group Limited(联想集团有限公司) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ForgeVLA框架,通过分布式视觉-动作对训练联邦VLA模型,无需集中数据或人工标注。通过客户端指令分类器构建完整三元组,并引入对比规划损失和自适应聚合策略以解决特征坍塌问题,实验表明性能优于基线模型。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI 62%

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01166 2026-05-11 cs.RO 57%

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

隐式推理VLA:面向视觉-语言-动作模型的隐式思考与预测

Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文提出LaRA-VLA框架,通过连续潜在表示实现多模态推理,减少推理开销,提升机器人实时控制效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 6 篇

2605.06761 2026-05-11 cs.AI cs.CV cs.LG 67%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05110 2026-05-11 cs.RO cs.AI 66%

LineRides: Line-Guided Reinforcement Learning for Bicycle Robot Stunts

LineRides: 基于线引导的强化学习用于自行车机器人特技

Seungeun Rho, Shamel Fahmi, Jeonghwan Kim, Arianna Ilvonen, Sehoon Ha, Gabriel Nelson

机构 * RAI Institute(RAI研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 本文提出LineRides框架,通过空间引导线和稀疏关键姿态实现自行车机器人自主学习多样特技行为,无需示范或显式时间信息。

Comments Published in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 57%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 57%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01195 2026-05-11 cs.RO 57%

TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies

TAIL-Safe: 无任务依赖的安全监控用于模仿学习策略

Riad Ahmed, Momotaz Begum

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出TAIL-Safe,通过构建Lipschitz连续的Q值函数,基于可见性、可识别性和可抓取性等短期任务无关标准,确定模仿学习策略的安全集,利用Nagumo定理启发的恢复机制提升策略安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03201 2026-05-11 cs.LG 57%

SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning

SLOPE:基于模型的强化学习中的乐观势能塑造

Yao-Hui Li, Zeyu Wang, Xin Li, Wei Pang, Yingfang Yuan, Zhengkun Chen, Boya Zhang, Riashat Islam, Alex Lamb, Yonggang Zhang

机构 * Beijing Institute of Technology(北京理工大学) Heriot-Watt University(赫瑞-沃森大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院) Microsoft Research NY(微软研究院纽约分部) Tsinghua University(清华大学) Jilin University(吉林大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 SLOPE通过乐观势能估计构建信息丰富的势能景观,解决稀疏奖励环境下梯度信息不足的问题,提升模型在稀疏、半稀疏和密集奖励任务中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 3 篇

2604.18905 2026-05-11 cs.RO 61%

Task-Adaptive Admittance Control for Human-Quadrotor Cooperative Load Transportation with Dynamic Cable-Length Regulation

任务自适应阻抗控制用于人机四旋翼协作负载运输与动态缆长调节

Shuai Li, Ton T. H. Duong, Damiano Zanotto

机构 * Dept. of Mechanical Engineering, Stevens Institute of Technology(机械工程系,史蒂文斯理工学院)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出一种任务自适应阻抗控制器,用于安全高效的四旋翼协作负载运输,通过主动控制的绞盘实现动态缆长调节,提升系统响应性和运动平滑度。

Comments Preprint of accepted manuscript to be published in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO 57%

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06045 2026-05-11 eess.SY cs.SY 50%

Kirigami-Structured Electronic Capsule for Long-Term Continuous Gastric Monitoring

具有 kirigami 结构的电子胶囊用于长期连续胃部监测

Hen-Wei Huang, Claas Ehmke, Dawei Wang, Blake Smith, Ziyao Zhou, Rong Tan, David Werder, Crystan McLymore, Niels Neidlein, Emanuele Falli, Ali Imani, James McRae, Yeseul Jeon, So-Yoon Yang, Wesley S. Culberson, James Byrne, Giovanni Traverso

专题命中 人机交互与遥操作 :robotic(abstract)

AI总结 本文提出一种胃部驻留的可食用机器人平台,通过生物启发的电触发释放机制与 kirigami 电子架构结合,实现周长持续运行,实现胃部辐射剂量的长期连续监测。

Comments This submission is withdrawn because the author/contributor information in the current version was submitted before explicit confirmation had been obtained from all relevant team members. We are withdrawing the article to avoid an inaccurate or unverified authorship/contribution record

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 18 篇

2604.26509 2026-05-11 cs.RO cs.CV 90%

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

专题命中 机器人数据与评测 :embodied AI(title,abstract);robotic(title,abstract);robot learning(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07687 2026-05-11 cs.RO 81%

PhySPRING: Structure-Preserving Reduction of Physics-Informed Twins via GNN

PhySPRING: 通过图神经网络实现物理信息双胞胎的结构保持降维

Yixiong Jing, Xingyuan Chen, Guangming Wang, Olaf Wysocki, Haibing Wu, Brian Sheil

机构 * University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robot policy(abstract);robotic(abstract)

AI总结 PhySPRING通过图神经网络学习层次化简化图拓扑及其机械参数,实现弹簧-质量双胞胎的结构保持降维,提升重建和预测精度并提高计算效率。

Comments 16 pages and 6 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06863 2026-05-11 cs.RO cs.HC 79%

Bi3: A Biplatform, Bicultural, Biperson Dataset for Social Robot Navigation

Bi3:一个双平台、双文化、双人数据集用于社交机器人导航

Andrew Stratton, Phani Teja Singamaneni, Pranav Goyal, Rachid Alami, Christoforos Mavrogiannis

机构 * Department of Robotics, University of Michigan(机器人系,密歇根大学) LAAS-CNRS, University of Toulouse(LAAS-CNRS,图卢兹大学) INRIA, University of Lorraine(INRIA,洛林大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 Bi3数据集通过双平台、双文化、双人交互,为社交机器人导航提供多样性模型复杂性的基准,用于研究人类与机器人在受限环境中的协同活动。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07325 2026-05-11 cs.RO cs.AI 73%

CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations

CSR:具有大规模缓存状态表示的无限时间 horizon 实时策略

Robin Karlsson, Go Suzui

机构 * GODOT Inc(GODOT公司) Graduate School of Informatics, Nagoya University(名古屋大学信息研究生院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CSR框架,通过优化KV缓存重用和异步状态协调算法,实现大规模LLM在机器人中的实时应用,显著降低延迟并提升性能。

Comments Extended Technical Report for Paper Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07943 2026-05-11 cs.RO cs.AI cs.CV cs.LG 70%

TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning

TAVIS:一种用于第一人称主动视觉和预见性注视的模仿学习基准

Giacomo Spigler

机构 * Department of Intelligent Systems(智能系统系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 TAVIS提出了一种评估主动视觉模仿学习的基础设施,包含两个任务集和两个仿人躯干机器人,通过实验发现主动视觉对任务类型和条件具有任务依赖性,且多任务策略在分布偏移下表现下降,模仿学习能产生与人类参考相当的预见性注视。

详情

展开后加载摘要…

URL PDF HTML 收藏