arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-09 至 2026-07-09 共收录 68 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 13 篇

2604.01577 2026-07-09 cs.LG cs.AI 版本更新 62%

Exploration of Fast-Slow Latent Recurrence for Train-Short, Test-Long Generalization

倾听时思考:用于长时间序列建模的快慢复发

Shota Takashiro, Masanori Koyama, Takeru Miyato, Yusuke Iwasawa, Yutaka Matsuo, Kohei Hayashi

机构 * The University of Tokyo(东京大学) University of Tübingen(图宾根大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出快慢复发机制,通过结合快速递归潜在更新与慢速观测更新,提升长周期序列建模的稳定性与泛化能力,优于LSTM等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06739 2026-07-09 cs.CV 新提交 57%

Hardware-aware Graph Neural Networks prunning for embedded event-based vision

用于嵌入式基于事件视觉的硬件感知图神经网络剪枝

Piotr Wzorek, Kamil Jeziorek, Tomasz Kryjak

机构 * AGH University of Krakow(克拉科夫AGH科技大学)

专题命中 具身导航 :robotics(abstract);分类 cs.CV

AI总结 研究针对嵌入式基于事件视觉,提出对图卷积神经网络模型的优化策略,结合硬件感知剪枝和量化,通过特定搜索方法灵活适配模型架构,在多数据集上评估,实现不同程度的内存减少和精度降低。

Journal ref 2025 Signal Processing: Algorithms, Architectures, Arrangements, and Applications (SPA), Poznan, Poland, 2025, pp. 182-187

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06724 2026-07-09 cs.RO 新提交 57%

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

EvoPlan:具有时空保证的进化神经符号机器人规划

Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究针对基于LLM的机器人规划器不足及经典PDDL规划器问题,提出含离线STL约束挖掘、进化PDDL规划器和受约束执行循环的神经符号框架,能保证计划属性,在基准测试中表现良好且可在无云环境下部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07390 2026-07-09 cs.RO cs.IT math.IT 新提交 57%

Communicative Efficiency of Single vs. Multi-Axis Robot Neck Motion

单轴与多轴机器人颈部运动的通信效率

Chapa Sirithunge, Haewon Jeong, Qinghua Guan, Fumiya Iida, Josie Hughes

机构 * University of Bristol School of Engineering Mathematics and Technology(布里斯托大学工程数学与技术学院) EPFL Institute of Mechanical Engineering(洛桑联邦理工学院机械工程学院) University of Tokyo Department of Precision Engineering(东京大学精密工程系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 研究机器人颈部运动的通信效率,提出信息论框架,通过实验发现交流信息在2自由度时达峰值,3自由度时下降,引入运动信息空间揭示交流效率,挑战解剖学完整性提升机器人表现力的假设,为形态设计提供定量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07466 2026-07-09 eess.SP 新提交 50%

5G Positioning Reference Signal impact assessment in Non-Terrestrial Networks communication service

非地面网络通信服务中5G定位参考信号的影响评估

Alejandro Gonzalez-Garrido, Ottavio M. Picchi, Francesco Menzione

专题命中 具身导航 :navigation(abstract)

AI总结 研究5G NTN中PRS传输与服务卫星数据流重叠问题,通过推导统计模型分析共存情况,经轨道模拟验证模型,评估检测限与误码率影响,结果表明适当设计PRS周期性,基于NR-PRS的PNT可与宽带下行链路共存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06830 2026-07-09 eess.SY cs.SY 新提交 50%

Neural-Enhanced Micro-Kalman Filtering for Satellite Tracking: A Comparative Study

用于卫星跟踪的神经增强微卡尔曼滤波:一项比较研究

Moh Kamalul Wafi

专题命中 具身导航 :navigation(abstract)

AI总结 研究卫星跟踪中准确状态估计的问题,提出神经增强微卡尔曼滤波方法,通过引入轻量级神经缩放机制在线调整噪声协方差,经数值模拟对比,该方法能准确跟踪卫星状态,兼具计算优势,为卫星状态估计提供有效灵活框架。

Comments arXiv admin note: substantial text overlap with arXiv:2304.04111

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06705 2026-07-09 physics.app-ph 新提交 50%

Untethered Micro-Robots for Surface Sensing through Electric-Field Confined Motion

通过电场限制运动实现表面传感的无系留微型机器人

Huaizhi Li, Kyoungtae Kevin Park, Donglei Emma Fan

专题命中 具身导航 :robotic(abstract)

AI总结 研究提出用无系留微电机作探针的表面传感创新方案,通过三维电动镊子驱动金微球电机沿设计路径运动,利用其运动变化检测生物分子模式等,确立机器人运动为新传感方式,开辟低成本表面传感技术途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17588 2026-07-09 cs.CL cs.HC 版本更新 50%

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02585 2026-07-09 cs.PL 50%

On the Origins of Objects by Means of Careful Selection

通过精心选择来探索对象的起源

Yegor Bugayenko, Maxim Trunnikov

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种用于EO编程语言的对象分类法,旨在为程序员提供导航参考,并为其他面向对象语言的设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 7 篇

2607.06640 2026-07-09 cs.LG cs.AI 新提交 81%

The Rank-One Corner: How Much Value Equivalence Does a Task Need from a World Model?

一阶角:任务从世界模型中需要多少价值等价性?

Donna Vakalis

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究任务从世界模型中所需的价值等价性,通过在DreamerV3堆栈上测量发现,潜在因素代表的闭包由训练目标维度决定,价值等价具维度性,单奖励目标是其一阶角,模型安装的任务结构与预测目标相关。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07392 2026-07-09 cs.LG cs.IR cs.RO 版本更新 81%

Event-Centric World Modeling with Memory-Augmented Retrieval for Embodied Decision-Making

基于记忆增强检索的事件中心世界建模用于具身决策

Zhaowen Fan, Rongchao Zhang, Yunxiang Han

机构 * Zhaowen Fan(Fan 研究院) Rongchao Zhang(Zhang 实验室)

专题命中 具身推理 :world model(title);navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种事件中心世界建模框架,通过记忆增强检索实现具身决策,结合语义事件和先前经验进行决策,提升动态环境的结构抽象与可解释性。

Comments 12 pages, 9 figures, 4 tables, currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 81%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06925 2026-07-09 cs.AI 新提交 79%

Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix

在紧凑世界模型中建立空间关系:指令泄漏与无目标动力学修复

Yufeng Wang, Lu Wei, Haibin Ling

机构 * Stony Brook University(纽约州立大学石溪分校) Westlake University(西湖大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究以语言目标为条件的紧凑世界模型中空间关系建立问题,发现指令泄漏陷阱,提出将目标排除在动力学外并监督读取路径的修复方法,适用于相关世界模型,提升关系基础的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07196 2026-07-09 cs.RO cs.AI cs.LG cs.SE 新提交 76%

Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators

在信任世界模型模拟器的裁决之前先验证其可靠性:世界模型模拟器的可接受性

Christian Oefinger, Finn Rasmus Schäfer, Korbinian Moller, Mattia Piccinini, Johannes Betz

机构 * Autonomous Vehicle Systems Lab(自主车辆系统实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 具身推理 :world model(abstract,comments);robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究世界模型模拟器裁决的可靠性问题,基于安全关键模拟的可信度实践定义可接受性阶梯,通过自动驾驶实例验证,指出视觉保真度不能预测行动稳健性,为世界模型模拟器的评估提供了新框架。

Comments Accepted at RSS 2026 Workshop on Robot World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 57%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07475 2026-07-09 cs.RO 新提交 57%

Agent-Exploitation Affordances: From Basic to Complex Representation Patterns

智能体-利用可供性:从基本到复杂的表示模式

Bastien Dussard, Aurélie Clodic, Guillaume Sarthou

机构 * LAAS-CNRS, Université de Toulouse, CNRS, Toulouse, France(LAAS-CNRS、图卢兹大学、CNRS、图卢兹、法国)

专题命中 具身推理 :robotics(abstract);分类 cs.RO

AI总结 研究社会机器人领域中智能体的合作可供性概念,提出易于处理的本体表示,通过组合基本模式描绘多样场景,展现此表示的有效性,助力人工智能体理解与环境交互及拓展行动可能。

Journal ref International Conference on Social Robotics (16th Edition), Oct 2024, Odense, Denmark. pp.443-455

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 5 篇

2607.06706 2026-07-09 cs.RO cs.AI cs.LG 新提交 91%

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

用于无人机机器人和双手操作的视觉语言动作(VLA)模型综述

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

机构 * Chef Robotics RovifyLab IT Application Research Center, Jeonbuk Regional Branch Department of Electrical, Computer and Software Engineering(电气与计算机软件工程系)

专题命中 机器人基础模型 :robotics(title,abstract);manipulation(title,abstract);navigation(abstract);world model(abstract)

AI总结 综述2017 - 2026年183篇文献,围绕视觉语言动作模型在无人机机器人和双手操作方面的应用,涵盖多维度,表明双手VLA相关策略可转移至无人机系统,还确定了两领域的14个研究方向。

Comments 56 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 79%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 机器人基础模型 :world model(title,abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 75%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05945 2026-07-09 cs.CV cs.CL 70%

MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

MobileEgo Anywhere:基于商用硬件的长时域自我中心数据开放基础设施

Senthil Palanisamy, Abhishek Anand, Satpal Singh Rathore, Pratyush Patnaik, Shubhanshu Khatana, Ekaksh Janweja

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出MobileEgo Anywhere框架,利用智能手机传感器实现超过一小时的自我中心轨迹采集,并发布开源处理流水线STERA、移动应用及200小时数据集,验证其在视觉-语言-动作模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05693 2026-07-09 cs.RO cs.AI 版本更新 62%

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 3 篇

2607.07252 2026-07-09 cs.LG cs.RO 新提交 62%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05296 2026-07-09 cs.RO cs.LG 版本更新 62%

Latent Policy Steering through One-Step Flow Policies

通过一步流策略实现潜在策略引导

Hokyun Im, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Latent Policy Steering (LPS),通过一步流策略实现高保真的潜在策略改进,解决了离线强化学习中回报最大化与行为约束之间的权衡问题,实现了无需复杂超参数调整的鲁棒性能。

Comments Accepted to RSS 2026, Project Webpage : https://jellyho.github.io/LPS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13879 2026-07-09 cs.LG 版本更新 57%

Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty

李普希茨正则化评论家导致策略对转移动态不确定性具有鲁棒性

Xulin Chen, Ruipeng Liu, Zhenyu Gan, Garrett E. Katz

机构 * College of Engineering & Computer Science, Syracuse University(工程与计算机科学学院,苏利文大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 研究针对强化学习中转移动态不确定性致策略性能下降问题,提出基于近端策略优化的PPO-PGDLC算法,集成投影梯度下降与李普希茨正则化评论家,实验表明该算法在环境扰动下性能更好且动作更平滑。

Journal ref Vol. 39 No. 1 (2026): Proceedings of FLAIRS-39

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 2 篇

2607.07350 2026-07-09 cs.RO 新提交 57%

Towards Reliable Aerial Ground Vehicle Collaboration: An Integrated Planning and Autonomy Framework for Field Deployment

迈向可靠的空地车辆协作:用于实地部署的集成规划与自主框架

Md Safwan Mondal, Luca Russo, James D. Humann, James M. Dotterweich, Pranav Bhounsule

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.RO

AI总结 研究针对无人机长时间任务飞行续航受限问题,提出集成规划与自主框架。通过深度强化学习规划器解决协同路由问题,引入标准化API弥合规划与执行差距,还有轻量级重新规划器,经实验验证系统在动态任务中有强大协同导航和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 57%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 人机交互与遥操作 :embodied AI(abstract);分类 cs.CV

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 11 篇

2602.18164 2026-07-09 cs.RO 版本更新 86%

GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation

GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集

Turcan Tuna, Jonas Frey, Frank Fu, Katharine Patterson, Tianao Xu, Maurice Fallon, Cesar Cadena, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Oxford University(牛津大学)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。

Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06701 2026-07-09 cs.CV cs.AI cs.GR cs.LG cs.RO 新提交 85%

SPEAR: A Simulator for Photorealistic Embodied AI Research

SPEAR:用于逼真的具身人工智能研究的模拟器

Mike Roberts, Renhan Wang, Rushikesh Zawar, Rachith Dey-Prakash, Quentin Leboutet, Stephan R. Richter, Matthias Müller, German Ros, Rui Tang, Stefan Leutenegger, Yannick Hold-Geoffroy, Kalyan Sunkavalli, Vladlen Koltun

机构 * Adobe Research(Adobe研究院) Intel Labs(英特尔实验室) Manycore Tech Inc(众核科技公司) Adobe(Adobe公司) NVIDIA(英伟达公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国学院)

专题命中 机器人数据与评测 :embodied AI(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对现有逼真模拟器局限,提出SPEAR这一Python库,通过模块化插件架构连接控制UE应用程序,提升可编程性与渲染速度,还提供新图像模态和高级编程模型,经多样示例应用展示了其效用。

Comments Accepted for publication at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04434 2026-07-09 cs.RO cs.AI cs.CV cs.GR 新提交 82%

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

RoboDojo:用于综合评估通用机器人操作策略的统一模拟与现实基准测试

Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Haoran Lu, Weijie Wan, Baijun Chen, Songling Liu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka

机构 * UC Berkeley(加州大学伯克利分校) THU(清华大学) PKU(北京大学) Stanford(斯坦福大学) MIT(麻省理工学院) UNC(北卡罗来纳大学) Princeton(普林斯顿大学) CMU(卡内基梅隆大学) NUS(新加坡国立大学) NTU(南洋理工大学) CUHK(香港中文大学) SJTU(上海交通大学) HKUST (GZ)(香港科技大学(广州)) ZJU(浙江大学) Yale(耶鲁大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 现有基准测试在系统评估通用机器人操作策略能力方面有限,本文引入RoboDojo统一基准测试,含模拟与现实任务,支持多维度评估及可扩展评估,还建立了公共排行榜与系统分析。

Comments Website: https://robodojo-benchmark.com/, Code: https://github.com/RoboDojo-Benchmark/RoboDojo, Leaderboard: https://robodojo-benchmark.com/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07403 2026-07-09 cs.MA cs.RO 新提交 79%

Multi-Agent Robotic Control with Onboard Vision-Language Models

基于机载视觉语言模型的多智能体机器人控制

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。

Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏