arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-07 至 2026-07-07 共收录 223 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 14 篇

2607.03941 2026-07-07 cs.RO 新提交 81%

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

WSA$_1$:用于可泛化机器人控制的以3D为中心的世界-空间-动作模型

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, Sen Wang, Zhaoshu Yu, Pengpeng Zeng, Xiaofeng Cao, Xuanhan Wang, Jingkuan Song, Heng Tao Shen

机构 * Tongji University(同济大学) Shanghai Innovation Institution(上海创新机构) Shanghai Magic(上海魔星) Koala Uran Project(考拉铀项目)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robot foundation model(abstract);robotic(abstract)

AI总结 研究针对当前机器人基础模型缺乏物理动力学推理等问题,提出以3D为中心的世界-空间-动作建模范式构建WSA$_1$模型,能学习3D世界感知视觉思维并建模约束,提升泛化能力且数据高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05122 2026-07-07 cs.CV cs.RO 新提交 81%

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

绿色代表可行,红色代表不可行:通过语义分割实现视觉基础以用于VLA导航策略

Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究VLA导航策略的视觉基础,提出基于实时分割的方法,用SegFormer突出可通行与不可通行区域,评估两种变体,结果表明视觉基础可降误差,对长指令效果更佳,还能作为轨迹长度正则化器。

Comments Accepted for RSS 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03146 2026-07-07 cs.RO 新提交 79%

Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations

Exp2VLA:通过专家示范实现无人机导航的视觉-语言-动作

Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar, Erdal Kayacan

机构 * Isaac Lab(艾萨克实验室)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO

AI总结 提出用于语言条件无人机导航的专家蒸馏管道Exp2VLA,将专家行为提炼为训练数据微调紧凑VLA模型,实现控制策略转移,降低新行为部署难度,实验表明微调模型可处理多样语义命令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04517 2026-07-07 cs.AI 新提交 70%

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

VLA 接地器:用于黑盒 VLA 模型的语言条件空间优化

Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRAI(未来人工智能研究机构) MISIS(俄罗斯国立科技大学莫斯科钢铁合金学院)

专题命中 机器人基础模型 :manipulation(abstract);robot foundation model(abstract);分类 cs.AI

AI总结 研究能否通过优化语言空间而非更新动作权重来改进冻结的 VLA 策略,提出语言条件空间策略,用强化学习优化,实验表明该优化能提升特定任务成功率,证明语言可作为机器人基础模型的可优化变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03693 2026-07-07 cs.RO 新提交 70%

CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts

CoRE-VLA:通过专家的条件路由实现可扩展且稳健的视觉-语言-动作建模

Haozhe Zhang, Sixian Li, Yifei Zhang, Zezheng Huai, Hao Chen, Chunhua Shen, Jingjing Gong, Xipeng Qiu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究视觉-语言-动作模型在实际部署中的挑战,提出CoRE-VLA框架,通过上下文条件稀疏计算生成动作,利用传感器可用性和任务意图进行专家路由,实验证明其在多任务等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03182 2026-07-07 cs.RO cs.AI 新提交 62%

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

AnchorVLA:为视觉-语言-动作规划连接离散决策与连续轨迹

Qi Liu, Yabei Li, Hongsong Wang, Heng Zhang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与交通国家重点实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Meituan Inc.(美团公司) Dongfeng Motor Corporation(东风汽车公司)

专题命中 机器人基础模型 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 自动驾驶规划需将多种信息转化为连续轨迹,现有视觉-语言-动作(VLA)规划器有局限。提出AnchorVLA框架,用轨迹模式锚连接高层VLA推理与连续轨迹执行,提升效率、语义动作对齐和生成灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02092 2026-07-07 cs.RO cs.AI 新提交 62%

Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies

引导动作流:面向流匹配视觉-语言-动作策略的Q引导推理

Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院) Department of Mechanical Engineering, University College London(机械工程系,伦敦大学学院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出Guided Action Flow框架,通过冻结预训练策略并利用学习到的动作块评论家引导逆向流采样,在LIBERO任务中单任务评论家将成功率从68.0%提升至82.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06575 2026-07-07 cs.RO cs.CV 版本更新 62%

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择

Fangyuan Wang, Peng Zhou, Jiaming Qi, Shipeng Lyu, Chengyang He, David Navarro-Alarcon, Guodong Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东区技术研究所) Great Bay University(大湾大学) Northeast Forestry University(东北林业大学) National University of Singapore(新加坡国立大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04816 2026-07-07 cs.RO 新提交 57%

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 10 篇

2607.04265 2026-07-07 cs.RO cs.AI 新提交 73%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03723 2026-07-07 cs.RO cs.AI 新提交 62%

OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies

OmniTacTune:用于视觉策略触觉残余适应的与策略无关的真实世界强化学习

Kelin Yu, Haode Zhang, Harish Ravichandar, Yunhai Han, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对视觉策略在接触丰富操作中不足的问题,提出OmniTacTune管道,通过残余校正让触觉反馈适应预训练视觉策略,经两阶段设计,实验证明其能跨任务等泛化,有效提升策略成功率。

Comments Project page: https://colinyu1.github.io/omnitactune-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03177 2026-07-07 cs.SE cs.AI cs.LG 新提交 62%

CRRL: A Causality-Based Reinforcement Learning Framework for Autonomous System Recovery

CRRL:一种用于自主系统恢复的基于因果关系的强化学习框架

Safia Fatima, Kai Olav Ellefsen, Leon Moonen

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究自主系统恢复中传统强化学习问题,引入基于因果关系的CRRL框架,利用驾驶日志因果关系塑造训练信号,使策略与基于规则的恢复有效协作,提升相关指标。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 60%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 模仿学习与强化学习 :分类 cs.AI、cs.CV、cs.LG;embodied AI(comments);world model(comments)

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05064 2026-07-07 cs.AI 新提交 57%

Diffusion-Guided Uncertainty-Aware Delayed Policy Optimization

扩散引导的不确定性感知延迟策略优化

Junqi Tu, Zejiao Liu, Fangfei Li, Yang Tang

机构 * The Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai, China(能源化工过程智能制造重点实验室,教育部,东华大学,上海,中国) The School of Mathematics, East China University of Science and Technology, Shanghai, China(东华大学数学学院,上海,中国)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 针对现实环境强化学习因延迟反馈性能严重下降问题,提出DUPO方法。用扩散模型明确延迟状态与当前状态关系,利用差异估计加权延迟策略,实验表明该方法优于现有方法。

Comments Preprint; appendices included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03512 2026-07-07 cs.RO 新提交 57%

High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning

基于分层混合物理信息深度强化学习的异构多机器人系统高精度编队控制

Yanzhou Li, Guangli Chen, Xiao-Meng Li, Wenjian Zhong, Yongkang Lu, Shenghuang He

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能产业重点实验室,大湾区大学先进工程学院) Technische Universität Dresden(德累斯顿工业大学) School of Mechanical and Electrical Engineering, Guangzhou University(广州大学机电工程学院) University of Science and Technology of China(中国科学技术大学) College of Computer Science, Dongguan University of Technology(东莞理工学院计算机科学与技术学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 针对异构多机器人系统编队控制问题,提出分层混合物理信息深度强化学习框架。上层用深度强化学习设计领导者导航策略网络,下层整合多种控制器构建编队控制策略网络,设计分层奖励函数训练跟随者,实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24633 2026-07-07 cs.RO 新提交 57%

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

超越单调进展:面向机器人模仿的重试监督值学习

Xinyao Qin, Junjie Lu, Kaixin Wang, Chuheng Zhang, Sinjae Kang, Kimin Lee, Min Xu, Bin Liang, Jun Yang, Li Zhao

机构 * Tsinghua University(清华大学) University of Technology Sydney(技术科技大学) Microsoft Research Asia(微软亚洲研究院) KAIST(韩国科学技术院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 针对机器人模仿学习中演示数据包含错误与修正行为的问题,提出ReTVL框架,利用重试事件作为稀疏监督学习对错误敏感的值函数,通过全局进度校准与局部偏好学习捕捉错误-恢复结构,优化下游行为克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12569 2026-07-07 eess.SP cs.AI 版本更新 57%

Active Sensing with Meta-Reinforcement Learning for Emitter Localization from RF Observations

基于元强化学习的主动感知用于从射频观测定位发射源

M. Shamail J. Khan, Nisha L. Raichur, Lucas Heublein, Christian Wielenberg, Alexander Mattick, Tobias Feigl, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所) Positioning Systems Lab, University of Technology Nürnberg (UTN)(定位系统实验室,图恩大学) Center for Artificial Intelligence, Technical University of Applied Sciences Würzburg-Schweinfurt(人工智能中心,应用技术大学魏玛-施魏尔堡)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出利用元强化学习框架,通过序列探索环境,从射频观测中定位发射源,解决GNSS干扰下的定位问题,实验显示80.1%的成功率。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11907 2026-07-07 cs.RO 版本更新 57%

A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

一种基于前沿势奖励的基于图的强化学习方法用于安全杂乱环境探索

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(计算机科学、电气与航天工程系,吕勒奥技术大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 提出结合图神经网络探索贪心策略与安全护盾的方法,用近端策略优化算法训练网络,最大化探索效率并减少护盾干预,还提出奖励函数,能在杂乱环境高效安全探索。

Comments 6 pages, 4 figures, accepted at the 24th European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02533 2026-07-07 eess.SP cs.SY eess.SY 新提交 50%

Centralized PPO-Based DRL for Multi-UAV-BS Positioning and Trajectory Optimization in Disaster Response Networks

基于集中式近端策略优化的深度强化学习用于灾害响应网络中的多无人机基站定位与轨迹优化

Azim Akhtarshenas, Mario Rico Ibanez, Matteo Bernabe, David Lopez-Perez, Merouane Debbah

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 针对灾害场景中多无人机基站定位与轨迹优化问题,扩展集中学习框架,将其建模为马尔可夫决策过程,用近端策略优化的深度强化学习求解,能协调多无人机基站并适应异构用户移动模式。

Comments Submitted to IEEE Transactions on Machine Learning in Communications and Networking (TMLCN). Dataset available at https://doi.org/10.5281/zenodo.20720697 and code available at https://github.com/aakhtarshenas/centralized-ppo-multi-uav-bs

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 2 篇

2603.06121 2026-07-07 cs.RO 版本更新 70%

Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

Glance-Say:通过粘性注视实现多模态人机协作与意图识别

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Benjamin Kiefer, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 人机交互与遥操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03063 2026-07-07 cond-mat.mtrl-sci 新提交 50%

Chiropiezoelectric Energy Harvesting from Lattice-Handedness-Controlled Selenium Nanowires

从晶格手性控制的硒纳米线中进行手性压电能量收集

Oleksii Ohiienko, Wookjin Jung, Jihyeon Yeom

专题命中 人机交互与遥操作 :robotics(abstract)

AI总结 研究提出原子手性工程作为无机压电纳米材料设计原则,以原子手性三角硒纳米线为模型,发现相同化学成分下晶格手性改变压电性能,为设计压电材料开辟新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 45 篇

2607.02642 2026-07-07 cs.RO 新提交 90%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :world model(title,abstract);robot policy(title);manipulation(abstract);robot foundation model(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16215 2026-07-07 cs.RO cs.CV 版本更新 87%

TiROD: Tiny Robotics Dataset and Benchmark for Continual Object Detection

TiROD:小型机器人数据集和持续物体检测基准

Francesco Pasti, Riccardo De Monte, Davide Dalle Pezze, Gian Antonio Susto, Nicola Bellotto

机构 * Department of Information Engineering(信息工程系)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TiROD数据集,用于评估适用于小型机器人平台的轻量持续学习策略,通过NanoDet检测器测试不同场景下的持续学习挑战。

Comments Accepted at Journal of Intelligent Robotics & Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05390 2026-07-07 cs.RO cs.CV 新提交 86%

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Deform360:面向可变形世界模型的大规模多视图视觉触觉数据集

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对可变形物体世界建模缺乏大规模真实数据的问题,构建含多视图视觉与触觉信息的Deform360数据集,评估现有主流世界模型,为相关研究提供基准。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04880 2026-07-07 cs.RO 新提交 85%

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

PRISM:通过基于图像的场景和运动合成生成个性化机器人数据集

Dogyu Ko, Haneul Kim, Chanyoung Yeo, Dowoon Lee, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);robot policy(abstract);分类 cs.RO

AI总结 针对大规模预训练模型在特定环境泛化有限的问题,提出PRISM端到端管道,从单张图像和自然语言指令生成个性化机器人数据集,构建场景并合成演示,实验表明其效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 83%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 机器人数据与评测 :navigation(title,abstract);world model(abstract);分类 cs.CV

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03072 2026-07-07 cs.MA cs.RO 新提交 83%

LOTUSim: Multi-Domain Simulator for Marine Robotics

LOTUSim:海洋机器人多域模拟器

Cédric Buche, Juliette Grosset, Hélène Lechêne, Marie Dubromel, Pierig Havez-Bodivit, Malcom Neo, Julien Prodhon

机构 * CROSSING IRL 2010, CNRS(CROSSING IRL 2010,CNRS) Naval Group, France(法国海军集团) IMT Atlantique(IMT阿蒂旺)

专题命中 机器人数据与评测 :robotics(title,abstract);robotic(abstract);分类 cs.RO

AI总结 介绍LOTUSim多域海洋模拟器,其贡献一是支持多用户跨系统交互,确保实时性与可扩展性;二是有高效水下电流模型,验证显示相比常用模型精度大幅提升,适合海洋机器人研究。

Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), IROS, Sep 2026, Pittsburgh (Etats-Unis), United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20216 2026-07-07 cs.AI cs.CE cs.CV cs.LG cs.RO 83%

CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents

CostNav:一个用于现实世界经济成本评估的物理AI代理导航基准

Haebin Seong, Sungmin Kim, Yongjun Cho, Myunchul Joe, Geunwoo Kim, Yubeen Park, Sunhoo Kim, Samwoo Seong, Yoonshik Kim, Suhwan Choi, Jaeyoon Jung, Jiyong Youn, Jinmyung Kwak, Sunghee Ahn, Jaemin Lee, Younggil Do, Seungyeop Yi, Woojin Cheong, Minhyeok Oh, Minchan Kim, Seongjae Kang, Youngjae Yu, Yunsung Lee

机构 * KAIST(韩国国立科学技术院) University of California, Irvine(加州大学 Irvine 分校) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 CostNav引入了一个经济导航基准,通过结合物理模拟和行业数据,评估AI代理的经济可行性,发现高任务成功率并不保证经济性,CANVAS在非零SLA合规性下表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04146 2026-07-07 cs.RO cs.AI cs.CL cs.CR cs.LG 新提交 82%

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics

!帝国,小型甚大阵:数据投毒对开源机器人技术的影响

Stefan Bühler, Mark Schutera

机构 * Duale Hochschule Baden-Württemberg, Ravensburg(巴登-符腾堡双元制应用技术大学拉文斯堡分校)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉语言动作模型的触发词数据投毒对开源机器人技术的影响,通过在真实任务中对小型甚大阵进行实验,发现少量投毒样本可嵌入后门致机器人失效,攻击具实用性、低成本且隐蔽。

Comments Accepted at KI2026. Repo: https://github.com/StefanBuhler/ImperioVLAPoisoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交 81%

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏