arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-24 至 2026-07-24 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 12 篇

2607.21582 2026-07-24 cs.RO cs.CV 新提交 85%

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

战略扩展:通过偏差感知评估和数据收集学习机器人操作中的组合泛化

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) NVIDIA(英伟达)

专题命中 机器人数据与评测 :manipulation(title);robotic(title);分类 cs.RO、cs.CV

AI总结 研究机器人操作中组合泛化问题,通过引入诊断框架量化指令因素偏差,提出偏差感知数据收集策略,能定位预训练策略捷径问题,实现更高效可泛化的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 84%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19178 2026-07-24 cs.RO cs.AI 版本更新 73%

Vision-Language-Policy Model for Dynamic Robot Task Planning

用于动态机器人任务规划的视觉-语言-策略模型

Jin Wang, Kim Tien Ly, Jacques Cloete, Jin Jin, Nikos Tsagarakis, Ioannis Havoutis

机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 67%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21488 2026-07-24 cs.LG cs.AI cs.MA cs.RO 新提交 67%

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

无信号交叉口自动驾驶车辆的紧凑潜在协调

Gil Lifshits, Igal Bilik, Gilad Katz

机构 * Ben-Gurion University of the Negev(内盖夫本古里安大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对无信号交叉口自动驾驶车辆协调难题提出MAPS分层DRL架构,主智能体生成编码全局策略的原型计划,工作智能体结合局部观测执行控制。实验表明MAPS能实现无碰撞导航、减少行驶时间,且原型计划泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 62%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20493 2026-07-24 cs.AI cs.LG 新提交 62%

Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Series Forecasting Models

基于注意力的经验回放框架用于不可知时间序列预测模型的持续学习

Quentin Besnard, Nicolas Ragot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络依赖固定数据集无法适应动态环境的问题,提出基于注意力机制引导经验回放策略的持续时间序列预测框架,能动态适应新环境保留知识,减轻遗忘,在多数据集上评估显示可提高预测性能、降低成本和数据需求。

Journal ref CAp & RFIAP, Jul 2026, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 62%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21571 2026-07-24 cs.RO 新提交 57%

Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering

超越情节性评估:序列式具身问答中的内存架构瓶颈

Zikui Cai, Kaushal Janga, Tan Dat Dao, Seungjae Lee, Shivin Dass, Mingyo Seo, Kaiyu Yue, Mintong Kang, Nandhu Pillai, Monte Hoover, Aadi Palnitkar, Ruchit Rawal, Ruijie Zheng, Bo Li, Yuke Zhu, Roberto Martín-Martín, Tom Goldstein, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究序列式具身问答中不同内存架构表现,发现仅保留现有记忆不足,短视情节数据训练的智能体有时间不匹配问题。强调结构化、基于空间记忆的必要性,实验表明其能打破准确性-效率权衡,对真实机器人连续智能操作至关重要。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21309 2026-07-24 cs.RO 新提交 57%

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar

用于基于平面激光雷达的人体姿态估计的分解时空卷积

Simone Arreghini, Mirko Nava, Nicholas Carlotti, Antonio Paolillo, Alessandro Giusti

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(瑞士意大利语区大学提契诺大学人工智能达勒莫利研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 针对服务机器人仅配备平面激光雷达和普通处理器的情况,提出基于时空块的轻量级网络,用于全向人体检测和相对2D姿态估计,通过跨模态自监督训练,优于基线模型,适用于计算受限的服务机器人空间感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04038 2026-07-24 cs.RO 版本更新 57%

Force-Aware Residual DAgger via Trajectory Editing for Precision Insertion with Impedance Control

具备力感知的残差数据集聚合轨迹编辑用于阻抗控制的精确插入

Yiou Huang, Ning Ma, Weichu Zhao, Zinuo Liu, Jun Sun, Qiufeng Wang, Yaran Chen

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出TER-DAgger框架,通过优化轨迹编辑学习残差策略,减少协变量偏移,结合力感知的失败预判机制和阻抗控制框架,提升精确插入任务的成功率。

Comments 8 pages, 3 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20951 2026-07-24 eess.AS cs.SD 新提交 50%

Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion

设计发声数据集:用于非人类语音转换的声音设计的人类和动物声音

Seolhee Lee, Minsu Kang, Yangsun Lee, Woosun Min, Choonghyeon Lee, Namhyun Cho

机构 * NC AI Co., Ltd, Republic of Korea(韩国NC AI公司) Sogang University, Republic of Korea(韩国成均馆大学)

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 针对设计发声缺乏公开资源及研究不足的问题,构建设计发声数据集,通过整合多样原始发声源并处理生成变体,提供标准化测试集,报告基线基准结果,以支持语音转换相关评估与研究。

Comments Accepted at InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏