arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-10 至 2026-04-10 共收录 13 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 13 篇

2604.07991 2026-04-10 cs.CV cs.MM 83%

MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models

MotionScape: 一个大规模真实世界高动态无人机视频数据集用于世界模型

Zile Guo, Zhan Chen, Enze Zhu, Kan Wei, Yongkang Zou, Xiaoxuan Liu, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Jilin University(吉林大学)

专题命中 机器人数据与评测 :world model(title,abstract);navigation(abstract);分类 cs.CV

AI总结 MotionScape提供高动态无人机视频数据,用于提升世界模型对复杂3D动态的模拟能力,通过语义和几何对齐的标注提升无人机自主导航与决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 79%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08418 2026-04-10 cs.RO cs.AI 73%

Exploring Temporal Representation in Neural Processes for Multimodal Action Prediction

探索神经过程在多模态动作预测中的时间表示

Marco Gabriele Fedozzi, Yukie Nagai, Francesco Rea, Alessandra Sciutti

机构 * DIBRIS Department, University of Genoa(热那亚大学DIBRIS系) CONTACT Unit, Italian Institute of Technology(意大利理工学院CONTACT单元) International Research Center for Neurointelligence, The University of Tokyo(东京大学国际神经智能研究中心)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了条件神经过程在机器人自监督多模态动作预测中的应用,提出改进的DMBN-PTE模型以提升时间信息表示的鲁棒性。

Comments Submitted to the AIC 2023 (9th International Workshop on Artificial Intelligence and Cognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08509 2026-04-10 cs.CV cs.RO 62%

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07728 2026-04-10 cs.CV cs.GR cs.RO 62%

GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting

GEAR: 基于高斯点划法的几何-运动交替优化用于关节物体建模

Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室,中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 GEAR通过交替优化几何与运动,提升关节物体重建的精度和泛化能力,尤其在复杂多关节物体上表现优异。

Comments Accepted to CVPRF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 62%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07799 2026-04-10 cs.CV cs.RO 62%

Horticultural Temporal Fruit Monitoring via 3D Instance Segmentation and Re-Identification using Colored Point Clouds

通过彩色点云进行3D实例分割与重识别的园艺时间水果监测

Daniel Fusaro, Federico Magistri, Jens Behley, Alberto Pretto, Cyrill Stachniss

机构 * University of Padua(帕多瓦大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用彩色点云进行3D水果实例分割与重识别的方法,通过学习模型和注意力匹配网络实现动态果园中水果的准确监测。

Journal ref Computers and Electronics in Agriculture, Volume 247, Pages 111723, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI 57%

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08184 2026-04-10 cs.SD cs.AI 57%

AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan

AT-ADD:所有类型音频深度伪造检测挑战评估计划

Yuankun Xie, Haonan Cheng, Jiayi Zhou, Xiaoxuan Guo, Tao Wang, Jian Liu, Weiqiang Wang, Ruibo Fu, Xiaopeng Wang, Hengyan Huang, Xiaoying Huang, Long Ye, Guangtao Zhai

机构 * Communication University of China(中国传媒大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 针对现有音频深度伪造检测方法在鲁棒性和泛化能力上的不足,AT-ADD挑战旨在通过标准化数据集和评估协议提升音频伪造检测的实用性和鲁棒性。

Comments Accepted to the ACM Multimedia 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07901 2026-04-10 cs.CV 57%

PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation

PanoSAM2:轻量级的失真和内存感知的SAM2改进用于360视频对象分割

Dingwen Xiao, Weiming Zhang, Shiqi Wen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PanoSAM2,通过改进SAM2以应对360视频中的失真和内存问题,提升分割可靠性,同时保持用户友好的提示设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07882 2026-04-10 cs.CV 57%

ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video

ReconPhys:从单个视频中重建外观和物理属性

Boyuan Wang, Xiaofeng Wang, Yongkang Li, Zheng Zhu, Yifan Chang, Angen Ye, Guosheng Zhao, Chaojun Ni, Guan Huang, Yijie Ren, Yueqi Duan, Xingang Wang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出ReconPhys,首个能从单目视频联合学习物理属性估计和3D高斯点云重建的端到端框架,实现快速高效的目标检测与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07759 2026-04-10 cs.CV 57%

WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects

WUTDet: 一艘船检测数据集和基准测试,包含10万尺度的密集小物体

Junxiong Liang, Mengwei Bao, Tianxiang Wang, Xinggang Wang, An-An Liu, Ryan Wen Liu

机构 * School of Navigation, Wuhan University of Technology(武汉理工大学航运学院) Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科教创新园) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出WUTDet数据集,包含10万张图像和38万艘船实例,涵盖港口、锚地等多种场景,评估了20种基线模型,发现Transformer在复杂海上场景中表现更优,CNN在推理效率上更胜一筹,Mamba在准确性和效率之间取得良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07574 2026-04-10 cs.CV cs.NA math.NA 57%

Mathematical Analysis of Image Matching Techniques

图像匹配技术的数学分析

Oleh Samoilenko

机构 * Institute of Mathematics, National Academy of Sciences of Ukraine(乌克兰国家科学院数学研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文分析了经典局部特征图像匹配算法在卫星图像中的表现,评估SIFT和ORB在关键点检测、描述子匹配及几何验证中的性能,探讨关键点数量对匹配质量的影响。

Comments 16 pages, 5 figures, 1 table

Journal ref Proceedings of the Institute of Applied Mathematics and Mechanics NAS of Ukraine, 39 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏