arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3085 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 494 篇

2607.00716 2026-07-02 cs.CV cs.AI 新提交 62%

Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach

部分骨架可见性用于动作识别:一种受限视野方法

Yingjie Dai, Tianyang Xu, Yanglin Deng, Xiao-Jun Wu, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 针对现实场景中视野受限导致骨架关节大量缺失的问题,提出PartialVisGraph超图框架,通过可学习虚拟超边和单头样本自适应Transformer,结合可见性先验实现鲁棒的动作识别,在NTU RGB+D 60/120上显著提升部分可见性下的准确率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 62%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 62%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31834 2026-07-01 cs.CV cs.AI 新提交 62%

Real-Time Source-Free Object Detection

实时无源目标检测

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 62%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31131 2026-07-01 cs.AI cs.RO 新提交 62%

Scenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records

利用真实世界故障记录生成自动驾驶系统测试场景

Anjali Parashar, Chuchu Fan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出一种基于LLM的场景生成流程,利用历史故障记录中的分类和上下文信息,生成多样化测试场景,在Metadrive模拟器上验证了方法的准确性和多样性。

Comments 9 pages, Appendix included. Paper accepted and presented at NeuS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27317 2026-06-26 cs.CV cs.RO 新提交 62%

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

OctoSense: 多模态机器人感知的自监督学习

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出OctoSense传感器平台和数据集,通过“晚融合”掩码自编码器实现多模态自监督学习,在多种退化条件下鲁棒预测光流、深度、语义分割和自运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26575 2026-06-26 cs.RO cs.AI 新提交 62%

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

IDEA: 通过效果对齐对动力学失配不敏感的模拟到现实迁移多智能体控制

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出一种通过效果对齐对动力学失配不敏感的模拟到现实迁移方法,结合随机环境结构与离散语义动作,并开发动作同步机制,提升多智能体系统在真实场景中的训练效率和成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22062 2026-06-26 cs.RO cs.LG 新提交 62%

How Should a Simulation-to-Reality Transfer Budget Be Spent?

模拟到现实迁移预算应如何分配?

Syed Hamzah Rizvi, Yash Vardhan Tomar

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO、cs.LG

AI总结 研究在模拟到现实迁移中,系统辨识与域随机化之间的预算分配权衡,发现少量辨识数据即可弥合大部分迁移差距,且基于估计参数训练优于宽随机化。

Comments Both authors contributed equally and share first authorship. Submitted to IEEE IROS First Workshop on Sim2Real and Classical Control 2026. Code is available: https://github.com/YTomar79/sim2real_budget

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23742 2026-06-24 cs.LG cs.AI cs.AR 新提交 62%

Low-power analogue neural networks with trainable nonlinear connections for continuous control

具有可训练非线性连接的低功耗模拟神经网络用于连续控制

Ian T. Vidamour, Fernando Aguirre, Thomas J. Hayward, Matthew O. A. Ellis, Charles Swindells, Alexander McDonnell, Martin Trefzer, Finley Robins, Luca Manneschi, Susan Stepney, Tony Kenyon, Oliver J. Sutton, Jack C. Gartside, Ivan Y. Tyukin, Adnan Mehonic, Eleni Vasilaki

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Intrinsic Semiconductor Technologies(Intrinsic Semiconductor Technologies公司) School of Chemical, Biological, and Materials Science Engineering, University of Sheffield(谢菲尔德大学化学、生物与材料科学工程学院) School of Physics, Engineering, and Technology, University of York(约克大学物理、工程与技术学院) Department of Computer Science, University of York(约克大学计算机科学系) Department of Electronic & Electrical Engineering, University College London(伦敦大学学院电子与电气工程系) King’s College London(伦敦国王学院) Blackett Laboratory, Imperial College London(帝国理工学院布莱克特实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 受Kolmogorov-Arnold网络启发,在连接上放置可训练非线性函数,使每个物理连接成为可学习计算单元,通过现场可编程模拟阵列实现带通滤波器,在连续控制等任务上以更少节点和连接达到高效,预计CMOS实现功耗约30微瓦。

Comments Preprint. Further verification of all simulations is ongoing. Any resulting corrections will be incorporated in a revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22409 2026-06-23 cs.CV cs.AI 新提交 62%

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解

Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang

机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21792 2026-06-23 cs.RO cs.AI 新提交 62%

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion

THREAD: 面向混合刚柔机械臂的环境感知扩散轨迹规划

Shivani Kamtikar, Pranav Asthana, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland College Park(马里兰大学帕克分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出首个基于扩散的混合刚柔机械臂轨迹规划器THREAD,通过物理启发损失联合约束刚柔段,实现狭窄环境穿行,任务成功率92.4%,碰撞减少5倍。

Comments Project Page: https://robot-thread.github.io, IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21525 2026-06-23 cs.LG cs.AI 新提交 62%

Backpropagating Through Simulation: Analytic Policy Gradients for Sample and Learning Efficient Differentiable Continuous Control

通过仿真反向传播:用于样本高效和学习高效的可微连续控制的解析策略梯度

Yueci Deng

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出解析策略梯度(APG)方法,利用可微环境动力学通过仿真反向传播计算精确梯度,在四个连续控制任务中与PPO对比,显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20781 2026-06-23 cs.RO cs.CV 新提交 62%

World Action Models: A Survey

世界行动模型:综述

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 本文综述世界行动模型(WAMs),通过两种互补视角组织现有工作,揭示其设计权衡与未来趋势。

Comments 57 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19813 2026-06-23 cs.RO cs.CV 新提交 62%

TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index

TIDY: 基于小波域熵和方向条纹指数的热红外图像去噪

Tai Hyoung Rhee, Dong-Guw Lee, Ayoung Kim

机构 * Dept. of Mechanical Engineering, SNU(首尔大学机械工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出轻量级小波域去噪器TIDY,利用真实噪声数据训练,通过小波熵和方向条纹指数损失项抑制随机噪声和条纹伪影,在室内恶劣条件下提升热红外图像质量及下游机器人任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19067 2026-06-18 cs.RO cs.CV 新提交 62%

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots

传感器配置至关重要:四足机器人多模态SLAM的系统评估

Roberto Corlito, Fabian Schmidt, Nils Seibert, Markus Enzweiler, Abhinav Valada, Arne Roennau

机构 * Machine Intelligence and Robotics Lab, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院智能机器人实验室) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃森堡应用科学大学智能系统研究所) Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 针对四足机器人运动中的传感器配置问题,系统评估了视觉、视觉-惯性和LiDAR-视觉-惯性SLAM方法,发现立体相机、全局快门和适当惯性集成能显著提升定位鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18861 2026-06-18 cs.CV cs.AI 新提交 62%

URDF Synthesis from RGB-D Sequences via Differentiable Joint Inference and Energy-Consistent Verification

基于可微联合推理与能量一致性验证的RGB-D序列URDF合成

Xinze Zhang

机构 * University of Southern California(南加州大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 提出KinemaForge管道,通过可微关节推理和能量一致性验证,从RGB-D序列联合估计部件形状、关节拓扑和参数,显著降低关节轴误差和仿真漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18315 2026-06-18 cs.LG cs.AI 新提交 62%

Ghost Attractor Networks: Basin-Structured Dynamical Decoders for Closed-Loop Sequential Generation

鬼吸引子网络:用于闭环序列生成的盆地结构动力学解码器

Tianyu Wang, Ying Wang, Zhihao Liu, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering, KTH Royal Institute of Technology(瑞典皇家理工学院生产工程系) Department of Decision and Control Systems, KTH Royal Institute of Technology(瑞典皇家理工学院决策与控制系统系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出鬼吸引子网络,一种理论推导的动力学解码器,通过构建盆地-吸引子结构实现高效闭环序列生成,在机器人动作解码任务中以2.3M参数匹配1.07B参数扩散变压器的离线精度,延迟降低32倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14824 2026-06-16 cs.AR cs.AI cs.LG 新提交 62%

Running hardware-aware neural architecture search on embedded devices under 512MB of RAM

在512MB内存下的嵌入式设备上运行硬件感知的神经架构搜索

Andrea Mattia Garavagno, Edoardo Ragusa, Paolo Gastaldo, Antonio Frisoli

机构 * University of Bologna(博洛尼亚大学) Politecnico di Milano(米兰理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在资源受限的嵌入式设备上直接运行的硬件感知神经架构搜索方法,生成针对低端MCU的微型CNN,在Visual Wake Word数据集上达到最先进水平。

Journal ref 2024 IEEE International Conference on Consumer Electronics (ICCE), Las Vegas, NV, USA, 2024, pp. 1-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14699 2026-06-15 cs.CV cs.GR cs.RO 新提交 62%

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control

Instruct-Particulate: 基于运动学控制的可扩展前馈式3D物体关节化

Ruining Li, Yuxin Yao, Matt Zhou, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出Instruct-Particulate模型,通过运动学规范(部件描述、连接性、关节类型等)指导3D网格的关节分割和运动参数预测,利用异构数据集(15万+物体)训练,实现跨类别和AI生成网格的泛化。

Comments Project page: https://instruct-particulate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11120 2026-06-10 cs.AI cs.CV 新提交 62%

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

Andrew Kang, Priya Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。

Comments CVPR 2026, CVSports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09108 2026-06-09 cs.RO cs.LG 新提交 62%

RAM: Reachability Across Morphologies

RAM: 跨形态可达性

Tim Walter, Xinyu Chen, Jonathan Külz, Matthias Althoff

机构 * Department of Computer Engineering(计算机工程系) German Electron Synchrotron Technical University(德国电子同步加速器技术大学) Technical University Munich(慕尼黑技术大学) University of Hamburg(汉堡大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出一种形态条件隐式神经表示RAM,快速、可微地预测可达性并泛化至未见形态,基于前向运动学生成大规模数据集训练,在纳秒级推理中F1达86%,显著加速形态和轨迹优化。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23468 2026-07-28 cs.CV 新提交 61%

Robust 6-DoF Object Pose Tracking with Built-In Recovery under Occlusions and Rapid Object Motions

在遮挡和快速物体运动情况下具有内置恢复功能的鲁棒6自由度物体姿态跟踪

Balázs Opra, Léo Ghafari, Thomas Stewart, Cyrill Stachniss

机构 * Woven by Toyota, Inc.(丰田编织公司) University of Bonn(波恩大学) University of Bonn, Center for Robotics, and the Lamarr Institute for Machine Learning and Artificial Intelligence(波恩大学机器人中心以及拉玛尔机器学习与人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.CV

AI总结 针对RGB-D数据中未见物体的6自由度跟踪问题,尤其是遮挡和快速运动场景,提出结合关键点匹配与优化对齐及故障检测恢复模块的方法,在多场景评估中表现出色,是鲁棒6自由度物体跟踪的重要进展。

Comments 8 pages, 4 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05777 2026-07-08 cs.RO 新提交 61%

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis

观测质量至关重要:通过面向失败的分析实现鲁棒多鱼眼相机校准

Peize Liu, Zhe Tong, Chen Feng, Shaojie Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 研究多鱼眼相机校准难题,通过面向失败分析发现内参初始化是主因,提出CO - Calib框架,结合鲁棒目标检测器和误差分析引导帧选择器,实验表明该框架提升校准成功率、外参精度及校准稳定性。

Comments 9 pages, 7 figures, 6 tables. Code: https://github.com/HKUST-Aerial-Robotics/CO-Calib

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交 57%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18632 2026-08-20 cs.RO 新提交 57%

Evaluation of Monocular SLAM Systems on High-Altitude Nadir UAV Footage

高空天底视角无人机影像下单目SLAM系统的评估

Gašper Spagnolo, Matej Dobrevski, Danijel Skočaj

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 该研究评估5种单目SLAM系统在高空天底视角无人机影像的性能,发现DROID-SLAM表现最优,MASt3R-SLAM水平误差最低,但所有系统垂直位置估计差、大面积轨迹失真,纯视觉单目SLAM不足以可靠应用于航空导航。

Comments 6 pages, submitted to ERK 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18624 2026-08-20 cs.CV 新提交 57%

Evaluation of Image Matching Methods for Visual Odometry on UAVs

无人机视觉里程计的图像匹配方法评估

Gašper Spagnolo, Luka Čehovin Zajc, Matej Dobrevski

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 该研究针对无人机视觉里程计任务,在合成数据集上评估多种图像匹配方法,发现RoMa匹配器性能最优,SIFT特征表现优于部分最新最先进方法,为无人机视觉导航提供参考。

Comments 5 pages, published in the Proceedings of the 33rd International Electrotechnical and Computer Science Conference ERK 2024

Journal ref Proceedings of the 33rd International Electrotechnical and Computer Science Conference ERK 2024, pp. 479-483, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17584 2026-08-19 cs.RO 新提交 57%

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

HODAgent:面向物理世界人机交互的按需、响应式人形机器人

Wang Warren Chen, Jiahao Zhang, Zhenjiang Li, Mingxu Wang, Lei Yi, Yuchen Kang, Shuo Sun, Ziping Chen, Jie Chen

机构 * Xiaopeng(小鹏)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO

AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 57%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 57%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏