arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-16 至 2026-03-16 共收录 17 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 17 篇

2603.11975 2026-03-16 cs.CV cs.AI cs.CR 81%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12806 2026-03-16 cs.RO 79%

FLUX: Accelerating Cross-Embodiment Generative Navigation Policies via Rectified Flow and Static-to-Dynamic Learning

FLUX:通过校正流和静态到动态学习加速跨身体生成导航策略

Zeying Gong, Yangyi Zhong, Yiyi Ding, Tianshuai Hu, Guoyang Zhao, Lingdong Kong, Rong Li, Jiadi You, Junwei Liang

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 FLUX是首个基于流的统一导航策略,通过线性化概率流提升推理效率,结合静态到动态课程学习,在六个导航任务中取得最佳性能,并实现无调优的仿真到现实迁移。

Comments Project Page at this [Website](https://zeying-gong.github.io/projects/flux/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12649 2026-03-16 cs.RO 79%

Autonomous Integration and Improvement of Robotic Assembly using Skill Graph Representations

基于技能图表示的机器人装配自主集成与改进

Peiqi Yu, Philip Huang, Chaitanya Chawla, Guanya Shi, Jiaoyang Li, Changliu Liu

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于技能图表示的机器人装配系统自主集成与持续改进框架,通过语义级规划与执行接口实现系统配置、执行、评估与学习的统一,提升装配系统的适应性与可重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 73%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 67%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13027 2026-03-16 cs.CV cs.AI cs.LG 67%

SortScrews: A Dataset and Baseline for Real-time Screw Classification

SortScrews:一种用于实时螺钉分类的数据集和基线

Tianhao Fu, Bingxuan Yang, Juncheng Guo, Shrena Sribalan, Yucheng Chen

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Project Neura UTMIST Amplimit

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20435 2026-03-16 cs.RO 65%

A Photorealistic Dataset and Vision-Based Algorithm for Anomaly Detection During Proximity Operations in Lunar Orbit

面向月球轨道近距操作的逼真数据集和基于视觉的异常检测算法

Selina Leveugle, Chang Won Lee, Svetlana Stolpner, Chris Langley, Paul Grouchy, Steven Waslander, Jonathan Kelly

机构 * Space and Terrestrial Autonomous Robotic Systems (STARS) Laboratory at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)空间与地面自主机器人系统实验室) Toronto Robotics and AI Laboratory (TRAIL) at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)多伦多机器人与人工智能实验室) MDA Space Inc.(MDA航天公司)

专题命中 机器人数据与评测 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本文提出MRAD算法,通过月球轨道合成数据集ALLO实现空间域异常检测,展现算法在像素和图像层面的高检测性能,推动空间操作中鲁棒的异常检测方法发展。

Comments In IEEE Robotics and Automation Letters (RA-L) and presented at the IEEE International Conference on Robotics and Automation (ICRA'26), 1-5 Jun. 2026, Vienna, Austria

Journal ref IEEE Robotics and Automation Letters (RA-L), Vol. 11, No. 3, pp. 2418 - 2415, Mar. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12960 2026-03-16 cs.RO cs.AI 62%

Efficient Real-World Autonomous Racing via Attenuated Residual Policy Optimization

通过衰减残差策略优化实现高效的现实世界自主赛车

Raphael Trumpp, Denis Hoornaert, Mirco Theile, Marco Caccamo

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出α-RPO方法,通过逐步衰减基础策略生成独立神经策略,减少系统复杂度并提升驾驶性能,适用于现实世界机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12930 2026-03-16 cs.CV cs.LG 62%

Rethinking VLMs for Image Forgery Detection and Localization

重新思考视觉语言模型用于图像伪造检测与定位

Shaofeng Guo, Jiequan Cui, Richang Hong

机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12758 2026-03-16 cs.CV cs.AI 62%

FC-Track: Overlap-Aware Post-Association Correction for Online Multi-Object Tracking

FC-Track: 重叠感知的在线多目标跟踪后关联修正

Cheng Ju, Zejing Zhao, Akio Namiki

机构 * Graduate School of Engineering, Chiba University(Chiba大学工学研究科)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 FC-Track通过重叠感知的后关联修正方法,有效减少在线多目标跟踪中的身份切换问题,无需全局优化或重识别,实现在复杂动态环境下的高可靠性跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12719 2026-03-16 cs.CV cs.AI 62%

IGASA: Integrated Geometry-Aware and Skip-Attention Modules for Enhanced Point Cloud Registration

IGASA: 集成几何感知和跳过注意力模块的增强点云配准

Dongxu Zhang, Jihua Zhu, Shiqi Li, Wenbiao Yan, Haoran Xu, Peilin Fan, Huimin Lu

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出IGASA框架,通过层次金字塔架构和HCLA、IGAR模块提升点云配准的鲁棒性和精度,实验表明其在多个基准数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12849 2026-03-16 eess.SP cs.RO 57%

AoI-FusionNet: Age-Aware Tightly Coupled Fusion of UWB-IMU under Sparse Ranging Conditions

AoI-FusionNet:在稀疏测距条件下基于UWB-IMU的年龄感知紧密耦合融合

Tehmina Bibi, Anselm Köhler, Jan-Thomas Fischer, Falko Dressler

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出AoI-FusionNet,通过直接融合UWB测距与IMU数据实现三维轨迹估计,采用年龄信息衰减模块和自适应注意力机制提升定位精度,通过数据增强策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12733 2026-03-16 cs.AI 57%

On Using Machine Learning to Early Detect Catastrophic Failures in Marine Diesel Engines

利用机器学习早期检测海洋柴油机灾难性故障

Francesco Maione, Paolo Lino, Giuseppe Giannino, Guido Maione

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种基于随机森林的机器学习方法,通过分析传感器读数与预期值的偏差导数,提前检测柴油机灾难性故障,从而避免严重损失和危险事件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12690 2026-03-16 cs.CV 57%

CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images

CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像

Liangzheng Sun, Mengfan He, Xingyu Shao, Binbin Li, Zhiqiang Yan, Chunyu Li, Ziyang Meng, Fei Xing

机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 57%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27475 2026-03-16 cs.CV cs.MM 57%

Referee: Reference-aware Audiovisual Deepfake Detection

审稿人:基于参考的音频视觉深度伪造检测

Hyemin Boo, Eunsang Lee, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software, Ewha Womans University(人工智能与软件系,世女子大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出Referee方法,通过建模单次示例中说话者特定特征的关联一致性,实现跨数据集和语言的音频视觉深度伪造检测,达到99.4%的AUC表现。

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV 57%

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏