arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-16 至 2026-03-16 共收录 57 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 10 篇

2603.12551 2026-03-16 cs.CV 57%

CVGL: Causal Learning and Geometric Topology

CVGL:因果学习与几何拓扑

Songsong Ouyang, Yingying Zhu

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出CLGT框架,通过因果特征提取器和几何拓扑融合模块解决跨视角地理定位中的混淆因素和视角差异问题,实验显示其在复杂真实场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12287 2026-03-16 cs.AI cs.CL cs.DB 57%

Context-Enriched Natural Language Descriptions of Vessel Trajectories

基于上下文的船舶轨迹自然语言描述

Kostas Patroumpas, Alexandros Troupiotis-Kapeliaris, Giannis Spiliopoulos, Panagiotis Betchavas, Dimitrios Skoutas, Dimitris Zissis, Nikos Bikakis

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种上下文感知的轨迹抽象框架,将AIS数据转化为结构化、语义丰富的表示,支持通过LLM生成受控自然语言描述,提升海洋任务的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12608 2026-03-16 cs.IR cs.HC 50%

InterDeepResearch: Enabling Human-Agent Collaborative Information Seeking through Interactive Deep Research

InterDeepResearch:通过交互式深度研究实现人机协作的信息检索

Bo Pan, Lunke Pan, Yitao Zhou, Qi Jiang, Zhen Wen, Minfeng Zhu, Wei Chen

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出InterDeepResearch系统,通过交互式深度研究框架提升人机协作信息检索效率,实验证明其在性能和用户研究支持方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 4 篇

2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 82%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13215 2026-03-16 cs.CV 79%

Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models

看得不见就忘记了吗?评估视频世界模型中的状态演变

Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文设计STEVO-Bench基准测试,评估视频世界模型能否脱离观察独立演进,揭示其在自然状态演变中的局限性。

Comments https://glab-caltech.github.io/STEVOBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12655 2026-03-16 cs.CV 79%

VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model

VGGT-World:将VGGT转变为一个自回归的几何世界模型

Xiangyu Sun, Shijie Wang, Fengyi Zhang, Lin Liu, Caiyan Jia, Ziying Song, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Beijing Jiaotong University(北京交通大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出VGGT-World,通过自回归方法预测冻结几何基础模型特征的时空演变,提升深度预测性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09346 2026-03-16 cs.RO 57%

How Safe Will I Be Given What I Saw? Calibrated Prediction of Safety Chances for Image-Controlled Autonomy

给我所见的安全性如何?面向图像控制自主系统的校准安全性预测

Zhenjiang Mao, Mrinall Eashaan Umasudhan, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab(可信工程自主性实验室)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 本文提出一种校准的安全性预测框架,用于端到端视觉控制系统,解决部分可观测性和分布偏移下的安全性预测问题,通过无监督域适应和世界模型提升预测鲁棒性。

Comments arXiv admin note: text overlap with arXiv:2308.12252

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 2 篇

2603.12868 2026-03-16 cs.RO 79%

Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies

超越模仿:用于自适应扩散导航策略的强化学习微调

Junhe Sheng, Ruofei Bai, Kuan Xu, Ruimeng Liu, Jie Chen, Shenghai Yuan, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) A*STAR, Singapore(A*STAR,新加坡) National University of Singapore, Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09325 2026-03-16 cs.CV cs.AI cs.LG cs.RO 70%

SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens

SegDAC:通过动态物体令牌实现强化学习中的视觉泛化

Alexandre Brown, Glen Berseth

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 SegDAC通过动态物体令牌实现强化学习中的视觉泛化,利用文本引导的分割生成物体掩码,并通过变换器处理动态令牌以保持空间信息,提升了在不同视觉条件下的性能。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 17 篇

2603.11975 2026-03-16 cs.CV cs.AI cs.CR 81%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12806 2026-03-16 cs.RO 79%

FLUX: Accelerating Cross-Embodiment Generative Navigation Policies via Rectified Flow and Static-to-Dynamic Learning

FLUX:通过校正流和静态到动态学习加速跨身体生成导航策略

Zeying Gong, Yangyi Zhong, Yiyi Ding, Tianshuai Hu, Guoyang Zhao, Lingdong Kong, Rong Li, Jiadi You, Junwei Liang

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 FLUX是首个基于流的统一导航策略,通过线性化概率流提升推理效率,结合静态到动态课程学习,在六个导航任务中取得最佳性能,并实现无调优的仿真到现实迁移。

Comments Project Page at this [Website](https://zeying-gong.github.io/projects/flux/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12649 2026-03-16 cs.RO 79%

Autonomous Integration and Improvement of Robotic Assembly using Skill Graph Representations

基于技能图表示的机器人装配自主集成与改进

Peiqi Yu, Philip Huang, Chaitanya Chawla, Guanya Shi, Jiaoyang Li, Changliu Liu

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出基于技能图表示的机器人装配系统自主集成与持续改进框架,通过语义级规划与执行接口实现系统配置、执行、评估与学习的统一,提升装配系统的适应性与可重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 73%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 67%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13027 2026-03-16 cs.CV cs.AI cs.LG 67%

SortScrews: A Dataset and Baseline for Real-time Screw Classification

SortScrews:一种用于实时螺钉分类的数据集和基线

Tianhao Fu, Bingxuan Yang, Juncheng Guo, Shrena Sribalan, Yucheng Chen

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Project Neura UTMIST Amplimit

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20435 2026-03-16 cs.RO 65%

A Photorealistic Dataset and Vision-Based Algorithm for Anomaly Detection During Proximity Operations in Lunar Orbit

面向月球轨道近距操作的逼真数据集和基于视觉的异常检测算法

Selina Leveugle, Chang Won Lee, Svetlana Stolpner, Chris Langley, Paul Grouchy, Steven Waslander, Jonathan Kelly

机构 * Space and Terrestrial Autonomous Robotic Systems (STARS) Laboratory at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)空间与地面自主机器人系统实验室) Toronto Robotics and AI Laboratory (TRAIL) at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)多伦多机器人与人工智能实验室) MDA Space Inc.(MDA航天公司)

专题命中 机器人数据与评测 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO

AI总结 本文提出MRAD算法,通过月球轨道合成数据集ALLO实现空间域异常检测,展现算法在像素和图像层面的高检测性能,推动空间操作中鲁棒的异常检测方法发展。

Comments In IEEE Robotics and Automation Letters (RA-L) and presented at the IEEE International Conference on Robotics and Automation (ICRA'26), 1-5 Jun. 2026, Vienna, Austria

Journal ref IEEE Robotics and Automation Letters (RA-L), Vol. 11, No. 3, pp. 2418 - 2415, Mar. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12960 2026-03-16 cs.RO cs.AI 62%

Efficient Real-World Autonomous Racing via Attenuated Residual Policy Optimization

通过衰减残差策略优化实现高效的现实世界自主赛车

Raphael Trumpp, Denis Hoornaert, Mirco Theile, Marco Caccamo

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出α-RPO方法,通过逐步衰减基础策略生成独立神经策略,减少系统复杂度并提升驾驶性能,适用于现实世界机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12930 2026-03-16 cs.CV cs.LG 62%

Rethinking VLMs for Image Forgery Detection and Localization

重新思考视觉语言模型用于图像伪造检测与定位

Shaofeng Guo, Jiequan Cui, Richang Hong

机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12758 2026-03-16 cs.CV cs.AI 62%

FC-Track: Overlap-Aware Post-Association Correction for Online Multi-Object Tracking

FC-Track: 重叠感知的在线多目标跟踪后关联修正

Cheng Ju, Zejing Zhao, Akio Namiki

机构 * Graduate School of Engineering, Chiba University(Chiba大学工学研究科)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 FC-Track通过重叠感知的后关联修正方法,有效减少在线多目标跟踪中的身份切换问题,无需全局优化或重识别,实现在复杂动态环境下的高可靠性跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12719 2026-03-16 cs.CV cs.AI 62%

IGASA: Integrated Geometry-Aware and Skip-Attention Modules for Enhanced Point Cloud Registration

IGASA: 集成几何感知和跳过注意力模块的增强点云配准

Dongxu Zhang, Jihua Zhu, Shiqi Li, Wenbiao Yan, Haoran Xu, Peilin Fan, Huimin Lu

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出IGASA框架,通过层次金字塔架构和HCLA、IGAR模块提升点云配准的鲁棒性和精度,实验表明其在多个基准数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12849 2026-03-16 eess.SP cs.RO 57%

AoI-FusionNet: Age-Aware Tightly Coupled Fusion of UWB-IMU under Sparse Ranging Conditions

AoI-FusionNet:在稀疏测距条件下基于UWB-IMU的年龄感知紧密耦合融合

Tehmina Bibi, Anselm Köhler, Jan-Thomas Fischer, Falko Dressler

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出AoI-FusionNet,通过直接融合UWB测距与IMU数据实现三维轨迹估计,采用年龄信息衰减模块和自适应注意力机制提升定位精度,通过数据增强策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12733 2026-03-16 cs.AI 57%

On Using Machine Learning to Early Detect Catastrophic Failures in Marine Diesel Engines

利用机器学习早期检测海洋柴油机灾难性故障

Francesco Maione, Paolo Lino, Giuseppe Giannino, Guido Maione

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出一种基于随机森林的机器学习方法,通过分析传感器读数与预期值的偏差导数,提前检测柴油机灾难性故障,从而避免严重损失和危险事件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12690 2026-03-16 cs.CV 57%

CM-Bench: A Comprehensive Cross-Modal Feature Matching Benchmark Bridging Visible and Infrared Images

CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像

Liangzheng Sun, Mengfan He, Xingyu Shao, Binbin Li, Zhiqiang Yan, Chunyu Li, Ziyang Meng, Fei Xing

机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 57%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27475 2026-03-16 cs.CV cs.MM 57%

Referee: Reference-aware Audiovisual Deepfake Detection

审稿人:基于参考的音频视觉深度伪造检测

Hyemin Boo, Eunsang Lee, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software, Ewha Womans University(人工智能与软件系,世女子大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出Referee方法,通过建模单次示例中说话者特定特征的关联一致性,实现跨数据集和语言的音频视觉深度伪造检测,达到99.4%的AUC表现。

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV 57%

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他机器人 1 篇

2507.15781 2026-03-16 eess.SY cs.SY 50%

Bio-inspired density control of multi-agent swarms via leader-follower plasticity

生物启发的多智能体群体密度控制 via 领导-跟随可塑性

Gian Carlo Maffettone, Alain Boldini, Mario di Bernardo, Maurizio Porfiri

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出一种生物启发的领导-跟随可塑性方法,用于多智能体群体的空间自组织控制,通过非线性偏微分方程建模群体密度,提供紧凑描述并保证稳态解的存在与局部稳定性。

Journal ref Volume 188, Automatica, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏