arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-14 至 2026-04-14 共收录 115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 29 篇

2507.17596 2026-04-14 cs.CV cs.AI cs.LG cs.RO 61%

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

PRIX:从原始像素学习计划以实现端到端自动驾驶

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) SCANIA(斯堪尼亚)

专题命中 机器人数据与评测 :分类 cs.RO、cs.AI、cs.CV;robotics(comments)

AI总结 PRIX通过使用仅需摄像头数据的端到端驾驶架构,无需BEV表示和LiDAR,直接从原始像素预测安全轨迹,实现了高效且实用的自动驾驶解决方案。

Comments Accepted for Robotics and Automation Letters (RA-L) and will be presented at iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10241 2026-04-14 cs.RO 61%

A Coordinate-Invariant Local Representation of Motion and Force Trajectories for Identification and Generalization Across Coordinate Systems

一种坐标不变的局部运动和力轨迹表示法用于跨坐标系统的识别与泛化

Arno Verduyn, Erwin Aertbeliën, Maxim Vochten, Joris De Schutter

机构 * KU Leuven(鲁汶大学) Flanders Make(弗兰德斯制造) Royal Military Academy(皇家军事学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出了一种坐标不变的轨迹表示法,用于在不同坐标系统中一致地识别和泛化运动和力轨迹,以提高鲁棒性和通用性。

Comments This preprint has been accepted for presentation at the 17th World Symposium on the Algorithmic Foundations of Robotics (WAFR 2026). The preprint corresponds to the version submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11038 2026-04-14 cs.CV 57%

EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates

EgoFun3D:基于第一人称视频建模交互三维物体的协调任务

Weikun Peng, Denys Iliash, Manolis Savva

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出EgoFun3D,通过函数模板建模交互三维物体,解决真实世界视频中交互物体建模难题,提出四阶段流程并展示其挑战性。

Comments Project website: https://3dlg-hcvc.github.io/EgoFun3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10780 2026-04-14 cs.CV 57%

LIDARLearn: A Unified Deep Learning Library for 3D Point Cloud Classification, Segmentation, and Self-Supervised Representation Learning

LIDARLearn: 一个用于3D点云分类、分割和自监督表示学习的统一深度学习库

Said Ohamouddou, Hanaa El Afia, Abdellatif El Afia, Raddouane Chiheb

机构 * ENSIAS, Mohammed V University, Rabat, Morocco(穆罕默德五世大学ENSIAS学院,拉巴特,摩洛哥)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出LIDARLearn,一个整合多种3D点云处理方法的统一深度学习库,支持分类、语义分割、部分分割和少样本学习,并提供标准化训练流程和严格多模型比较工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05510 2026-04-14 cs.CV 57%

Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality

在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试

Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09056 2026-04-14 cs.CV 57%

ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

ConceptPose:基于概念向量的无训练零样本物体姿态估计

Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 ConceptPose利用视觉语言模型生成开放词汇3D概念图,通过建立概念图间的3D-3D对应关系,实现无训练的零样本物体姿态估计,优于现有最佳基线62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10058 2026-04-14 cs.RO cs.CG 57%

A Ray Intersection Algorithm for Fast Growth Distance Computation Between Convex Sets

用于凸集之间快速生长距离计算的射线相交算法

Akshay Thirugnanam, Koushil Sreenath

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种高效算法,通过迭代构造Minkowski差集的内外多面体近似,计算凸集之间的生长距离,该算法在运动规划和刚体模拟中具有广泛应用。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09996 2026-04-14 cs.CV 57%

A Comparative Study of Modern Object Detectors for Robust Apple Detection in Orchard Imagery

现代目标检测器在果园图像中稳健苹果检测的比较研究

Mohammed Asad, Ajai Kumar Gautam, Priyanshu Dhiman, Rishi Raj Prajapati

机构 * Affiliation omitted for double-blind review

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文比较了六个现代目标检测器在苹果检测中的性能,发现YOLO11n在严格定位性能上表现最佳,同时分析了不同检测器在阈值鲁棒性和下游任务需求上的差异。

Comments Accepted at ICICV 2026; 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-04-14 cs.MA cs.AI cs.CL 57%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09649 2026-04-14 cs.HC cs.AI eess.SP 57%

WearBCI Dataset: Understanding and Benchmarking Real-World Wearable Brain-Computer Interfaces Signals

WearBCI 数据集:理解和评估真实世界可穿戴脑机接口信号

Haoxian Liu, Hengle Jiang, Lanxuan Hong, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出WearBCI数据集,通过同步多模态记录和系统性评估,研究运动伪影对可穿戴BCI信号的影响,并探索跨模态信号增强和多维行为理解的新应用。

Comments Accepted by Sensys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09578 2026-04-14 cs.AI 57%

Explainable Planning for Hybrid Systems

混合系统的可解释规划

Mir Md Sajid Sarwar

机构 * School of Mathematical and Computational Sciences, Indian Association for the Cultivation of Science, Kolkata(印度科学培育协会数学与计算科学学院,加尔各答)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 研究针对混合系统中的可解释人工智能规划,探讨生成AI系统解释的方法,以应对自动化规划在复杂安全领域中的应用需求。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18976 2026-04-14 cs.CV cs.HC 57%

Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking

Ninja Codes: 由神经生成的隐匿式六自由度跟踪标记

Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato

机构 * Osaka University(大阪大学) Kyoto University(京都大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出Ninja Codes,一种由神经网络生成的隐匿式标记,能自然融入真实环境,通过编码网络将任意图像转换为标记,用于机器人和增强现实等领域的隐匿六自由度跟踪。

Comments CVPR 2026 Findings; Project page: https://sento.net/research/ninjacodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10763 2026-04-14 cs.IR cs.HC 50%

BDIViz in Action: Interactive Curation and Benchmarking for Schema Matching Methods

BDIViz在行动:交互式整理与基准测试用于模式匹配方法

Eden Wu, Christos Koutras, Cláudio T. Silva, Juliana Freire

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出BDIViz系统,通过交互式可视化和LLM辅助验证,解决模式匹配方法评估中的基准多样性不足问题,支持人类在循环中的基准测试和迭代匹配器开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10522 2026-04-14 cs.CR 50%

SEED: A Large-Scale Benchmark for Provenance Tracing in Sequential Deepfake Facial Edits

SEED:一个大规模的面部深度伪造序列编辑溯源基准

Mengieong Hoi, Zhedong Zheng, Ping Liu, Wei Liu

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 SEED通过多步扩散编辑流程生成90000张图像,包含编辑顺序、文本指令等细粒度标注,用于研究序列溯源和伪造检测,揭示空间与频域特征在深度伪造分析中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 11 篇

2604.11708 2026-04-14 cs.RO cs.SE cs.SY eess.SY 79%

ACT: Automated CPS Testing for Open-Source Robotic Platforms

ACT:用于开源机器人平台的自动化CPS测试

Aditya A. Krishnan, Donghoon Kim, Hokeun Kim

机构 * Arizona State University(亚利桑那州立大学) Arkansas State University(阿肯色州立大学)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出ACT框架,通过自动化持续测试开源CPS软件与机器人平台,解决多模块开发中测试不足的问题,并通过案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09612 2026-04-14 cs.AI cs.HC 79%

Beyond Theory of Mind in Robotics

机器人中的超越心智理论

Malte F. Jung

专题命中 其他机器人 :robotics(title,abstract);分类 cs.AI

AI总结 本文挑战传统心智理论在机器人社交交互中的应用,提出通过实时协调产生社会意义,强调协调策略与主动参与的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11585 2026-04-14 cs.CV cs.RO 73%

GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth

GeomPrompt:用于在缺失和退化深度下的RGB-D语义分割的几何提示学习

Krishna Jaganathan, Patricio Vela

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他机器人 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 GeomPrompt通过从RGB生成任务驱动的几何提示,提升RGB-D语义分割在缺失和退化深度下的性能,同时比单目深度估计器更高效。

Comments Accepted to the CVPR 2026 URVIS Workshop. Project page: https://geomprompt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11572 2026-04-14 cs.RO cs.MM 70%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 其他机器人 :embodied AI(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09886 2026-04-14 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

Not Your Stereo-Typical Estimator: Combining Vision and Language for Volume Perception

非典型立体视觉估计器:结合视觉与语言进行体积感知

Gautham Vinod, Bruce Coburn, Siddeshwar Raghavan, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 其他机器人 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出融合立体视觉隐式3D线索与自然语言显式先验知识的方法,通过多模态表示提升体积估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11373 2026-04-14 cs.RO cs.AI 62%

Minimal Embodiment Enables Efficient Learning of Number Concepts in Robot

最小的具身化能有效学习数字概念的机器人

Zhegong Shangguan, Alessandro Di Nuovo, Angelo Cangelosi

机构 * Cognitive Robotics Lab, Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系认知机器人实验室) Smart Interactive Technologies (SIT) Research Laboratory, Department of Computing, Sheffield Hallam University(谢菲尔德哈勒姆大学计算系智能交互技术(SIT)研究实验室)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了通过机器人与Franka Panda机械臂的自然交互,利用神经网络模型进行序列计数,证明最小具身化能提高学习效率并产生生物合理的表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10772 2026-04-14 cs.CV 57%

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 其他机器人 :embodied AI(abstract);分类 cs.CV

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10582 2026-04-14 cs.CV 57%

TAPNext++: What's Next for Tracking Any Point (TAP)?

TAPNext++: 追踪任意点(TAP)的下一步

Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Chandar Research Lab(钱达尔研究实验室) Polytechnique Montréal(蒙特利尔综合理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Technical University Munich (TUM)(慕尼黑工业大学)

专题命中 其他机器人 :robotics(abstract);分类 cs.CV

AI总结 TAPNext++通过训练长序列和引入重检指标提升追踪性能,在保持低内存计算开销的同时实现更长序列的追踪。

Comments 8 pages, will be publised at CVPR Findings 2026, Website https://tap-next-plus-plus.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21484 2026-04-14 cs.CV 57%

Unified Unsupervised and Sparsely-Supervised 3D Object Detection by Semantic Pseudo-Labeling and Prototype Learning

通过语义伪标签和原型学习实现统一的无监督和稀疏监督3D目标检测

Yushen He, Lei Zhao, Weidong Chen

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医疗机器人研究院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理教育部重点实验室)

专题命中 其他机器人 :robotic(abstract);分类 cs.CV

AI总结 本文提出SPL框架,通过语义伪标签和原型学习统一无监督和稀疏监督3D目标检测,生成高质量伪标签并稳定特征学习,实验表明在KITTI和nuScenes数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10057 2026-04-14 cs.RO 57%

Natural Gradient Gaussian Approximation Filter on Lie Groups for Robot State Estimation

在李群上的自然梯度高斯近似滤波器用于机器人状态估计

Tianyi Zhang, Wenhan Cao, Chang Liu, Yao Lyu, Shengbo Eben Li

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) College of Engineering, Peking University(北京大学工学院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Tsinghua-Efort Joint Research Center for EAI Computation and Perception(清华大学-埃夫特EAI计算与感知联合研究中心)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO

AI总结 本文提出在李群上基于自然梯度优化的高斯近似滤波器,用于解决机器人系统在李群流形上状态估计的非线性问题,通过避免局部线性化提高估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21488 2026-04-14 cond-mat.soft nlin.PS 50%

Electro-mechanical wrinkling of soft dielectric films bonded to hyperelastic substrates

软电介质薄膜与超弹性基底的机电皱褶

Bin Wu, Linghao Kong, Weiqiu Chen, Davide Riccobelli, Michel Destrade

专题命中 其他机器人 :robotics(abstract)

AI总结 研究通过电场控制软薄膜-基底复合材料的皱褶现象,推导出临界拉伸和电压的解析公式,揭示了机电皱褶的基本机制,为柔性材料设计提供理论指导。

Journal ref Journal of the Mechanics and Physics of Solids, Volume 209, 2026, 106490

详情

展开后加载摘要…

URL PDF HTML 收藏