arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-07-07 至 2026-07-07 共收录 19 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 1 篇

2603.02369 2026-07-07 hep-ex 版本更新 50%

Continual Learning via Ensemble-Based Depth-Wise Masked Autoencoders for Data Quality Monitoring in High-Energy Physics

基于集成的深度掩蔽自动编码器的持续学习用于高能物理中的数据质量监测

Dale Julson, Eric Reinhardt, Andrii Krutsylo, Resham Sohal, Guillermo Fidalgo, Sergei Gleyzer, Emanuele Usai, The CMS HCAL Collaboration

专题命中 感知 :occupancy(abstract)

AI总结 研究高能物理数据质量监测,提出轻量级掩蔽自动编码器DepthViT,用独特深度嵌入和注意力实现高效异常检测,构建持续学习框架,集成新旧模型提升抗数据偏移能力,多场景测试效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 3 篇

2503.23650 2026-07-07 cs.LG cs.RO 版本更新 79%

A Survey of Reinforcement Learning-Based Motion Planning for Autonomous Driving: Lessons Learned from a Driving Task Perspective

基于强化学习的自动驾驶运动规划综述:从驾驶任务角度吸取的经验教训

Zhuoren Li, Guizhe Jin, Ran Yu, Weiqi Zhang, Zhiwen Chen, Nan Li, Lu Xiong, Ilya Kolmanovsky, Dimitar Filev, Bo Leng, Jia Hu

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) Key Laboratory of Road and Traffic Engineering of the Ministry of Education, Tongji University(教育部道路与交通工程重点实验室) Department of Aerospace Engineering, University of Michigan(密歇根大学航空航天工程系) Hagler Institute for Advanced Study, Texas A&M University(德克萨斯大学A&M分校哈格勒先进研究学院)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.RO

AI总结 综述基于强化学习的自动驾驶运动规划,先概述强化学习方法基础,再调研其在运动规划中的应用,分析特定场景特征与任务要求,总结关键设计经验并为未来实施提供指导,还探讨前沿挑战及应对策略。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08572 2026-07-07 cs.CV 版本更新 57%

ECTraj: Enhanced Consistency Training for Multi-Agent Trajectory Prediction

增强多智能体轨迹预测的一致性模型

Alen Mrdovic, Qingze, Liu, Danrui Li, Mathew Schwartz, Kaidong Hu, Sejong Yoon, Mubbasir Kapadia, Vladimir Pavlovic

机构 * Rutgers University - New Brunswick(罗格斯大学-新不伦瑞克分校) New Jersey Institute of Technology(新泽西理工学院) The College of New Jersey(新泽西学院)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出ECTraj,通过改进训练和条件生成方法,提升多智能体轨迹预测的一致性模型性能,实现更快推理和更准确预测,建立新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13836 2026-07-07 eess.SY cs.RO cs.SY math.OC 版本更新 57%

A Convex Obstacle Avoidance Formulation

一种凸避障公式

Ricardo Tapia, Iman Soltani

机构 * Laboratory for AI, Robotics and Automation, University of California at Davis(人工智能、机器人与自动化实验室,加州大学戴维斯分校)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO

AI总结 提出首个通用凸避障公式,通过逻辑集成方法将避障融入凸MPC,相比非凸方法大幅提升计算效率,且障碍物在预测时域外仍有效,支持短时域实时部署。

Comments 17 pages, 12 figures, multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 3 篇

2603.28489 2026-07-07 eess.IV cs.CV 版本更新 62%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、eess.IV

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新 62%

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16923 2026-07-07 cs.CR cs.AI cs.LG 版本更新 57%

UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks

UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距

Mansi Phute, Matthew Hull, Haoran Wang, Alec Helbling, ShengYun Peng, Willian Lunardi, Martin Andreoni, Wenke Lee, Duen Horng Chau

机构 * Georgia Institute of Technology(佐治亚理工学院) Technology Innovation Institute(技术创新研究院)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.AI

AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 4 篇

2603.27044 2026-07-07 cs.LG cs.AI 版本更新 85%

Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching

无监督行为压缩:通过状态占用匹配学习低维策略流形

Andrea Fraschini, Davide Tenedini, Riccardo Zamboni, Mirco Mutti, Marcello Restelli

专题命中 BEV与占用 :occupancy(title,summary_cn);分类 cs.AI

AI总结 本文提出Occupancy-based Policy Compression方法,通过改进策略压缩框架,以长周期状态空间覆盖替代即时动作匹配,提升行为表示的鲁棒性和泛化能力。

Comments RLC 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06576 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 83%

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

BEVLM:将语言模型中的语义知识提炼到鸟瞰视图表示中

Thomas Monninger, Shaoyuan Xie, Qi Alfred Chen, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰研发北美研究所) University of California, Irvine(加州大学伊尔弗分校)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);autonomous driving(abstract);end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究将大语言模型集成到自动驾驶,针对现有方法冗余计算、空间一致性受限等问题,提出BEVLM框架,连接鸟瞰视图表示与大语言模型,能有效提升跨视图驾驶场景推理准确性及端到端驾驶性能。

Comments Accepted to the 2026 European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28747 2026-07-07 hep-ph 版本更新 50%

Maximum phase-space density of linearly polarized gluon TMDs in the saturation region

饱和区域中线偏振胶子TMD的最大相空间密度

Lei Wang

专题命中 BEV与占用 :occupancy(abstract)

AI总结 利用Mueller占据数论证和小x Weizsäcker-Williams与偶极子胶子分布,计算了饱和区域中线偏振胶子TMD系数$h_1^{\perp g}$的Sudakov限制最大相空间密度,发现偶极子分布的最大值为$2\alpha_s^{-3/2}$,并进行了数值Collins-Soper演化研究。

Comments This paper is being withdrawn because the numerical results contain errors that require significant revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10041 2026-07-07 cs.PF cs.SY eess.SY 版本更新 50%

Emergency Department Patient Flow Optimization with an Alternative Care Threshold Policy

基于替代护理阈值策略的急诊科患者流优化

Sahba Baniasadi, Paul M. Griffin, Prakash Chakraborty

专题命中 BEV与占用 :occupancy(abstract)

AI总结 针对急诊科拥挤问题,提出基于阈值的收治政策,将非紧急患者在高峰拥堵时重定向至替代护理途径,通过特定排队系统建模并分析,得出最优阈值,有显著性能提升。

Comments 44 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 7 篇

2606.28637 2026-07-07 cs.RO 版本更新 87%

PinNet: Keypoint-Aware Learned Local Descriptors with Geometric Embedding for Loop Closure in LiDAR SLAM

PinNet:用于LiDAR SLAM回环检测的具有几何嵌入的关键点感知局部描述符

Yanlong Ma, Nakul S. Joshi, Christa S. Robison, Philip R. Osteen, Brett T. Lopez

机构 * University of California, Los Angeles(加州大学洛杉矶分校) DEVCOM Army Research Laboratory (ARL)(陆军研究实验室(ARL))

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.RO

AI总结 提出PinNet网络,通过关键点生成和平面几何自注意力模块增强描述符判别性,实现基于点云的回环检测与配准,在多个数据集上验证了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08457 2026-07-07 cs.RO cs.LG cs.SY eess.SP eess.SY physics.data-an 版本更新 79%

Adaptive Entropy-Driven Sensor Selection in a Camera-LiDAR Particle Filter for Single-Vessel Tracking

相机-激光雷达粒子滤波器中用于单船跟踪的自适应熵驱动传感器选择

Andrei Starodubov, Yaqub Aris Prabowo, Andreas Hadjipieris, Ioannis Kyriakides, Roberto Galeazzi

机构 * Cyprus Marine and Maritime Institute(塞浦路斯海洋与航海研究所) Technical University of Denmark(丹麦技术大学)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO

AI总结 研究单船跟踪问题,提出含相机-激光雷达融合的粒子滤波器及信息增益自适应传感策略,在实际海事部署中验证,该策略能依信息增益切换模态,实现精度与连续性平衡,提供实用基线。

Comments 10 pages, 5 figures, submitted and accepted FUSION 2026 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03695 2026-07-07 cs.RO 版本更新 74%

TreeLoc++: Robust 6-DoF LiDAR Localization in Forests with a Compact Digital Forest Inventory

TreeLoc++:利用紧凑数字森林清单在森林中进行稳健的6自由度激光雷达定位

Minwoo Jung, Dongjae Lee, Nived Chebrolu, Haedam Oh, Maurice Fallon, Ayoung Kim

机构 * Department of Mechanical Engineering, Seoul National University, Seoul, South Korea(首尔国立大学机械工程系,韩国首尔) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, India(印度班加罗尔印度理工学院计算机科学与工程系) Oxford Robotics Institute, Department of Engineering Science, University of Oxford, Oxford, UK(牛津大学奥克斯福德机器人研究所,英国牛津)

专题命中 激光雷达 :LiDAR(title);分类 cs.RO

AI总结 研究提出TreeLoc++框架,直接基于数字森林清单定位,以紧凑几何属性编码树干。通过距离直方图等减少误匹配,优化估计姿态,不依赖密集点云数据,实现厘米级精度定位,具长期部署扩展性。

Comments 30 pages, 33 figures and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新 70%

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

专题命中 激光雷达 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08807 2026-07-07 cs.RO cs.LG 版本更新 70%

Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation

Humanoid Everyday:面向开放世界人形机器人操作的综合机器人数据集

Zhenyu Zhao, Hongyi Jing, Xiawei Liu, Jiageng Mao, Abha Jha, Hanwen Yang, Rong Xue, Sergey Zakharov, Vitor Guizilini, Yue Wang

机构 * University of Southern California(南加州大学) Toyota Research Institute(丰田研究院)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出Humanoid Everyday数据集,包含10.3k轨迹、260个任务的多模态数据,用于人形机器人灵巧操作、人机交互和移动操作研究,并配套云评估平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28660 2026-07-07 cs.CV 版本更新 57%

Industrial3D: A Water-Treatment TLS Point Cloud Dataset and Cross-Paradigm Benchmark for MEP Scene Understanding

Industrial3D: 一个用于工业基础设施的地面激光雷达点云数据集和跨范式基准

Chao Yin, Hongzhe Yue, Qing Han, Difeng Hu, Zhenyu Liang, Fangzhou Lin, Bing Sun, Boyu Wang, Mingkai Li, Wei Yao, Jack C. P. Cheng

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省科学院广州地理研究所) School of Civil Engineering, Southeast University(东南大学土木工程学院) College of Geography and Tourism, Hengyang Normal University(衡阳师范学院地理与旅游学院) Department of Architecture and Civil Engineering, City University of Hong Kong(香港城市大学建筑与土木工程系) S.M.A.R.T. Construction Research Group, New York University Abu Dhabi(纽约大学阿布扎比分校S.M.A.R.T.建筑研究组) Department of the Built Environment, National University of Singapore(新加坡国立大学建筑环境系) Spatial Intelligence and Urban Computing, Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所空间智能与城市计算) State Key Lab of Ecological Security of Regions and Cities, Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所区域与城市生态安全国家重点实验室)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出Industrial3D数据集,包含6.12亿个高精度标注点云,用于解决工业设施中密集点云的语义理解难题,并建立首个跨范式基准,揭示了工业TLS数据中统计稀有性和几何模糊性带来的领域迁移挑战。

Comments 52 pages, 8 figure, 14 tables

Journal ref 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15379 2026-07-07 cs.CV 版本更新 57%

The P$^3$ Dataset: Pixels, Points and Polygons for Multimodal Building Vectorization

P$^3$数据集:用于多模态建筑物矢量化的像素、点和多边形

Raphael Sulzer, Liuyun Duan, Nicolas Girard, Florent Lafarge

机构 * Université Côte d’Azur, INRIA(法国里沃利大学、INRIA) LuxCarta Technology(LuxCarta技术公司)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.CV

AI总结 介绍用于建筑物矢量化的多模态P$^3$数据集,由多源数据构建,含大量高精度激光雷达点等。证明激光雷达点云可用于预测建筑物多边形,融合激光雷达和图像能提高预测精度与几何质量,数据集公开。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多传感器融合 1 篇

2106.15277 2026-07-07 cs.CV 版本更新 77%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 多传感器融合 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏