arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-05-08 至 2026-05-08 共收录 14 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6 篇

2605.05014 2026-05-08 cs.CV 77%

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

专题命中 感知 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05338 2026-05-08 cs.RO 74%

Track A*: Fast Visibility-Aware Trajectory Planning for Active Target Tracking

Track A*: 为主动目标跟踪的快速可见性感知轨迹规划

Hanxuan Chen, Kangli Wang, Ji Pei

机构 * Autel Robotics(奥特 Robotics)

专题命中 感知 :trajectory planning(title);分类 cs.RO

AI总结 本文提出Track A*,一种基于离线搜索的轨迹规划器,用于在离散的四维时空网格上实现可见性感知的目标跟踪。通过分层有向无环图搜索和三种工程优化,Track A*在保证实用性的同时提升了可扩展性,实验证明其在计算成本低的情况下具有稳健的可见性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05328 2026-05-08 cs.CV cs.RO 73%

Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift

Query2Uncertainty: 3D目标检测中分布偏移下的鲁棒不确定性量化与校准

Till Beemelmanns, Alexey Nekrasov, Stefan Vilceanu, Jonas Steinhaus, Timo Woopen, Bastian Leibe, Lutz Eckstein

机构 * Institute for Automotive Engineering, RWTH Aachen(汽车工程研究所,亚琛RWTH大学) Computer Vision Institute, RWTH Aachen(计算机视觉研究所,亚琛RWTH大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出一种密度感知校准方法,结合后验校准器与DETR风格3D目标检测器的潜在对象查询特征密度,提升分布偏移场景下的不确定性估计与校准性能。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06478 2026-05-08 cs.RO 70%

GA3T: A Ground-Aerial Terrain Traversability Dataset for Heterogeneous Robot Teams in Unstructured Environments

GA3T:一种用于异构机器人团队在非结构化环境中的地面-空中地形可 traversability 数据集

Siwei Cai, Knut Peterson, Quan Tran, Christian Ricks, Dhanush Parthasarathy, Amir Kaidarov, Neil Deshpande, Sukaina Najm, David Han, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 GA3T 数据集通过地面和空中平台的多模态数据融合,提升非结构化环境中的地形可 traversability 估计与协同场景理解能力。

Comments For DARS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06010 2026-05-08 cs.CV cs.AI 62%

Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models

通过蒸馏扩散模型在实时中增强视觉系统热感知

Yuchen Guo, Junli Gong, Wenjun Dong, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FusionProxy模块,通过蒸馏扩散模型实现实时热感知融合,提升静态识别和动态任务鲁棒性,适用于边缘部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05216 2026-05-08 cs.LG 50%

SAT: Sequential Agent Tuning for Coordinator Free Plug and Play Multi-LLM Training with Monotonic Improvement Guarantees

SAT: 为无协调自由插拔多LLM训练的单调改进保证的序列代理调优

Yi Xie, Yangyang Xu, Yi Fan, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Tucson, Arizona USA Department of Mathematical Sciences, Rensselaer Polytechnic Institute Troy, New York USA Amazon Web Services New York USA Department of Electrical \& Computer Engineering, University of Arizona Department of Mathematical Sciences, Rensselaer Polytechnic Institute Amazon Web Services

专题命中 感知 :occupancy(abstract)

AI总结 本文提出SAT方法,通过因子化策略和块坐标更新实现无协调的分布式训练,保证训练过程单调改进和插拔不变性,实验表明其在AIME24/25基准上性能优于Qwen3-32B。

Comments Published at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2605.05664 2026-05-08 cs.CV 57%

Sparse-to-Complete: From Sparse Image Captures to Complete 3D Scenes

稀疏到完整:从稀疏图像捕获到完整3D场景

Yiyang Shen, Yin Yang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) University of Utah(犹他大学) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

专题命中 规划控制 :trajectory planning(abstract);分类 cs.CV

AI总结 本文提出S2C-3D框架,通过六到八张图像实现高保真完整场景重建,结合专用扩散模型、视图一致性条件采样和相机轨迹规划,提升3D重建质量与鲁棒性。

Journal ref SIGGRAPH 2026 Conf. Proc

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 4 篇

2605.05960 2026-05-08 cs.RO 70%

Plug-and-Play Label Map Diffusion for Universal Goal-Oriented Navigation

即插即用标签地图扩散用于通用目标导向导航

Zhixuan Shen, Yijie Zeng, Shengxiang Luo, Tianrui Li, Haonan Luo

机构 * School of Computing and Artificial Intelligence(计算与人工智能学院)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出PLMD方法,通过扩散模型生成未知区域的障碍和语义标签,实现部分观测环境下的目标定位,同时提升导航策略的语义地图整合能力,实验表明其在三个目标导向导航任务中表现优异。

Comments 21 pages, 10 figures, Extended Version of accepted ICML 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17980 2026-05-08 cs.CV 70%

Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding

感知空间:面向高效准确3D场景理解的自我运动感知视频表示

Shuyao Shi, Kang G. Shin

机构 * Department of Computer Science(计算机科学系) University of Michigan(密歇根大学) University of Michigan Ann Arbor(密歇根大学安阿伯分校)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Motion-MLLM框架,结合IMU数据与视觉特征,通过运动-视觉关键帧过滤模块和异构跨模态融合模块,提升3D场景理解与空间推理的效率和准确性。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06529 2026-05-08 cs.AI cs.LG 57%

Market-Alignment Risk in Pricing Agents: Trace Diagnostics and Trace-Prior RL under Hidden Competitor State

定价代理中的市场对齐风险:轨迹诊断与隐藏竞争状态下的轨迹先验强化学习

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI 实验室)

专题命中 BEV与占用 :occupancy(abstract);分类 cs.AI

AI总结 本文研究了在部分可观测环境下,定价代理因无法观测竞争者状态导致的市场对齐失败,提出轨迹先验强化学习方法以修复此类问题。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01505 2026-05-08 cs.LG stat.ML 50%

Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum

单时间尺度Actor-Critic的最优样本复杂度

Navdeep Kumar, Tehila Dahan, Lior Cohen, Ananyabrata Barua, Giorgia Ramponi, Kfir Yehuda Levy, Shie Mannor

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出单时间尺度Actor-Critic算法在无限时间折扣马尔可夫决策过程中的最优样本复杂度为O(ε^{-2}),通过STORM算法减少方差并结合缓冲机制提升稳定性。

Comments Following further internal verification, we identified foundational issues in the analytical framework, including unresolved problems in the treatment of nonstationary sampling and parts of the coupled convergence analysis under the stated assumptions. Addressing these issues requires a substantial overhaul of the theoretical framework beyond a standard revision

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 2 篇

2605.05897 2026-05-08 cs.RO 91%

Generating Roadside LiDAR Datasets from Vehicle-Side Datasets via Novel View Synthesis

通过新颖视角合成从车辆侧数据生成道路侧LiDAR数据集

Yuhan Xia, Runxin Zhao, Hanyang Zhuang, Chunxiang Wang, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai 200240, China(自动化与智能感知学院,上海交通大学,上海200240,中国) Key Laboratory of System Control and Information Processing, Ministry of Education of China, Shanghai 200240, China(系统控制与信息处理重点实验室,中华人民共和国教育部,上海200240,中国) Global College, Shanghai Jiao Tong University, Shanghai 200240, China(全球学院,上海交通大学,上海200240,中国)

专题命中 激光雷达 :LiDAR(title,title_cn);occupancy(abstract);分类 cs.RO

AI总结 本文提出VRS框架,通过LiDAR新颖视角合成从车辆侧数据生成标注道路侧LiDAR数据集,缓解车辆到道路域差距,提升道路侧感知模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06409 2026-05-08 cs.CV 83%

LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation

LiCamPose:结合多视角LiDAR和RGB相机实现鲁棒的单帧3D人体姿态估计

Zhiyu Pan, Zhicheng Zhong, Wenxuan Guo, Yifan Chen, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, BNRist, Tsinghua University, China(自动化系、北京人工智能研究院、清华大学、中国)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 本文提出LiCamPose,结合多视角RGB和稀疏点云数据,通过单帧实现鲁棒的3D人体姿态估计,并设计了合成数据生成器和无监督域适应策略,验证了方法在多种数据集上的泛化能力。

Comments Accepted by WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他自动驾驶 1 篇

2605.05843 2026-05-08 cs.NI cs.SY eess.SY 50%

Comparative Analysis of Direct-to-Cell (D2C) and 3GPP Non-Terrestrial Networks (NTN) for Global Connectivity

直接到终端(D2C)与3GPP非地面网络(NTN)的比较分析:为全球连接性服务

Donglin Wang, Anjie Qiu, Qiuheng Zhou, Hans D. Schotten

专题命中 其他自动驾驶 :autonomous driving(abstract)

AI总结 本文比较了D2C和3GPP NTN两种架构,分析其标准化、网络架构、物理层创新及安全性和运营权衡,指出NTN在性能、安全性和扩展性上优于D2C,适合6G卫星-地面融合。

Comments 7 pages, 2 figures, IEEE VTC fall 2026

详情

展开后加载摘要…

URL PDF HTML 收藏