arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-04-02 至 2026-04-02 共收录 22 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 2 篇

2604.00363 2026-04-02 cs.RO cs.CV 81%

A Dual-Stream Transformer Architecture for Illumination-Invariant TIR-LiDAR Person Tracking

一种用于光照不变TIR-LiDAR人体跟踪的双流Transformer架构

Yuki Minase, Kanji Tanaka

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究科)

专题命中 感知 :LiDAR(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种双流Transformer架构,利用LiDAR和TIR摄像头实现全天候鲁棒的人体跟踪,通过知识迁移策略提升性能,实验显示在AO和SR指标上优于传统方法。

Comments 6 pages, 4 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16483 2026-04-02 cs.CV 70%

Octree Diffusion for Semantic Scene Generation and Completion

八叉树扩散用于语义场景生成与补全

Xujia Zhang, Brendan Crowe, Christoffer Heckman

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Autonomous Robotics and Perception Group(自主机器人与感知实验室)

专题命中 感知 :LiDAR(abstract);occupancy(abstract);分类 cs.CV

AI总结 本文提出Octree Latent Semantic Diffusion框架,通过八叉树隐式表示实现跨域的3D语义场景补全、扩展和生成,结合结构扩散与语义扩散生成语义标签,无需重训练即可完成单扫描的补全与零样本泛化。

Comments Accepted to ICRA 2026. Revised version with updated paragraphs

Journal ref Proceedings of the 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 5 篇

2604.00391 2026-04-02 cs.RO cs.SY eess.SY 74%

Behavioral Score Diffusion: Model-Free Trajectory Planning via Kernel-Based Score Estimation from Data

行为得分扩散:通过核基得分估计实现无模型轨迹规划

Shihao Li, Jiachen Li, Jiamin Xu, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划控制 :trajectory planning(title);分类 cs.RO

AI总结 本文提出行为得分扩散(BSD),通过核加权估计直接从轨迹数据中计算扩散得分函数,无需学习模型或动力学模型,在停车场景中实现高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00343 2026-04-02 cs.RO 57%

Real Time Local Wind Inference for Robust Autonomous Navigation

实时局部风场推断用于稳健自主导航

Spencer Folk

机构 * University of Pennsylvania(宾夕法尼亚大学) NASA Ames Research Center(美国国家航空航天局艾姆斯研究中心)

专题命中 规划控制 :LiDAR(abstract);分类 cs.RO

AI总结 本文通过融合距离测量与稀疏实地风测数据,实现实时风场推断,解决密集城市环境中地形数据的充分性及学习风模型在运动规划中的应用,提升自主导航的能耗效率与避障能力。

Comments PhD Thesis, University of Pennsylvania, 2026. 152 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10441 2026-04-02 cs.RO 57%

KnowDiffuser: A Knowledge-Guided Diffusion Planner with LLM Reasoning

KnowDiffuser: 一种基于知识的扩散规划器与大语言模型推理

Fan Ding, Xuewen Luo, Fengze Yang, Bo Yu, HwaHui Tew, Ganesh Krishnasamy, Junn Yong Loo

机构 * Monash University Malaysia(莫纳什大学马来西亚校区) University of Utah(犹他大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出KnowDiffuser,结合大语言模型的语义理解和扩散模型的生成能力,有效解决自动驾驶中语义到物理的鸿沟问题,实验表明其在开放环和闭环评估中表现优异。

Comments 10pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22514 2026-04-02 eess.SY cs.SY 50%

Robust Multi-Agent Safety via Tube-Based Tightened Exponential Barrier Functions

通过管状紧缩指数屏障函数实现多智能体系统鲁棒安全性

Armel Koulong, Ali Pakniyat

专题命中 规划控制 :trajectory planning(abstract)

AI总结 本文提出一种构造性框架,用于合成非线性多智能体系统在有界扰动下的可证明安全控制器。核心贡献是通过约束紧缩方法将鲁棒误差反馈与名义轨迹规划相结合,利用RPI管的几何特性推导状态依赖的安全余量,从而保证轨迹安全性。

Comments Joint submission to IFAC World Congress 2026 and NAHS journal (Reference: NAHS_101717). Accepted for NAHS journal; under review by World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09744 2026-04-02 cs.MA 50%

Inferring Occluded Agent Behavior in Dynamic Games from Noise Corrupted Observations

从噪声受损观测中推断动态博弈中被遮挡行为

Tianyu Qiu, David Fridovich-Keil

专题命中 规划控制 :autonomous driving(abstract)

AI总结 本文提出一种考虑遮挡的博弈推理方法,用于估计可能被遮挡的智能体位置,并推断可见和被遮挡智能体的意图,同时验证了在噪声观测下的导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 4 篇

2604.00969 2026-04-02 cs.CV 85%

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 端到端驾驶 :autonomous driving(title,abstract);BEV(abstract);occupancy(abstract);分类 cs.CV

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV 84%

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

专题命中 端到端驾驶 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.CV

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24587 2026-04-02 cs.LG cs.RO 79%

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24506 2026-04-02 cs.CV 57%

Toward Physically Consistent Driving Video World Models under Challenging Trajectories

迈向在挑战性轨迹下物理一致的驾驶视频世界模型

Jiawei Zhou, Zhenxin Zhu, Lingyi Du, Linye Lyu, Lijun Zhou, Zhanqian Wu, Hongcheng Luo, Zhuotao Tian, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Yu Li

机构 * Zhejiang University(浙江大学) Xiaomi EV(小米电动汽车) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出PhyGenesis,通过物理条件生成器和物理增强视频生成器,解决挑战性轨迹下视频生成的物理不一致问题,实验表明其在复杂轨迹上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 5 篇

2604.01081 2026-04-02 cs.CV cs.LG cs.RO eess.IV 85%

ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Prediction

ProOOD:基于原型的分布外3D占用预测

Yuheng Zhang, Mengfei Duan, Kunyu Peng, Yuhang Wang, Di Wen, Danda Pani Paudel, Luc Van Gool, Kailun Yang

机构 * Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 BEV与占用 :occupancy(title,abstract);autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 本文提出ProOOD方法,通过原型引导的语义填充和尾部挖掘提升3D占用预测和分布外检测性能,实验表明其在多个数据集上均取得显著改进。

Comments Accepted to CVPR 2026. The source code is publicly available at https://github.com/7uHeng/ProOOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00701 2026-04-02 cs.NI 78%

Birdcast: Interest-aware BEV Multicasting for Infrastructure-assisted Collaborative Perception

Birdcast: 以兴趣为导向的BEV多播用于基础设施辅助的协作感知

Yanan Ma, Zhengru Fang, Yihang Tao, Yu Guo, Yiqin Deng, Xianhao Chen, Yuguang Fang

专题命中 BEV与占用 :BEV(title,abstract)

AI总结 Birdcast提出了一种新的多播框架,通过考虑个体感兴趣的特征图,解决V2I-CP中通信瓶颈和异构信息需求问题,提升系统效用和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01134 2026-04-02 cs.RO cs.DB eess.IV 62%

VRUD: A Drone Dataset for Complex Vehicle-VRU Interactions within Mixed Traffic

VRUD:一种用于复杂车辆-行人交互的无人机数据集

Ziyu Wang, Hongrui Kou, Cheng Wang, Ruochen Li, Hubert P. H. Shum, Amir Atapour-Abarghouei, Yuxin Zhang

机构 * National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与仿生全国重点实验室) DRIVEResearch School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院) Department of Computer Science, Durham University(杜伦大学计算机科学系)

专题命中 BEV与占用 :autonomous driving(abstract);分类 cs.RO、eess.IV

AI总结 本文提出VRUD数据集,用于复杂城市交通环境中的车辆-行人交互研究,包含高精度轨迹数据和多智能体交互场景,填补了现有数据集在无结构城市环境中的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00810 2026-04-02 cs.MA 50%

Role Differentiation in a Coupled Resource Ecology under Multi-Level Selection

群体中多级选择下的角色分化

Siddharth Chaturvedi, Ahmed El-Gazzar, Marcel van Gerven

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文研究了在持续个体级选择下,群体如何通过分化不同资源通道避免公地悲剧,通过计算模型和实验发现,零和通道的使用在世代间增加,角色分化得以维持。

Comments 9 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00028 2026-04-02 cs.AR cs.DC 50%

Sequence-Aware Split Heuristic to Mitigate SM Underutilization in FlashAttention-3 Low-Head-Count Decoding

基于序列意识的分割启发式方法以缓解FlashAttention-3在低头数解码中的SM不足

Martí Llopart Font, Javier Hernando, Cristina España-Bonet

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出一种序列感知的分割策略,通过在低头数情况下实现序列级并行,提升硬件利用率,从而在元数据启用的推理路径中提高解码内核效率约21-24%。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 2 篇

2604.00371 2026-04-02 cs.CV 85%

Neural Reconstruction of LiDAR Point Clouds under Jamming Attacks via Full-Waveform Representation and Simultaneous Laser Sensing

通过全波形表示和同时激光感知实现对抗攻击下的LiDAR点云神经重建

Ryo Yoshida, Takami Sato, Wenlun Zhang, Yuki Hayakawa, Shota Nagai, Takahiro Kado, Taro Beppu, Ibuki Fujioka, Yunshan Zhong, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Sony Semiconductor Solutions(索尼半导体解决方案公司) Hainan University(海南大学)

专题命中 激光雷达 :LiDAR(title,abstract);autonomous driving(abstract);driving perception(abstract);分类 cs.CV

AI总结 本文提出PULSAR-Net,利用全波形表示和同时激光感知,在对抗攻击下重建真实点云,通过轴向空间注意力机制识别攻击信号,实验显示其在静态和驾驶场景中对车辆的重建率分别达92%和73%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多传感器融合 2 篇

2603.24327 2026-04-02 cs.CV 57%

Le MuMo JEPA: Multi-Modal Self-Supervised Representation Learning with Learnable Fusion Tokens

Le MuMo JEPA:多模态自监督表示学习中的可学习融合标记

Ciem Cornelissen, Sam Leroux, Pieter Simoens

机构 * IDLab, Department of Information Technology, Ghent University - imec(根特大学-imec信息技术系IDLab)

专题命中 多传感器融合 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出Le MuMo JEPA框架,通过学习融合标记实现多模态统一表示学习,实验显示其在性能与效率之间取得最佳平衡,尤其在CenterNet检测和密集深度估计中表现优异。

Comments 14 pages, 4 figures, supplementary material. Accepted at the CVPR 2026 Workshop on Unified Robotic Vision with Cross-Modal Sensing and Alignment (URVIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00583 2026-04-02 eess.SP cs.IT math.IT 50%

SAR/ISAR Imaging in 6G Network

SAR/ISAR成像在6G网络中的应用

Yanmo Hu, Shuowen Zhang, Ross Murch, Liang Liu

专题命中 多传感器融合 :autonomous driving(abstract)

AI总结 本文提出两种高分辨率无线电成像方案,利用多普勒信息实现6G网络下的成像,无需范围估计,解决了带宽限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他自动驾驶 2 篇

2604.00069 2026-04-02 cs.LG cond-mat.mtrl-sci cs.AI 57%

Perspective: Towards sustainable exploration of chemical spaces with machine learning

视角:利用机器学习实现可持续的化学空间探索

Leonardo Medrano Sandonas, David Balcells, Anton Bochkarev, Jacqueline M. Cole, Volker L. Deringer, Werner Dobrautz, Adrian Ehrenhofer, Thorben Frank, Pascal Friederich, Rico Friedrich, Janine George, Luca Ghiringhelli, Alejandra Hinostroza Caldas, Veronika Juraskova, Hannes Kneiding, Yury Lysogorskiy, Johannes T. Margraf, Hanna Türk, Anatole von Lilienfeld, Milica Todorović, Alexandre Tkatchenko, Mariana Rossi, Gianaurelio Cuniberti

专题命中 其他自动驾驶 :self-driving(abstract);分类 cs.AI

AI总结 本文探讨了利用机器学习在化学空间中实现可持续探索的关键挑战与策略,包括通用机器学习模型、多保真度方法和物理约束整合,以提升效率和资源利用率。

Comments 44 pages, 8 figures, SusML workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 57%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 其他自动驾驶 :autonomous driving(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏