arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-07-03 至 2026-07-03 共收录 13 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 4 篇

2607.00736 2026-07-03 cs.CV 新提交 79%

Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation

迈向鲁棒的驾驶感知:用于自监督单目深度估计的灵活尺度驱动系列

Zhaowen Zhu, Li Zhang, Yujie Chen, Tian Zhang, Yingjie Wang, Mingxia Zhan

机构 * Hefei University of Technology(合肥工业大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Chengpin Home Tech(橙品家居科技) Differential Robotics(差分机器人)

专题命中 感知 :driving perception(title,abstract);分类 cs.CV

AI总结 提出FlexDepth,一种尺度驱动的自监督单目深度估计模型系列,通过两阶段静态-动态解耦训练和尺度驱动解码器,在复杂驾驶场景中实现高精度深度估计,且计算开销低。

Comments Accepted by ECCV2026. Code is available at https://github.com/startnew/flexdepth

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01827 2026-07-03 cs.CV 新提交 77%

C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation

C2E: 通过多教师对比知识蒸馏提升仅自我3D目标检测

Jinlong Wang, Xun Huang, Qiming Xia, Shijia Zhao, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建省城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算教育部重点实验室,厦门大学) Zhongguancun Academy(中关村学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV

AI总结 提出C2E范式,通过多对一智能体对比知识蒸馏框架M2S,结合多级特征增强、辅助点云重建和多教师对比蒸馏,在无通信成本下提升仅自我3D检测性能,在多个数据集上验证有效性。

Comments 18 pages, 8figures

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02494 2026-07-03 cs.CV cs.CL 新提交 57%

Towards Robustness against Typographic Attack with Training-free Concept Localization

基于训练无关的概念定位实现对抗印刷体攻击的鲁棒性

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种无需训练的可解释性方法,通过分析注意力头对词汇和语义的编码差异,定位并干预ViT中的词汇偏置电路,从而在不额外训练的情况下显著提升对印刷体攻击的鲁棒性。

Comments 15 pages main text, provisionally accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01370 2026-07-03 cs.CV 新提交 57%

MapDreamer: Aerial Imagery Conditioned Latent Diffusion for Lane-Level Map Generation

MapDreamer: 基于航空影像条件潜扩散的车道级地图生成

Julian Brandes, Philipp Crocoll, Wolfram Burgard

机构 * Department CSAI at University of Technology Nuremberg(纽伦堡工业大学CSAI系) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出MapDreamer,一种从单张航空影像直接生成带显式拓扑的车道级矢量地图的生成扩散模型,通过变分自编码器学习车道中心线及其拓扑的紧凑潜表示,并利用基于Transformer的潜扩散模型预测图结构,在几何和拓扑保真度上优于非生成基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2607.01454 2026-07-03 cs.RO 新提交 57%

SE(2) Navigation Mesh

SE(2)导航网格

Shuyang Shi, Kaixian Qu, Changan Chen, Ines Kast, Yuntao Ma, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 规划控制 :occupancy(abstract);分类 cs.RO

AI总结 提出SE(2)导航网格,通过编码偏航依赖的可通行性,支持非圆形机器人在复杂多层环境中的高效路径规划,并开发了A*-拉绳-A*分层路径搜索策略。

Comments Project page: https://se2-navmesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 3 篇

2607.01928 2026-07-03 cs.CV 新提交 79%

Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction

稀疏感知向量量化用于带宽高效的协作3D语义占据预测

Feng Li, Chaokun Zhang, Gong Chen

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Cybersecurity, Tianjin University(天津大学网络空间安全学院)

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV

AI总结 提出稀疏感知向量量化(SAVQ)机制,利用3D场景稀疏性压缩编码信息区域,大幅降低通信开销同时保持几何完整性,并设计双分支自适应空间细化模块增强结构一致性,实现高达82倍通信量减少。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01633 2026-07-03 cs.CV 新提交 79%

Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images

桥接3D高斯与语义占据:从无位姿图像实现开放词汇的全面场景理解

Hu Zhu, Bohan Li, Xianda Guo, Yanlun Peng, Zheng Zhu, Xin Jin, Wenjun Zeng, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Tsinghua University(清华大学) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工大学宁波数字孪生研究院)

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV

AI总结 提出COVScene框架,通过可微体积提升将可渲染高斯原语与密集语义占据场耦合,实现无位姿图像下的新颖视图合成、开放词汇语义查询和语义占据预测。

Comments Hu Zhu, Bohan Li, and Xianda Guo contributed equally. Corresponding author: Wenjun Zeng

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02219 2026-07-03 cond-mat.mtrl-sci cond-mat.dis-nn cond-mat.stat-mech 新提交 50%

Differentiable inverse design of short-range order in high-entropy alloys: from target sro to target property

高熵合金中短程有序的可微逆设计:从目标SRO到目标性能

Tiancheng Ding, Conrard Giresse Tetsassi Feugmo

专题命中 BEV与占用 :occupancy(abstract)

AI总结 提出基于梯度下降的可微逆设计方法,将原子占据视为连续变量,结合物理修正项和神经网络,实现从目标短程有序到目标力学性能的端到端优化,在4000原子系统中速度提升6倍、精度提升8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 1 篇

2607.02074 2026-07-03 cs.CV 新提交 92%

Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving

自动驾驶中基于LiDAR的3D物体检测的全面鲁棒性分析

Adwait Chandorkar, Kai Krink, Yerdana Maulenbay, Hasan Tercan, Tobias Meisen

机构 * Institute for TMDT, University of Wuppertal, Germany(TMDT研究所,乌尔姆大学,德国) IKB Faculty of Science, University of British Columbia, Canada(科学学院,不列颠哥伦比亚大学,加拿大)

专题命中 激光雷达 :LiDAR(title,title_cn);autonomous driving(title);分类 cs.CV

AI总结 针对LiDAR-only 3D物体检测模型对抗鲁棒性研究不足的问题,提出一个综合评估框架,通过结构因子(点云密度、定位)和预测因子(误分类、定位误差、自车距离)分析,发现高容量体素检测器比支柱检测器更易受结构化坐标扰动,非锚点检测器鲁棒性差。

Comments Accepted at ECCV 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多传感器融合 1 篇

2607.01772 2026-07-03 cs.CV eess.SP 新提交 79%

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

LLM赋能的自动驾驶多模态融合框架:语义增强与信道自适应设计

Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui

机构 * National Natural Science Foundation of China(国家自然科学基金) Shenzhen Natural Science Foundation(深圳市自然科学基金) Shenzhen Key Laboratory Evaluation(深圳市重点实验室评估)

专题命中 多传感器融合 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出LM-SCIP框架,以LLM为核心推理中枢,通过信道自适应语义模块动态融合视觉与雷达特征,实现低信噪比下的视觉主导回退和高信噪比下的协同融合,在nuScenes和VIRAT数据集上显著提升定位精度。

Comments 6 pages, 4 figures. Accepted by 2026 IEEE 37th International Symposium on Personal, Indoor and Mobile Radio Communications (PIMRC)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真评测 3 篇

2607.01382 2026-07-03 cs.RO 新提交 79%

CommonRoad-Game: A Human-in-the-Loop Simulation Framework for Autonomous Driving

CommonRoad-Game:面向自动驾驶的人机协同仿真框架

Yunfei Bi, Youran Wang

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO

AI总结 提出CommonRoad-Game轻量级人机协同仿真框架,通过多线程同步机制实现确定性交互,支持运动规划器测试与人类驾驶行为分析。

Comments 15 pages, 18 figures, 2 tables. Source code: https://github.com/Yunfei-Bi8/CommonRoad-Game

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31918 2026-07-03 cs.CV 新提交 79%

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver: 基于点云条件的视频修复用于自动驾驶仿真中的可控车辆插入

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出DriveWeaver框架,通过点云条件视频修复实现自动驾驶仿真中可控车辆插入,解决光照不一致和3D资产依赖问题,支持大规模场景增强。

Comments Accepted at ECCV 2026, Project Page: https://github.com/LogosRoboticsGroup/DriveWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01658 2026-07-03 cs.CV 新提交 57%

Teaching Vision-Language-Action Models What to See and Where to Look

教视觉-语言-动作模型看什么和看哪里

Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao

机构 * School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) DiDi(滴滴出行) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 提出DriveTeach-VLA框架,通过驾驶感知视觉蒸馏和2D轨迹引导提示,教VLA模型关注驾驶相关区域,实现端到端自动驾驶轨迹预测,在NAVSIM和nuScenes上达到最优性能。

Comments The paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏