UniVision: A Unified Framework for Vision-Centric 3D Perception
专题命中 感知 :autonomous driving(abstract);BEV(abstract);LiDAR(abstract);occupancy(abstract)
视觉与机器人
自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。
专题命中 感知 :autonomous driving(abstract);BEV(abstract);LiDAR(abstract);occupancy(abstract)
专题命中 感知 :autonomous driving(abstract);BEV(abstract);LiDAR(abstract);occupancy(abstract)
Comments Accepted by WACV 2024
多模型方法用于自动驾驶:对交通标志、车辆和车道检测及行为克隆的综合研究
专题命中 感知 :autonomous driving(title);self-driving(abstract);分类 cs.CV、cs.AI
AI总结 本文提出多模型方法,通过预训练和定制神经网络提升自动驾驶中的交通标志、车辆和车道检测及行为克隆性能。
Comments 35 pages, 40 figures
FedS2R: 面向自动驾驶中合成到真实语义分割的一次性联邦域泛化
机构 * Computer Vision Center (CVC) Univ. Autònoma de Barcelona (UAB) Barcelona, Spain(计算机视觉中心(CVC)巴塞罗那自治大学(UAB)巴塞罗那,西班牙)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 提出FedS2R框架,通过不一致性驱动的数据增强和多客户端知识蒸馏,实现自动驾驶中合成到真实语义分割的一次性联邦域泛化,在五个真实数据集上性能接近集中式训练。
Comments Accepted by IEEE Intelligent Vehicles Symposium (IV) 2026
EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解
机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) ; Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) ; Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。
Comments 36 Pages, Accepted at ECCV 2026
压缩验证瓶颈:用于科学发现的智能自动驾驶实验室
专题命中 感知 :self-driving(title,abstract);分类 cs.RO、cs.AI
AI总结 针对智能科学发现中自动驾驶实验室的验证瓶颈,提出先验感知的智能实验设计循环和成本感知代理,通过利用领域知识和预测测量,减少实验循环次数和每次实验成本来加速实验循环。
Comments Accepted at ICML 2026 AI for Science Workshop ; AI Scientist Competition
UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架
机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom ; organization= SpaceTimeLab, Department of Civil, Environmental ; Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom ; organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China ; organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom ; organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom ; organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。
自动驾驶应用中相对位姿估计的高效最小求解器
机构 * College of Aerospace Science and Engineering, Naval Aviation University(海军航空大学航空航天科学与工程学院)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.CV
AI总结 提出基于新平移参数化和一阶旋转近似的统一框架,设计三种最小求解器(利用IMU垂直方向、转向旋转轴方向、平面运动假设),减少点对应数量和代数复杂度,在RANSAC中加速假设生成,平衡速度与精度。
驯服感知抖动:面向可靠运动分类的不确定性感知激光雷达目标检测
机构 * Technical University of Munich(慕尼黑工业大学) ; Institute for Automotive Engineering, Munich Institute of Robotics and Machine Intelligence, School of Engineering and Design(汽车工程研究所,慕尼黑机器人与机器智能研究所,工程与设计学院)
专题命中 感知 :LiDAR(title);autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 提出一种部署友好的策略,通过不确定性估计和统计检验减少静态物体的虚假动态预测,在真实驾驶中显著降低误报和不必要停车。
Drive-KD:自动驾驶中用于视觉语言模型的多教师知识蒸馏
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出Drive-KD框架,通过将自动驾驶分解为感知-推理-规划三元组,并利用知识蒸馏转移能力,构建了专用教师模型,并通过异构梯度投影缓解跨能力梯度冲突,验证了方法在不同模型家族和规模上的泛化能力,展示了蒸馏模型在自动驾驶任务中的优越性能。
Comments Preprint. 23 pages, 14 figures
SkyShield:占用作为低空无人机自主飞行的安全接口
机构 * Xiamen University(厦门大学) ; Jiangxi Academy of Sciences(江西省科学院)
专题命中 感知 :occupancy(title,abstract);分类 cs.CV、cs.AI
AI总结 针对低空无人机自主飞行中的三维空间理解问题,提出首个前视单目语义占用基准SkyShield、动态感知度量KAR-mIoU和几何优先基线SkyOcc,将占用作为安全接口。
从片段到场景:自动驾驶中基于视觉语言模型的时间理解
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Washington(华盛顿大学) ; University of Southern California(南加州大学)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。
Invascal: 面向不确定性感知激光雷达距离视图语义分割的逆空性自校准
机构 * Faculty of Engineering and Computer Science, University of Applied Sciences Aschaffenburg(工程与计算机科学学院,阿施费尔德应用科学大学)
专题命中 感知 :LiDAR(title,abstract);分类 cs.RO、eess.IV
AI总结 提出一种与架构无关的不确定性感知适配器头,通过偏好头和强度头分解预测,并设计逆空性自校准目标(Invascal)来监督强度信号,实现可靠且校准良好的不确定性估计,同时保持分割精度。
Comments Accepted for publication at the 2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC)
CityGen: 结构引导的城市风格合成用于跨城市自动驾驶
机构 * Jiangsu Cytoderm Intelligent Technology Co., Ltd., China(江苏细胞膜智能科技有限公司,中国) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学,中国) ; Tsinghua University, Beijing, China(清华大学,中国) ; University of Science and Technology of China, Hefei, China(中国科学技术大学,中国)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 提出CityGen,一种基于扩散模型的生成框架,通过高清地图条件和城市级视觉提示实现零标签城市适应,提升跨城市自动驾驶在感知、分割和规划任务上的鲁棒性。
E3AD:面向以人为中心的端到端自动驾驶的情感感知视觉-语言-动作模型
机构 * McGill University(麦吉尔大学) ; University of Macau(澳门大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 提出E3AD框架,通过连续VAD情感模型和双路径空间推理模块,将情感理解融入视觉-语言-动作模型,实现开放域端到端自动驾驶中的情感感知轨迹规划,在真实数据集上达到SOTA性能。
SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用
机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) ; National Science and Major Project(国家科学技术重大专项)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.AI
AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。
Comments 7 pages, 4 figures, accepted by IJCNN 2026
SAM增强的道路数据集分割:自动驾驶中关键类别的平衡
机构 * Department of Mechanical and Industrial Engineering, Tallinn University of Technology(塔林技术大学机械与工业工程系) ; FinEst Centre for Smart Cities, Tallinn University of Technology(塔林技术大学智能城市研究中心) ; Department of Computer Science and Engineering, Universitas Mercatorum(默卡托姆大学计算机科学与工程系) ; Department of Computer Science and Engineering, Chalmers University of Technology(挑战者技术大学计算机科学与工程系) ; University of Gothenburg(哥德堡大学)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.CV
AI总结 提出基于SAM的标注流水线,将ZOD数据集的边界框转换为密集像素级语义掩码,并评估不同架构在类别不平衡下的性能,通过双向迁移学习实现跨传感器配置的有效迁移。
SafeAlign-VLA: 一种增强负样本的安全对齐框架用于风险感知的自动驾驶
机构 * College of Transportation, Tongji University(同济大学交通运输学院) ; Department of Civil Engineering, Tsinghua University(清华大学土木工程系) ; School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) ; Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出SafeAlign-VLA框架,通过整合负样本数据提升自动驾驶系统对安全边界的理解,通过生成安全标签和反事实轨迹,结合两阶段训练策略和基于锚点的群体相对策略优化,提高了自动驾驶的安全性和鲁棒性。
VLM-AutoDrive: 事后训练视觉-语言模型用于安全关键的自动驾驶事件
机构 * NVIDIA
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLM-AutoDrive框架,通过整合元数据生成的描述、LLM生成的描述、视觉问答对和推理监督,提升预训练视觉语言模型在安全关键自动驾驶事件中的检测性能。
Comments 16 pages, 9 figures, submitted to arXiv
VLADriver-RAG:基于检索增强的视觉-语言-动作模型用于自动驾驶
机构 * College of Automotive Engineering(汽车工程学院) ; The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室) ; ReeFocus AI Technology(ReeFocus人工智能技术)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出VLADriver-RAG,通过构建结构化的历史知识,提升自动驾驶中长尾场景的泛化能力,采用视觉到场景机制和场景对齐嵌入模型,结合查询驱动的VLA骨干网络,实现高精度轨迹合成。
基于多尺度光谱注意力模块的自动驾驶场景高光谱分割
机构 * School of Engineering, University of Galway, Ireland(Galway大学工程学院,爱尔兰) ; Ryan Institute, University of Galway, Ireland(Galway大学Ryan研究所,爱尔兰) ; Valeo Vision Systems, Tuam, Ireland(爱尔兰Tuam市Valeo Vision Systems公司)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出多尺度注意力机制提升高光谱图像分割性能,通过不同核尺寸的1D卷积和自适应特征聚合,在多个城市驾驶场景数据集中提升mIoU和mF1指标,证明了最优核组合的dataset特异性。
OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶
机构 * ShanghaiTech University(上海科技大学) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; Shanghai Jiao Tong University(上海交通大学) ; MEGVII Technology(美科维七科技) ; AFARI
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。
ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Carizon ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 针对自动驾驶中多视角相机和多帧视频输入的计算开销问题,ST-Prune提出无训练的时空令牌修剪框架,通过MTP和RSP模块有效压缩时空冗余,实现90%令牌减少下的近无损性能。
Comments 18 pages, 4 figures
AD4AD:为更安全的自动驾驶基准测试视觉异常检测模型
机构 * University of Padova(帕多瓦大学)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文通过AnoVox数据集评估了八种先进的视觉异常检测方法,发现Tiny-Dinomaly在边缘部署中实现了最佳的准确率与效率平衡,显著降低内存成本。
面向多类车辆的自适应协作感知用于V2X系统中的激光雷达三维物体检测
专题命中 感知 :LiDAR(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种自适应协作感知架构,通过多尺度窗口注意力、类特定融合模块、鸟瞰图增强和类平衡目标加权,提升多类三维物体检测性能,实验显示在V2X-Real基准上,该方法在卡车、行人和汽车检测中均表现优异。
Comments 16 pages, 7 figures, 4 tables
SearchAD:大规模稀有图像检索数据集用于自动驾驶
机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ; Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。
Comments To be published in CVPR 2026
基于深度神经网络的自动驾驶道路施工检测
专题命中 感知 :autonomous driving(title);LiDAR(abstract);分类 cs.RO、cs.CV
AI总结 本文提出一种实时系统,结合YOLO网络和LiDAR数据,用于自动驾驶车辆检测并定位道路施工区域,提升施工区域导航安全性。
Comments 7 pages, 10 figures
UniDriveVLA: 联合理解、感知与行动规划以实现自动驾驶
机构 * Huazhong University of Science and Technology(华中科技大学) ; SKL-IOTSC, University of Macau(澳门大学智慧城市物联网国家重点实验室)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO、cs.CV
AI总结 UniDriveVLA通过专家解耦和三阶段训练策略,解决自动驾驶中感知与推理的冲突,实现空间感知与语义推理的统一,取得nuScenes和Bench2Drive的优异性能。
Comments code has been released at https://github.com/xiaomi-research/unidrivevla
一种用于光照不变TIR-LiDAR人体跟踪的双流Transformer架构
机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究科)
专题命中 感知 :LiDAR(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出一种双流Transformer架构,利用LiDAR和TIR摄像头实现全天候鲁棒的人体跟踪,通过知识迁移策略提升性能,实验显示在AO和SR指标上优于传统方法。
Comments 6 pages, 4 figures, technical report
高效多专家模型用于基于视频的驾驶员状态和生理多任务估计在条件自动驾驶中
机构 * the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Hong Kong(香港大学)
专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出VDMoE模型,通过RGB视频和远程PPG数据监测驾驶员状态,优化多专家框架以提升多模态输入下的检测效率与准确性,通过新数据集验证其在条件自动驾驶中的有效性。