arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-08-06 至 2026-08-06 共收录 19 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6 篇

2608.04568 2026-08-06 cs.CV 新提交 85%

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Talk2Sensors:基于传感器自适应物理线索匹配的自动驾驶3D视觉 grounding

Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) MMLab, CUHK(香港中文大学MMLab) School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通科学与工程学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Intelligent Manufacturing and Smart Transportation, Suzhou City University(苏州城市学院智能制造与智能交通学院) Qingdao University of Science and Technology(青岛科技大学) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 感知 :autonomous driving(title,abstract);LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有室外3D视觉 grounding 未充分利用多传感器互补物理属性的问题,提出首个多传感器数据集Talk2Sensors及TSFormer框架,在相关基准上实现了最优性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17430 2026-08-06 cs.RO 版本更新 70%

SafeLand: Safe Autonomous Landing in Unknown Environments with Bayesian Semantic Mapping

SafeLand: 在未知环境中使用贝叶斯语义映射实现安全自主着陆

Markus Gross, Andreas Greiner, Sai Bharadhwaj Matha, Felix Soest, Daniel Cremers, Henri Meeß

机构 * Fraunhofer IVI Autonomous Aerial Systems(弗劳恩霍夫IVI自主航空系统) TU Munich Computer Vision Group(慕尼黑工业大学计算机视觉组) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出SafeLand系统,通过深度学习语义分割构建在线语义地面地图,结合贝叶斯概率过滤和行为树实现安全自主着陆,通过200次模拟和60次实地测试,展示零误报的人类检测率和亚秒响应延迟。

Journal ref ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04865 2026-08-06 cs.CV 新提交 57%

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

超越帧的烹饪:厨房中的立体事件相机数据集

Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen

机构 * Delft University of Technology(代尔夫特理工大学) STMicroelectronics(意法半导体)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文推出EventKitchen数据集,以第一人称视角从10名参与者在13个厨房中收集5.5小时的烹饪相关多传感器数据,训练基线模型完成动作识别等任务,为神经形态视觉提供新基准。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 57%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04852 2026-08-06 cs.ET 新提交 50%

Toward Blockage-Resilient 6G-V2X Connectivity: Semi-Distributed Bandit with Dynamic Arm Set for mmWave HetNets

面向抗阻塞的6G车万物联网(V2X)连接:面向毫米波异构车联网的具有动态臂集的半分布式多臂老虎机算法

Weiqi Chi, Bo Qian, Hanlin Wu, Donghui Li, Haibo Zhou, Manabu Tsukada

专题命中 感知 :autonomous driving(abstract)

AI总结 针对毫米波异构车联网的阻塞与信道波动问题,提出BAND及半分布式S-BAND算法,结合TAK区域与KIF度量,在10%-50%阻塞率下较集中式MAB基线实现34.9%-59.4%的遗憾降低,TAK区域性能优于K-means聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04068 2026-08-06 cs.IT eess.SP math.IT 新提交 50%

Tail-Calibrated Soft-Output GRAND for Finite-Memory Noise-Effect Posteriors

面向有限记忆噪声效应后验的尾端校准软输出GRAND

Behrooz Razeghi

专题命中 感知 :occupancy(abstract)

AI总结 针对有限记忆噪声效应后验,提出尾端校准软输出GRAND算法,实现后验权重等估计并给出相关理论界,可提供逐块APP估计等解码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 2 篇

2605.14832 2026-08-06 cs.RO cs.CV 版本更新 86%

Learning Direct Control Policies with Flow Matching for Autonomous Driving

通过流匹配学习自动驾驶的直接控制策略

Marcello Ceresini, Federico Pirazzoli, Andrea Bertogalli, Lorenzo Cipelli, Filippo D'Addeo, Anthony Dell'Eva, Alessandro Paolo Capasso, Alberto Broggi

机构 * Università degli Studi di Parma(帕尔马大学) Alma Mater Studiorum - Università di Bologna(博洛尼亚大学) VisLab (an Ambarella Inc. company)(VisLab(安柏莱拉公司))

专题命中 规划控制 :autonomous driving(title,abstract);BEV(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出一种基于流匹配的自动驾驶规划器,直接输出由加速度和曲率剖面定义的可控轨迹,通过鸟瞰图栅格输入,在少量常微分方程积分步骤中生成控制序列,实现低延迟推理。在真实城市场景上训练并在多车道高速公路等新环境中评估,证明模型能可靠泛化。

Comments 16 pages, 6 figures, 2 tables. Accepted for oral presentation at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04670 2026-08-06 cs.HC 版本更新 50%

Who Responds When the Driver Is Gone? A Framework for Holistic Passenger Intent Understanding

当驾驶员离开时谁来做出反应?一种人类意图理解框架

Xuewen Luo, Ding Fan, Ruiqi Chen, Ye Cao, Xiujin Liu, Bo Yu, Fengze Yang, Chenxi Liu

专题命中 规划控制 :autonomous driving(abstract)

AI总结 研究无人驾驶时谁理解并回应乘客,提出Intent2Drive框架,将意图建模为潜在认知状态,构建数据集和推理器,引入分层规划器,提升意图推理等能力,迈向响应乘客的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 1 篇

2606.10804 2026-08-06 cs.CV 版本更新 57%

SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning

SCAIL-2:通过端到端上下文条件统一受控角色动画

Wenhao Yan, Fengjia Guo, Zhuoyi Yang, Jie Tang

机构 * Z.ai Tsinghua University(清华大学)

专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.CV

AI总结 提出SCAIL-2框架,通过端到端上下文条件统一受控角色动画,绕过中间表示直接利用驱动视频,并合成MotionPair-60K数据集,采用上下文掩码和模式RoPE实现统一,结合Bias-Aware DPO减少误差,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 3 篇

2506.18266 2026-08-06 cs.CV 版本更新 79%

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04642 2026-08-06 cs.CV 新提交 70%

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI

YOLO-PVC:用于MRI中体积肝肿瘤定位的切片式检测的2D到3D整合方法

Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune

机构 * ESME Research Lab(ESME研究实验室) Université Paris-Est Créteil(巴黎东部克雷泰伊大学) LRE EPITA(EPITA LRE实验室) Institute of Space Technology(空间技术研究所) Henri Mondor University Hospital(亨利·蒙多大学医院)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 针对切片式2D目标检测器在体积数据中预测碎片化不稳定的问题,提出YOLO-PVC框架,通过几何整合提升肝脏肿瘤定位的3D IoU至0.710,优于多种基线方法。

Comments 14 pages, 2 figures, 4 tables. Accepted at AI4M3D Workshop, ECCV 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04453 2026-08-06 cs.CV cs.AI 新提交 62%

TwinIR: Coordinated Invisible Dual-Point Attacks on Online HD Map Construction

TwinIR:针对在线高清地图构建的协同式不可见双点攻击

Haibo Hu, Jianghuai Deng, Chen Tang, Yang Lou, Qian Xu, Jianping Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 BEV与占用 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对在线HD地图构建的跨边界补偿效应,提出TwinIR攻击方法,通过优化攻击点实现低感知性的有效攻击,可显著降低地图构建精度并影响自动驾驶决策。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 5 篇

2603.07741 2026-08-06 physics.optics 89%

Continuous-streaming high-speed two-photon dual-comb LiDAR with free-running lasers

连续流高-speed双光子双梳LiDAR

Benjamin H. Forman, Hollie Wright, Hanna Ostapenko, Derryck T. Reid

专题命中 激光雷达 :LiDAR(title,title_cn)

AI总结 利用自由运行激光器实现高速低数据负担的双光子双梳LiDAR距离计量,精度达1微米,适用于工业应用。

Comments Submitted for publication. In peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04004 2026-08-06 cs.RO 版本更新 79%

Gaussian-LIC2: LiDAR-Inertial-Camera Gaussian Splatting SLAM

Gaussian-LIC2:激光雷达-惯性-相机高斯溅射SLAM

Xiaolei Lang, Jiajun Lv, Kai Tang, Laijian Li, Jianxin Huang, Lina Liu, Yong Liu, Xingxing Zuo

机构 * Institute of Cyber-Systems and Control(控制系统研究所) Zhejiang University(浙江大学) Department of Robotics(机器人系) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈罗德·本·扎耶德人工智能大学)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO

AI总结 本文提出首个兼顾视觉质量、几何精度与实时性的激光雷达-惯性-相机高斯溅射SLAM系统,引入零样本深度补全与CUDA加速策略,构建专用数据集,可实现高质量新视角渲染及下游应用。

Comments Accepted by IJRR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12729 2026-08-06 physics.optics 78%

Two-photon dual-comb LiDAR imaging

双光子双梳激光雷达成像

Alexander J. M. Nelmes, Simon Fletcher, Andrew Longstaff, Jake M. Charsley, Hollie Wright, Derryck T. Reid

专题命中 激光雷达 :LiDAR(title,abstract)

AI总结 本文提出一种基于双光子双梳测距的激光雷达成像方法,利用皮秒级激光脉冲飞行时间实现厘米级点云数据集,具有微米级精度和高精度测量能力,适用于光学质量差的不连续表面。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 70%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29097 2026-08-06 cs.CV 版本更新 70%

GeRaF: Neural Geometry Reconstruction from Radio Frequency Signals

GeRaF: 从射频信号进行神经几何重建

Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出GeRaF方法,利用神经隐式学习从射频信号重建近距3D几何,通过滤波渲染、物理射频体渲染和无透镜采样策略解决低分辨率、噪声和镜面反射问题。

Comments Accepted at NeurIPS 2025 (Spotlight)

Journal ref Advances in Neural Information Processing Systems 38 (2026): 94200-94230

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多传感器融合 1 篇

2608.04130 2026-08-06 cs.CV 新提交 70%

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理

Jiaju Han, Xuemeng Sun, Qike Zhang, Xiang Chen, Luwei Yang, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 多传感器融合 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 仿真评测 1 篇

2607.13028 2026-08-06 cs.LG cs.AI cs.RO 版本更新 62%

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

TerraZero:用于大规模零演示自博弈的过程式驾驶模拟

Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Saeed Bonab, Tim Wang, Wei Zhan

机构 * Applied Intuition(应用直觉)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在训练强大自动驾驶智能体,提出TerraZero过程式驾驶模拟器和自博弈训练堆栈,其速度快、逼真且多样。通过特定方式填充地图生成无限场景,智能体仅靠强化学习训练,能零样本泛化,在多个基准测试中表现出色。

Comments Technical Report from Applied Intuition Research

详情

展开后加载摘要…

URL PDF HTML 收藏