arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-08-06 至 2026-08-06 共收录 9 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 5 篇

2608.04568 2026-08-06 cs.CV 新提交 85%

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Talk2Sensors:基于传感器自适应物理线索匹配的自动驾驶3D视觉 grounding

Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) MMLab, CUHK(香港中文大学MMLab) School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通科学与工程学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Intelligent Manufacturing and Smart Transportation, Suzhou City University(苏州城市学院智能制造与智能交通学院) Qingdao University of Science and Technology(青岛科技大学) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 感知 :autonomous driving(title,abstract);LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有室外3D视觉 grounding 未充分利用多传感器互补物理属性的问题,提出首个多传感器数据集Talk2Sensors及TSFormer框架,在相关基准上实现了最优性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04865 2026-08-06 cs.CV 新提交 57%

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

超越帧的烹饪:厨房中的立体事件相机数据集

Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen

机构 * Delft University of Technology(代尔夫特理工大学) STMicroelectronics(意法半导体)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文推出EventKitchen数据集,以第一人称视角从10名参与者在13个厨房中收集5.5小时的烹饪相关多传感器数据,训练基线模型完成动作识别等任务,为神经形态视觉提供新基准。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 57%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04852 2026-08-06 cs.ET 新提交 50%

Toward Blockage-Resilient 6G-V2X Connectivity: Semi-Distributed Bandit with Dynamic Arm Set for mmWave HetNets

面向抗阻塞的6G车万物联网(V2X)连接:面向毫米波异构车联网的具有动态臂集的半分布式多臂老虎机算法

Weiqi Chi, Bo Qian, Hanlin Wu, Donghui Li, Haibo Zhou, Manabu Tsukada

专题命中 感知 :autonomous driving(abstract)

AI总结 针对毫米波异构车联网的阻塞与信道波动问题,提出BAND及半分布式S-BAND算法,结合TAK区域与KIF度量,在10%-50%阻塞率下较集中式MAB基线实现34.9%-59.4%的遗憾降低,TAK区域性能优于K-means聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04068 2026-08-06 cs.IT eess.SP math.IT 新提交 50%

Tail-Calibrated Soft-Output GRAND for Finite-Memory Noise-Effect Posteriors

面向有限记忆噪声效应后验的尾端校准软输出GRAND

Behrooz Razeghi

专题命中 感知 :occupancy(abstract)

AI总结 针对有限记忆噪声效应后验,提出尾端校准软输出GRAND算法,实现后验权重等估计并给出相关理论界,可提供逐块APP估计等解码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. BEV与占用 2 篇

2608.04642 2026-08-06 cs.CV 新提交 70%

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI

YOLO-PVC:用于MRI中体积肝肿瘤定位的切片式检测的2D到3D整合方法

Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune

机构 * ESME Research Lab(ESME研究实验室) Université Paris-Est Créteil(巴黎东部克雷泰伊大学) LRE EPITA(EPITA LRE实验室) Institute of Space Technology(空间技术研究所) Henri Mondor University Hospital(亨利·蒙多大学医院)

专题命中 BEV与占用 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 针对切片式2D目标检测器在体积数据中预测碎片化不稳定的问题,提出YOLO-PVC框架,通过几何整合提升肝脏肿瘤定位的3D IoU至0.710,优于多种基线方法。

Comments 14 pages, 2 figures, 4 tables. Accepted at AI4M3D Workshop, ECCV 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04453 2026-08-06 cs.CV cs.AI 新提交 62%

TwinIR: Coordinated Invisible Dual-Point Attacks on Online HD Map Construction

TwinIR:针对在线高清地图构建的协同式不可见双点攻击

Haibo Hu, Jianghuai Deng, Chen Tang, Yang Lou, Qian Xu, Jianping Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 BEV与占用 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对在线HD地图构建的跨边界补偿效应,提出TwinIR攻击方法,通过优化攻击点实现低感知性的有效攻击,可显著降低地图构建精度并影响自动驾驶决策。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 激光雷达 1 篇

2608.04175 2026-08-06 cs.CV 新提交 70%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多传感器融合 1 篇

2608.04130 2026-08-06 cs.CV 新提交 70%

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理

Jiaju Han, Xuemeng Sun, Qike Zhang, Xiang Chen, Luwei Yang, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 多传感器融合 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏