arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-07-02 至 2026-07-02 共收录 12 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 1 篇

2607.00746 2026-07-02 cs.CV cs.AI 新提交 79%

GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception

GaussianFusion:用于多模态融合感知的统一3D高斯表示

Xiao Zhao, Chang Liu, Mingxu Zhu, Zheyuan Zhang, Linna Song, Qingliang Luo, Chufan Guo, Kuifeng Su

机构 * Tencent, Autonomous Driving Lab(腾讯自动驾驶实验室)

专题命中 感知 :BEV(abstract,abstract_cn);occupancy(abstract);分类 cs.CV、cs.AI

AI总结 提出基于3D高斯表示的多模态融合框架GaussianFusion,通过连续3D高斯空间统一多模态特征,保留细节,支持多种3D感知任务,在nuScenes上检测NDS提升2.6,占用预测mIoU提升1.55且速度提升450%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 2 篇

2607.00399 2026-07-02 cs.CV 新提交 79%

DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving

DriveVer: 自动驾驶的轻量级轨迹评估器作为测试时验证器

Chong He, Yuechen Luo, Fang Li, Shaoqing Xu, Fuxi Wen

机构 * Tsinghua University(清华大学) University of Macau(澳门大学)

专题命中 规划控制 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出DriveVer,一种轻量级即插即用的测试时验证器,通过双头架构融合候选轨迹与多视图视觉特征,预测安全置信度和几何修正向量,在不增加训练成本下提升规划模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00283 2026-07-02 cs.RO cs.AI cs.CV 新提交 67%

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

隐藏之物至关重要:使用视觉语言模型识别规划关键性的被遮挡智能体

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出利用视觉语言模型(VLM)识别对自车轨迹影响最大的被遮挡智能体,通过规划KL散度(PKL)度量进行排序,并微调VLM以提升性能,实验表明该方法比随机采样提升约30%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 2 篇

2607.00273 2026-07-02 cs.CV 新提交 81%

MVDGC: Joint 3D and 2D Multi-view Pedestrian Detection via Dual Geometric Constraints

MVDGC: 通过双重几何约束的联合3D和2D多视角行人检测

Thinh Phan, Hao Vo, Khoa Vo, Thanh Ngo, Cuong Pham, Ngan Le

机构 * University of Arkansas(阿肯色大学) University of Information Technology(信息技术大学) Posts and Telecommunications Institute of Technology (PTIT)(邮电技术学院)

专题命中 BEV与占用 :BEV(summary_cn,abstract);分类 cs.CV

AI总结 提出MVDGC框架,利用3D圆柱查询联合优化BEV平面定位和2D边界框,通过双重几何约束解决透视变换导致的特征畸变和密集区域定位模糊问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01009 2026-07-02 cond-mat.stat-mech cond-mat.soft 新提交 78%

Phase diagram of a double-occupancy cell model of a fluid with Curie-Weiss interaction

具有Curie-Weiss相互作用的双占据单元流体的相图

R. V. Romanik, O. A. Dobush, M. P. Kozlovskii, I. V. Pylyuk, M. A. Shpot

专题命中 BEV与占用 :occupancy(title,abstract)

AI总结 研究具有Curie-Weiss相互作用的双占据单元流体模型,通过自旋-占据变量变换证明其与完全图上的Blume-Capel模型同构,并利用解析和数值方法揭示其丰富的相行为,包括单临界点、双临界点、三临界点和三相点。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 2 篇

2607.01079 2026-07-02 cs.RO 新提交 81%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 激光雷达 :LiDAR(summary_cn,abstract);分类 cs.RO

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00514 2026-07-02 cs.CV cs.AI 新提交 73%

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

Cross4D-JEPA: 用于4D点云表示学习的密集跨模态对应蒸馏

Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo, Hoang M. Truong, Tuan-Anh Vu

机构 * Nagoya University(名古屋大学) Northeastern University(东北大学) KC Machine Learning Lab(KC机器学习实验室) University of Science, Vietnam National University Ho Chi Minh City(胡志明市越南国立大学理科大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Cross4D-JEPA,通过教师-学生框架将冻结的2D基础模型(如DINOv2或V-JEPA 2)的密集补丁特征蒸馏到4D点编码器,实现每点对应和潜在空间匹配,在四个基准上优于模态内和全局跨模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 5 篇

2607.00710 2026-07-02 cs.CV cs.AI cs.RO 新提交 83%

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark

创建有影响力的自动驾驶数据集:从研究空白到基准的战略指南

Richard Schwarzkopf, Jonas Merkert, Frank Bieder, Annika Bätz, Alexander Blumberg, Carlos Fernandez, Felix Hauser, Fabian Immel, Christian Kinzig, Hendrik Königshof, Fabian Konstantinidis, Martin Lauer, Willi Poh, Nils Rack, Kevin Rösch, Yinzhe Shen, Marlon Steiner, Gleb Stepanov, Dominik Strutz, Ömer Şahin Taş, Julian Truetsch, Kaiwen Wang, Royden Wagner, Jan-Hendrik Pauls, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出一种诊断研究问题类型并选择最小数据操作符填补空白的战略框架,通过KITScenes案例验证,指导中小实验室和初创公司高效创建有影响力的自动驾驶数据集。

Comments Keywords: Autonomous Driving, Dataset Design, Benchmarks, Research Gap Identification. 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27660 2026-07-02 cs.CV 新提交 79%

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。

Comments accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01133 2026-07-02 cs.CV cs.RO 新提交 62%

Towards Metric-Agnostic Trajectory Forecasting

迈向度量无关的轨迹预测

Markus Knoche, Daan de Geus, Bastian Leibe

机构 * RWTH Aachen University(亚琛工业大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出度量无关的概率训练目标,并引入TraDiE策略将预测分布映射为轨迹和置信度,实现度量优化作为下游任务,在Waymo基准上取得最优结果。

Comments ECCV 2026. Project page at https://vision.rwth-aachen.de/TraDiE-policies

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00839 2026-07-02 cs.CV 新提交 57%

Rethinking Multi-Label Image Classification With Deep Learning: Taxonomy, Challenge, and Outlook

重新思考基于深度学习的多标签图像分类:分类法、挑战与展望

Xuelin Zhu, Xiu-Shen Wei, Jiawei Ge, Shuai Xu, Bing Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 本文综述了基于深度学习的多标签图像分类方法,将其分为六类,并总结了关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00545 2026-07-02 cs.CV 新提交 57%

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation

ECoSim:面向可控交通模拟的数据高效微调

Yu-Hsiang Chen, Wei-Jer Chang, Yi-Ting Chen, Masayoshi Tomizuka

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 提出轻量级控制适应框架,通过身份初始化的FiLM层调制中间特征,为预训练的扩散和自回归交通模型添加多模态控制(草图、潜在行为编码和文本),使用不到1%的配对数据实现强可控性。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏