arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-29 至 2026-06-29 共收录 18 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 5 篇

2511.11266 2026-06-29 cs.CV 版本更新 79%

GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving

GraphPilot: 基于场景图条件化的语言自主驾驶

Fabian Schmidt, Markus Enzweiler, Abhinav Valada

机构 * Esslingen University of Applied Sciences(埃斯林根应用科学大学) University of Freiburg(弗赖堡大学)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.CV

AI总结 提出GraphPilot方法,通过交通场景图序列化与结构化提示模板,将关系上下文注入语言驾驶模型,显著提升驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 62%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 62%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 57%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27554 2026-06-29 cs.CV 新提交 57%

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

理解自动驾驶感知中的跨传感器配置泛化:多配置基准与配置变化度量

Tim Alexander Bader, Tim Dieter Eberhardt, Maximilian Dillitzer, Wilhelm Stork

机构 * Dept. of Highly Automated and Assisted Driving, Dr. Ing. h.c. F. Porsche AG(保时捷股份公司高度自动化与辅助驾驶部门) Institute for Information Processing Technologies, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息处理技术研究所) Faculty of Mobility and Technology, Esslingen University of Applied Sciences(埃斯林根应用科学大学移动性与技术学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对自动驾驶感知中传感器配置变化导致的领域差距,构建了包含14种系统化相机配置的基准,提出两种基于标定的配置描述符(配置方差和配置对比距离),实验证明几何配置差异与性能变化强相关。

Comments Accepted at ECCV 2026; Project Page: https://badertim.github.io/plentiful-carla-camera-rigs

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 2 篇

2606.27900 2026-06-29 cs.CV 新提交 57%

Long-Term Prediction of Local and Global Human Motion with Occlusion Recovery

局部与全局人体运动的长期预测及遮挡恢复

Qiaoyue Yang, Sven Heutger, Christopher Niemann, Magnus Jung, Ayoub Al-Hamadi, Sven Wachsmuth

机构 * Bielefeld University(比勒费尔德大学) Otto-von-Guericke-University Magdeburg(奥托·冯·格里克马格德堡大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 提出基于时空注意力的非自回归Transformer,同时预测局部姿态和全局运动,并训练模型恢复遮挡缺失关节,处理可变历史观测长度。

Comments Advances in Visual Computing (ISVC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21477 2026-06-29 cs.CV 版本更新 57%

Fine-Grained Behavior and Lane Constraints Guided Trajectory Prediction Method

细粒度行为与车道约束引导的轨迹预测方法

Wenyi Xiong, Jian Chen, Ziheng Qi

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院广东省全驱系统控制理论与技术重点实验室) Leapmotor Technology(零跑科技)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 提出BLNet双流架构,通过并行注意力机制融合行为意图识别与车道约束建模,利用两阶段解码器生成轨迹,在nuScenes和Argoverse数据集上显著提升预测精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 3 篇

2507.04049 2026-06-29 cs.CV cs.RO 版本更新 84%

DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous Driving

DIVER:强化扩散突破端到端自动驾驶的模仿瓶颈

Ziying Song, Lin Liu, Hongyu Pan, Bencheng Liao, Mingzhe Guo, Lei Yang, Yongchang Zhang, Shaoqing Xu, Caiyan Jia, Yadan Luo

机构 * School of Artificial Intelligence (School of Software), Yanshan University(燕山大学人工智能学院(软件学院)) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science and Technology, Beijing Jiaotong University(北京交通大数据挖掘与具身智能关键实验室,北京交通大学计算机科学与技术学院) Horizon Robotics(地平线机器人) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) University of Macau(澳门大学) School of Electrical Engineering and Computer Science, The University of Queensland(昆士兰大学电子工程与计算机科学学院)

专题命中 端到端驾驶 :autonomous driving(title,abstract);end-to-end driving(abstract);分类 cs.RO、cs.CV

AI总结 DIVER通过融合强化学习与扩散生成,生成多样化可行轨迹,提升自动驾驶的泛化能力,解决模仿学习中的模式崩溃问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27644 2026-06-29 cs.CV 新提交 83%

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

CascadeOcc: 用级联VQ表示重新思考3D占用世界模型

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 端到端驾驶 :occupancy(title,abstract);autonomous driving(abstract);分类 cs.CV

AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。

Comments Accepted to IEEE Signal Processing Letters (SPL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16732 2026-06-29 cs.CV 版本更新 57%

A Comprehensive Survey on World Models for Embodied AI

具身AI世界模型综述

Xinqing Li, Xin He, Le Zhang, Min Wu, Xiaoli Li, Yun Liu

机构 * College of Computer Science and the Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学计算机科学学院与前沿交叉学科研究院) School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局资讯通信研究院) Information Systems Technology and Design (ISTD) Pillar, Singapore University of Technology and Design (SUTD)(新加坡科技设计大学信息系统科技与设计系)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文系统综述了具身AI中的世界模型,提出了功能、时间建模和空间表示的三轴分类法,并总结了数据资源、评估指标及开放挑战。

Comments https://github.com/Li-Zn-H/AwesomeWorldModels

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 7 篇

2606.27811 2026-06-29 cs.RO 新提交 90%

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations

LXD-SLAM:基于LiDAR+X的密集SLAM,支持∑_{i=0}^{5}C_5^i种可配置传感器组合

Zhong Wang, Lin Zhang, Linfei Li, Ying Shen, Shaoming Zhang, Pengcheng Shi, Shengjie Zhao

机构 * Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.RO

AI总结 提出LXD-SLAM,一种以3D LiDAR为中心的多传感器融合框架,支持32种传感器组合,通过统一的迭代误差状态卡尔曼滤波和混合位姿图实现高保真、全局一致的密集建图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27729 2026-06-29 cs.CV 新提交 90%

Learning 1-Bit LiDAR-based Localization with Auxiliary Objective

学习基于1比特LiDAR的定位与辅助目标

Kaijie Yin, Zhiyuan Zhang, Tian Gao, Wentao Zhu, Cheng-zhong Xu, Hui Kong

机构 * University of Macau(澳门大学) Singapore Management University(新加坡管理大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出首个二值神经网络框架BiLoc用于6-DoF LiDAR定位,通过信息瓶颈原理和辅助目标缓解二值化信息损失,实现轻量高效定位。

Comments European Conference on Computer Vision(ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27509 2026-06-29 cs.CV 新提交 90%

Structured-Li-GS: Structured 3D Gaussians Splatting with LiDAR Incorporation and Spatial Constraints

Structured-Li-GS:结合LiDAR与空间约束的结构化3D高斯泼溅

Huaiyuan Weng, Huibin Li, Chul Min Yeum

机构 * University of Waterloo(滑铁卢大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出Structured-Li-GS框架,利用LiDAR-惯性-视觉SLAM生成密集彩色点云,通过锚定高斯原语并初始化椭球参数,结合光度、扁平化、偏移、深度和法向损失训练,无需高斯密集化即可实现高质量3D重建,模型适中且性能优于现有方法。

Comments 9 pages, ISPRS Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27491 2026-06-29 cs.CV 新提交 87%

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

SelectAnyTree: 一种用于3D森林LiDAR点云的可提示实例分割模型

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Julian Frey, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN(理化学研究所) University of Freiburg(弗莱堡大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(特温特大学) KC Machine Learning Lab(KC机器学习实验室) Hanoi University of Science and Technology(河内科技大学) Ritsumeikan University(立命馆大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出SelectAnyTree模型,通过点击提示和树冠高度模型引导的首次提示,实现3D森林点云中任意单木的实例分割,在交互和实例级别上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27838 2026-06-29 quant-ph 新提交 82%

Quantum LiDAR with non-local modulation

非局域调制的量子激光雷达

Xiao-Dong Fan, Zhong-Hua Ou, Yun-Ru Fan, Kai Guo, Zong-Liang Xie, Qiang Qi, Li-Xun Zhang, Si Shen, Hai-Zhi Song, Yan-Yu Wei, Hao Li, Li-Xing You, Qi Zhang, Yong Liu, Guang-Can Guo, Qiang Zhou

专题命中 激光雷达 :LiDAR(title,abstract)

AI总结 提出一种非局域调制的量子振幅调制连续波激光雷达,利用量子关联实现高精度(0.64 mm@1s,29 μm@500s)和米级测量范围(2-8 m),并在强噪声下比经典方案精度提升50倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06205 2026-06-29 cs.RO 版本更新 81%

KISS-IMU: Self-supervised Inertial Odometry with Motion-balanced Learning and Uncertainty-aware Inference

KISS-IMU:基于运动平衡学习与不确定性感知推理的自监督惯性里程计

Jiwon Choi, Hogyun Kim, Geonmo Yang, Juhui Lee, Younggun Cho

机构 * Electrical and Computer Engineering, Inha University(信息电子工程学院,印斯大学)

专题命中 激光雷达 :LiDAR(summary_cn,abstract);分类 cs.RO

AI总结 提出KISS-IMU自监督框架,通过运动平衡训练和不确定性加权推理消除对真值依赖,仅用LiDAR作为轻量监督信号,实现鲁棒惯性里程计。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02379 2026-06-29 cs.CV 版本更新 70%

Honey, I Shrunk the Arc de Triomphe!

亲爱的,我把凯旋门缩小了!

Yuanbo Xiangli, Hanyu Chen, Xueqing Tsang, Noah Snavely

机构 * Cornell University(康奈尔大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 针对单目度量几何估计中的“尺度坍缩”现象,通过构建新数据集MetricScenes并采用两阶段泊松补全方法提升深度图质量,微调MoGe-2模型显著缓解了尺度低估问题。

Comments Project page: https://metricscenes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 1 篇

2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏