arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-29 至 2026-06-29 共收录 11 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 3 篇

2606.28094 2026-06-29 cs.CV cs.AI 新提交 62%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 57%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27554 2026-06-29 cs.CV 新提交 57%

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

理解自动驾驶感知中的跨传感器配置泛化:多配置基准与配置变化度量

Tim Alexander Bader, Tim Dieter Eberhardt, Maximilian Dillitzer, Wilhelm Stork

机构 * Dept. of Highly Automated and Assisted Driving, Dr. Ing. h.c. F. Porsche AG(保时捷股份公司高度自动化与辅助驾驶部门) Institute for Information Processing Technologies, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息处理技术研究所) Faculty of Mobility and Technology, Esslingen University of Applied Sciences(埃斯林根应用科学大学移动性与技术学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对自动驾驶感知中传感器配置变化导致的领域差距,构建了包含14种系统化相机配置的基准,提出两种基于标定的配置描述符(配置方差和配置对比距离),实验证明几何配置差异与性能变化强相关。

Comments Accepted at ECCV 2026; Project Page: https://badertim.github.io/plentiful-carla-camera-rigs

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2606.27900 2026-06-29 cs.CV 新提交 57%

Long-Term Prediction of Local and Global Human Motion with Occlusion Recovery

局部与全局人体运动的长期预测及遮挡恢复

Qiaoyue Yang, Sven Heutger, Christopher Niemann, Magnus Jung, Ayoub Al-Hamadi, Sven Wachsmuth

机构 * Bielefeld University(比勒费尔德大学) Otto-von-Guericke-University Magdeburg(奥托·冯·格里克马格德堡大学)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV

AI总结 提出基于时空注意力的非自回归Transformer,同时预测局部姿态和全局运动,并训练模型恢复遮挡缺失关节,处理可变历史观测长度。

Comments Advances in Visual Computing (ISVC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 1 篇

2606.27644 2026-06-29 cs.CV 新提交 83%

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

CascadeOcc: 用级联VQ表示重新思考3D占用世界模型

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 端到端驾驶 :occupancy(title,abstract);autonomous driving(abstract);分类 cs.CV

AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。

Comments Accepted to IEEE Signal Processing Letters (SPL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 5 篇

2606.27811 2026-06-29 cs.RO 新提交 90%

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations

LXD-SLAM:基于LiDAR+X的密集SLAM,支持∑_{i=0}^{5}C_5^i种可配置传感器组合

Zhong Wang, Lin Zhang, Linfei Li, Ying Shen, Shaoming Zhang, Pengcheng Shi, Shengjie Zhao

机构 * Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.RO

AI总结 提出LXD-SLAM,一种以3D LiDAR为中心的多传感器融合框架,支持32种传感器组合,通过统一的迭代误差状态卡尔曼滤波和混合位姿图实现高保真、全局一致的密集建图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27729 2026-06-29 cs.CV 新提交 90%

Learning 1-Bit LiDAR-based Localization with Auxiliary Objective

学习基于1比特LiDAR的定位与辅助目标

Kaijie Yin, Zhiyuan Zhang, Tian Gao, Wentao Zhu, Cheng-zhong Xu, Hui Kong

机构 * University of Macau(澳门大学) Singapore Management University(新加坡管理大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出首个二值神经网络框架BiLoc用于6-DoF LiDAR定位,通过信息瓶颈原理和辅助目标缓解二值化信息损失,实现轻量高效定位。

Comments European Conference on Computer Vision(ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27509 2026-06-29 cs.CV 新提交 90%

Structured-Li-GS: Structured 3D Gaussians Splatting with LiDAR Incorporation and Spatial Constraints

Structured-Li-GS:结合LiDAR与空间约束的结构化3D高斯泼溅

Huaiyuan Weng, Huibin Li, Chul Min Yeum

机构 * University of Waterloo(滑铁卢大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出Structured-Li-GS框架,利用LiDAR-惯性-视觉SLAM生成密集彩色点云,通过锚定高斯原语并初始化椭球参数,结合光度、扁平化、偏移、深度和法向损失训练,无需高斯密集化即可实现高质量3D重建,模型适中且性能优于现有方法。

Comments 9 pages, ISPRS Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27491 2026-06-29 cs.CV 新提交 87%

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

SelectAnyTree: 一种用于3D森林LiDAR点云的可提示实例分割模型

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Julian Frey, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN(理化学研究所) University of Freiburg(弗莱堡大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(特温特大学) KC Machine Learning Lab(KC机器学习实验室) Hanoi University of Science and Technology(河内科技大学) Ritsumeikan University(立命馆大学)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 提出SelectAnyTree模型,通过点击提示和树冠高度模型引导的首次提示,实现3D森林点云中任意单木的实例分割,在交互和实例级别上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27838 2026-06-29 quant-ph 新提交 82%

Quantum LiDAR with non-local modulation

非局域调制的量子激光雷达

Xiao-Dong Fan, Zhong-Hua Ou, Yun-Ru Fan, Kai Guo, Zong-Liang Xie, Qiang Qi, Li-Xun Zhang, Si Shen, Hai-Zhi Song, Yan-Yu Wei, Hao Li, Li-Xing You, Qi Zhang, Yong Liu, Guang-Can Guo, Qiang Zhou

专题命中 激光雷达 :LiDAR(title,abstract)

AI总结 提出一种非局域调制的量子振幅调制连续波激光雷达,利用量子关联实现高精度(0.64 mm@1s,29 μm@500s)和米级测量范围(2-8 m),并在强噪声下比经典方案精度提升50倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 1 篇

2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏