arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-08-12 至 2026-08-12 共收录 12 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 4 篇

2509.26087 2026-08-12 cs.CV 版本更新 79%

Easy3D-Labels: Supervising Semantic Occupancy Estimation with 3D Pseudo-Labels for Automotive Perception

Easy3D-Labels: 通过3D伪标签监督语义占用估计用于汽车感知

Seamie Hayes, Ganesh Sistu, Tim Brophy, Ciaran Eising

机构 * Department of Electronic and Computer Engineering, University of Limerick(利默里克大学电子与计算机工程系) Data Driven Computer Engineering Research Centre, University of Limerick(利默里克大学数据驱动计算机工程研究中心) SFI CRT Foundations in Data Science, University of Limerick(爱尔兰科学基金会数据科学基础研究中心,利默里克大学)

专题命中 感知 :occupancy(title,abstract);分类 cs.CV

AI总结 本文提出Easy3D-Labels,利用Grounded-SAM和Metric3Dv2生成3D伪标签,提升汽车感知中语义占用估计的性能,实现mIoU和RayIoU显著提升。

Comments Accepted at IEEE OJVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12826 2026-08-12 cs.CV cs.AI 版本更新 62%

DIMOS: Disentangling Instance-level Moving Object Segmentation

DIMOS: 解耦实例级运动目标分割

Hongxiang Huang, Hongwei Ren, Xiaopeng Lin, Yulong Huang, Zeke Xie, Bojun Cheng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-12 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: https://github.com/boschresearch/TASE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01656 2026-08-12 cs.CV 版本更新 57%

WaveInst: A Frequency-Domain Enhanced Network for Fine-Grained Thin Tree Trunk Extraction in Forest Scenes

WaveInst:面向森林场景中细粒度细树干提取的频域增强网络

Chenyang Fan, Xujie Zhu, Taige Luo, Zhulin Chen, Sheng Xu

机构 * College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与人工智能学院) Department of Geography, College of Natural Resources and Environment, Virginia Tech(维吉尼亚理工大学地理系) Institute of Forest Resource Information Techniques, Chinese Academy of Forestry(中国林业科学研究院森林资源信息技术研究所) State Forestry and Grassland Administration, Key Laboratory of Forest Management and Growth Modelling(国家林业和草原局森林管理与生长建模重点实验室) School of Geospatial Artificial Intelligence, East China Normal University(华东师范大学地理空间人工智能学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 针对现有方法在森林场景细树干提取中易误判、受数据与直径差异限制的问题,提出WaveInst频域增强实例分割网络,在多数据集上实现了更优的细树干提取性能,尤其在幼龄树干上优势显著。

Comments 18 pages, 16 figures, published in IEEE Transactions on Geoscience and Remote Sensing

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 4409718-4409718, 2026, Art no. 4409718

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2604.07126 2026-08-12 cs.RO cs.AI cs.LG 版本更新 62%

RankFormer: A Propose-then-Select Transformer for Multi-Agent Multimodal Trajectory Prediction

自发现意图感知变换器用于多模态车辆轨迹预测

Diyi Liu, Zihan Niu, Tu Xu, Xingchen Zhang, Lishan Sun

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于Transformer的多模态车辆轨迹预测模型,通过分离空间模块和轨迹生成模块提升预测性能,并通过预测残差偏移学习有序轨迹。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 3 篇

2608.08696 2026-08-12 cs.CV 版本更新 79%

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Prediction

OccAnyScene:面向统一的室内-室外三维占用预测

Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang

机构 * SuSTech(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) HITSZ(哈尔滨工业大学深圳校区) Pengcheng Laboratory(鹏城实验室)

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV

AI总结 该研究提出跨场景三维语义占用预测新任务,构建OccAnyScene框架实现室内外场景统一三维占用预测,在Occ-ScanNet和SurroundOcc-nuScenes数据集上取得最优mIoU结果。

Comments Corrected a typo in the title; manuscript unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14743 2026-08-12 cs.SI math.OC 版本更新 50%

Computing Absorbing-Frequency Centrality: Complexity, Estimators, and Scalable Algorithms for Stochastic Networks

在不确定性的中间节点:一种吸收马尔可夫链方法

Wencheng Bao, Eleftheria Kontou, Chrysafis Vogiatzis

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出一种针对随机网络的介数中心性度量方法,通过吸收马尔可夫链模型研究不确定环境下的节点重要性,并通过蒙特卡洛模拟进行估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20199 2026-08-12 cs.IR 版本更新 50%

MERGE: Next-Generation Item Indexing Paradigm for Large-Scale Streaming Recommendation

MERGE:面向大规模流媒体推荐的下一代物品索引范式

Jing Yan, Yimeng Bai, Zongyu Liu, Yahui Liu, Junwei Wang, Jingze Huang, Haoda Li, Sihao Ding, Shaohui Ruan, Yang Zhang

专题命中 BEV与占用 :occupancy(abstract)

AI总结 MERGE通过动态聚类和层次索引结构提升大规模流媒体推荐系统的物品索引效率和性能。

Comments Accepted by CIKM'26

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 1 篇

2503.17005 2026-08-12 cs.RO cs.SY eess.SY 版本更新 57%

Autonomous Exploration-Based Precise Mapping for Mobile Robots through Stepwise and Consistent Motions

基于逐步一致运动的移动机器人自主探索精准建图

Muhua Zhang, Lei Ma, Ying Wu, Kai Shen, Yongkui Sun, Henry Leung

专题命中 激光雷达 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出一种面向采用激光SLAM的室内移动机器人的自主探索框架,通过多RRT采样、逐步一致运动等策略提升建图精度与鲁棒性,经仿真与真实实验验证其优于基准2D算法。

Comments 8 pages, 11 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 3 篇

2511.17361 2026-08-12 cs.CV 版本更新 83%

SuperQuadricOcc: Real-Time Self-Supervised Semantic Occupancy Estimation with Superquadric Volume Rendering

SuperQuadricOcc: 基于超级二次曲面体渲染的实时自监督语义占用估计

Seamie Hayes, Alexandre Boulch, Andrei Bursuc, Reenu Mohandas, Ganesh Sistu, Tim Brophy, Ciaran Eising

机构 * Data Driven Computer Engineering (D²iCE) Research Centre(数据驱动计算机工程(D²iCE)研究中心) University of Limerick(利默里克大学) Taighde Éireann – Research Ireland(爱尔兰研究——塔吉德)

专题命中 仿真评测 :occupancy(title,abstract);autonomous driving(abstract);分类 cs.CV

AI总结 本文提出SuperQuadricOcc,通过超级二次曲面体渲染实现实时自监督语义占用估计,相比传统方法更高效且占用内存更少,在Occ3D-nuScenes数据集上取得最佳性能。

Comments Accepted at WACV 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07468 2026-08-12 cs.CV 版本更新 79%

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science & Technology(华中科技大学) Dongfeng Research & Development Institute(东风研发院)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.CV

AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。

Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16943 2026-08-12 cs.RO 版本更新 57%

SinD 2.0: A Multi-City UAV Dataset with Semantic Risk Annotations for SOTIF-Oriented Safety Validation at Signalized Intersections

SinD 2.0:一个用于信号交叉口面向SOTIF安全验证的具有语义风险注释的多城市无人机数据集

Yunwei Li, Shengjie Fu, Chunrong Chen, Chengxiang Zhao, Yuchen Fan, Mingyu Zhu, Yanchao Xu, Jiahui Xu, Anran Wang, Huanan Wang, Yuxin Zhang, Lan Yang, Chuzhao Li, Jie Ji, Yi He, Abhijit Sarkar, Akash Sonth, Hong Wang, Jun Li

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangzhou Automobile Group Co., Ltd.(广州汽车集团股份有限公司) Jilin University(吉林大学) Chang’an University(长安大学) Chongqing University(重庆大学) Southwest University(西南大学) Wuhan University of Technology(武汉理工大学) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Virginia Tech(弗吉尼亚理工大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO

AI总结 针对自动驾驶系统在信号交叉口安全验证的瓶颈,介绍SinD 2.0多城市无人机数据集。通过跨域多样、高密度风险交互、分层语义注释及全栈测试工具链,能有效暴露算法性能局限,为ADS安全分析提供有力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏