arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 344 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 79 篇

2605.17984 2026-07-03 eess.IV cs.CV cs.RO 版本更新 67%

See Silhouettes in Motion with Neuromorphic Vision

用神经形态视觉感知运动中的轮廓

Pei Zhang, Shijie Lin, Zhou Ge, Jinpeng Chen, Wei Pu

机构 * School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院) SHU General Intelligent Robotics Research Institute(SHU通用智能机器人研究院) School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家试点软件学院)) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 本文提出了一种双模方法,利用帧和事件的协同作用,在仅CPU的设备上实现实时高帧率二值化,有效减少运动模糊并提升在恶劣光照下的性能,为资源受限边缘平台的轻量感知和交互铺平道路。

Comments 13 pages, 15 figures, and 5 tables. This work is under review. Project page: https://github.com/pz-even/event_binarization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 67%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12826 2026-08-12 cs.CV cs.AI 版本更新 62%

DIMOS: Disentangling Instance-level Moving Object Segmentation

DIMOS: 解耦实例级运动目标分割

Hongxiang Huang, Hongwei Ren, Xiaopeng Lin, Yulong Huang, Zeke Xie, Bojun Cheng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11554 2026-08-11 cs.RO cs.CV cs.LG 版本更新 62%

HyperDet: 3D Object Detection with Hyper 4D Radar Point Clouds

HyperDet: 基于超4D雷达点云的3D目标检测

Yichun Xiao, Runwei Guan, Jin Jin, Fangqiang Ding

机构 * University of Edinburgh(爱丁堡大学) HKUST (GZ)(香港科技大学(广州)) University of Oxford(牛津大学) MIT(麻省理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 提出一种与检测器无关的框架HyperDet,通过构建任务感知的超4D雷达点云,利用时空累积、跨传感器验证和多普勒引导的运动补偿以及前景生成增强,显著提升仅用雷达的3D目标检测性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07254 2026-07-02 cs.CV cs.RO 版本更新 62%

Towards Accurate State Estimation: Motion Dynamics Kalman Filter for 3D Multi-Object Tracking

迈向精确状态估计:用于3D多目标跟踪的运动动力学卡尔曼滤波器

Mohamed Nagy, Naoufel Werghi, Bilal Hassan, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学) New York University of Abu Dhabi(纽约大学阿布扎比分校)

专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.CV

AI总结 提出运动动力学卡尔曼滤波器(MD-KF),通过将连续测量间运动变化建模为高斯分布并自适应调整加权运动模型,克服恒定运动假设,在保持模型单一性的同时提升遮挡和静止目标的状态估计精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 62%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03694 2026-06-24 cs.RO cs.CV cs.HC 版本更新 62%

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset

面向人机交互的面部与身体跟踪:一个自我中心数据集

Jessica Wenninger, Gabriel Skantze

机构 * Furhat Robotics University of Naples Federico II(那不勒斯费德里科二世大学) Division of Speech, Music and Hearing, KTH Royal Institute of Technology(语音、音乐和听觉研究所,皇家理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 针对社交机器人自我中心视角下频繁身份切换问题,提出一个自定义标注的自我中心数据集,通过系统评估检测误差、对比面部与身体跟踪,并分析扩展空间记忆和外观重识别的影响,最终优化管道将身份切换减少49%。

Comments 8 pages, 5 figures, 3 tables. Camera-ready version. Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15493 2026-06-23 cs.RO cs.CV 版本更新 62%

Build Once, Monitor Continuously: Persistent Semantic Mapping via Autonomous Exploration and Open-Vocabulary Object Updates

一次构建,持续监控:通过自主探索和开放词汇对象更新的持久语义地图

Sai Haneesh Allu, Itay Kadosh, Tyler Summers, Yu Xiang

机构 * Department of Mechanical Engineering, University of Texas at Dallas(德克萨斯大学达拉斯分校机械工程系)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 提出两阶段系统,先通过前沿探索构建几何地图,再通过开放词汇检测和分割模型更新语义对象图,实现仅重复轻量语义阶段的高效持久监控。

Comments 10 pages, 8 figures, 5 tables. Project page is available at https://irvlutd.github.io/SemanticMapping/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 62%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24058 2026-06-16 cs.CV cs.AI 版本更新 62%

Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification

通过注意力不平衡修正减轻LVLM中的对象幻觉

Han Sun, Qin Li, Peixin Wang, Min Zhang

机构 * Shanghai Key Laboratory of Trustworthy Computing, East China Normal University(上海可信计算实验室,东华大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 发现多模态和token间注意力不平衡是对象幻觉的因果因素,提出轻量级解码干预方法AIR,通过重新分配注意力权重修正不平衡,在多个基准上减少幻觉达35.1%,并提升通用能力。

Comments CVPR 2026 Findings Track, code is available at https://github.com/Ice-wave/AIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 62%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12608 2026-08-14 cs.CV 版本更新 57%

A Data Efficiency Study of Synthetic Fog for Object Detection Using the Clear2Fog Pipeline

使用Clear2Fog管道研究合成雾的数据效率

Mohamed Ahmed Mohamed, Xiaowei Huang

机构 * Waymo Open Dataset(Waymo开放数据集)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出Clear2Fog管道,通过物理模拟生成雾数据,研究环境多样性对模型鲁棒性的影响,发现混合密度数据训练模型优于固定密度数据,且通过调整学习率可克服合成偏见。

Comments Accepted to Neurocomputing. Project code and experimental configs available at https://github.com/mmohamed28/Clear2Fog

Journal ref Neurocomputing, Vol. 703, 134798, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 57%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03314 2026-08-12 cs.CV 版本更新 57%

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

TASE: 用于3D场景理解与编辑的截断感知语义嵌入

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

机构 * Bosch Research(博世研究院) Rheinisch-Westfälische Technische Hochschule Aachen(亚琛工业大学) University of Bonn(波恩大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出TASE方法,通过将预训练的2D语义特征投影到截断感知嵌入空间,结合尺度和平移等变损失,实现可控的3D场景文本驱动编辑,在大几何修改任务上显著优于现有方法。

Comments Code: https://github.com/boschresearch/TASE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01656 2026-08-12 cs.CV 版本更新 57%

WaveInst: A Frequency-Domain Enhanced Network for Fine-Grained Thin Tree Trunk Extraction in Forest Scenes

WaveInst:面向森林场景中细粒度细树干提取的频域增强网络

Chenyang Fan, Xujie Zhu, Taige Luo, Zhulin Chen, Sheng Xu

机构 * College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学与人工智能学院) Department of Geography, College of Natural Resources and Environment, Virginia Tech(维吉尼亚理工大学地理系) Institute of Forest Resource Information Techniques, Chinese Academy of Forestry(中国林业科学研究院森林资源信息技术研究所) State Forestry and Grassland Administration, Key Laboratory of Forest Management and Growth Modelling(国家林业和草原局森林管理与生长建模重点实验室) School of Geospatial Artificial Intelligence, East China Normal University(华东师范大学地理空间人工智能学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 针对现有方法在森林场景细树干提取中易误判、受数据与直径差异限制的问题,提出WaveInst频域增强实例分割网络,在多数据集上实现了更优的细树干提取性能,尤其在幼龄树干上优势显著。

Comments 18 pages, 16 figures, published in IEEE Transactions on Geoscience and Remote Sensing

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 4409718-4409718, 2026, Art no. 4409718

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00854 2026-08-11 cs.RO 版本更新 57%

Minute-Scale Training for Microrobot Navigation

微型机器人导航的分钟级训练

Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文针对微型机器人DRL导航训练耗时久的问题,提出含全向量化模拟器与TSR奖励框架的学习框架,将训练缩至10分钟内,支持零样本部署,可缩短设计周期、加速部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09245 2026-08-11 cs.CV 版本更新 57%

Bridging Object Detection and Segmentation with Polygon Detection Transformers

面向多实例分割的多边形检测变换器

Jiacheng Sun, Jiaqi Lin, Wenlong Hu, Haoyang Li, Xinghong Zhou, Chenghai Mao, Xinliang Zhang, Jianya Guo, Yuqiang Zhai, Yan Peng, Xiaomao Li

机构 * Shanghai University(上海大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 Poly-DETR通过极坐标表示将实例分割转化为稀疏顶点回归,实现更轻量的高分辨率分割,优于现有极坐标方法并在特定领域表现更优。

Comments Substantially revised and extended version with a new title, additional co-authors, new methodology, expanded experiments and analyses, and supplementary material in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09062 2026-08-11 cs.CV cs.LG 版本更新 57%

SIP: Site in Pieces- A Dataset of Disaggregated Construction-Phase 3D Scans for Semantic Segmentation and Scene Understanding

SIP: 构建阶段碎片化3D扫描数据集——用于语义分割和场景理解

Seongyong Kim, Yong Kwon Cho

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 SIP数据集通过碎片化3D扫描反映施工现场实际约束,为建筑场景的语义分割和理解提供高质量基准数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21638 2026-08-10 cs.CV 版本更新 57%

SparseVoxelDet: Fully Sparse Voxel Networks for Efficient Event-Based Drone Detection

无需密集张量:在事件相机体素网格上实现完全稀疏目标检测

Mohamad Yazan Sadoun, Sarah Sharif, Yaser Mike Banad

机构 * University of Oklahoma(俄克拉荷马大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出SparseVoxelDet,首个基于事件相机的完全稀疏目标检测器,通过稀疏体素卷积在占用体素上进行特征提取和检测,显著降低内存和存储开销,验证了稀疏处理在事件相机目标检测中的可行性。

Comments 38 Pages, 9 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30239 2026-08-04 cs.CV 版本更新 57%

CA-World: Multi-Object Counterfactual Alignment for Efficient Interactive-Ready Reconstruction

SAM3D-Phys:迈向真实世界中的多物体交互仿真

Xin Dong, Weijian Deng, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29471 2026-08-04 cs.CV 版本更新 57%

V2VCrafter: Consistent Street-View Image Generation Across Vehicles

V2XCrafter:学习生成跨智能体的驾驶场景

Yihang Tao, Yu Guo, Senkang Hu, Yanan Ma, Zihan Fang, Sam Kwong, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) City University of Hong Kong(香港城市大学) Lingnan University(岭南大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出V2XCrafter框架,通过渐进式多智能体扩散模型和跨智能体注意力模块,生成跨智能体相机视角的一致可控协作驾驶场景,以增强数据并提升下游协作3D目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08163 2026-08-04 cs.CV 版本更新 57%

Accuracy Does Not Guarantee Human-Likeness: Cross-Domain Human-Centered Benchmark in Monocular Depth Estimation

单目深度估计器中准确性并不保证人类化

Yuki Kubota, Taiki Fukiage

机构 * Communication Science Laboratories, NTT, Inc.(NTT通信科学实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 研究发现单目深度估计器的准确性与人类相似性之间存在复杂权衡,提升准确性不一定增强人类化行为。

Comments 21 pages, 14 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10167 2026-08-03 cs.CV 版本更新 57%

FlexPath: Adapting Learned Connectivity Guidance to Path Preferences

FlexPath: 基于图像规划的学习语义路径先验

Taehyoung Kim, Tim Schoenbrod, David Eckel, Henri Meeß

机构 * Fraunhofer IVI(弗劳恩霍夫研究所) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出FlexPath两阶段框架,将可行性先验与偏好解耦,通过可微路径形状目标实现任务自适应,在最短路径规划中搜索代价降低14.3%,并支持零样本泛化与多目标适配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21831 2026-07-29 cs.CV 版本更新 57%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20662 2026-07-28 cs.RO cond-mat.mtrl-sci 版本更新 57%

Scalable Low-Cost Laboratory Automation: A Digital Twin-Integrated Robotic Platform for Autonomous Liquid Handling (RAINBOT)

可扩展的低成本实验室自动化:用于自主液体处理的数字孪生集成机器人平台(RAINBOTTM)

Mohamed Rami Ayeche, Souhil Sid, Ahyen Mostofa, Rehaan Hussain, Ali Shayesteh, Fadwa El Mellouhi

机构 * Acceleration Consortium, University of Toronto(多伦多大学加速联盟) AISCIA Informatics(AISCIA信息学公司) Hamad Bin Khalifa University (HBKU)(哈马德·本·哈利法大学)

专题命中 感知 :self-driving(abstract);分类 cs.RO

AI总结 研究针对商业液体处理系统的局限,提出将消费级3D打印机改装为低成本液体处理机器人RAINBOTTM的方法,通过数字孪生实现远程监控,结合CEIDTM框架进行目标导向实验,成本低,建立了可访问的物理 - 虚拟实验室自动化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10760 2026-07-28 cs.RO 版本更新 57%

MAGS-SLAM: Monocular Multi-Agent Gaussian Splatting SLAM for Geometrically and Photometrically Consistent Reconstruction

MAGS-SLAM:单目多智能体高斯点云SLAM用于几何和光度一致的重建

Zhihao Cao, Qi Shao, Shuhao Zhai, Jing Zhang, Anh Nguyen, Hesheng Wang, Baoru Huang

机构 * ETH Zurich(苏黎世联邦理工学院) Harbin Engineering University(哈尔滨工程大学) University of Liverpool(利物浦大学) University of Macau(澳门大学) University of Ottawa(多伦多大学) Wuhan University(武汉大学) Imperial College London(伦敦帝国学院)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 MAGS-SLAM通过单目视觉实现多智能体高斯点云SLAM,无需RGB-D传感器即可完成几何和光度一致的场景重建,实验表明其跟踪精度和渲染质量可与现有RGB-D方法媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13553 2026-07-27 cs.CV 版本更新 57%

Geometry-Guided Representations for Coherent Lane and Traffic Topology Reasoning in Driving Scenes

用于驾驶场景中连贯车道和交通拓扑推理的几何引导表示

Yueru Luo, Changqing Zhou, Yiming Yang, Erlong Li, Chao Zheng, Shuguang Cui, Zhen Li

机构 * FNii SSE, CUHK-Shenzhen HKUST-Guangzhou(HKUST-广州) Tencent Map T-Lab(腾讯地图T实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 研究自动驾驶中道路拓扑推理问题,提出CoPo统一框架,通过整合感知层、推理层和监督层的几何引导关系建模,实现感知与推理的端到端联合优化,实验证明该方法在多个指标上优于现有方法。

Comments KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04122 2026-07-23 cs.CV 版本更新 57%

Contour Errors: Ego-Centric Matching for 3D Multi-Object Tracking Performance Evaluation

轮廓误差:用于 3D 多目标跟踪性能评估的自我中心匹配

Sharang Kaul, Simon Bultmann, Mario Berk, Abhinav Valada

机构 * CARIAD SE - Volkswagen Group(大众集团CARIAD分公司) Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 研究自动驾驶 3D 多目标跟踪开环性能评估问题,提出基于豪斯多夫型推理的轮廓误差(CE)自我中心匹配标准,相比现有方法,CE 能提供分级方向敏感性,评估显示其可提高匹配率,是改善开环感知评估的主要因素。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 57%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17183 2026-07-15 cs.CV cs.CY 版本更新 57%

Benchmarking Nighttime Traffic Sign Recognition with Illumination-Adaptive Detection and Semantic Attribute Reasoning

在低光照条件下学习:用于交通标志识别的数据集和算法

Aditya Mishra, Akshay Agarwal, Haroon Lone

机构 * IISER Bhopal(印度比哈尔州国际研究学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出INTSD数据集和LENS-Net算法,解决夜间交通标志识别中的低光照和干扰问题,通过大规模数据和先进模型验证了夜间识别的挑战与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏