arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 21222 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6065 篇

2603.24699 2026-03-27 cs.RO 57%

Saranga: MilliWatt Ultrasound for Navigation in Visually Degraded Environments on Palm-Sized Aerial Robots

Saranga:用于手掌大小空中机器人在视觉退化环境中的导航的毫瓦超声波

Manoj Velmurugan, Phillip Brush, Colin Balfour, Richard J. Przybyla, Nitin J. Sanket

机构 * Perception and Autonomous Robotics (PeAR) Group(感知与自主机器人组) Worcester Polytechnic Institute(沃思彻斯特理工学院) TDK InvenSense

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 Saranga通过低功耗超声波感知栈在视觉退化环境中实现导航,利用双超声波阵列定位障碍物,并通过物理降噪和深度学习去噪方法解决信号噪声问题,实现在密集雾、黑暗和雪中导航。

Journal ref Science Robotics Vol 11, Issue 112, eadz9609 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24294 2026-03-26 cs.CV 57%

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

VERIA:面向长尾3D目标检测的验证导向多模态实例增强

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Naver Labs(Naver实验室)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 VERIA通过多模态实例增强方法提升长尾分布下3D目标检测性能,利用基础模型生成同步RGB-LiDAR实例并进行语义与几何验证,改进稀有类别的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV 57%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23112 2026-03-25 cs.RO 57%

Active Robotic Perception for Disease Detection and Mapping in Apple Trees

主动机器人感知用于苹果树疾病检测与制图

Hayden Feddock, Francisco Yandun, Srđan Aćimović, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Plant Pathology, Virginia Polytechnic Institute and State University(弗吉尼亚理工大学植物病理学系)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出一种自主移动主动感知系统,用于在苹果树休眠期精准检测和制图疾病,通过融合多种传感技术实现疾病症状的精确定位,并评估了三种视角规划策略以提升观测精度。

Comments 8 pages, 6 figures, IROS 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22502 2026-03-25 cs.RO 57%

MapForest: A Modular Field Robotics System for Forest Mapping and Invasive Species Localization

MapForest:一种用于森林制图和入侵物种定位的模块化野外机器人系统

Sandeep Zachariah, Francisco Yandun, Sachet Korada, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出MapForest,一种模块化机器人系统,利用多模态传感器数据生成GIS-ready的入侵物种地图,通过LiDAR-惯性制图、图像识别和地理参考制图实现精准定位,实验显示其在GNSS间断环境下具有高精度和鲁棒性。

Comments 8 pages, 9 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20188 2026-03-23 cs.CV 57%

Wildfire Spread Scenarios: Increasing Sample Diversity of Segmentation Diffusion Models with Training-Free Methods

野火蔓延场景:通过无训练方法增加分割扩散模型的样本多样性

Sebastian Gerard, Josephine Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出通过无训练方法提升分割扩散模型样本多样性,验证了粒子引导和SPELL等技术在野火蔓延场景中的有效性,提升了HM IoU指标。

Comments Accepted at NLDL 2026. This version contains small corrections compared to the initial publication, see appendix for details

Journal ref Proceedings of the 7th Northern Lights Deep Learning Conference (NLDL), PMLR, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19776 2026-03-23 cs.CV 57%

ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detection

ReManNet:一种用于单目3D车道检测的黎曼流形网络

Chengzhi Hong, Bijun Li

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(信息工程测绘遥感国家重点实验室)

专题命中 感知 :BEV(abstract);分类 cs.CV

AI总结 本文提出ReManNet,通过将道路视为三维空间中的光滑2D流形,利用黎曼流形上的高斯描述符和轻量级门机制,提升单目3D车道检测的几何一致性与形状对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19308 2026-03-23 cs.LG cs.AI cs.MA 57%

GT-Space: Enhancing Heterogeneous Collaborative Perception with Ground Truth Feature Space

GT-Space:通过地面真实特征空间增强异构协作感知

Wentao Wang, Haoran Xu, Guang Tan

机构 * Sun Yat-sen University, Shenzhen Campus(中山大学深圳校区) Peng Cheng Laboratory (PCL)(鹏城实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出GT-Space框架,通过构建地面真实标签的共同特征空间,实现异构agent的统一特征对齐,避免了传统方法中需要重新训练编码器或设计解释器模块的局限,提升了多agent协作感知的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18210 2026-03-20 cs.RO 57%

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

GoalVLM: 多智能体系统中基于视觉语言模型的目标导航

MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

机构 * Intelligent Space Robotics Laboratory(智能空间机器人实验室) Center for Digital Engineering(数字工程中心) Skolkovo Institute of Science and Technology(斯克尔科夫科学与技术研究所)

专题命中 感知 :BEV(abstract);分类 cs.RO

AI总结 本文提出GoalVLM,一种基于视觉语言模型的多智能体零样本开放词汇目标导航框架,通过整合SAM3和SpaceOM实现语义优先级探索,无需重新训练即可完成复杂目标导航任务。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20292 2026-03-19 cs.RO 57%

Dynamic-ICP: Doppler-Aware Iterative Closest Point Registration for Dynamic Scenes

动态ICP:针对动态场景的多普勒感知迭代最近点配准

Dong Wang, Daniel Casado Herraez, Stefan May, Andreas Nüchter

机构 * Julius-Maximilians-Universität Würzburg(乌尔姆-约亨大学) Zentrum für Telematik e.V.(电信研究中心) Nuremberg Institute of Technology Georg Simon Ohm(纽伦堡技术学院 Georg Simon Ohm) University of Bonn(波恩大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出动态ICP方法,通过多普勒速度估计自身运动、动态物体聚类、常速模型预测动态点及结合点到平面残差与多普勒残差的紧凑目标,实现动态场景下的鲁棒配准。

Comments 8 pages, 5 figures

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO 57%

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16742 2026-03-18 cs.CV 57%

When the City Teaches the Car: Label-Free 3D Perception from Infrastructure

当城市教导汽车:从基础设施实现无标签的3D感知

Zhen Xu, Jinsu Yoo, Cristian Bautista, Zanming Huang, Tai-Yu Pan, Zhenzhen Liu, Katie Z Luo, Mark Campbell, Bharath Hariharan, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Google(谷歌) Cornell University(康奈尔大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

专题命中 感知 :self-driving(abstract);分类 cs.CV

AI总结 本文提出一种无标签的3D感知方法,利用道路设施作为无监督教师,通过固定视角和重复观测学习局部3D检测器,并广播预测作为伪标签监督,无需基础设施即可训练独立的车辆检测器。

Comments Project Page: https://jinsuyoo.info/civet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16303 2026-03-18 cs.RO 57%

Toward Deep Representation Learning for Event-Enhanced Visual Autonomous Perception: the eAP Dataset

迈向事件增强的视觉自主感知的深度表示学习:eAP数据集

Jinghang Li, Shichao Li, Qing Lian, Peiliang Li, Xiaozhi Chen, Yi Zhou

机构 * Neuromorphic Automation and Intelligence Lab (NAIL) at School of AI & Robotics, Hunan University(神经形态自动化与智能实验室(NAIL)位于人工智能与机器人学院,湖南大学) ByteDance(字节跳动) Zhuoyu Technology(卓宇科技)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出eAP数据集,用于研究事件增强的深度视觉感知,通过深度学习方法提升3D车辆检测和物体时间到接触估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19490 2026-03-18 cs.HC cs.CV 57%

RISEE: A Highly Interactive Naturalistic Driving Trajectories Dataset with Human Subjective Risk Perception and Eye-tracking Information

RISEE:一个具有人类主观风险感知和眼动信息的高交互自然驾驶轨迹数据集

Xinzheng Wu, Junyi Chen, Peiyi Wang, Shunxiang Chen, Haolan Meng, Yong Shen

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出RISEE数据集,整合人类主观风险评估和眼动数据,通过无人机与模拟相结合的方法,提升自动驾驶决策系统的人机交互研究质量。

Comments Preprint accepted by ITSC 2025

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV 57%

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15470 2026-03-17 cs.CV 57%

Automated Counting of Stacked Objects in Industrial Inspection

工业检测中堆叠物体的自动化计数

Corentin Dumery, Noa Etté, Aoxiang Fan, Ren Li, Jingyi Xu, Hieu Le, Pascal Fua

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Southern University of Science and Technology(南方科技大学) Stony Brook University(石溪大学) University of North Carolina(北卡罗来纳大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出一种新的3D计数方法,通过多视角图像估计堆叠物体的3D几何和占用率,解决容器中堆叠物体遮挡问题,验证了在大规模合成和真实数据上的鲁棒性。

Comments This preprint is a journal extension of our ICCV25 Oral paper: https://corentindumery.github.io/projects/stacks.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14909 2026-03-17 cs.CV 57%

TopoVST: Toward Topology-fidelitous Vessel Skeleton Tracking

TopoVST:迈向拓扑忠实的血管骨架跟踪

Yaoyu Liu, Minghui Zhang, Junjun He, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出TopoVST,通过多尺度球图和图神经网络实现血管骨架跟踪,结合门控特征融合和几何感知加权方案,有效解决拓扑忠实性和类别不平衡问题,实验表明其在重叠和拓扑指标上表现优异。

Comments 10 pages, 9 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12908 2026-03-17 cs.RO 57%

GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation

GoalSwarm:多无人机语义协调用于开放词汇物体导航

MoniJesu Wonders James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出GoalSwarm框架,通过轻量语义地图构建、零样本目标检测和去中心化协调策略,实现多无人机在未知环境中的开放词汇物体导航。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV 57%

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 57%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11477 2026-03-17 cs.LG cs.AI 57%

TraffiDent: A Dataset for Understanding the Interplay Between Traffic Dynamics and Incidents

TraffiDent: 一个用于理解交通动态与事件相互作用的数据集

Xiaochuan Gou, Ziyue Li, Tian Lan, Junpeng Lin, Zhishuai Li, Bingyu Zhao, Chen Zhang, Di Wang, Xiangliang Zhang

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 TraffiDent数据集首次将交通动态与事件在时空对齐的大型区域(16972个交通节点)中整合,包含交通流量、车道占用率和平均车速的时间序列数据,以及七类事件记录,支持交通-事件交互分析和因果关系研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14309 2026-03-17 cs.CV 57%

In-Field 3D Wheat Head Instance Segmentation From TLS Point Clouds Using Deep Learning Without Manual Labels

基于TLS点云的田间小麦头实例分割:无需手动标注的深度学习方法

Tomislav Medic, Liangliang Nan

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出一种无需手动标注的深度学习方法,直接从TLS点云中实现田间小麦头实例分割,通过两阶段流程提升分割效果,优于现有基于多视角RGB图像和3D高斯点划法的解决方案。

Comments to be published in ISPRS Annals of Photogrammetry and Remote Sensing at XXV ISPRS Congress, Toronto, Canada, July 2026, 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23194 2026-03-17 cs.CV 57%

Unsupervised Online 3D Instance Segmentation with Synthetic Sequences and Dynamic Loss

无监督在线3D实例分割与合成序列及动态损失

Yifan Zhang, Wei Zhang, Chuangxin He, Zhonghua Miao, Junhui Hou

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出一种通过合成点云序列生成增强训练分布的新框架,采用灵活的采样策略和动态加权损失,提升3D实例分割的准确性和时间关联性。

Comments Accepted to TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06251 2026-03-17 cs.CV 57%

NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks

NexusFlow:通过可逆流网络在部分监督下统一分散任务

Fangzhou Lin, Yuping Wang, Yuliang Guo, Zixun Huang, Xinyu Huang, Haichong Zhang, Kazunori Yamada, Zhengzhong Tu, Liu Ren, Ziming Zhang

机构 * Worcester Polytechnic Institute(沃斯特理工大学) Texas A&M University(德克萨斯A&M大学) Tohoku University(东北大学) University of Michigan(密歇根大学) Bosch Research North America & Bosch Center for AI(博世北美研究与人工智能中心)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 NexusFlow通过可逆耦合层对任务潜在特征分布对齐,实现结构多样任务下的知识迁移,优于现有部分监督基线,在自动驾驶和NYUv2数据集上均取得新突破。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12823 2026-03-16 cs.CV 57%

TreeDGS: Aerial Gaussian Splatting for Distant DBH Measurement

TreeDGS:用于远距离树冠直径胸高测量的空天地高斯点云法

Belal Shaheen, Minh-Hieu Nguyen, Bach-Thuan Bui, Shubham, Tim Wu, Michael Fairley, Matthew David Zane, Michael Wu, James Tompkin

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 TreeDGS利用3D高斯点云法实现远距离树冠直径胸高测量,通过高斯优化和点云提取,结合多视角透明度可靠性评分,实现高精度DBH估计,优于LiDAR基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07540 2026-03-16 cs.CV 57%

Enhancing Novel View Synthesis via Geometry Grounded Set Diffusion

通过几何引导的集扩散增强新视角合成

Farhad G. Zanjani, Hong Cai, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出SetDiff框架,结合3D先验、坐标映射和姿态感知的Plucker射线嵌入,提升多视角扩散模型在处理可变参考和目标视角时的鲁棒性和视觉保真度。

Comments Paper and supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17843 2026-03-16 cs.CV 57%

JigsawComm: Joint Semantic Feature Encoding and Transmission for Communication-Efficient Cooperative Perception

JigsawComm: 联合语义特征编码与传输以实现通信高效的协作感知

Chenyi Wang, Zhaowei Li, Ming F. Li, Wujie Wen

机构 * University of Arizona(亚利桑那大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出JigsawComm框架,通过联合语义特征编码与传输,在通信预算限制下提升多智能体协作感知的准确性,利用语义感知的编码器和轻量级特征效用估计器减少数据传输量,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10390 2026-03-12 cs.RO 57%

ScanDP: Generalizable 3D Scanning with Diffusion Policy

ScanDP: 可泛化的3D扫描与扩散策略

Itsuki Hirako, Ryo Hakoda, Yubin Liu, Matthew Hwang, Yoshihiro Sato, Takeshi Oishi

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 ScanDP提出一种基于扩散策略的高效3D扫描框架,通过占据网格映射和混合方法提升鲁棒性和泛化能力,实现对多样化物体的高效扫描。

Comments 8 pages, 7 figures, 5 tables. Project Page: https://treeitsuki.github.io/ScanDP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV 57%

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏