arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 777 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 236 篇

2607.24199 2026-07-28 cs.CV 新提交 57%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23758 2026-07-28 cs.CV 新提交 57%

RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction

RoadVGGT:基于道路结构感知的前馈式路面重建

Han Jiao, Chen Liu, Jiakai Sun, Zhanjie Zhang, Mengyuan Yang, Yimeng Li, Mofan Zhou, Kun Zhan, Lei Zhao

专题命中 感知 :driving perception(abstract);分类 cs.CV

AI总结 针对现有道路重建方法需逐场景训练及场景依赖覆盖设计的局限,提出RoadVGGT框架,利用几何基础模型结合多视图图像等,经高斯头预测、坐标对齐及融合等重建紧凑高斯路面,提升多方面性能,证明几何基础模型在路面重建中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22494 2026-07-27 cs.MM cs.CV 新提交 57%

CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation

CARA:用于可解释碰撞预测的概念感知风险注意力

Zhishan Tao, Ruoyu Wang, Yucheng Wu, Enjun Du, Yilei Yuan, Sherwin Ho, Yue Su, Jinbo Su, Yi Hong

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Renmin University of China(中国人民大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 研究自动驾驶碰撞预测问题,提出CARA框架,从事故叙述中获取风险概念并与视频帧对齐成轨迹,将语义风险因素作为动态证据,结合可解释性与预测过程,实验证明其能提高预测准确性和预警及时性。

Comments Accepted to ACM Multimedia 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22226 2026-07-27 cs.RO 新提交 57%

Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments

用于户外环境的基于几何目标定位的离线视觉语言导航

Ali Salmasi, Xianjia Yu, Tomi Westerlund

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 研究针对户外环境下的离线视觉语言导航,通过对17个可边缘部署的SLM与4个在线API进行基准测试,提出轻量级混合语义几何目标定位框架并集成到Edge-BehAV中,提升了性能,降低目标距离误差,实现无网络连接下的有效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22147 2026-07-27 cs.CV 新提交 57%

Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis

通过新视图合成在别名和低纹理环境中从稀疏视图进行视觉重定位

Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato

机构 * University of Zaragoza(萨拉戈萨大学) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 针对类行星地形中视觉定位难题,提出基于 3D 高斯溅射构建可微地图表示估计相机姿态的方法,采用结合光度与几何损失的几何感知训练策略,经实验验证能有效提升定位准确性与姿态估计鲁棒性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22123 2026-07-27 cs.RO 新提交 57%

DB-VIO: Dual-Branch Visual Inertial Odometry with Enhanced Visual-Inertial Representation

DB-VIO:具有增强视觉惯性表示的双分支视觉惯性里程计

Ziyu Wan, Lin Zhao

机构 * National University of Singapore(新加坡国立大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 研究针对视觉惯性里程计问题,提出DB-VIO双分支框架,通过融入深度线索、姿态先验和解耦姿态估计进行运动特定时间建模,实验表明该方法在自动驾驶和空中机器人基准测试中性能优异,提升了旋转和平移估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21138 2026-07-24 cs.CV 新提交 57%

DTIF: Robust Loop Closure Detection via Delaunay Triangle Topology in Complex Forests

DTIF:通过复杂森林中的德劳内三角拓扑进行稳健的回环检测

Xin Zhao, Jianping Li, Qin Zou, Fuxun Liang, Zhen Dong, Bisheng Yang

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Urban Design, Wuhan University(武汉大学城市设计学院) LIESMARS, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 针对森林环境中合并局部地图的难题,提出DTIF框架。通过提取树干地标、德劳内拓扑编码、统计筛选、一致性验证等步骤构建加权顶点对应,纳入可靠性权重到姿态估计器。实验证明该方法在边缘平台上兼顾鲁棒性、效率与可部署性,实现准确配准。

Comments 19 pages, 6 figures, 4 tables. Submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 57%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20061 2026-07-23 cs.RO 新提交 57%

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack:用于具身视觉跟踪的先指认后跟踪

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

机构 * SUSTech(南方科技大学) Tencent Robotics X(腾讯机器人X实验室) Peking University(北京大学) Futian Laboratory(福田实验室)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 研究针对具身视觉跟踪问题,提出ReferTrack先指认后跟踪范式,用单个摄像头,先选目标再解码跟踪航点,通过滑动窗口队列保留运动线索,经数据集协同训练增强识别,在EVT - Bench上达先进单视图性能并验证了迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19935 2026-07-23 cs.AI 新提交 57%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19146 2026-07-22 cs.CR cs.CV 新提交 57%

Sarus: Privacy-Preserving Multi-Vendor Perception Fusion via Homomorphic Encryption

Sarus:通过同态加密实现隐私保护的多供应商感知融合

Munawar Hasan, Apostol Vassilev

机构 * National Institute of Standards and Technology, USA(美国国家标准与技术研究院) Michigan Technological University, USA(密歇根理工大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 研究自动驾驶多供应商感知融合的隐私保护问题,提出Sarus框架,利用同态加密,将检测编码为高斯矩向量加密传输,服务器在加密域聚合,实验表明其能有效聚合互补检测,提高覆盖率,实现实时隐私保护融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18286 2026-07-22 cs.LG cs.AI cs.SY eess.SY 新提交 57%

Preference-Conditioned Multi-Objective Reinforcement Learning for Runtime-Tunable Transit Signal Priority

用于运行时可调公交信号优先的偏好条件多目标强化学习

Philip-Roman Adam, Stefanie Schmidtner

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 研究公交信号优先中平衡多目标的问题,提出偏好条件TSP控制器,能在运行时通过偏好参数调整权衡公交与整体交通延误,无需重训练。通过扩展场景生成实现,实验表明该控制器优于基线,保持约束可行性,且能揭示不同偏好下的非公交外部性情况。

Comments 8 pages, 3 figures, 4 tables. Accepted at the 29th IEEE International Conference on Intelligent Transportation Systems (ITSC 2026). Code: https://github.com/urbanAIthi/morl-tsp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17984 2026-07-21 cs.RO 新提交 57%

Distilling Global Traversability Priors for Image-based Affordance Prediction in Off-road Environments

用于越野环境中基于图像的可承受性预测的全局可通行性先验知识提炼

Matthew Sivaprakasam, Samuel Triest, Micah Nye, Deegan Atha, Shehryar Khattak, David Fan, Wenshan Wang, Sebastian Scherer

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Field AI(现场人工智能公司)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 研究非结构化地形长距离自主导航易短视问题,利用卫星图像计算导航路径监督网络,直接从FPV图像提取远距离可通行性感知边界,提升长距离越野导航性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16181 2026-07-20 cs.CV 新提交 57%

Vision-Language Assistant for Emotional Reactions to Risky Driving

用于对危险驾驶产生情感反应的视觉语言助手

Harine Choi, Eun Hak Lee, Zhengzhong Tu

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 研究针对现有自动驾驶视觉语言模型忽视情感维度与用户体验的问题,提出KYA系统。它由视觉模块(用YOLOv8变体检测危险行为并提取指标生成日志)和语言模块(依情感基调设置生成回应)组成,经实验评估表现良好,为车载人工智能带来新范式。

Comments Transportation Research Record. Advance online publication (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15048 2026-07-17 cs.CV 新提交 57%

RoGS: Adaptive Meshgrid Gaussian for Large-Scale Road Surface Mapping

RoGS:用于大规模路面映射的自适应网格高斯方法

Tianchen Deng, Zhiheng Feng, Wenhua Wu, Ziming Li, Siting Zhu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong university(上海交通大学自动化与智能感知学院) State Key Laboratory of Avionics Integration and Aviation System-of-Systems Synthesis(航空电子集成与航空系统-of-系统综合国家重点实验室) Shanghai Key Laboratory of Navigation and Location Based Services(上海基于位置服务重点实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对大规模路面映射中传统方法的局限,提出ROADGS-T框架,基于自适应网格高斯表示,通过放置二维高斯面片建模路面,减少冗余,并引入自适应网格和姿态稳健细化策略,提升表示效率和结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13806 2026-07-16 cs.RO cs.MA 新提交 57%

A Deployed Hybrid Vehicle-in-the-Loop Platform for Validating Cooperative Perception

一种用于验证协同感知的已部署混合车辆在环平台

Anastasia Bolovinou, Giorgos Hadjipavlis, Markos Antonopoulos, Panagiotis Tachtalis, Konstantinos Petousakis, Konstantinos Lazaridis, Alexandros Siskos, Bill Roungas, Angelos Amditis

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 该研究提出一种通过V2X消息管道耦合真实车辆与数字孪生的混合车辆在环平台,用于验证协同感知。在多车辆场景测试,表征不同条件下CP工作负载,结果显示CP能扩视野、提召回率,定位不确定性在一定阈值后成主要误差源,还规划了平台向地中海ODD测试服务发展轨迹。

Comments 4 pages, 5 figures, to be presented in the IEEE ITSC 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13365 2026-07-16 cs.CV 新提交 57%

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

DiffGI:用于高保真薄壳3D生成的可微几何图像

Eungjune Shim, Hansol Lee, Eunjung Ju

机构 * CLO Virtual Fashion Inc.(CLO虚拟时尚公司)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 DiffGI针对现有3D生成模型问题,提出端到端3D到2D映射框架,用连续函数取代二进制图,引入可微算法,训练相关模型,在薄壳3D生成中实现高保真、高精度,减少计算资源需求。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12858 2026-07-15 cs.CV 新提交 57%

LARAD: Layout-Aware Road Anomaly Detection via Spatial-Logic Reasoning

LARAD:通过空间逻辑推理进行布局感知道路异常检测

Shiyi Mu, Xujie Chen, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对自动驾驶中异常检测问题,提出LARAD方法,通过空间逻辑推理,引入SLVS管道生成训练样本,并用轻量级注意力分支增强分割网络,显著提升对逻辑异常的鲁棒性,保持单模型架构高效率并达新的技术水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10942 2026-07-14 cs.AR cs.AI 新提交 57%

Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous Vehicles

针对自动驾驶车辆在异构边缘GPU上进行视觉Transformer的边缘物理AI部署

Ashiyana Abdul Majeed, Mahmoud Meribout, Neethu Joseph, Abel Kidane Haile, Mohammad Abdullah Al Faruque

机构 * Jetson-aware embedded deep learning inference(Jetson-aware嵌入式深度学习推理)

专题命中 感知 :driving perception(abstract);分类 cs.AI

AI总结 研究针对自动驾驶车辆在异构边缘GPU上部署视觉Transformer的问题,提出硬件感知的H-FraDS方法,通过固定调度比率路由帧,适配组件,结合OFA,实现高效推理,提升了帧率、吞吐量并满足实时操作要求。

Comments 14 pages, 15 figures, This work has been submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09971 2026-07-14 cs.AI 新提交 57%

TopoExplore: Topological Discrimination for Archive-Based Exploration

TopoExplore:基于存档探索的拓扑判别

Jason Carlson

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 研究针对基于存档探索方法未考虑边界后区域能否进入的问题,提出TopoExplore,通过周期性拓扑遍历增强单元格选择,在MiniGrid套件等实验中取得加速效果,证明拓扑感知选择在区分封闭结构及开放覆盖区域均有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06700 2026-07-09 cs.RO 新提交 57%

CILC: Cryptographically-secure Inter-agent Loop Closure Candidate Detection for Multi-Agent Collaborative SLAM

CILC:用于多智能体协作SLAM的加密安全的智能体间闭环候选检测

Andrew Fishberg, Yixuan Jia, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 研究多智能体协作SLAM中智能体间闭环候选检测问题,提出CILC系统,利用安全多方计算仅对隐私敏感且计算量轻的GD相似性比较步骤进行加密处理,在模拟和硬件实验中验证其能保持实时性、通信可行并减轻信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24805 2026-07-08 cs.CV 新提交 57%

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

DDStereo: 用于立体3D道路异常检测的高效双解码器Transformer

Shiyi Mu, Zichong Gu, Zhiqi Ai, Yilin Gao, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出DDStereo,一种双解码器立体Transformer,通过轻量级解码器分支和紧凑视差特征提取器,实现实时开放集3D目标检测,在封闭和开放集协议下均达到最先进精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04330 2026-07-07 cs.CV 新提交 57%

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

道路施工区域检测与地理定位的框架和多模态数据集

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) Technical University of Munich(慕尼黑工业大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。

Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03818 2026-07-07 cs.CV 新提交 57%

TRISTAR: Triple-Signal Stair Recognition and Vision-Only Indoor Navigation for Search-and-Rescue Micro-UAVs

TRISTAR:用于搜索救援微型无人机的三重信号楼梯识别与仅视觉室内导航

Octavian Gîngu, Stelian Spînu

机构 * Military Technical Academy(军事技术学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 研究为低成本无人机提出仅基于单目视觉的室内导航框架。结合深度估计、传统计算机视觉和轻量级深度学习模型。核心方法是TRISTAR三重传感器融合,贡献是实现可靠室内探索与楼梯穿越,无需特殊测距硬件。

Comments 10 pages, 7 figures. Project repository available at: https://github.com/tavigingu/HawkOps-Indoor-Drone-Navigation-and-TRISTAR-Stair-Climbing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03758 2026-07-07 cs.RO cs.CR 新提交 57%

Occluding the Solution Space: Planner-Agnostic Adversarial Attacks on Tolerance-Aware Manipulation

遮挡解空间:针对容错感知操纵的与规划器无关的对抗攻击

Keke Tang, Tianyu Hao, Weilong Peng, Hao Jiang, Feng Wu, Peican Zhu, Jianmin Ji, Zhihong Tian

机构 * Guangzhou University(广州大学) University of Science and Technology of China(中国科学技术大学) Northwestern Polytechnical University(西北工业大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 提出针对容错感知操纵的与规划器无关攻击框架,通过运动学占用热图刻画机器人能力,将攻击设为预算最大覆盖优化,实验表明该方法能可靠引发规划失败,优于基线。

Comments Accepted by IROS'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03155 2026-07-07 cs.RO 新提交 57%

Hope for the Best, Prepare for the Worst: Occlusion-Aware Contingency Planning for Autonomous Vehicles

抱最好的希望,做最坏的打算:自动驾驶车辆的遮挡感知应急规划

Truls Nyberg, Anna Gautier, Jana Tumova

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Traton AB(特拉顿集团) Chalmers University of Technology(查尔姆斯理工大学) Univeristy of Gothenburg(哥德堡大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 针对城市环境中自动驾驶车辆面临的遮挡风险,提出正式的遮挡感知轨迹规划框架,基于可达性分析方法,集成树形运动规划器,减少保守性并保障安全,在模拟场景中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00874 2026-07-07 cs.RO cs.MA 新提交 57%

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

超越视线:复杂场景中V2X集体感知的混合验证

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

机构 * European Union(欧盟)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。

Comments 6 pages, 4 figures, to be presented in ITS World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02494 2026-07-03 cs.CV cs.CL 新提交 57%

Towards Robustness against Typographic Attack with Training-free Concept Localization

基于训练无关的概念定位实现对抗印刷体攻击的鲁棒性

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种无需训练的可解释性方法,通过分析注意力头对词汇和语义的编码差异,定位并干预ViT中的词汇偏置电路,从而在不额外训练的情况下显著提升对印刷体攻击的鲁棒性。

Comments 15 pages main text, provisionally accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01370 2026-07-03 cs.CV 新提交 57%

MapDreamer: Aerial Imagery Conditioned Latent Diffusion for Lane-Level Map Generation

MapDreamer: 基于航空影像条件潜扩散的车道级地图生成

Julian Brandes, Philipp Crocoll, Wolfram Burgard

机构 * Department CSAI at University of Technology Nuremberg(纽伦堡工业大学CSAI系) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出MapDreamer,一种从单张航空影像直接生成带显式拓扑的车道级矢量地图的生成扩散模型,通过变分自编码器学习车道中心线及其拓扑的紧凑潜表示,并利用基于Transformer的潜扩散模型预测图结构,在几何和拓扑保真度上优于非生成基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 57%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏