arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6065 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6065 篇

2606.01192 2026-06-02 cs.CV 57%

PairedGTA: Generating Driving Datasets for Controlled Photometric Shift Analysis

PairedGTA:用于受控光度偏移分析的驾驶数据集生成

Andrea Chianese, Giulio Rossolini, Alessandro Biondi, Marco Cococcioni, Giorgio Buttazzo

机构 * Scuola Superiore Sant’Anna(圣安娜高等学院) Department of Excellence in Robotics & AI(机器人与人工智能卓越部门) University of Pisa(比萨大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出基于高保真游戏引擎的PairedGTA框架,通过生成完美配对的图像,实现独立于几何和语义变化的光度偏移分析,并用于评估语义分割模型在恶劣条件下的性能退化。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00688 2026-06-02 cs.CV 57%

Shape-Prior-Based Point Cloud Completion for Single-Stage Fully Sparse 3D Object Detection

基于形状先验的点云补全用于单阶段全稀疏3D目标检测

Kaizheng Wang, Mingqian Ji, Jian Yang, Shanshan Zhang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对单阶段全稀疏3D检测器中点云稀疏和不完整的问题,提出一种基于形状先验的点云补全方法,通过实例选择和对齐补全模块显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21361 2026-06-02 cs.CV cs.LG 57%

Domain Adaptation with a Single Vision-Language Embedding

基于单一视觉-语言嵌入的域适应

Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette

机构 * Inria(法国国家信息与自动化研究所) Kyutai(Kyutai公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种利用单一视觉-语言(VL)嵌入进行域适应的框架,通过提示/照片驱动的实例归一化(PIN)挖掘多种视觉风格,实现零样本和单样本无监督域适应,在语义分割任务上优于基线方法。

Comments International Journal of Computer Vision (IJCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12916 2026-06-01 cs.LG cs.AI 57%

Surprised by Attention: Predictable Query Dynamics for Time Series Anomaly Detection

Surprised by Attention: 面向时间序列异常检测的可预测查询动态

Kadir-Kaan Özer, René Ebeling, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(智能系统研究所,埃森嫩应用科学大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 提出 AxonAD 无监督检测器,通过预测多头注意力查询向量的演化并结合重构误差与查询不匹配分数,有效检测多变量时间序列中的结构依赖偏移异常。

Comments This manuscript has been accepted for publication at ECML-PKDD 2026. The final version will be published in the conference proceedings. Main: 17 Pages, 7 Figures, 3 Tables; Appendix: 3 Pages, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30328 2026-05-29 cs.CV 57%

Supercharging Thermal Gaussian Splatting with Depth Estimation

利用深度估计增强热高斯泼溅

Manoj Biswanath, Chenxin Cai, Hannah Schieber, Daniel Roth, Benjamin Busam

机构 * Technical University of Munich(技术大学慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与人工智能研究所) Human-Centered Computing and Extended Reality Lab(以人为本计算与扩展现实实验室) TUM University Hospital(技术大学慕尼黑医院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出一种仅使用热红外图像和深度估计的单模态方法TDg,通过热到深度高斯泼溅推导辐射场,在渲染质量和训练时间上优于多模态基线。

Comments 8 pages, 4 figures. Accepted and will be published in ISPRS proceedings (ISPRS Congress 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27643 2026-05-28 cs.RO physics.optics 57%

Agentic Language-to-Objective Synthesis for Optofluidic Assembly

面向光流组件的智能语言到目标合成

Ivan Saraev, Elena Erben, Weida Liao, Fan Nan, Gerhard Neumann, Eric Lauga, Moritz Kreysing

机构 * Institute of Biological and Chemical Systems, Karlsruhe Institute of Technology, Germany(马克斯·普朗克研究所生物和化学系统研究所,卡尔斯鲁厄技术大学,德国) Department of Applied Mathematics and Theoretical Physics, University of Cambridge, UK(应用数学和理论物理系,剑桥大学,英国) Department of Mathematics, Imperial College London, UK(数学系,伦敦帝国理工学院,英国) Institute of Anthropomatics and Robotics (IAR), Karlsruhe Institute of Technology, Germany(人机学与机器人研究所(IAR),卡尔斯鲁厄技术大学,德国)

专题命中 感知 :self-driving(abstract);分类 cs.RO

AI总结 提出Speak-to-Objective模块化智能流水线,利用条件大语言模型将口语或书面指令转换为可微目标函数,实现光流控微粒子组装,并支持用户反馈学习。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23327 2026-05-27 cs.CV 57%

GFSR: Geometric Fidelity and Spatial Refinement for Reliable Lane Detection

GFSR:用于可靠车道检测的几何保真度与空间细化

Tiancheng Wang, Zhaolu Ding, Richeng Xu, Tianhui Zheng, Hui Liu, Hanyu Xuan, Zhiliang Wu, Guanghui Yue

机构 * the School of Big Data and Statistics, Anhui University(安徽大学大数据与统计学院) the School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Institute of Dataspace, Hefei Comprehensive National Science Center(合肥综合性国家科学中心数据空间研究院) the College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) the School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学院生物医学工程学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对现有车道检测方法中分类置信度与几何质量脱节、回归模块弱化采样点关联导致复杂场景性能下降的问题,提出包含LaneIoU引导的置信度校准和自适应门控位置细化的GFSR框架,在CULane和CurveLanes上取得最优结果。

Comments Submitted to IEEE Transactions on Intelligent Transportation Systems. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09606 2026-05-27 cs.CV 57%

SpaceVista: All-Scale Visual Spatial Reasoning from mm to km

SpaceVista:从毫米到公里的全尺度视觉空间推理

Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xiangyu Yue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Beijing University of Posts(北京邮电大学) Hong Kong University of Science(香港理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出全尺度空间推理解决方案,通过结构化知识系统、尺度感知建模和渐进训练范式,构建SpaceVista-1M数据集(38K视频场景、约1M空间QA对)和SpaceVista-7B模型,在5个基准上展现强泛化能力。

Comments Project Page: https://peiwensun2000.github.io/mm2km/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25373 2026-05-26 cs.CV 57%

Physics-Aware 3D Gaussian Editing for Driving Scene Generation

物理感知的三维高斯编辑用于驾驶场景生成

Feng Zhou, Jian Zhang, Yuhang Sun, He Wang, Qiong Wen, Debao Kong, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与生物力学国家重点实验室) China FAW Group Co., Ltd.(中国第一汽车集团有限公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出RoVES系统,通过单图像驱动的道路几何插入和4-DOF半车动力学模型,实现物理感知的驾驶场景编辑与车辆姿态校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01348 2026-05-26 cs.RO 57%

Kilometer-Scale GNSS-Denied UAV Navigation via Heightmap Gradients: A Winning System from the SPRIN-D Challenge

基于高程图梯度的千米级GNSS拒止无人机导航:SPRIN-D挑战优胜系统

Michal Werner, David Čapek, Tomáš Musil, Ondřej Franěk, Tomáš Báča, Martin Saska

机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子工程系)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 针对GNSS拒止环境下无人机长距离飞行中的漂移问题,提出一种利用高程图梯度模板匹配进行漂移校正的轻量级定位方法,并在SPRIN-D挑战中实现9公里航点导航。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22997 2026-05-25 cs.CV 57%

Scene Reconstruction as Mapping Priors for 3D Detection

场景重建作为3D检测的映射先验

Yang Fu, Yuliang Zou, Hao Xiang, Xin Huang, Yijing Bai, Chen Song, Weijing Shi, Govind Thattai, Dragomir Anguelov, Mingxing Tan, Yingwei Li

机构 * Waymo LLC(Waymo公司) UC San Deigo(加州大学圣地亚哥分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出利用自动构建的密集映射先验增强3D检测,设计MPA3D框架融合多模态传感器数据,在Waymo数据集上取得新最优结果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11551 2026-05-25 cs.RO 57%

CarlaNCAP: A Framework for Quantifying the Safety of Vulnerable Road Users in Infrastructure-Assisted Collective Perception Using EuroNCAP Scenarios

CarlaNCAP:使用EuroNCAP场景量化基础设施辅助集体感知中弱势道路使用者安全性的框架

Jörg Gamerdinger, Sven Teufel, Simon Roller, Oliver Bringmann

机构 * University of Tübingen, Faculty of Science, Department of Computer Science, Embedded Systems Group(图宾根大学科学学院计算机科学系嵌入式系统组)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 提出CarlaNCAP框架,通过包含11000帧安全关键EuroNCAP场景的数据集,评估基础设施辅助集体感知对弱势道路使用者的安全改进,仿真显示事故避免率可达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22578 2026-05-22 cs.CV 57%

Beyond Chamfer Distance: Granular Order-aware Evaluation Metric For Online Mapping

超越形变距离:面向在线制图的粒度化顺序感知评估度量

Chouaib Bencheikh Lehocine, Adam Lilja, Junsheng Fu, Lars Hammarstrand

机构 * Zenseact AB(Zenseact公司) Chalmers University of Technology(楚姆勒斯技术大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出一种粒度化顺序感知评估度量,用于评估在线制图方法,通过引入序列最优子模式分配(SOSPA)和多实例评估框架中的多段线定位与检测(PLD),改进了传统基于形变距离的评估方法,揭示了当前方法中检测能力是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01369 2026-05-22 eess.SP cs.AI cs.LG 57%

MU-SHOT-Fi: Self-Supervised Multi-User Wi-Fi Sensing with Source-free Unsupervised Domain Adaptation

MU-SHOT-Fi: 基于源无关无监督域适应的多用户Wi-Fi感知

Ahmed Y. Radwan, Hina Tabassum

机构 * department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 本文提出MU-SHOT-Fi框架,通过源无关无监督域适应方法,在单用户和多用户Wi-Fi感知中实现准确的活动分类和占用估计,同时防止模型崩溃。

Journal ref IEEE Internet of Things Journal, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02127 2026-05-22 cs.CV 57%

Enhancing Event-based Object Detection with Monocular Normal Maps

通过单目法线图增强基于事件的目标检测

Mingjie Liu, Hanqing Liu, Luoping Cui, Chuang Zhu

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出NRE-Net框架,结合法线图的结构先验、RGB图像的外观上下文和事件的高频动态,通过自适应双流融合模块和事件模态感知融合模块提升自动驾驶中复杂光照下的目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20666 2026-05-21 cs.RO 57%

A Semantic and Occlusion-Aware GM-PHD Filter

一种语义和遮挡感知的GM-PHD滤波器

Jovan Menezes, Mark Campbell

机构 * Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学机械与航空航天工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出了一种包含从深度学习中提取的语义信息的新出生模型,以创建一种遮挡感知的高斯混合概率假说密度(GM-PHD)滤波器。与以往依赖简单或统一假设的方法不同,所提出的语义-遮挡感知(S-OA)出生模型通过显式考虑遮挡区域并利用环境的语义信息来定义初始化项。这使滤波器能够准确表示新物体更可能出现的位置,从而在复杂和高密度的驾驶场景中提高跟踪性能。该方法通过蒙特卡洛模拟和KITTI数据集的实验进行评估。性能通过测量首次检测与跟踪初始化之间的延迟、平均绝对数量误差以及最优子模式分配(OSPA)度量来评估。结果表明,S-OA出生模型在遮挡密集的环境中减少了初始化延迟,在约70%的情况下匹配或优于最强基线。还提供了出生模型权重的敏感性分析。总体而言,研究结果强调了在自动驾驶中将遮挡推理和语义先验整合到贝叶斯跟踪框架中的优势。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06750 2026-05-21 cs.CV 57%

How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study

视觉-语言模型对连续驾驶场景的理解有多好?一项敏感性研究

Roberto Brusnicki, Mattia Piccinini, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems(自动驾驶系统教授职位) TUM School of Engineering and Design(技术大学慕尼黑工程与设计学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文通过系统分析视觉-语言模型(VLMs)在连续驾驶场景中的表现,揭示了输入配置对模型性能的影响,发现即使顶级模型在连续驾驶场景中的准确率仅为57%,远低于人类在相似约束下的65%,并暴露了VLMs在理解车辆动态和时间关系上的显著差距。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20241 2026-05-21 cs.LG cs.AI cs.CL 57%

Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry

Geometry-Lite: 通过层间边际几何进行可解释的安全探测

Woo Seob Sim, Yu Rang Park

机构 * Yonsei University(延世大学) Yonsei University College of Medicine(延世大学医学院) Department Biomedical Systems Informatics(生物医学系统信息学部门)

专题命中 感知 :occupancy(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在提示级别上的安全探测问题,提出了一种名为Geometry-Lite的紧凑探测器,通过层间边际几何分析来提高安全检测的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20044 2026-05-20 cs.CV 57%

OP2GS: Object-Aware 3D Gaussian Splatting with Dual-Opacity Primitives

OP2GS: 带双不透明度的物体感知3D高斯散射

Guiyu Liu, Niklas Vaara, Janne Mustaniemi, Juho Kannala, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰) Aalto University, Finland(阿尔托大学,芬兰)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 OP2GS通过引入双不透明度机制,为每个原始体素添加显式实例身份和专用实例不透明度σ*,以解决3D高斯散射在物体层面身份缺失的问题,从而提升开放词汇场景理解的性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19744 2026-05-20 cs.CV 57%

Real-World On-Vehicle Evaluation of Embedding-Based Anomaly Detection

车载场景中基于嵌入的异常检测实测

Albert Schotschneider, Daniel Bogdoll, Svetlana Pavlitska, Ahmed Abouelazm, Johann Marius Zoellner

机构 * FZI Research Center for Information Technology(FZI信息科技研究中心) KIT Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种适应性强的实时异常检测方法,利用预训练视觉变换器嵌入来检测潜在异常,通过在潜在语义特征空间中使用最近邻相似性检测偏差,并在真实世界场景中评估了该方法的性能。

Comments Accepted at CVPR 2026 Workshop AUTOPILOT-NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO 57%

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17822 2026-05-19 cs.CV 57%

Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection

释放傅里叶形状的表示能力以攻击红外目标检测

Yixing Yong, Jian Wang, Ming Lei, Lijun He, Fan Li

机构 * School of Information and Communications Engineering, Faculty of Electronic and Information Engineering, Xi'an Jiaotong University, Xi'an, China(信息与通信工程学院,电子与信息工程学院,西安交通大学,西安,中国) School of Physics, Xi'an Jiaotong University, Xi'an, China(物理学院,西安交通大学,西安,中国)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种基于傅里叶形状的红外目标检测攻击方法,通过引入可学习的傅里叶形状,克服了传统形状方法在表示能力和优化能力之间的根本权衡问题,实现了高效的梯度优化生成具有欺骗性的形状,使人类目标逃避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17421 2026-05-19 cs.RO 57%

MUSE: Multimodal Uncertainty Quantification of State Estimation

MUSE:多模态状态估计不确定性量化

Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

机构 * Department of Mechanical Science and Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校塞贝尔计算与数据科学学院) Department of Electrical Engineering, University of South Carolina(南卡罗来纳大学电气工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出MUSE,一种基于学习的实时框架,利用Mamba的强效序列建模能力,从多个异步传感器流中估计定位不确定性,提高了状态估计的可靠性和鲁棒性。

Comments Code and dataset: https://github.com/hungdche/MUSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16979 2026-05-19 cs.RO 57%

NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints

NORM-Nav: 通过自然语言行为约束实现零样本移动机器人导航

Dongjie Huo, Junhui Wang, Chao Gao, Yan Qiao, Dong Zhang, Guyue Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门大学系统工程与智能科学与系统联合实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出NORM-Nav框架,通过将自然语言行为约束整合到基于成本图的规划中,提升移动机器人在人类环境中导航的社交适应性,实验表明其在任务成功率和轨迹贴近人类参考方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16925 2026-05-19 cs.CV 57%

P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction

P2GS: 基于物理先验的高斯点云法用于光度一致的城市重建

Kota Shimomura, Hidehisa Arai, Tsubasa Takahashi, Takayoshi Yamashita, Hironobu Fujiyoshi

机构 * Chubu University(名古屋大学) Turing Inc.(图灵公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出P2GS,一种基于物理先验的高斯点云法,用于解决自动驾驶中由于异质相机管道和动态户外照明导致的光度不一致问题,通过联合分解视图不变的线性HDR光场、每视图曝光尺度和色调映射函数,提升光度一致性与光照一致性。

Comments Accepted CVPR2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06037 2026-05-19 cs.CV 57%

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

基于几何的思考:用于空间推理的主动几何整合

Haoyuan Li, Qihang Cao, Tao Tang, Kun Xiang, Zihan Guo, Jianhua Han, JiaWang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yet-sen University(中山大学深圳校区) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司) Shanghai Jiao Tong University(上海交通大学) Shanghai innovation institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出GeoThinker框架,通过主动感知机制改进空间推理,通过空间接地融合和重要性门控实现几何与语义的精准整合,提升空间智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15326 2026-05-18 cs.CV 57%

Multimodal Object Detection Under Sparse Forest-Canopy Occlusion

多模态目标检测在稀疏森林冠层遮挡下的应用

Nitik Jain, Mangal Kothari

机构 * Robotics & AI, Johns Hopkins University, USA(约翰霍普金斯大学机器人与人工智能系,美国) Department of Aerospace Engineering, IIT Kanpur(印度理工学院坎浦尔航空航天工程系) Senior Principal Flight Control Engineer, ADASI, EDGE Group, Abu Dhabi, UAE(阿布扎赫尔ADASI高级飞行控制系统工程师,EDGE集团)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出一种多模态管道,结合激光雷达、可见-热成像融合和合成孔径成像技术,以提高森林冠层下人类检测的可靠性,展示了改进的YOLOv5检测器在热成像和融合图像上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15116 2026-05-15 cs.CV 57%

DriveCtrl: Conditioned Sim-to-Real Driving Video Generation

DriveCtrl: 基于条件的仿真到现实驾驶视频生成

Haonan Zhao, Yiting Wang, Jingkun Chen, Valentina Donzella, Thomas Bashford-Rogers, Kurt Debattista

机构 * University of Warwick(沃里克大学) Northwestern Polytechnical University(西北工业大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出DriveCtrl框架,通过深度条件生成逼真的驾驶视频,保留场景结构和运动模式,提升生成视频的现实感和时序一致性,同时引入可扩展的数据生成管道和Driving Video Realism Score评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV 57%

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12735 2026-05-14 cs.RO 57%

The Unified Autonomy Stack: Toward a Blueprint for Generalizable Robot Autonomy

统一自主栈:迈向通用机器人自主性的蓝图

Mihir Dharmadhikari, Nikhil Khedekar, Mihir Kulkarni, Morten Nissov, Martin Jacquet, Angelos Zacharia, Marvin Harms, Albert Gassol Puigjaner, Philipp Weiss, Kostas Alexis

机构 * Autonomous Robots Lab(自主机器人实验室)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出统一自主栈,通过多模态感知、多行为规划和多层安全导航模块实现通用机器人自主性,经实地测试验证其在复杂环境中的鲁棒性。

Comments 35 pages, 22 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏