arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 428 信号源:cs.CV, cs.GR, cs.RO

1. 点云 134 篇

2512.21831 2026-07-29 cs.CV 版本更新 57%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.06320 2026-07-29 cs.CV cs.LG eess.IV 版本更新 57%

A2D2: Audi Autonomous Driving Dataset

A2D2:奥迪自动驾驶数据集

Jakob Geyer, Yohannes Kassahun, Mentar Mahmudi, Xavier Ricou, Rupesh Durgesh, Andrew S. Chung, Lorenz Hauswald, Viet Hoang Pham, Maximilian Mühlegg, Sebastian Dorn, Tiffany Fernandez, Martin Jänicke, Sudesh Mirashi, Chiragkumar Savani, Martin Sturm, Oleksandr Vorobiov, Martin Oelker, Sebastian Garreis, Peter Schuberth

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 为加速机器学习等领域研究,发布奥迪自动驾驶数据集A2D2,含同步图像与3D点云等,有多种注释,传感器全方位覆盖,数据经同步配准,还提供大量未标注序列,按许可可商业使用,数据等信息可在指定网址获取。

Comments https://a2d2-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14021 2026-07-27 cs.RO 版本更新 57%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03499 2026-07-27 eess.IV cs.CV 版本更新 57%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08541 2026-07-22 cs.RO 版本更新 57%

EquiBim: Learning Symmetry-Equivariant Policy for Bimanual Manipulation

EquiBim: 学习双臂操作的对称等变策略

Zhiyuan Zhang, Aditya Mohan, Seungho Han, Wan Shou, Dongyi Wang, Yu She

机构 * Purdue University(普渡大学) University of Arkansas(阿肯色大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出EquiBim框架,通过强制对称性等变性提升双臂操作的性能和鲁棒性,适用于多种感知与动作表示。

Comments Accepted to IROS 2026. Project page: https://zhangzhiyuanzhang.github.io/equibim-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22881 2026-07-21 cs.RO eess.SP 版本更新 57%

A Vendor-Agnostic LiDAR Data Conversion System with Multi-Signal Detection and Multi-Format Output

一种支持多信号检测和多格式输出的厂商无关LiDAR数据转换系统

Param Patel, Jay Dave, Pratyush Chakraborty

机构 * BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区) Department of Electrical and Electronics Engineering, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区电气与电子工程系) Department of Computer Science and Information Systems, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区计算机科学与信息系统系)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出一种厂商无关的LiDAR数据转换系统,通过加权多信号方法自动识别传感器厂商,并输出五种标准格式,解决了多厂商SDK不兼容问题。

Comments Manuscript submitted at Software: Practice and Experience

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25623 2026-07-21 cs.RO 版本更新 57%

Neural Surface and Reflectance Modelling from 3D Radar Data

从3D雷达数据进行神经表面和反射率建模

Judith Treffler, Vladimír Kubelka, Henrik Andreasson, Martin Magnusson

机构 * Örebro University(厄勒布鲁大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出一种神经隐式方法,从雷达点云联合建模场景几何和视角相关雷达强度,利用混合特征编码学习连续SDF,生成更平滑准确的3D表面重建。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05610 2026-07-21 cs.CV 版本更新 57%

NormalView: tree species classification from backpack and aerial lidar data using geometric projections

NormalView:利用几何投影从背包和航空激光雷达数据进行树种分类

Juho Korkeala, Jesse Muhojoki, Josef Taher, Klaara Salolahti, Matti Hyyppä, Antero Kukko, Juha Hyyppä

机构 * Finnish Geospatial Research Institute FGI(芬兰地理研究 institute FGI) The National Land Survey of Finland(芬兰国家土地调查局) Department of Remote Sensing and Photogrammetry(遥感与摄影测量系) Department of Built Environment, School of Engineering(环境系,工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究利用NormalView方法,通过将几何信息嵌入二维投影并输入YOLOv11网络进行树种分类,在移动和航空激光雷达数据上测试,发现多传感器强度信息有益,该方法仅依赖几何信息,公开了相关数据集,取得较好分类结果。

Comments 25 pages, 10+4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11585 2026-07-21 cs.CV cs.AI 版本更新 57%

OV-MAP: Open-Vocabulary Zero-Shot 3D Instance Segmentation Map for Robots

OV-MAP:用于机器人的开放词汇零样本3D实例分割地图

Juno Kim, Yesol Park, Hye-Jung Yoon, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(人工智能交叉学科项目,首尔国立大学) Artificial Intelligence Institute, Seoul National University(人工智能研究所,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究针对移动机器人开放世界3D映射,提出OV-MAP方法,通过集成开放特征到3D地图提升物体识别能力,利用类无关分割模型等克服相邻体素特征重叠问题,经实验验证其在多环境下零样本性能、鲁棒性和适应性优越。

Comments 7 pages, 7 figures. Published in the Proceedings of the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024)

Journal ref 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024, pp. 13780-13786

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14839 2026-07-17 cs.CV 版本更新 57%

MapAnything: Evaluating Monocular Metric Depth Models for 3D Urban Asset Localization

MapAnything: 评估单目度量深度模型用于3D城市资产定位

Miriam Louise Carnot, Jonas Kunze, Erik Quinten Fastermann, Eric Peukert, André Ludwig, Bogdan Franczyk

机构 * ScaDS.AI (University of Leipzig)(ScaDS.AI(莱比锡大学)) University of Leipzig(莱比锡大学) Kühne Logistics University(库赫内物流大学) Wrocław University of Economics(沃拉夫经济大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出MapAnything框架,通过单目图像自动映射城市物体和事件,利用度量深度估计模型计算物体坐标,验证其在复杂城市环境中的精度,展示其在交通标志和道路损坏等实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08068 2026-07-17 cs.CV 版本更新 57%

Simulating Automotive Radar with Lidar and Camera Inputs

利用激光雷达和相机输入模拟汽车雷达

Peili Song, Dezhen Song, Yifan Yang, Enfan Lan, Jingtai Liu

机构 * Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) Tianjin Key Laboratory of Intelligent Robotics(天津智能机器人重点实验室) TBI center, Nankai University(南开大学TBI中心) Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(人工智能 Mohamed Bin Zayed 大学机器人系)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究利用相机图像、激光雷达点云和自身速度模拟汽车雷达信号的方法,基于DIS-Net和RSS-Net两个神经网络,经实验验证能生成高保真信号,用其增强数据训练的目标检测网络性能更优,助力基于雷达的自动驾驶研发。

Comments Accepted by 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19108 2026-07-16 cs.RO 版本更新 57%

Understanding Fire Through Thermal Radiation Fields for Mobile Robots

通过热辐射场理解火灾以实现移动机器人安全导航

Anton R. Wagner, Madhan Balaji Rao, Xuesu Xiao, Sören Pirk

机构 * Department of Computer Science, Kiel University(计算机科学系,基尔大学) Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出通过实时热辐射场帮助移动机器人安全导航,利用斯特凡-玻尔兹曼定律识别火灾并生成热安全路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02741 2026-07-16 cs.RO 版本更新 57%

PokeNet: Learning Kinematic Models of Articulated Objects from Human Observations

PokeNet: 从人类观察中学习机械结构模型

Anmol Gupta, Weiwei Gu, Omkar Patil, Jun Ki Lee, Nakul Gopalan

机构 * School of Computation and AI, ASU, Tempe(计算与人工智能学院,亚利桑那州立大学) AI Institute, Seoul National University, Seoul, South Korea(首尔国立大学人工智能研究所)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 PokeNet通过单个人类示范学习机械结构模型,无需先验知识,提升关节轴和状态估计精度达27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09433 2026-07-16 cs.CV eess.IV 版本更新 57%

Efficient LiDAR Reflectance Compression via Scanning Serialization

通过扫描序列化实现高效的激光雷达反射率压缩

Jiahao Zhu, Kang You, Dandan Ding, Zhan Ma

机构 * School of Information Science and Technology, Hangzhou Normal University, Hangzhou, China(信息科学与技术学院,杭州师范大学) School of Electronic Science and Engineering, Nanjing University, Nanjing, China(电子科学与工程学院,南京大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究针对激光雷达反射率在神经压缩方法中未充分探索的问题,提出基于序列化的SerLiC框架。通过扫描序列化转换点云、标记点及采用双并行化方案建模,实验表明其压缩效果优,轻量级版本性能好,对实际应用有吸引力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21511 2026-07-14 cs.CV 版本更新 57%

Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

回到点:探索用于零样本3D异常检测的点语言模型

Kaiqiang Li, Gang Li, Mingle Zhou, Min Li, Delong Han, Jin Wan

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, China(计算机功率网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁大学(山东科学院),济南,中国) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, China(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心,济南,中国)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出BTP框架,通过结合3D点云和文本嵌入,提升零样本3D异常检测的性能,实验表明其在Real3D-AD和Anomaly-ShapeNet上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13431 2026-07-08 cs.CV 版本更新 57%

FUSE: A Flow-based Mapping Between Shapes

FUSE:一种基于流的形状间映射

Lorenzo Olearo, Giulio Viganò, Daniele Baieri, Filippo Maggioli, Simone Melzi

机构 * University of Milano-Bicocca(米兰-布西卡大学) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Pegaso University(佩加索大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究3D形状间映射,基于流匹配模型提出新型神经表示,计算高效,支持跨表示形状匹配,无需大规模训练等。通过特定流映射和嵌入编码形状,在多种形状匹配任务及其他任务如UV映射、人体点云扫描配准中表现出色。

Comments 11 pages, 9 figures. Accepted for publication at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28637 2026-07-07 cs.RO 版本更新 57%

PinNet: Keypoint-Aware Learned Local Descriptors with Geometric Embedding for Loop Closure in LiDAR SLAM

PinNet:用于LiDAR SLAM回环检测的具有几何嵌入的关键点感知局部描述符

Yanlong Ma, Nakul S. Joshi, Christa S. Robison, Philip R. Osteen, Brett T. Lopez

机构 * University of California, Los Angeles(加州大学洛杉矶分校) DEVCOM Army Research Laboratory (ARL)(陆军研究实验室(ARL))

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出PinNet网络,通过关键点生成和平面几何自注意力模块增强描述符判别性,实现基于点云的回环检测与配准,在多个数据集上验证了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23087 2026-07-07 cs.RO 版本更新 57%

CoLA-Flow Policy: Temporally Coherent Imitation Learning via Continuous Latent Action Flow Matching for Robotic Manipulation

CoLA-Flow Policy: 通过连续潜在动作流匹配实现机器人操作的时序一致模仿学习

Wu Songwei, Jiang Zhiduo, Sun Wandong, Xie Guanghu, Zhao Rui, Liu Hong, Liu Yang

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学) The University of Sydney(悉尼大学) Honor Device Co., Ltd.(荣耀设备有限公司)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出CoLA-Flow Policy,一种基于连续潜在动作空间的轨迹级模仿学习框架,通过学习显式的潜在空间流,解耦全局运动结构与低层控制噪声,从而实现平滑可靠的长时程执行,并结合几何感知点云条件和执行时多模态调节,提升现实环境的鲁棒性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24847 2026-07-07 cs.CV 版本更新 57%

CORA: Generalizable coronary artery disease assessment and risk stratification from coronary CT angiography using pathology-centric representation learning

CORA:一种由病理合成驱动的冠状动脉CT血管造影分析和MACE风险评估基础模型

Jinkui Hao, Gorkem Durak, Halil Ertugrul Aktas, Ulas Bagci, Bradley D. Allen, Nilay S. Shah, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Northwestern University(西北大学生物医学工程系) Department of Cardiology, Northwestern University(西北大学心脏病学系) Department of Preventive Medicine, Northwestern University(西北大学预防医学系)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 CORA通过病理合成驱动的自监督框架,直接从体积CT血管造影数据中学习,提升冠状动脉疾病分析和MACE风险评估性能,实现29%的性能提升。

Comments Code is available at: https://github.com/Advanced-AI-in-Medicine-and-Physics-Lab/CORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07866 2026-07-07 cs.RO cs.LG cs.SY eess.SY 版本更新 57%

Language-Guided Grasping under Partial Observation for Mobile Manipulation in Field Inspection and Maintenance

用于现场检查和维护中移动操作的部分观察下语言引导抓取

Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪利亚机械工程系) Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Faculdade Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾伯特·爱因斯坦以色列教学与研究学院,艾伯特·爱因斯坦医院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出用于腿部移动操纵器在部分观察下的语言引导抓取流程,经多步骤处理,在四足机器人上实现并评估,相比基线提高抓取成功率,提升语言引导抓取可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03695 2026-07-07 cs.RO 版本更新 57%

TreeLoc++: Robust 6-DoF LiDAR Localization in Forests with a Compact Digital Forest Inventory

TreeLoc++:利用紧凑数字森林清单在森林中进行稳健的6自由度激光雷达定位

Minwoo Jung, Dongjae Lee, Nived Chebrolu, Haedam Oh, Maurice Fallon, Ayoung Kim

机构 * Department of Mechanical Engineering, Seoul National University, Seoul, South Korea(首尔国立大学机械工程系,韩国首尔) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, India(印度班加罗尔印度理工学院计算机科学与工程系) Oxford Robotics Institute, Department of Engineering Science, University of Oxford, Oxford, UK(牛津大学奥克斯福德机器人研究所,英国牛津)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 研究提出TreeLoc++框架,直接基于数字森林清单定位,以紧凑几何属性编码树干。通过距离直方图等减少误匹配,优化估计姿态,不依赖密集点云数据,实现厘米级精度定位,具长期部署扩展性。

Comments 30 pages, 33 figures and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15379 2026-07-07 cs.CV 版本更新 57%

The P$^3$ Dataset: Pixels, Points and Polygons for Multimodal Building Vectorization

P$^3$数据集:用于多模态建筑物矢量化的像素、点和多边形

Raphael Sulzer, Liuyun Duan, Nicolas Girard, Florent Lafarge

机构 * Université Côte d’Azur, INRIA(法国里沃利大学、INRIA) LuxCarta Technology(LuxCarta技术公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 介绍用于建筑物矢量化的多模态P$^3$数据集,由多源数据构建,含大量高精度激光雷达点等。证明激光雷达点云可用于预测建筑物多边形,融合激光雷达和图像能提高预测精度与几何质量,数据集公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15277 2026-07-07 cs.CV 版本更新 57%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09604 2026-07-03 cs.CV 版本更新 57%

DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition

DAP:面向异构毫米波的点网络用于人类动作识别

Jiaying Lin, Shiman Wu, Jinfu Liu, Can Wang, Mengyuan Liu

机构 * Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) DJI Technology Company Ltd.(大疆技术创新有限公司) Christian-Albrechts-Universität zu Kiel(基尔大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出DAP-Net,通过异构雷达源的跨模态对齐和D2R模块实现点云增强,提升动作识别的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14421 2026-07-03 cs.RO 版本更新 57%

BIEVR-LIO: Robust LiDAR-Inertial Odometry through Bump-Image-Enhanced Voxel Maps

BIEVR-LIO:通过凸起图像增强体素地图实现鲁棒的激光雷达惯性里程计

Patrick Pfreundschuh, Turcan Tuna, Cedric Le Gentil, Roland Siegwart, Cesar Cadena, Helen Oleynikova

机构 * 1 Autonomous Systems Lab, ETH Z\"urich, Switzerland, 2 Robotic Systems Lab, ETH Z\"urich, Switzerland, 3 Mobile Robotics Lab, ETH Z\"urich, Switzerland -1.5mm

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出BIEVR-LIO方法,通过高分辨率体素地图表示和信息导向点采样策略,提升在信息稀疏环境下的激光雷达惯性里程计鲁棒性,并在多种场景中实现优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10816 2026-07-03 cs.CV 版本更新 57%

Occlusion-Aware 3D Hand-Object Pose Estimation with Masked AutoEncoders

基于掩码自编码器的遮挡感知3D手-物体姿态估计

Hui Yang, Wei Sun, Jian Liu, Jin Zheng, Jian Xiao, Ajmal Mian

机构 * National Engineering Research Center for Robot Visual Perception and Control Technology, School of Artificial Intelligence and Robotics, Hunan University(国家机器人视觉感知与控制技术工程研究中心,人工智能与机器人学院,湖南大学) School of Architecture and Art, Central South University(建筑与艺术学院,中南大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出HOMAE方法,通过目标聚焦掩码策略和隐式SDF与显式点云融合,解决手-物体交互中的严重遮挡问题,在DexYCB和HO3Dv2上达到最优性能。

Comments IEEE Transactions on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29963 2026-07-02 cs.CV cs.CR 版本更新 57%

Explainability-Aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors

可解释性感知的视锥攻击:揭示基于LiDAR的3D目标检测器中的结构脆弱性

Chengzeng You, Binbin Xu, Soteris Demetriou

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出可解释性引导的对抗分析方法,通过SALL方法生成通用显著性图,并设计EFA攻击,仅扰动最关键的视锥区域,在KITTI和nuScenes上使检测召回率下降超15个百分点,同时减少25-50%的扰动视锥数。

Comments European Conference on Computer Vision (ECCV), September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01001 2026-07-02 cs.CV cs.AI 版本更新 57%

EgoSim: Egocentric World Simulator for Embodied Interaction Generation

EgoSim:用于具身交互生成的视角世界模拟器

Jinkun Hao, Mingda Jia, Ruiyan Wang, Hongrui Zhu, Jiafei Cao, Xihui Liu, Ran Yi, Lizhuang Ma, Jiangmiao Pang, Xudong Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 EgoSim通过建模可更新的世界状态,解决现有视角模拟器在3D grounding和动态更新上的不足,生成空间一致的交互视频并支持跨具身迁移。

Comments Project Page: egosimulator.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 57%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新 57%

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏