arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-26 至 2026-05-26 共收录 45 信号源:cs.CV, cs.GR, cs.RO

1. 点云 23 篇

2605.25293 2026-05-26 cs.CV cs.AI cs.RO 62%

Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks

基于神经形态激光雷达的鸟瞰图目标检测:使用节能脉冲神经网络

Sambit Mohapatra, Senthil Yogamani, Heinrich Gotzig, Patrick Mader

机构 * Valeo, Germany(德国瓦莱欧公司) Valeo, Ireland(爱尔兰瓦莱欧公司) TU Ilmenau, Germany(德国伊门豪大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出一种端到端脉冲编码器-解码器网络,用于激光雷达点云鸟瞰图表示中的目标检测,通过代理梯度反向传播训练,在KITTI基准上达到高精度,并实现3.33倍突触操作能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07607 2026-05-26 cs.CV 57%

FS-I2P:A Hierarchical Focus-Sweep Registration Network with Dynamically Allocated Depth

FS-I2P:一种具有动态分配深度的分层聚焦扫描配准网络

Zhixin Cheng, Yujia Chen, Xujing Tao, Bohao Liao, Xiaotian Yin, Baoqun Yin, Tianzhu Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(深空探测国家实验室,深空探测实验室) Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出一种基于聚焦-扫描范式的分层交互模块和动态层分配策略,用于解决图像到点云配准中的尺度模糊和注意力漂移问题,在RGB-D Scenes V2和7-Scenes数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20390 2026-05-26 cs.RO 57%

NeuralTouch: Neural Descriptors for Precise Sim-to-Real Tactile Robot Control

NeuralTouch: 用于精确的仿真到现实触觉机器人控制的神经描述符

Yijiong Lin, Bowen Deng, Keju Pu, Chenghua Lu, Max Yang, Efi Psomopoulou, Nathan F. Lepora

机构 * Department of Engineering Mathematics and Bristol Robotics Laboratory(工程数学系和布里斯托尔机器人实验室)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出NeuralTouch多模态框架,结合神经描述符场(NDF)和触觉感知,通过深度强化学习策略利用触觉反馈优化抓取姿态,实现精确且可泛化的机器人操作。

Journal ref IEEE/ASME Transactions on Mechatronics, 2026 IEEE/ASME Transactions on Mechatronics IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24777 2026-05-26 cs.RO 57%

MR-LiDAR: A Multi-Resolution Roadside LiDAR Benchmark for Perception Diagnostics and Deployment Guidance

MR-LiDAR:用于感知诊断和部署指导的多分辨率路边激光雷达基准

Shunlai Cui, Peng Cao, Yuan Zhu, Yongjiang He, Jiacheng Yin, Xiao Huo, Gang Cao, Xiaobo Liu

机构 * Intelligent Comprehensive Transportation Key Laboratory of Sichuan Province(四川省智能综合交通运输重点实验室)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对激光雷达选型缺乏实证基准的问题,提出MR-LiDAR多分辨率基准,通过控制光束数和分布等变量,系统分析其对感知性能的影响,并给出选型指导。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.01215 2026-05-26 cs.RO 57%

Lidar Scan Registration Robust to Extreme Motions

对极端运动鲁棒的激光雷达扫描配准

Simon-Pierre Deschênes, Dominic Baril, Vladimír Kubelka, Philippe Giguère, François Pomerleau

机构 * Northern Robotics Laboratory(北方机器人实验室)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对极端运动下点云畸变导致配准失败的问题,提出一种考虑轨迹运动不确定性和环境几何的去畸变方法,在200 m/s^2和800 rad/s^2的峰值加速度下,平移误差降低9.26%,旋转误差降低21.84%。

Comments 8 pages, 8 figures, published in 2021 18th Conference on Robots and Vision (CRV), Burnaby, Canada

Journal ref 2021 18th Conference on Robots and Vision (CRV), 2021, pp. 17-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03134 2026-05-26 eess.SP cs.CV 57%

Controllable Radar Simulation with Waveform Parameter Embedding

具有波形参数嵌入的可控雷达仿真

Weiqing Xiao, Hao Huang, Chonghao Zhong, Yujie Lin, Nan Wang, Xiaoxue Chen, Zhaoxi Chen, Saining Zhang, Shuocheng Yang, Pierre Merriaux, Lei Lei, Hao Zhao

机构 * NJU(南京大学) BJTU(北京理工大学) BIT(北京理工大学) AIR, THU(空气科技,清华大学) NTU(国立台湾大学) SVM, THU(SVM,清华大学) Lightwheel AI LeddarTech

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出Ctrl-RS框架,通过环境反射张量、波形参数抽象和WARP-Net网络,实现可控的雷达立方体仿真,在2D/3D检测和语义分割任务中性能接近或超越真实雷达。

Comments CVPR 2026 Findings: Code: https://github.com/zhuxing0/SA-Radar Project page: https://zhuxing0.github.io/projects/SA-Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02836 2026-05-26 cs.LG math.AT 50%

A Closed-Form Persistence-Landmark Pipeline for Certified Point-Cloud and Graph Classification

一种用于认证点云和图分类的闭式持久性-地标管道

Sushovan Majhi, Atish Mitra, Žiga Virk, Pramita Bagchi

机构 * Data Science, George Washington University, USA(乔治华盛顿大学数据科学系) Department of Mathematical Sciences, Montana Technological University, USA(蒙塔纳技术大学数学科学系) Faculty of Computer and Information Science, University of Ljubljana, Institute IMFM, Slovenia(卢布尔雅那大学计算机与信息科学系,IMFM研究所,斯洛文尼亚) Biostatistics and Bioinformatics, George Washington University, USA(乔治华盛顿大学生物统计学与生物信息学系)

专题命中 点云 :point cloud(abstract)

AI总结 提出PLACE管道,通过闭式公式从持久同调签名中分类点云和图,无需学习权重或校准,提供基于间隔的过量风险率、描述符选择规则和每个预测的认证。

Comments TMLR submission, https://openreview.net/forum?id=4kZxNlE5Ve. v2: variance-aware Pinelis-Bernstein certificate (radius iii) fires on 8/12 benchmarks (v1: not operational); MUTAG: empirical and population NC rules agree on 940/940 predictions. Matching-free nu-coherence replaces non-interference. Le Cam lower bound (Thm 3.2) recast PD-native, matching regime m<~R/D explicit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25577 2026-05-26 cs.LG cs.AI 50%

Geometric Flow Matching for Molecular Conformation Generation via Manifold Decomposition

基于流形分解的几何流匹配分子构象生成

Yunqing Liu, Yi Zhou, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 点云 :point cloud(abstract)

AI总结 提出GO-Flow方法,通过将生成过程分解为平移、旋转和构象三个物理子空间,利用流形上的最优传输和测地流,解决现有方法忽略分子几何层次结构的问题,实现高质量、高效率的分子构象生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24013 2026-05-26 physics.chem-ph 50%

UniField: RBF-Guided Electron Density Fusion for Enhanced Molecular Representations

UniField: RBF引导的电子密度融合用于增强分子表示

Wei Zhang, Kun Li, Jiameng Chen, Jiajun Yu, Yizhen Zheng, Duanhua Cao, Wenbin Hu

专题命中 点云 :point cloud(abstract)

AI总结 提出UniField,一种SE(3)-等变多模态架构,通过融合离散拓扑图与连续电子密度场,在多个基准上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 2 篇

2512.14180 2026-05-26 cs.CV 70%

Spherical Voronoi: Directional Appearance as a Differentiable Partition of the Sphere

球面Voronoi:作为球面可微分划分的定向外观

Francesco Di Sario, Daniel Rebain, Dor Verbin, Marco Grangetto, Andrea Tagliasacchi

机构 * University of Torino(都灵大学) Simon Fraser University(西蒙弗雷泽大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind)

专题命中 新视角合成 :Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 提出球面Voronoi(SV)作为3D高斯泼溅中外观表示的统一框架,通过可学习区域划分实现视图依赖效果,在反射建模上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24321 2026-05-26 cs.CV 57%

Unified 3D Scene Understanding Through Physical World Modeling

统一3D场景理解:通过物理世界建模

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Honglin Chen, Khai Loong Aw, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学) OpenAI

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出一个概率图模型3WM,将深度估计、新视角合成和物体操作等3D视觉任务统一为单一模型,通过不同推理路径实现零样本任务执行,无需微调即达到最先进性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 1 篇

2605.24805 2026-05-26 cs.CV 57%

Fishbone: From One 3D Asset to a Million Controllable Edits

Fishbone: 从一个3D资产到百万可控编辑

Yumeng He, Xiaoying Wang, Peihao Li, Yanjia Huang, Joe Masterjohn, Jiajun Wu, Leonidas Guibas, Yin Yang, Ying Jiang, Chenfanfu Jiang

机构 * UCLA(加州大学洛杉矶分校) USC(南加州大学) UC Berkeley(加州大学伯克利分校) TRI(技术研究院) Stanford(斯坦福大学) Utah(犹他大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出一种统一的脊-肋表示方法Fishbone,支持通用网格的可控参数化变形、降阶动力学和动画,并构建了Fishbone-136K数据集,应用于可控3D生成、机器人学习数据增强等任务。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 2 篇

2605.25813 2026-05-26 cs.RO 57%

Extending Embodied Question Answering from Perception to Decision

将具身问答从感知扩展到决策

Xicheng Gong, Qiwei Li, Peiran Xu, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身AI)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 提出大规模具身问答数据集EQA-Decision和基线模型RoboDecision,系统覆盖静态场景构建、空间理解、任务动态推理和即时决策四个维度,以统一框架评估具身环境中的感知、推理和行动级决策。

Comments 11 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21406 2026-05-26 cs.CV cs.LG 57%

Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation

通过多表示生成增强统一多模态模型的理解能力

Zihan Su, Hongyang Wei, Kangrui Cen, Yong Wang, Guanhua Chen, Chun Yuan, Xiangxiang Chu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出UniMRG方法,通过辅助生成像素、深度和分割等多重表示,增强统一多模态模型的理解能力,减少幻觉并提升空间理解。

Comments Code: https://github.com/Sugewud/UniMRG

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 1 篇

2603.29236 2026-05-26 cs.CV 57%

M2H-MX: Multi-Task Semantic and Geometric Perception for Real-Time Monocular 3D Scene Graph Construction

M2H-MX:用于实时单目3D场景图构建的多任务语义与几何感知

U. V. B. L. Udugama, George Vosselman, Francesco Nex

机构 * Department of Earth Observation Science(地球观测科学系)

专题命中 SLAM与定位 :spatial understanding(abstract);分类 cs.CV

AI总结 提出M2H-MX多任务感知模型,通过注册门控全局上下文和受控跨任务交互的轻量解码器,在严格延迟约束下实现深度与语义预测相互增强,并集成到单目SLAM中,显著提升轨迹精度和地图质量。

Comments 6 pages, 5 figures, 5 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏