arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-19 至 2026-05-19 共收录 51 信号源:cs.CV, cs.GR, cs.RO

1. 点云 18 篇

2402.15058 2026-05-19 math.AT cs.CG cs.LG 71%

Mixup Barcodes: Quantifying Geometric-Topological Interactions between Point Clouds

Mixup Barcodes: 量化点云之间几何-拓扑相互作用

Hubert Wagner, Nickolas Arustamyan, Matthew Wheeler, Peter Bubenik

机构 * University of Florida(佛罗里达大学) University of Central Florida(中央佛罗里达大学)

专题命中 点云 :point cloud(title)

AI总结 本文提出了一种新的方法,通过结合标准持续同调与图像持续同调,定义了量化形状及其相互作用的新型方法,引入了混合条形码、总混合度和总百分比混合度等统计量,并开发了相关软件工具,用于机器学习中的特征解缠问题。

Comments To appear at SoCG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17865 2026-05-19 cs.CV 70%

Imaging Hidden Objects with Consumer LiDAR via Motion Induced Sampling

通过运动诱导采样用消费级LiDAR成像隐藏物体

Siddharth Somasundaram, Aaron Young, Akshat Dave, Adithya Pediredla, Ramesh Raskar

机构 * Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院)

专题命中 点云 :3D reconstruction(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种多帧融合策略,利用运动诱导孔径采样模型,在消费级LiDAR上实现了非线视成像,实现了隐藏物体的3D重建、多物体跟踪和相机定位,并展示了消费级硬件无需额外设置即可实现非线视成像的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17327 2026-05-19 cs.RO cs.AI cs.CV 62%

Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model

为单目视觉-惯性系统使用前馈3D模型实现高效的特征-free初始化

Yuantai Zhang, Jiaqi Yang, Huajian Zeng, Changhao Chen, Haoang Li, Liang Li, Dezhen Song, Xingxing Zuo

机构 * MBZUAI(马克斯·普朗克人工智能研究所) HKUST (GZ)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种无需视觉特征跟踪的初始化框架,利用前馈3D模型预测的点云,从而提高了单目视觉-惯性导航系统的初始化可靠性与效率,实验表明其初始化成功率超过90%且数据需求显著减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17556 2026-05-19 cs.RO cs.AI 57%

Visual Sculpting: Visually-Aligned Planning Representations for Long-Horizon Robot Clay Sculpting

视觉雕刻:用于长周期机器人泥塑的视觉对齐规划表示

Peter Schaldenbrand, Jean Oh

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出了一种视觉对齐的规划表示方法,用于长周期机器人泥塑任务,通过捕捉光照和纹理特征,提高了对可变形材料动态的建模能力,并展示了在不同可变形材料和末端执行器下的性能。

Comments 8 pages, 14 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11130 2026-05-19 cs.LG cs.CV 57%

Meltdown: Circuits and Bifurcations in Point-Cloud-Conditioned 3D Diffusion Transformers

Meltdown: 点云条件化3D扩散变换器中的电路与分叉

Maximilian Plattner, Fabian Paischer, Johannes Brandstetter, Arturs Berzins

机构 * Institute for Machine Learning, JKU Linz(机器学习研究所,林茨大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究探讨了点云条件化3D扩散变换器在输入变化下的失败模式,揭示了Meltdown现象,通过机制性案例研究展示了其成因,并提出了PowerRemap方法以抑制该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17197 2026-05-19 cs.LG cs.CV 57%

OPTNet: Ordering Point Transformer Network for Post-disaster 3D Semantic Segmentation

OPTNet:用于灾后3D语义分割的点变换网络

Nhut Le, Ehsan Karimi, Maryam Rahnemoonfar

机构 * Computer Science and Engineering, Lehigh University, Bethlehem PA 18015, US(计算机科学与工程系,莱维大学,贝特莱姆 PA 18015,美国) Civil and Environmental Engineering, Lehigh University, Bethlehem PA 18015, US(土木与环境工程系,莱维大学,贝特莱姆 PA 18015,美国)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出OPTNet,一种通过可学习的点排序模块动态预测最优排列以提高注意力机制局部性的网络,用于灾后3D点云语义分割。

Comments Accepted for International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17135 2026-05-19 cs.CV 57%

Collaborative Learning for Semi-Supervised LiDAR Semantic Segmentation

协同学习用于半监督激光雷达语义分割

Bin Yang, Alexandru Paul Condurache

机构 * Bosch Research, Robert Bosch GmbH, Stuttgart, Germany(博世研究, 博世有限公司, 斯图加特, 德国) Institute for Neuro- and Bioinformatics, University of Lübeck, Lübeck, Germany(神经与生物信息学研究所, 奥尔德马克大学, 奥尔德马克, 德国)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CoLLiS框架,通过协同学习解决半监督学习中伪标签单一导致的偏差问题,实验表明其在低标注情况下表现优异。

Comments The paper was accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16859 2026-05-19 cs.CV cs.AI 57%

VGGT-CD: Training-Free Robust Registration for 3D Change Detection

VGGT-CD:无训练的鲁棒三维变化检测注册

Wei Zhang, Songhua Li, Yihang Wu, Qiang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出VGGT-CD方法,通过解耦跨时间注册与动态变化干扰,实现无训练的鲁棒三维变化检测注册,有效减少轨迹误差并提升注册速度。

Comments 13 pages, 5 figures. Code is available at: https://github.com/WZ-CS/VGGT-CD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16832 2026-05-19 cs.CV 57%

Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction

粗粒度语义注入用于LLM条件的结构室内预测

Shuliang Zhu, Tomiwa Adey, Jinjia Zhou

机构 * Shuliang Zhu(朱舒良) Tomiwa Adey(阿德伊汤米瓦) Jinjia Zhou(周锦佳)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种接口保持的语义增强方法,用于LLM条件的结构解码,通过将语义证据与点云表示关联,将其编码为RGBB点接口,以提升结构室内预测的精度,特别是在复杂场景中的门框定位和家具检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16779 2026-05-19 cs.CV cs.AI 57%

A Holistic Method for Superquadric Fitting Using Unsupervised Clustering Analysis

一种基于无监督聚类分析的超二次曲面拟合整体方法

Mingyang Zhao, Sipu Ruan, Xiaohong Jia

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学学院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Robotics Institute, School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程与自动化学院机器人研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种新的方法,用于在存在噪声和异常值的情况下对点云进行超二次曲面拟合,通过无监督聚类分析重新定义问题,实现了刚性和变形超二次曲面的一体化拟合,同时提供了闭式解析解和收敛性证明。

Comments 20 pages, Code: https://github.com/zikai1/SuperquadricFitting

Journal ref IEEE TRANSACTIONS ON PATTERN ANALYSIS AND MACHINE INTELLIGENCE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16742 2026-05-19 cs.CV stat.ME 57%

Diffeomorphic Cortical Alignment via Direct Warping of Streamline Endpoints

通过直接变形纤维束端点实现的皮层对齐

Yang Xiang, Martin Cole, Zhengwu Zhang

机构 * Department of Statistics and Operations Research, The University of North Carolina at Chapel Hill(统计与运筹学系,北卡罗来纳大学教堂山分校) Department of Psychiatry, University of Rochester(精神病学系,罗切斯特大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于连接性的皮层对齐方法,通过直接操作白质纤维束端点来对齐皮层表面,以提高纤维束层面的对应性,并在主要纤维束上实现更高的连接性重叠系数和更强的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16391 2026-05-19 eess.SP cs.AI cs.LG cs.RO 57%

Overcoming the Intrinsic Performance Limitations of MEMS IMU via Diffusion-Based Generative Learning

通过扩散生成学习克服MEMS惯性测量单元的固有性能限制

Jiarui Lv, Feng Zhu, Xiaohong Zhang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory, Wuhan University(湖北珞珈实验室) Chinese Antarctic Center of Surveying and Mapping, Wuhan University(中国极地测绘南极科考中心)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出基于扩散的生成学习框架,利用低成本IMU数据生成高保真虚拟IMU数据,提升定位和姿态估计性能,并在空中测绘中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16756 2026-05-19 hep-ph hep-ex 50%

Higgs Physics with the XFEL Compton $\boldsymbol{γγ}$ Collider Concept at $\boldsymbol{\sqrt{s}=125}$ GeV

利用XFEL康普顿γγ对撞机概念在√s=125 GeV处研究希格斯物理

Umar Sohail Qureshi, Tim Barklow, Ariel Schwartzman

专题命中 点云 :point cloud(abstract)

AI总结 本文研究了在√s=125 GeV的γγ碰撞中利用XFEL康普顿对撞机概念进行单个希格斯玻色子产生,通过结合新的基于集合变换器的深度学习框架和遗传算法优化器,实现了对希格斯玻色子不同衰变模式的高灵敏度分析,展示了该对撞机在高精度探测希格斯领域和新物理发现方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11970 2026-05-19 cs.LG 50%

NOFE - Neural Operator Function Embedding

NOFE - 神经操作函数嵌入

Lars Uebbing, Harald L. Joakimsen, Siyan Chen, Georgios Leontidis, Kristoffer K. Wickstrøm, Michael C. Kampffmeyer, Sébastien Lefèvre, Arnt-Børre Salberg, Robert Jenssen

机构 * David S. Hippocampus Department of Computer Science Cranberry-Lemon University(David S. Hippocampus 计算机科学系 Cranberry-Lemon 大学) UiT The Arctic University of Norway(UiT 北极大学) Norwegian Computing Center(挪威计算中心) University of South Brittany(南布列塔尼大学) University of Copenhagen(哥本哈根大学)

专题命中 点云 :point cloud(abstract)

AI总结 NOFE是一种面向连续域的降维框架,通过图核操作学习函数到函数的映射,实现无网格评估,优于传统方法在局部结构保持和鲁棒采样方面表现。

Comments 21 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23641 2026-05-19 cs.LG cs.AI hep-ex physics.ins-det 50%

Spatially Aware Linear Transformer (SAL-T) for Particle Jet Tagging

具有空间意识的线性变换器(SAL-T)用于粒子喷注标记

Aaron Wang, Zihan Zhao, Subash Katel, Vivekanand Gyanchand Sahu, Elham E Khoda, Abhijith Gandrakota, Jennifer Ngadiuba, Richard Cavanaugh, Javier Duarte

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of California San Diego(加州大学圣地亚哥分校) Fermi National Accelerator Laboratory(费米国家加速器实验室)

专题命中 点云 :point cloud(abstract)

AI总结 SAL-T通过空间感知分区和卷积层提升喷注分类性能,在资源消耗和延迟方面优于标准linformer。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 新视角合成 2 篇

2605.18599 2026-05-19 cs.CV 79%

Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling

通过语义-空间解耦解决前馈新视角合成变换器中的表示歧义

Yihang Wu, Yihang Sun, Shaofeng Zhang, Zuxuan Wu, Junchi Yan, Xiaosong Jia, Yu-gang Jiang

机构 * Institute of Trustworthy Embodied Artificial Intelligence (TEAI)(可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Sch. of Artificial Intelligence & Sch. of Computer Science, Shanghai Jiao Tong University(上海交通大学人工智能学院与计算机科学学院) University of Science and Technology of China(中国科学技术大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 本文提出通过语义-空间解耦解决前馈新视角合成变换器中的表示歧义问题,通过分离语义和空间令牌,保持两者的显式表示并利用共享注意力路由保持跨分支交互,同时引入可选分类监督和双向调制以提高交互效果,从而在解码器-only和编码器-解码器前馈NVS模型中实现一致的改进。

Comments 24 pages, 11 figures, 4 tables. Project page: https://hangzay.github.io/ssd_lvsm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16440 2026-05-19 cs.CV cs.AI 79%

Semantic Smoothing via Novel View Synthesis for Robust SAR Image Classification

通过新颖视角合成实现语义平滑以实现稳健的SAR图像分类

Daniel Brignac, Fengwei Tian, Banafsheh Latibari, Abhijit Mahalanobis, Ravi Tandon

机构 * The University of Arizona(亚利桑那大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 本文提出语义平滑方法,通过新颖视角合成模型生成结构化随机变换,提升SAR图像分类在对抗攻击下的鲁棒性,并提高干净分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 3D生成 3 篇

2605.16355 2026-05-19 cs.GR cs.CV 73%

Generative 3D Gaussians with Learned Density Control

具有学习密度控制的生成3D高斯

Runjie Yan, Yan-Pei Cao, Peng Wang, Ding Liang, Yuan-Chen Guo

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 3D生成 :Gaussian Splatting(abstract);3D generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Density-Sampled Gaussians (DeG),通过学习概率密度函数实现3D表示的自适应密度控制,结合渲染监督优化空间密度和高斯属性,提升单图到3D生成的质量。

Comments 19 pages, 16 figures, SIGGRAPH Conference Papers '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16745 2026-05-19 cs.CV 57%

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

EVA01: 通过混合变换器实现统一的原生3D理解和生成

Zongyuan Yang, Mingjing Yi, Wanli Ma, Chenzhuo Fan, Bocheng Li, Baolin Liu, Yuke Lou, Yingde Song, Yongping Xiong, Zhengdong Guo, Shimu Wang

机构 * SeeleAI Team(SeeleAI团队)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。

Comments 28 pages, 10 figures, 6 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28134 2026-05-19 cs.CV 57%

MeshReGen: A Unified 3D Geometry Regeneration Framework

MeshReGen: 一种统一的3D几何再生框架

Geon Yeong Park, Roman Shapovalov, Rakesh Ranjan, Jong Chul Ye, Andrea Vedaldi, Thu Nguyen-Phuoc

机构 * KAIST Meta Reality Labs(韩国科学技术院元宇宙实验室)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 MeshReGen通过基于VecSet的条件机制,实现从2D图像和初始3D形状再生3D对象,支持增强、重建和编辑等任务,无需额外标注即可在多个任务中实现可控的3D生成。

Comments Project page: https://geonyeong-park.github.io/meshregen/ 32 pages, 18 figures, 6 tables. Includes Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 1 篇

2604.02060 2026-05-19 cs.CV cs.RO 62%

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

CompassAD: 基于意图的多功能竞争物体3D affordance 地标

Jingliang Li, Jindou Jia, Tuo An, Chuhao Zhou, Xiangyu Chen, Shilin Shan, Boyu Ma, Bofan Lyu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏