arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-23 至 2026-06-23 共收录 16 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 62%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07690 2026-06-23 cs.CV 版本更新 57%

FrameVGGT: Coherence-Preserving Memory for Bounded Streaming Geometry

FrameVGGT:几何对齐的帧级内存用于有界流式VGGT

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science(工业科学研究所) The University of Tokyo(东京大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 FrameVGGT从几何支持角度重新审视有界内存流式处理,通过组织帧级增量KV贡献为连贯段,实现稳定几何支持与内存平衡。

Comments 23pages including appendix checklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03962 2026-06-23 cs.CV 版本更新 57%

A Linear Fractional Transformation Model and Calibration Method for Light Field Camera

光场相机的线性分式变换模型与标定方法

Zhong Chen, Changfeng Chen

机构 * School of Mechanical and Automotive Engineering, South China University of Technology(机械与自动化工程学院,华南理工大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种线性分式变换模型,通过单一参数解耦主透镜与微透镜阵列成像,实现独立标定,在物理与模拟数据集上达到2.1%的平均平移误差,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18276 2026-06-23 cs.RO cs.AI 版本更新 57%

GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation

GAPartManip:面向材料无关铰接物体操作的大规模部件中心数据集

Wenbo Cui, Chengyang Zhao, Songlin Wei, Jiazhao Zhang, Haoran Geng, Yaran Chen, Haoran Li, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Galbot

专题命中 三维重建 :3D vision(abstract);分类 cs.RO

AI总结 提出大规模部件中心数据集GAPartManip,结合照片级材质随机化和部件级交互姿态标注,通过模块化框架提升深度估计与交互姿态预测,在仿真和真实场景中实现鲁棒的铰接物体操作。

Comments Accepted by ICRA 2025. Project page: https://pku-epic.github.io/GAPartManip/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2503.12947 2026-06-23 cs.CV 版本更新 91%

DivCon-NeRF: Diverse and Consistent Ray Augmentation for Few-Shot NeRF

DivCon-NeRF:用于少样本NeRF的多样且一致的射线增强

Ingyun Lee, Jae Won Jang, Seunghyeon Seo, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 NeRF :NeRF(title,title_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 针对少样本NeRF中稀疏视图导致的过拟合和伪影问题,提出基于球面的射线增强方法,通过一致性掩码过滤不一致射线,结合定制损失函数减少浮点伪影和视觉失真,在多个数据集上优于现有方法。

Comments Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 2 篇

2601.03357 2026-06-23 cs.CV cs.GR 版本更新 87%

RelightAnyone: A Generalized Relightable 3D Gaussian Head Model

RelightAnyone: 一种通用的可重光照3D高斯头部模型

Yingyan Xu, Pramod Rao, Sebastian Weiss, Gaspard Zoss, Markus Gross, Christian Theobalt, Marc Habermann, Derek Bradley

机构 * ETH Zürich(苏黎世联邦理工学院) DisneyResearch|Studios(迪士尼研究与工作室) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学院,SIC)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 提出一种两阶段通用可重光照3D高斯头部模型,无需OLAT数据即可从单/多视图图像重光照任意对象,通过从平光照3DGS头像到物理反射参数的映射实现高质量重光照。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新 81%

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 7 篇

2603.25260 2026-06-23 cs.CV 版本更新 79%

Towards Practical Lossless Neural Compression for LiDAR Point Clouds

面向激光雷达点云的实际无损神经压缩

Pengpeng Yu, Haoran Li, Runqing Jiang, Dingquan Li, Jing Wang, Liang Lin, Yulan Guo

机构 * Sun Yat-sen University, China(中山大学) Pengcheng Laboratory, China(鹏城实验室)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出紧凑表示实现高效预测无损编码,通过几何重密化模块和跨尺度特征传播模块解决稀疏点云上下文建模难题,实现实时速度下的竞争性压缩性能。

Comments arXiv admin note: substantial text overlap with arXiv:2508.20466

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05497 2026-06-23 cs.RO 版本更新 57%

Safe-SAGE: Social-Semantic Adaptive Guidance for Safe Engagement through Laplace-Modulated Poisson Safety Functions

Safe-SAGE: 通过拉普拉斯调制泊松安全函数实现安全交互的社会-语义自适应引导

Lizhi Yang, Ryan M. Bena, Meg Wilkinson, Gilbert Bahati, Andy Navarro Brenes, Ryan K. Cosner, Aaron D. Ames

机构 * Caltech MCE(Caltech机械工程系) Tufts ME(Tufts大学机械工程系)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出Safe-SAGE框架,结合泊松安全函数与拉普拉斯引导场,融合多传感器点云与视觉语义分割,通过多层安全滤波器实现腿式机器人在语义丰富动态环境中的安全导航。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Copyright transferred to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06331 2026-06-23 cs.CV 版本更新 57%

Label-Efficient 3D Forest Mapping: Self-Supervised and Transfer Learning for Instance Segmentation, Semantic Segmentation, and Species Classification

标签高效的3D森林映射:自监督与迁移学习用于实例分割、语义分割和物种分类

Aldino Rizaldy, Fabian Ewald Fassnacht, Ahmed Jamal Afifi, Hua Jiang, Richard Gloaguen, Pedram Ghamisi

机构 * Helmholtz-Zentrum Dresden-Rossendorf (HZDR), Helmholtz Institute Freiberg for Resource Technology (HIF)(德累斯顿-罗斯托克亥姆霍兹中心(HZDR)、弗里贝格资源技术亥姆霍兹研究所(HIF)) Remote Sensing and Geoinformatics, Freie Universität Berlin(柏林自由大学遥感与地理信息学系) Institute of Geomatics, BOKU University(博科尼大学测绘学院) Faculty of Electrical and Computer Engineering, University of Iceland(爱沙尼亚大学电气与计算机工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文利用自监督和迁移学习策略,在少量标注数据下提升3D点云中树木实例分割、语义分割和物种分类的性能,并集成统一框架以简化流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17125 2026-06-23 cs.RO 版本更新 57%

Imagine2Act: Leveraging Object-Action Motion Consistency from Imagined Goals for Robotic Manipulation

Imagine2Act:利用想象目标中的物体-动作运动一致性进行机器人操作

Liang Heng, Jiadong Xu, Yiwen Wang, Xiaoqi Li, Muhe Cai, Yan Shen, Juan Zhu, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PrimeBot AGIBOT

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出Imagine2Act框架,通过生成想象目标点云并引入物体-动作一致性策略,将语义和几何约束融入策略学习,解决高精度物体重排任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06828 2026-06-23 cs.RO cs.AI 版本更新 57%

NeuPAN: Direct Point Robot Navigation with End-to-End Model-based Learning

NeuPAN: 基于端到端模型学习的直接点机器人导航

Ruihua Han, Shuai Wang, Shuaijun Wang, Zeqing Zhang, Jianjun Chen, Shijie Lin, Chengyang Li, Chengzhong Xu, Yonina C. Eldar, Qi Hao, Jia Pan

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出NeuPAN,一种实时、高精度、无地图、易部署的机器人运动规划器,通过紧耦合感知-控制框架和端到端模型学习,直接处理原始点云生成无碰撞运动,避免感知到控制的误差传播。

Comments Accepted by TRO 2025; project website: https://hanruihua.github.io/neupan_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11589 2026-06-23 eess.SP cs.IT math.IT 版本更新 50%

Unification of Signal Transform Theory

信号变换理论的统一

Mitchell A. Thornton

专题命中 点云 :3D vision(abstract)

AI总结 本文基于代数多样性框架,统一了多种信号变换及其连续形式,揭示了其作为协方差不变性的本征基的原理,并提出了基于匹配群发现的算法。

Comments v2: Added Hankel, Hankel (cont.), AR(m)/pedagogical remarks, 10 new references; v3: Added material on matched transforms without a group (non-Schurian association schemes) and a code repository link; v4: Added Dunkl transform theorem

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01022 2026-06-23 cs.LG eess.SP stat.ML 版本更新 50%

VDW-GNNs: Vector diffusion wavelets for geometric graph neural networks

VDW-GNNs:面向几何图神经网络的向量扩散小波

David R. Johnson, Alexander Sietsema, Rishabh Anand, Deanna Needell, Smita Krishnaswamy, Michael Perlmutter

机构 * Program in Computing, Boise State University, Boise, Idaho, USA(博伊西州立大学计算项目) Department of Mathematics, UCLA, Los Angeles, CA, USA(洛杉矶大学数学系) Department of Computer Science, Yale University, New Haven, CT, USA(耶鲁大学计算机科学系) Department of Genetics, Yale University, New Haven, CT, USA(耶鲁大学遗传学系) Department of Mathematics, Boise State University, Boise, Idaho, USA(博伊西州立大学数学系)

专题命中 点云 :point cloud(abstract)

AI总结 提出向量扩散小波(VDW),受向量扩散映射算法启发,可有效融入几何图神经网络(VDW-GNNs),在合成点云和真实风场、神经活动数据上表现良好,并证明其具有框架理论和旋转平移对称性。

Comments Presented at ICML 2026. A previous, shorter version of this work was presented in the "New Perspectives in Advancing Graph Machine Learning" workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2605.08787 2026-06-23 cs.CV 版本更新 74%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 空间理解 :spatial understanding(title);分类 cs.CV

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他3D视觉 1 篇

2603.08305 2026-06-23 cs.CV cs.AI 版本更新 57%

Retrieval-Augmented Anatomical Guidance for Text-to-CT Generation

检索增强的解剖引导用于文本到CT生成

Daniele Molino, Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma, Rome, Italy(人工智能与计算机系统单位,工程系,罗马生物医学大学,意大利罗马) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University, Umeå, Sweden(诊断与介入系,生物医学工程与放射物理,乌梅大学,瑞典乌梅)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出检索增强方法,通过检索相关临床案例的解剖标注作为结构代理,注入文本条件潜在扩散模型,实现文本到CT生成中语义与解剖信息的融合,提升图像保真度和临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏