arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-08 至 2026-07-08 共收录 11 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2603.21046 2026-07-08 cs.CV cs.AI 版本更新 57%

SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation

SpatialFly:基于几何的表示对齐用于城市环境中无人机视觉与语言导航

Wen Jiang, Kangyao Huang, Li Wang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hanfang Liang, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua University(清华大学) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Jianghan University(江汉大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出SpatialFly框架,通过几何引导的2D表示对齐机制,解决无人机在复杂3D环境中的视觉与语言导航问题,实验表明其在路径对齐和运动稳定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15275 2026-07-08 cs.CV cs.LG 版本更新 57%

RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

RayRoPE: 多视角注意力的投影位置编码

Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 三维重建 :3DGS(abstract);分类 cs.CV

AI总结 本文提出RayRoPE,一种基于投影坐标的位置编码方法,用于多视角Transformer,实现SE(3)不变的注意力机制,并能适应3D场景几何。

Comments Project page: https://rayrope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02716 2026-07-08 cs.CV 版本更新 57%

MorphGS: Morphology-Adaptive Articulated 3D Motion Transfer from Videos

MorphGS:基于形态的 articulated 3D 动作迁移从视频

Taeyeon Kim, Youngju Na, Jumin Lee, Sebin Lee, Minhyuk Sung, Sung-Eui Yoon

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出MorphGS框架,通过图像空间监督直接优化目标形态和姿态,解决视频到3D角色动作迁移中的形态差异和姿态模糊问题,实验显示优于基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21245 2026-07-08 cs.CV 版本更新 57%

FIELDS: Face reconstruction with accurate Inference of Expression using Learning with Direct Supervision

FIELDS:通过直接监督学习进行表情精确推断的面部重建

Chen Ling, Henglin Shi, Hedvig Kjellström

机构 * KTH Royal Institute of Technology(皇家理工学院) Linköping University(林奈大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究单目3D面部重建,提出FIELDS框架,通过直接监督学习在几何合理性约束下获取FLAME表情代码用于面部表情识别,采用混合2D/3D监督,提升情感预测且保持几何保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2308.16041 2026-07-08 cs.CV 版本更新 57%

From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

从像素到肖像:会说话头像生成技术与应用的全面综述

Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda

专题命中 NeRF :NeRF(abstract);分类 cs.CV

AI总结 综述会说话头像生成技术,将文献分为四类方法并讨论其技术思想等。分析定量指标与感知质量差距,比较公开模型,研究新兴趋势,确定开放挑战,为从业者提供领域地图,突出相关技术和社会问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 3 篇

2411.17392 2026-07-08 cs.CV 版本更新 79%

NumGrad-Pull: Numerical Gradient Guided Tri-plane Representation for Surface Reconstruction from Point Clouds

NumGrad-Pull:用于从点云进行表面重建的数值梯度引导三平面表示

Ruikai Cui, Binzhu Xie, Shi Qiu, Jiawei Liu, Saeed Anwar, Nick Barnes

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Computer Science & Software Engineering, the University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文针对从点云重建连续曲面的挑战,提出NumGrad-Pull方法,利用三平面结构、数值梯度、渐进平面扩展和数据采样策略,集成到统一框架,有效应对学习SDF的局部性和稀疏性问题,实验验证了方法的有效性和鲁棒性。

Comments Accepted in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08230 2026-07-08 cs.CV cs.LG 版本更新 74%

Partial Symmetry Detection for 3D Geometry using Contrastive Learning with Geodesic Point Cloud Patches

使用测地线点云补丁对比学习进行3D几何的部分对称检测

Gregor Kobsik, Isaak Lim, Leif Kobbelt

机构 * Visual Computing Institute, RWTH Aachen University(视觉计算研究所,亚琛工业大学)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 研究3D几何中部分对称检测难题,提出自监督对比学习框架SymCL,通过映射局部测地线补丁到欧几里得群不变潜在空间,将对称检测转化为基于密度的聚类问题,能同时发现多实例对称关系,在新基准上定量评估并展示泛化能力。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13431 2026-07-08 cs.CV 版本更新 57%

FUSE: A Flow-based Mapping Between Shapes

FUSE:一种基于流的形状间映射

Lorenzo Olearo, Giulio Viganò, Daniele Baieri, Filippo Maggioli, Simone Melzi

机构 * University of Milano-Bicocca(米兰-布西卡大学) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Pegaso University(佩加索大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究3D形状间映射,基于流匹配模型提出新型神经表示,计算高效,支持跨表示形状匹配,无需大规模训练等。通过特定流映射和嵌入编码形状,在多种形状匹配任务及其他任务如UV映射、人体点云扫描配准中表现出色。

Comments 11 pages, 9 figures. Accepted for publication at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 2 篇

2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 79%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29655 2026-07-08 cs.CV cs.GR 版本更新 62%

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent America(腾讯美国)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. SLAM与定位 1 篇

2605.10004 2026-07-08 eess.SP 版本更新 50%

Environment-Conditioned Diffusion Meta-Learning for Data-Efficient WiFi Localization

环境感知扩散元学习用于数据高效的WiFi定位

Jun Gao, Zheng Xing, Wenliang Lin, Weibing Zhao, Xuhui Zhang, Junting Chen, Zhongliang Deng, Shuguang Cui

专题命中 SLAM与定位 :point cloud(abstract)

AI总结 本文提出EnvCoLoc框架,通过环境条件化的扩散元学习方法,解决WiFi指纹定位中跨环境泛化能力差的问题,核心贡献是引入几何感知先验和元学习初始化,提升在有限样本下的定位精度。

Comments The dataset used in this paper is publicly available at: https://drive.google.com/file/d/1GWUFExgJl3SYyIm-sUYedy9gjC_Bvq0q/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏