arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-08 至 2026-07-08 共收录 22 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2603.21046 2026-07-08 cs.CV cs.AI 版本更新 57%

SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation

SpatialFly:基于几何的表示对齐用于城市环境中无人机视觉与语言导航

Wen Jiang, Kangyao Huang, Li Wang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hanfang Liang, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua University(清华大学) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Jianghan University(江汉大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出SpatialFly框架,通过几何引导的2D表示对齐机制,解决无人机在复杂3D环境中的视觉与语言导航问题,实验表明其在路径对齐和运动稳定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15275 2026-07-08 cs.CV cs.LG 版本更新 57%

RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

RayRoPE: 多视角注意力的投影位置编码

Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

专题命中 三维重建 :3DGS(abstract);分类 cs.CV

AI总结 本文提出RayRoPE,一种基于投影坐标的位置编码方法,用于多视角Transformer,实现SE(3)不变的注意力机制,并能适应3D场景几何。

Comments Project page: https://rayrope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02716 2026-07-08 cs.CV 版本更新 57%

MorphGS: Morphology-Adaptive Articulated 3D Motion Transfer from Videos

MorphGS:基于形态的 articulated 3D 动作迁移从视频

Taeyeon Kim, Youngju Na, Jumin Lee, Sebin Lee, Minhyuk Sung, Sung-Eui Yoon

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出MorphGS框架,通过图像空间监督直接优化目标形态和姿态,解决视频到3D角色动作迁移中的形态差异和姿态模糊问题,实验显示优于基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21245 2026-07-08 cs.CV 版本更新 57%

FIELDS: Face reconstruction with accurate Inference of Expression using Learning with Direct Supervision

FIELDS:通过直接监督学习进行表情精确推断的面部重建

Chen Ling, Henglin Shi, Hedvig Kjellström

机构 * KTH Royal Institute of Technology(皇家理工学院) Linköping University(林奈大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究单目3D面部重建,提出FIELDS框架,通过直接监督学习在几何合理性约束下获取FLAME表情代码用于面部表情识别,采用混合2D/3D监督,提升情感预测且保持几何保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2308.16041 2026-07-08 cs.CV 版本更新 57%

From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

从像素到肖像:会说话头像生成技术与应用的全面综述

Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda

专题命中 NeRF :NeRF(abstract);分类 cs.CV

AI总结 综述会说话头像生成技术,将文献分为四类方法并讨论其技术思想等。分析定量指标与感知质量差距,比较公开模型,研究新兴趋势,确定开放挑战,为从业者提供领域地图,突出相关技术和社会问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 4 篇

2607.05598 2026-07-08 cs.GR cs.CV 新提交 93%

SSA-3DGS: Unsupervised Removal of Screen-Space Artifacts for 3D Gaussian Splatting

SSA-3DGS:用于3D高斯点渲染的屏幕空间伪影无监督移除

Kristof Overdulve, Lode Jorissen, Nick Michiels

机构 * Digital Future Lab, Flanders Make, Hasselt University(数字未来实验室,弗拉芒制造,哈塞尔特大学)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对3D高斯点渲染中屏幕空间伪影问题,提出SSA-3DGS无监督框架,利用视图几何一致性,联合优化3D场景与2D叠加,在合成及真实数据集上,相比同条件3DGS提高重建保真度9dB PSNR,且保留伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05522 2026-07-08 cs.CV cs.AI 新提交 89%

Rendering-Aware Bayesian 3D Gaussian Splatting with Native Uncertainty and Adaptive Complexity Control

具有原生不确定性和自适应复杂度控制的渲染感知贝叶斯3D高斯点云渲染

Gaoxiang Jia, Vikram Appia, Junzhou Huang, Xinlei Wang

机构 * Advanced Micro Devices, Inc.(超威半导体公司) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 研究针对3D高斯点云渲染标准训练管道的不足,引入渲染感知贝叶斯3DGS框架,通过特定后验跟踪高斯几何,有可选扩展及明确训练计划。实验表明该框架在主动视图选择等任务中表现出色,能提供原生预测不确定性,提升相关指标。

Comments 26 pages, 4 figures, 24 tables including appendix. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06238 2026-07-08 cs.CV 新提交 57%

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

PhyMRI-SR:迈向基于物理感知的MRI图像超分辨率

Lihua Wei, Huatong Gao, Jia Gong, Zhiyu Tan, Hao Li, Jun Liu, Zhihua Ren

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Academy of AI for Science(上海人工智能研究院) Fudan University(复旦大学) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学生物医学工程学院与先进医学材料与器械国家重点实验室) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究旨在解决MRI图像超分辨率问题,将其视为物理感知重建问题。核心方法是采用2D高斯点渲染并引入三项创新,包括先验感知高斯表示、物理约束信号建模和元学习框架。主要贡献是在动态分辨率数据集和标准基准上实现领先性能,有临床部署潜力。

Comments Project Page: https://bio-med-i2-lab.github.io/projects/PhyMRI-SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05906 2026-07-08 cs.CV 新提交 57%

GaussFusion: Towards Multimodal 3D Gaussian Pretraining

高斯融合:迈向多模态3D高斯预训练

Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo

机构 * Wuhu HIT Robot Technology Research Institute Co., Ltd.(芜湖哈工大机器人技术研究院有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究提出GaussFusion多模态3D高斯预训练框架,通过跨模态语义对齐集成图像和文本监督,还提出高斯显著性引导的多尺度空洞掩码,实验表明该方法提高了高斯表示可迁移性,在ModelNet40和ScanObjectNN上有性能提升。

Comments 32 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 9 篇

2607.06484 2026-07-08 cs.CR cs.CV cs.LG 新提交 79%

Assessing the Operational Impact of Poisoning Attacks over Augmented 3D Point Cloud Public Datasets for Connected and Autonomous Vehicles

评估针对联网和自动驾驶车辆的增强型3D点云公共数据集的中毒攻击的操作影响

Marwan Lazrag, Badis Hammi, Lorena Gonzalez-Manzano, Joaquin Garcia-Alfaro

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris) Universidad Carlos III de Madrid

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 探讨针对联网和自动驾驶车辆增强型3D点云公共数据集的中毒攻击影响,以生成对抗网络技术为例评估增强中毒数据集效果,验证中毒能规避增强技术净化特性及在增强数据集上的传播与干扰,且实验材料公开。

Comments Accepted for presentation at SECRYPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17392 2026-07-08 cs.CV 版本更新 79%

NumGrad-Pull: Numerical Gradient Guided Tri-plane Representation for Surface Reconstruction from Point Clouds

NumGrad-Pull:用于从点云进行表面重建的数值梯度引导三平面表示

Ruikai Cui, Binzhu Xie, Shi Qiu, Jiawei Liu, Saeed Anwar, Nick Barnes

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Computer Science & Software Engineering, the University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文针对从点云重建连续曲面的挑战,提出NumGrad-Pull方法,利用三平面结构、数值梯度、渐进平面扩展和数据采样策略,集成到统一框架,有效应对学习SDF的局部性和稀疏性问题,实验验证了方法的有效性和鲁棒性。

Comments Accepted in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交 74%

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08230 2026-07-08 cs.CV cs.LG 版本更新 74%

Partial Symmetry Detection for 3D Geometry using Contrastive Learning with Geodesic Point Cloud Patches

使用测地线点云补丁对比学习进行3D几何的部分对称检测

Gregor Kobsik, Isaak Lim, Leif Kobbelt

机构 * Visual Computing Institute, RWTH Aachen University(视觉计算研究所,亚琛工业大学)

专题命中 点云 :point cloud(title);分类 cs.CV

AI总结 研究3D几何中部分对称检测难题,提出自监督对比学习框架SymCL,通过映射局部测地线补丁到欧几里得群不变潜在空间,将对称检测转化为基于密度的聚类问题,能同时发现多实例对称关系,在新基准上定量评估并展示泛化能力。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交 62%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05955 2026-07-08 cs.CV cs.AI 新提交 57%

NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation

NegROI:基于场景条件负提示的以点击为中心的不确定性引导细化用于稳健交互式3D分割

Shuheng Zhang, Feng Wu

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究针对交互式3D分割中粗体素分辨率及背景误报问题,提出NegROI框架,结合点击中心多分辨率细化与场景条件负提示,通过不确定性驱动选择性细化、负提示建模及边界感知硬负挖掘,提升点击效率、减少误报并增强跨数据集鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05493 2026-07-08 cs.CV 新提交 57%

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理

Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong Polytechnic University(香港理工大学) Linköping University(林雪平大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究3D环境自然语言查询的可操作性问题,提出Ground3D-LMM统一模型,以点云等为输入,支持3D空间对话,能给出基于点的响应和度量数值输出,通过定义新任务、引入数据集验证,为3D对话理解提供强大基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05421 2026-07-08 cs.GR 新提交 57%

Procedural Volumetric Modeling of Plant Branching Structures for Finite Element Analysis

用于有限元分析的植物分支结构的过程性体素建模

Ajith Moola, Prashant Kumar Gupta, Baskar Ganapathysubramanian, Aishwarya Pawar

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 针对精准农业等领域对植物建模的需求,提出自动体素过程性建模框架,能从输入骨架或点云生成适合有限元分析的六面体网格,经多步骤操作实现,在多植物数据集验证,还支持动态网格生成模拟植物生长。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13431 2026-07-08 cs.CV 版本更新 57%

FUSE: A Flow-based Mapping Between Shapes

FUSE:一种基于流的形状间映射

Lorenzo Olearo, Giulio Viganò, Daniele Baieri, Filippo Maggioli, Simone Melzi

机构 * University of Milano-Bicocca(米兰-布西卡大学) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Pegaso University(佩加索大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究3D形状间映射,基于流匹配模型提出新型神经表示,计算高效,支持跨表示形状匹配,无需大规模训练等。通过特定流映射和嵌入编码形状,在多种形状匹配任务及其他任务如UV映射、人体点云扫描配准中表现出色。

Comments 11 pages, 9 figures. Accepted for publication at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 3 篇

2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 79%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29655 2026-07-08 cs.CV cs.GR 版本更新 62%

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent America(腾讯美国)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06565 2026-07-08 cs.CV cs.AI cs.LG 新提交 57%

ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

ELSA3D:用于统一3D理解与生成的弹性语义锚定

Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. SLAM与定位 1 篇

2605.10004 2026-07-08 eess.SP 版本更新 50%

Environment-Conditioned Diffusion Meta-Learning for Data-Efficient WiFi Localization

环境感知扩散元学习用于数据高效的WiFi定位

Jun Gao, Zheng Xing, Wenliang Lin, Weibing Zhao, Xuhui Zhang, Junting Chen, Zhongliang Deng, Shuguang Cui

专题命中 SLAM与定位 :point cloud(abstract)

AI总结 本文提出EnvCoLoc框架,通过环境条件化的扩散元学习方法,解决WiFi指纹定位中跨环境泛化能力差的问题,核心贡献是引入几何感知先验和元学习初始化,提升在有限样本下的定位精度。

Comments The dataset used in this paper is publicly available at: https://drive.google.com/file/d/1GWUFExgJl3SYyIm-sUYedy9gjC_Bvq0q/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏