arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-13 至 2026-04-13 共收录 16 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2604.08945 2026-04-13 cs.CV cs.RO 81%

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08610 2026-04-13 cs.CV 74%

A Semi-Automated Framework for 3D Reconstruction of Medieval Manuscript Miniatures

一种用于中世纪手稿微型画三维重建的半自动化框架

Riccardo Pallotto, Pierluigi Feliciati, Tiberio Uricchio

机构 * University of Macerata(马切拉塔大学) University of Pisa(比萨大学)

专题命中 三维重建 :3D reconstruction(title);分类 cs.CV

AI总结 本文提出一种半自动化框架,将中世纪手稿中的二维微型画转换为适用于扩展现实、触觉3D打印和网络可视化三维数字模型,通过评估七种图像到3D方法,发现体积扩展与几何保真度之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27222 2026-04-13 cs.CV 57%

HD-VGGT: High-Resolution Visual Geometry Transformer

HD-VGGT:高分辨率视觉几何变换器

Tianrun Chen, Yuanqi Hu, Yidong Han, Hanjie Xu, Deyi Ji, Qi Zhu, Chunan Yu, Xin Zhang, Cheng Chen, Chaotao Ding, Ying Zang, Xuanfu Li, Jin Ma, Lanyun Zhu

机构 * Zhejiang University(浙江大学) Huzhou University(湖州师范学院) Nanjing University of Science and Technology(南京理工大学) Huawei(华为) Tongji University(同济大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 HD-VGGT通过双分支架构实现高效稳定的高分辨率3D重建,利用低分辨率分支生成全局一致的几何结构,高分辨率分支通过学习的特征上采样模块细化细节,采用特征调制技术抑制不稳定特征,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08835 2026-04-13 physics.optics 50%

High-resolution long-range 3D single-photon imaging with a compact SPAD array

高分辨率远距离3D单光子成像技术基于紧凑型SPAD阵列

Zunwang Bo, Chenjin Deng, Fei Wang, Wenlin Gong, Yuanhao Su, Yichen Zhang, Mingliang Chen, Chunfang Wang, Shensheng Han

专题命中 三维重建 :3D reconstruction(abstract)

AI总结 本文提出一种基于DMD和紧凑型SPAD阵列的高分辨率远距离3D单光子成像系统,通过高分辨率空间调制与并行时间分辨检测结合,实现超越传统检测器格式的采样,并通过飞行时间测量保持深度信息,实验中在670米距离实现256x256有效空间分辨率的3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 7 篇

2604.08760 2026-04-13 cs.CV 85%

SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation

SIC3D:基于风格图像的文本到3D高斯点云生成

Ming He, Zhixiang Chen, Steve Maddock

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);3D generation(abstract);分类 cs.CV

AI总结 SIC3D通过引入变分风格化分数蒸馏损失,提升文本到3D生成的可控性和纹理精度,实验表明其在几何真实性和风格一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01767 2026-04-13 cs.CV 83%

LoBE-GS: Load-Balanced and Efficient 3D Gaussian Splatting for Large-Scale Scene Reconstruction

LoBE-GS:负载均衡且高效的3D高斯点散射用于大规模场景重建

Sheng-Hsiang Hung, Ting-Yu Yen, Wei-Fang Sun, Simon See, Shih-Hsuan Hung, Hung-Kuo Chu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(NVIDIA AI技术中心(NVAITC))

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 LoBE-GS通过负载均衡的KD树分区和优化切线,提升大规模3DGS场景重建效率,实现两倍更快的端到端训练时间,同时保持重建质量并支持无法用传统3DGS处理的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08967 2026-04-13 cs.SD 82%

AudioGS: Spectrogram-Based Audio Gaussian Splatting for Sound Field Reconstruction

AudioGS:基于频谱的音频高斯点云用于声音场重建

Chunhao Bi, Houqiang Zhong, Zhixin Xu, Li Song, Zhengxue Cheng

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学文创学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract)

AI总结 AudioGS通过频谱构建音频高斯点云,无需视觉先验,有效重建空间音频,实验显示其在MAG和DPAM指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09324 2026-04-13 cs.CV 79%

Structure-Aware Fine-Grained Gaussian Splatting for Expressive Avatar Reconstruction

具有结构意识的细粒度高斯点散布用于表现力Avatar重建

Yuze Su, Hongsong Wang, Jie Gui, Liang Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Purple Mountain Laboratories(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用监管工程研究中心(东南大学)) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统全国重点实验室) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出SFGS方法,通过空间三平面和时间六平面捕捉动态特征,结合结构感知高斯模块和残差细化模块,实现高保真全身体素Avatar重建,优于现有方法。

Comments The code is on Github: https://github.com/Su245811YZ/SFGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07928 2026-04-13 cs.CV cs.LG 79%

Generative 3D Gaussian Splatting for Arbitrary-ResolutionAtmospheric Downscaling and Forecasting

生成式3D高斯散射用于任意分辨率的大气降尺度与预测

Tao Han, Zhibin Wen, Zhenghao Chen, Fenghua Lin, Junyu Gao, Song Guo, Lei Bai

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Computer and Information Sciences, University of Newcastle(纽卡斯尔大学计算机与信息科学学院) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能、光学与电子学学院(iOPEN))

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出GSSA-ViT框架,通过生成式3D高斯模型与尺度感知注意力机制,实现高维大气场的任意分辨率预测与降尺度,提升多尺度预测效率与准确性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02781 2026-04-13 cs.SD 67%

DynFOA: Generating First-Order Ambisonics with Conditional Diffusion for Dynamic and Acoustically Complex 360-Degree Videos

DynFOA: 利用条件扩散生成动态和声学复杂的360度视频的首阶混响

Ziyu Luo, Lin Chen, Qiang Qu, Xiaoming Chen, Yiran Shen

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3DGS(abstract)

AI总结 本文提出DynFOA,通过整合动态场景重建与条件扩散模型,从360度视频生成首阶混响,解决复杂场景中声学效果建模问题,实验表明其在空间准确性、声学保真度等方面优于现有方法。

Comments Accidental duplicate submission. This paper was intended to be a replacement (v2) for arXiv:2602.06846

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10415 2026-04-13 math.NA cs.NA 50%

Multiscaling in Wasserstein Spaces

Wael Mattar, Nir Sharon

专题命中 Gaussian Splatting :point cloud(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 4 篇

2604.09478 2026-04-13 cs.CV cs.RO 62%

Incremental Semantics-Aided Meshing from LiDAR-Inertial Odometry and RGB Direct Label Transfer

增量语义辅助的LiDAR-惯性里程计与RGB直接标签转移的网格生成

Muhammad Affan, Ville Lehtola, George Vosselman

机构 * Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente(特温特大学地理信息科学与地球观测学院(ITC))

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 本文提出基于RGB和LiDAR的增量语义辅助网格生成方法,通过直接标签转移提升几何重建精度,优于ImMesh和Voxblox,为XR和数字建模提供新路径。

Comments 8 pages, 5 figures, 2 tables. Accepted in ISPRS Archives 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08664 2026-04-13 cs.RO 57%

Generative Simulation for Policy Learning in Physical Human-Robot Interaction

生成仿真在物理人机交互中政策学习中的应用

Junxiang Wang, Xinwen Xu, Tiancheng Wu, Julian Millan, Nir Pechuk, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出零样本生成仿真框架,通过自然语言提示生成多样化的物理人机交互场景,用于自主收集合成数据并训练基于视觉的模仿学习策略,实现从仿真到现实的零样本迁移。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08548 2026-04-13 cs.CV 57%

ETCH-X: Robustify Expressive Body Fitting to Clothed Humans with Composable Datasets

ETCH-X:通过可组合数据集增强具有衣物人类的表达性身体拟合

Xiaoben Li, Jingyi Wu, Zeyu Cai, Siyuan Yu, Boqian Li, Yuliang Xiu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出ETCH-X,通过引入紧致性感知拟合范式、SMPL-X扩展和隐式密集对应关系,提升身体拟合的鲁棒性和细节表达,实现对衣物动态、姿态变化和噪声输入的高效处理。

Comments Page: https://xiaobenli00.github.io/ETCH-X/, Code: https://github.com/XiaobenLi00/ETCH-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05060 2026-04-13 cs.CV cs.LG 57%

R3PM-Net: Real-time, Robust, Real-world Point Matching Network

R3PM-Net:实时、稳健、真实世界点匹配网络

Yasaman Kashefbahrami, Erkut Akdag, Panagiotis Meletis, Evgeniya Balmashnova, Dip Goswami, Egor Bondarau

机构 * Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) Sioux Technologies

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出R3PM-Net,一种轻量级、全局感知的点匹配网络,旨在解决点云配准在真实工业场景中的泛化性和实时性问题,通过两个新数据集验证其在精度和速度上的优势。

Comments Accepted to CVPRw 2026 (Oral), Code and datasets at https://github.com/YasiiKB/R3PM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 1 篇

2604.09531 2026-04-13 cs.CV cs.AI cs.CL 57%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏