arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-27 至 2026-04-27 共收录 14 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2604.22714 2026-04-27 cs.CV 57%

Long-tail Internet photo reconstruction

长尾互联网照片重建

Yuan Li, Yuanbo Xiangli, Hadar Averbuch-Elor, Noah Snavely, Ruojin Cai

机构 * Cornell University(康奈尔大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文针对长尾分布的互联网照片重建问题,提出MegaDepth-X数据集和采样策略,提升极端稀疏场景下的3D重建鲁棒性,并增强对对称重复场景的重建可靠性。

Comments Project page: https://megadepth-x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21749 2026-04-27 cs.GR 57%

CuRast: Cuda-Based Software Rasterization for Billions of Triangles

CuRast:基于CUDA的软件光栅化用于数十亿个三角形

Markus Schütz, Lukas Lipp, Elias Kristmann, Michael Wimmer

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.GR

AI总结 CuRast通过CUDA实现高效光栅化,可处理数十亿个三角形,比Vulkan快2-5倍(唯一)或12倍(实例化),但不支持透明和低多边形场景的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20435 2026-04-27 cs.LG cs.AI cs.CG math.AT 50%

The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology

对抗影响的形状:利用持久同调表征大语言模型的潜在空间

Aideen Fay, Inés García-Redondo, Qiquan Wang, Haim Dubossarsky, Anthea Monod

机构 * Microsoft Security Response Center(微软安全响应中心) AIDOS Lab, University of Fribourg(弗里堡大学AIDOS实验室) Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系) Queen Mary University of London(伦敦大学量子玛丽学院) Imperial College London(伦敦帝国理工学院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 三维重建 :point cloud(abstract)

AI总结 本文利用持久同调方法分析对抗输入如何改变大语言模型潜在空间的几何拓扑结构,揭示了潜在空间压缩和拓扑特征的普遍性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 4 篇

2604.22183 2026-04-27 cs.CV 87%

EvFlow-GS: Event Enhanced Motion Deblurring with Optical Flow for 3D Gaussian Splatting

EvFlow-GS:基于事件流的运动去模糊与3D高斯点云拼接

Feiyu An, Yufei Deng, Zihui Zhang, Rong Xiao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出EvFlow-GS框架,结合事件流和光流优化端到端的双积分、相机姿态和3D高斯点云拼接,解决运动模糊图像的3D重建问题。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20046 2026-04-27 cs.CV 87%

Gaussians on a Diet: High-Quality Memory-Bounded 3D Gaussian Splatting Training

饮食中的高斯:高质量内存受限的3D高斯喷射训练

Yangming Zhang, Jian Xu, Chaojian Li, Kunxiong Zhu, Wei Niu, Gagan Agrawal, Yang Katie Zhao, Jian Wang, Yingyan Celine Lin, Miao Yin

机构 * Dept. of Computer Science University of Texas at Arlington(计算机科学系德克萨斯理工大学阿灵顿分校) School of Computer Science Georgia Institute of Technology(计算机科学学院佐治亚理工学院) School of Computing University of Georgia(计算学院佐治亚大学) Department of ECE University of Minnesota - Twin Cities(电子与计算机工程系明尼苏达大学-双城分校) Snap Inc.(Snap公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出一种内存受限的3D高斯喷射训练框架,通过动态优化高斯体实现低内存消耗,显著提升渲染质量,实现在NVIDIA Jetson AGX Xavier上的高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22129 2026-04-27 cs.CV cs.RO 86%

PAGaS: Pixel-Aligned 1DoF Gaussian Splatting for Depth Refinement

PAGaS:基于像素对齐的1DoF高斯散射用于深度细化

David Recasens, Robert Maier, Aljaz Bozic, Stephane Grabli, Javier Civera, Tony Tung, Edmond Boyer

机构 * University of Zaragoza(萨拉戈萨大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);novel view synthesis(abstract);分类 cs.CV、cs.RO

AI总结 PAGaS通过1DoF高斯散射模型提升多视图立体深度估计的精度,利用像素对齐和约束优化实现高精度深度映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22439 2026-04-27 cs.CV 79%

NRGS: Neural Regularization for Robust 3D Semantic Gaussian Splatting

NRGS: 用于鲁棒3D语义高斯点云的神经正则化

Zaiyan Yang, Xinpeng Liu, Heng Guo, Jinglei Shi, Zhanyu Ma, Fumio Okura

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学,中国) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance, China(北京多模态数据智能感知与治理重点实验室,中国) The University of Osaka, Japan(大阪大学,日本) Nankai University, China(南开大学,中国)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出神经正则化方法,通过提升多视角不一致2D特征产生的3D语义场,以获得准确且鲁棒的3D语义高斯点云。方法直接在3D高斯点云上操作,利用其几何和外观属性纠正3D空间中的语义错误。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 3 篇

2604.22354 2026-04-27 cs.CV 79%

One Shot Learning for Edge Detection on Point Clouds

单样本学习用于点云边缘检测

Zhikun Tu, Yuhe Zhang, Yiou Jia, Kang Li, Daniel Cohen-Or

机构 * School of Information Science and Technology, Northwest University(信息科学与技术学院,西北大学) Department of Computer Science, Tel Aviv University(计算机科学系,特拉维夫大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出OSFENet,通过设计过滤KNN表面补丁表示实现单样本学习,提升点云边缘检测性能,实验验证其在多个数据集上的有效性。

Comments 17 pages, 14 figures. Published in IEEE Transactions on Visualization and Computer Graphics

Journal ref IEEE Transactions on Visualization and Computer Graphics 31(10) (2025) 7184-7195

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22657 2026-04-27 cs.CV 57%

A Non-Invasive Alternative to RFID: Self-Sufficient 3D Identification of Group-Housed Livestock

一种非侵入式的替代 RFID:自给自足的 3D 牛群识别

Shiva Paudel, TsungCheng Tsai, Dongyi Wang

机构 * University of Arkansas Fayetteville(阿肯色大学富特海斯分校)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出基于 3D 点云数据的非侵入式识别系统,采用自给自足的半监督框架 TARA,通过动态校准机制实现牛群身份一致性,实验表明在无标签环境中实现 100% 准确率,为自主动物监测提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22518 2026-04-27 cs.CV 57%

Non-Minimal Sampling and Consensus for Prohibitively Large Datasets

非最小采样与共识:对大规模数据集的非最小采样与共识

Seong Hun Lee, Patrick Vandewalle, Javier Civera

机构 * I3A, University of Zaragoza(I3A,萨拉戈萨大学) EAVISE, KU Leuven(EAVISE,鲁文大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出NONSAC框架,通过非最小采样和稳健估计提升大规模数据集的鲁棒性和可扩展性,适用于相对相机姿态估计、PnP和点云配准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2604.21776 2026-04-27 cs.CV 57%

Reshoot-Anything: A Self-Supervised Model for In-the-Wild Video Reshooting

Reshoot-Anything:一种用于真实视频重拍的自监督模型

Avinash Paliwal, Adithya Iyer, Shivin Yadav, Muhammad Ali Afridi, Midhun Harikumar

机构 * Morphic Inc.(Morphic公司)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出一种自监督框架,通过生成伪多视角训练三元组实现动态视频重拍,利用互联网级单目视频提升模型泛化能力,解决多视角数据稀缺问题。

Comments CVPRW 2026, Project page: https://adithyaiyer1999.github.io/reshoot-anything/, Code: https://github.com/morphicfilms/video-to-video

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 3 篇

2604.17706 2026-04-27 cs.RO 74%

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型

Haoxiang Jie, Yaoyuan Yan, Xiangyu Wei, Kailin Wang, Hongjie Yan, Zhiyou Heng, Daocheng Chen

机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) Omni AI(奥米尼人工智能) VBot East China Normal University(东华大学)

专题命中 空间理解 :spatial understanding(title);分类 cs.RO

AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22595 2026-04-27 cs.CV 57%

EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges

EV-CLIP:为视觉挑战下的少样本动作识别在CLIP中实现高效的视觉提示适应

Hyo Jin Jon, Longbin Jin, Eun Yi Kim

机构 * Artificial Intelligence & Computer Vision Lab., Konkuk University, Seoul, South Korea(人工智能与计算机视觉实验室,韩国康 kuk 大学,首尔)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出EV-CLIP,通过引入mask prompts和context prompts提升CLIP在少样本视频动作识别中的性能,克服视觉挑战对空间感知的影响。

Comments 14 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10698 2026-04-27 cs.CV cs.AI 57%

AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models

AugVLA-3D:基于深度的特征增强用于视觉-语言-动作模型

Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua, Dongfu Yin, Zhen Tian, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) School of Information Technology, Carleton University(卡尔顿大学信息技术学院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出AugVLA-3D框架,通过整合深度估计提升视觉-语言-动作模型的3D特征表示,增强模型在复杂3D环境中的感知与动作预测能力。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏