arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-05-25 至 2026-05-25 共收录 24 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 6 篇

2605.23889 2026-05-25 cs.CV 79%

HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction

HorizonStream: 用于流式3D重建的长程注意力

Chong Cheng, Peilin Tao, Nanjie Yao, Guanzhi Ding, Xianda Chen, Yuansen Du, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Zhengqing Chen, Hao Wang

机构 * HKUST(GZ)(香港科技大学) Horizon Robotics(Horizon机器人) CASIA(中国科学院自动化研究所) CSU(中国科学技术大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 针对流式3D重建中长序列漂移和崩溃问题,提出HorizonStream模型,通过分解几何传播核为长程时间因子(几何线性注意力)和短程空间因子(几何局部注意力),实现恒定内存和线性时间下的稳定重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15828 2026-05-25 cs.CV 77%

Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer

并非所有任务量化平等:面向视觉几何Transformer的Fisher引导量化

Yipu Zhang, Jintao Cheng, Weilun Feng, Jiehao Luo, Chuanguang Yang, Zhulin An, Yongjun Xu, Wei Zhang

机构 * Department of Electronic and Computer Engineering, HKUST(香港科技大学电子与计算机工程系) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science and Engineering, South China Normal University(华南师范大学数据科学与工程学院)

专题命中 三维重建 :3D vision(abstract);3D reconstruction(abstract);point cloud(abstract);分类 cs.CV

AI总结 提出Fisher引导量化方法,利用Fisher信息矩阵量化不同任务、块和通道的敏感性,在量化校准中保护关键通道和块,以解决前馈3D重建模型量化时任务间敏感性差异导致的精度损失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23892 2026-05-25 cs.CV cs.AI cs.GR cs.LG cs.RO 67%

Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

优质令牌狩猎:视觉几何变换器令牌选择指南

Shuhong Zheng, Michael Oechsle, Erik Sandström, Marie-Julie Rakotosaona, Federico Tombari, Igor Gilitschenski

机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) Google(谷歌) Technical University of Munich(慕尼黑技术大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR、cs.RO

AI总结 针对视觉几何变换器因全局注意力导致计算成本随序列长度平方增长的问题,提出一种两阶段令牌选择框架(帧间多样性选择+帧内层感知稀疏化),在加速85%以上同时保持或提升基线性能。

Comments Project Page: https://zsh2000.github.io/good-token-hunting.github.io, Code: https://github.com/zsh2000/gotohunt

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23888 2026-05-25 cs.CV 57%

GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction

GenRecon: 桥接生成先验的多视图3D场景重建

Katharina Schmid, Nicolas von Lützow, Jozef Hladký, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学) Computing Systems Lab, Huawei Technologies(华为技术有限公司计算系统实验室)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV

AI总结 提出一种将多视图RGB图像重建与强生成3D先验紧密结合的方法,通过条件3D生成和投影条件机制实现高保真、多视图一致的场景级重建,性能优于现有方法16%。

Comments Project page: https://kasothaphie.github.io/GenRecon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23386 2026-05-25 cs.RO 57%

Droneulator: A Portable UAV Simulator for Agricultural Workflows with RotorPy and Godot 4

Droneulator: 一种基于RotorPy和Godot 4的农业工作流便携式无人机模拟器

Jacob Swindell, Michael Lowen, Marija Popovic, Riccardo Polvara

机构 * Lincoln Centre for Autonomous Systems (L-CAS), University of Lincoln, Lincoln, UK(林肯自主系统中心(L-CAS)、林肯大学、林肯,英国) Faculty of Aerospace Engineering, MAVLab, Delft University of Technology (TU Delft), Delft, Netherlands(航空航天工程学院、MAVLab、代尔夫特理工大学(TU Delft)、代尔夫特,荷兰)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 提出一种结合RotorPy动力学与Godot 4渲染的便携式无人机模拟器Droneulator,支持PX4控制、WebSocket命令和Zenoh/ROS~2管道,实现农业无人机数据采集、局部规划和强化学习实验的统一验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23098 2026-05-25 cs.RO 57%

UfM*: Uncertainty from Motion* for DNN Depth Estimation Using Gaussians

UfM*:基于高斯分布的运动不确定性用于DNN深度估计

Soumya Sudhakar, Sertac Karaman, Vivienne Sze

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 提出UfM*算法,利用紧凑高斯混合模型高效计算多视图不一致性,实现单次推理的不确定性估计,在资源受限机器人上达到实时性能。

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2503.20066 2026-05-25 cs.RO cs.CV 85%

Learning Scene-Level Signed Directional Distance Function with Ellipsoidal Priors and Neural Residuals

学习场景级有符号方向距离函数:结合椭球先验与神经残差

Zhirui Dai, Hojoon Shin, Yulun Tian, Ki Myung Brian Lee, Nikolay Atanasov

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Brain Corporation(Brain公司) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 NeRF :NeRF(abstract,abstract_cn);3D vision(abstract);Gaussian Splatting(abstract);point cloud(abstract)

AI总结 提出有符号方向距离函数(SDDF),结合显式椭球先验和隐式神经残差,实现高效准确的场景级几何重建与可微渲染。

Journal ref 2026 IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 9 篇

2601.14821 2026-05-25 cs.CV 93%

POTR: Post-Training 3DGS Compression

POTR:训练后3DGS压缩

Bert Ramlot, Martijn Courteaux, Peter Lambert, Glenn Van Wallendael

机构 * IDLab-MEDIA research group(IDLab-MEDIA研究组) Ghent University(根特大学) imec

专题命中 Gaussian Splatting :3DGS(title,title_cn);NeRF(abstract,abstract_cn);Gaussian Splatting(abstract);novel view synthesis(abstract)

AI总结 提出POTR后训练压缩框架,通过改进的3DGS光栅化器高效剪枝和重算光照系数,实现2-4倍剪枝率和1.5-2倍推理加速,在率失真和速度上优于现有方法。

Comments 15 pages, 12 figures. Submitted to IEEE TCSVT, under review

Journal ref IEEE Transactions on Circuits and Systems for Video Technology (TCSVT), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23602 2026-05-25 cs.CV 87%

GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes

GlowGS: 夜间发光场景中用于3D高斯溅射的生成式语义特征学习

Beibei Lin, Xiao Cao, Jingyuan Guo, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title);分类 cs.CV

AI总结 针对夜间发光场景中3D高斯溅射因缺乏纹理和边缘等结构特征而难以渲染高质量新视图的问题,提出GlowGS方法,利用扩散模型和视觉基础模型生成语义特征作为隐式结构线索,并通过新视图语义学习实现无真实标签的优化,显著提升渲染质量。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23287 2026-05-25 cs.CV 87%

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

LangFlash: 基于前馈的3D语言高斯泼溅从稀疏无位姿图像

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D vision(abstract);3D reconstruction(abstract);novel view synthesis(abstract)

AI总结 提出LangFlash,一种前馈框架,从稀疏无位姿多视图图像直接预测3D高斯原语及其语言对齐语义特征,实现低延迟3D重建和语义一致场景理解。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22020 2026-05-25 cs.CV 87%

ForeSplat: Optimization-Aware Foresight for Feed-Forward 3D Gaussian Splatting

ForeSplat:面向前馈3D高斯泼溅的优化感知预判

Yuke Li, Weihang Liu, Cheng Zhang, Yuefeng Zhang, Jiadi Cui, Zixuan Wang, Junran Ding, Haoyu Wu, Yujiao Shi, Jingyi Yu, Xin Lou

机构 * ShanghaiTech University(上海科技大学) GGU Technology Co., Ltd(GGU技术有限公司) Stereye

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);3D reconstruction(abstract);分类 cs.CV

AI总结 提出优化感知训练框架ForeSplat,通过元梯度规则使前馈3DGS模型生成利于快速精细优化的初始化,缩小了前馈预测与逐场景优化之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14135 2026-05-25 cs.RO cs.CV 85%

GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation

GAF: 高斯动作场作为机器人操作中动态世界建模的4D表示

Ying Chai, Litao Deng, Ruizhi Shao, Jiajun Zhang, Kangchen Lv, Liangjun Xing, Xiang Li, Hongwen Zhang, Yebin Liu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Shadow AI

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 提出GAF,通过扩展3D高斯溅射引入可学习运动属性,实现动态场景的4D建模,并利用动作-视觉对齐去噪框架提升机器人操作成功率。

Comments https://ChaiYing1.github.io/projects/GAF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23672 2026-05-25 cs.CV 83%

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

RiGS: 从单目视频中的刚性感知4D高斯泼溅

Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 提出RiGS,通过静态、刚性和瞬态三种高斯原语分别建模不同时间尺度的运动,并利用目标动态掩码和场景流引导实现单目视频动态场景重建,在新视角合成任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22961 2026-05-25 eess.SP 78%

OctCGS: Octree-Contextual Gaussian Splatting with Explicit Multi-Order Propagation Modeling for Channel Knowledge Map Construction

OctCGS: 基于八叉树上下文的高斯泼溅与显式多阶传播建模的信道知识图谱构建

Jinghan Zhang, Xitao Gong, Qi Wang, Richard A. Stirling-Gallacher, Giuseppe Caire

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 提出OctCGS框架,利用八叉树上下文的高斯泼溅显式建模多跳无线传播的阶数,实现高效的信道知识图谱构建,在信道增益MAE和NMAE上分别提升0.88 dB和0.021。

Comments Submitted to IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23845 2026-05-25 cs.CV 70%

Learning a Particle Dynamics Model with Real-world Videos

利用真实世界视频学习粒子动力学模型

Chanho Kim, Suhas V. Sumukh, Li Fuxin

机构 * Oregon State University(俄勒冈州立大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV

AI总结 提出一种从无标签真实视频直接训练神经物体动力学模型的框架,结合高斯溅射技术,通过渲染监督学习粒子位置和旋转变化,避免对合成数据的依赖。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06088 2026-05-25 cs.CV 57%

OpenGaFF: Open-Vocabulary Gaussian Feature Field with Codebook Attention

OpenGaFF: 基于码本注意力的开放词汇高斯特征场

Kunyi Li, Michael Niemeyer, Sen Wang, Stefano Gasperini, Nassir Navab, Federico Tombari

机构 * Technical University of Munich(慕尼黑技术大学) Google(谷歌) Munich Center for Machine Learning(慕尼黑机器学习中心) Visualais

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出OpenGaFF框架,通过高斯特征场和码本注意力机制实现开放词汇3D场景理解,提升语义一致性和分割质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 5 篇

2605.07590 2026-05-25 cs.CV 79%

Beyond Defenses: Manifold-Aligned Regularization for Intrinsic 3D Point Cloud Robustness

超越防御:面向内在3D点云鲁棒性的流形对齐正则化

Pedro Alonso, Chongshou Li, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Engineering Research Center of Sustainable Urban Intelligent Transportation, Ministry of Education, Southwest Jiaotong University(可持续城市智能交通工程研究中心,教育部,西南交通大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出流形对齐点识别(MAPR)框架,通过正则化潜在几何结构并施加内在扰动一致性损失,在不依赖对抗训练或额外数据的情况下显著提升点云模型对多种攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23406 2026-05-25 cs.CV 57%

RS2AD-LiDAR: End-to-End Autonomous Driving LiDAR Data Generation from Roadside Sensor Observations

RS2AD-LiDAR:基于路侧传感器观测的端到端自动驾驶LiDAR数据生成

Runyi Huang, Ni Ding, Ruidan Xing, Yuheng Shi, Lei He, Keqiang Li

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility(智能绿色车辆与移动国家重点实验室) School of Vehicle and Mobility(车辆与移动学院) College of Artificial Intelligence(人工智能学院) Logic & Silicon AI Studio School of Instrumentation and Optoelectronic Engineering(仪器科学与光电工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出RS2AD-LiDAR框架,通过坐标变换、虚拟LiDAR建模和点云重采样技术,从路侧LiDAR点云生成车载LiDAR数据,解决数据获取成本高和场景稀缺问题,并验证生成数据对BEV和3D检测的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23064 2026-05-25 cs.CV cs.LG 57%

Millimeter-wave Imaging for Anthropometric Body Measurement

毫米波成像用于人体测量

Miriam Senne, Benjamin D. Killeen, Christoph Baur, Nassir Navab, Azade Farshad

机构 * Chair for Computer Aided Medical Procedures(计算机辅助医疗程序研究所) Technical University of Munich(慕尼黑技术大学) Rohde & Schwarz GmbH & Co. KG(罗德与施瓦茨 GmbH & Co. KG) Munich Center for Machine Learning(慕尼黑机器学习中心) ELLIS Unit Helsinki, Dept. Computer Science, Aalto University(赫尔辛基ELLIS单位,计算机科学系,阿alto大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出基于毫米波雷达的优化框架,通过加权配准和SMPL模型从点云恢复3D人体形状并提取围度等测量值,实现穿衣服况下的快速无接触测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23774 2026-05-25 cs.MM 50%

Swarical: An Integrated Hierarchical Approach to Localizing Flying Light Specks

Swarical:一种集成层次化方法用于定位飞行光点

Hamed Alimohammadzadeh, Shahram Ghandeharizadeh

专题命中 点云 :point cloud(abstract)

AI总结 提出一种基于群体智能的层次化定位技术Swarical,通过异构传感器配置和点云转换,使微型无人机FLS能高精度高效定位并照亮复杂2D/3D形状,相比现有技术速度提升2倍以上。

Comments Appeared in proceedings of the 32nd ACM International Conference on Multimedia (MM '24), October 28-November 1, 2024, Melbourne, VIC, Australia. ACM, New York, NY, USA, 9 pages. Source code available at: https://github.com/flyinglightspeck/Swarical. See https://youtu.be/NHMGT-Pjy-A for a demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23156 2026-05-25 cs.LG math.FA math.RT stat.ML 50%

Any-Dimensional Invariant Universality

任意维不变泛化性

Shengtai Yao, Eitan Levin, Mateo Díaz

机构 * Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Department of Computing and Mathematical Sciences, Caltech(加州理工学院计算与数学科学系)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种系统方法,通过将任意维函数映射到无限维极限空间中的唯一函数,建立任意维模型的泛化性,并证明现有架构的非泛化性及简单修改可恢复泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 1 篇

2605.23381 2026-05-25 cs.CV 57%

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

VDE: 通过速度分解与估计实现无训练加速整流流模型

Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

机构 * South China University of Technology(华南理工大学)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 2 篇

2505.17015 2026-05-25 cs.CV cs.CL 79%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05997 2026-05-25 cs.CV 74%

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker: 用4D图像进行动态空间理解的思考

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

机构 * Tsinghua University, SIGS(清华大学 SIGS) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) LMMs-Lab(LMMs实验室) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 空间理解 :spatial understanding(title);分类 cs.CV

AI总结 提出4DThinker框架,通过动态潜在心理图像(在连续隐藏空间中模拟场景演化)增强视觉语言模型的动态空间推理能力,并引入无标注数据生成、动态图像微调及4D强化学习,在多个基准上超越强基线。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏