arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-17 至 2026-07-17 共收录 16 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2607.15211 2026-07-17 cs.CV 新提交 79%

MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos

MAGiSt3R:基于单目RGB视频的多智能体前馈3D重建

Ziren Gong, Xiaohan Li, Fabio Tosi, Ninghui Xu, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

机构 * University of Bologna(博洛尼亚大学) The University of Hong Kong(香港大学) Southeast University(东南大学) Monash University(莫纳什大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究基于单目RGB视频的多智能体3D重建问题,核心方法是用3R家族前馈模型和MAGMA合并模型,并进行姿态图优化,主要贡献是在合成和真实数据集上验证该框架相比现有方法有更高重建和相机跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 57%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 5 篇

2607.14513 2026-07-17 cs.CV eess.IV 新提交 85%

Compression of 3D Gaussian Splatting Data Using GPU-friendly Graphics Texture Coding

使用 GPU 友好型图形纹理编码压缩 3D 高斯点云数据

Amir Said, Randall Rauwendaal

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 研究 3D 高斯点云数据压缩,提出用专为 GPU 并行解码设计的纹理压缩方案压缩 SH 颜色系数,引入比特率控制策略,实验表明该方法能有效压缩数据且不影响渲染视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14203 2026-07-17 cs.GR cs.AI cs.CV 新提交 85%

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation

即时NuRec:用于驾驶场景模拟的前馈3D高斯重建

NVIDIA, :, Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning Xu, Qi Wu, Janick Martinez Esturo, Shengyu Huang, Nick Schneider, Laura Leal-Taixe, Zan Gojcic, Sanja Fidler

机构 * NVIDIA

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 针对自动驾驶3D模拟平台中神经模拟方法存在的速度慢和需逐场景调整问题,提出即时NuRec这一前馈神经重建模型,可快速将多视图驾驶日志转为3DGS世界,在数据集上PSNR表现出色,还能用于闭环模拟。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/instant-nurec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14481 2026-07-17 cs.CV 新提交 84%

Immediate 3D Gaussian Splat Reconstruction of Unordered Input with Global Consistency

具有全局一致性的无序输入的即时3D高斯点云重建

Andreas Meuleman, Linus Franke, Boris Zhestiankin, Camille Montemagni, George Drettakis

机构 * Inria, Université Côte d’Azur(法国蔚蓝海岸大学 - 法国国家信息与自动化研究所) EPFL(洛桑联邦理工学院)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究针对无序输入的辐射场捕获,提出利用视觉位置识别模型等实现快速匹配找关键帧,结合GPU优化等进行局部重建,再用基于聚类方法实现回环闭合,引入渐进层次结构处理大场景,提供具全局一致性的即时反馈3DGS重建。

Journal ref SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14470 2026-07-17 cs.CV cs.RO 新提交 79%

G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction

G$^2$SR:基于几何方法的快速且内存高效的高斯曲面重建

Dasong Gao, Vivienne Sze, Sertac Karaman

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 研究少视图曲面重建问题,提出G2SR方法,利用跨视图2D平铺对应关系,通过轻量级神经前端和解析后端,实现快速且内存高效的高斯曲面重建,在多个数据集上几何精度高且内存占用小。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 57%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.RO

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 4 篇

2607.14639 2026-07-17 cs.RO cs.CV 新提交 81%

Image-to-Point Cloud Registration Made Easy with Rectified Flow-based LiDAR Upsampling

基于整流流的激光雷达上采样实现图像到点云配准简化

Reon Tabata, Kenji Koide, Shuji Oishi, Masashi Yokozuka, Taku Okawara, Aoki Takanose, Jun Miura

机构 * Department of Computer Science and Engineering, Toyohashi University of Technology(丰桥技术科学大学计算机科学与工程系) National Institute of Advanced Industrial Science and Technology(国立先进工业科学技术研究所)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 研究图像到点云配准难题,提出将激光雷达视为成像传感器的方法,通过条件整流流、特征匹配等步骤估计位姿,经自监督预训练和少量数据微调,实现高精度快速配准,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14946 2026-07-17 cs.CV 新提交 79%

DINE: Distance Is Not Enough -- Learning Global Deformation Priors for Robust Soft-Tissue Point Cloud Registration

DINE:距离并不够——学习用于鲁棒软组织点云配准的全局变形先验

Sara Monji-Azad, Rohit Beer, Marvin Kinz, Claudia Scherl, Jürgen Hesser

机构 * Mannheim Institute for Intelligent Systems in Medicine (MIISM), Medical Faculty Mannheim, Heidelberg University(曼海姆医学智能系统研究所(MIISM),海德堡大学曼海姆医学院) Department of Radiation Oncology, Brigham and Women’s Hospital, Dana-Farber Cancer Institute, Harvard Medical School(布莱根妇女医院放射肿瘤学系,达纳-法伯癌症研究所,哈佛医学院) Department of Otorhinolaryngology, Head and Neck Surgery, University Medical Center Mannheim, Medical Faculty Mannheim, Heidelberg University(海德堡大学曼海姆医学院曼海姆大学医学中心耳鼻咽喉头颈外科) Department of Otolaryngology, Head and Neck Surgery, Campus Klinikum Bielefeld Mitte, University Hospital OWL of Bielefeld University(比勒费尔德大学OWL大学医院比勒费尔德市中心校区耳鼻咽喉头颈外科) Interdisciplinary Center for Scientific Computing (IWR), Heidelberg University(海德堡大学跨学科科学计算中心(IWR)) Central Institute for Computer Engineering (ZITI), Heidelberg University(海德堡大学中央计算机工程研究所(ZITI)) CZS Heidelberg Center for Model-Based AI, Heidelberg University(海德堡大学CZS基于模型的人工智能中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 研究针对软组织点云配准中对应估计难题,提出DINE框架,通过学习统计先验增强基于距离的配准,应用于两个主干并采用两阶段策略,实验表明其能降低平均倒角距离,提高对变形和噪声的鲁棒性,凸显全局变形合理性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14778 2026-07-17 eess.SP 新提交 78%

Conditional Generative Learning Enabled Wireless UAV Sensing and Tracking via Point Cloud Imaging

基于点云成像的条件生成学习实现无线无人机感知与跟踪

Xinhong Dai, Yuan Gao, Hao Jiang, Xiaojun Yuan, Xin Wang

专题命中 点云 :point cloud(title,abstract)

AI总结 研究无人机感知与跟踪问题,提出AUGUST方法,集成条件信道编码与生成解码模块,通过位置和信噪比嵌入及加权训练目标的扩散模型,实现更准确的无人机点云重建与定位,提升对其姿态和形状信息的捕获能力。

Comments 16pages, 13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14419 2026-07-17 cs.LG cs.CG 新提交 50%

HyperShadow: A Benchmark for Detecting 3D Projections of Higher-Dimensional Spatial Objects

HyperShadow:用于检测高维空间对象3D投影的基准测试

Akshay Sasi

专题命中 点云 :point cloud(abstract)

AI总结 HyperShadow是用于检测高维空间对象3D投影的基准测试,通过190k参数点网络及零参数刚性见证进行检测,能在不同损坏层级达到高准确率和泛化率,为研究三维解释不兼容性提供工具,数据等已公开。

Comments 8 pages, 5 figures. Code: https://github.com/AkshaySasi/hypershadow. Dataset: https://huggingface.co/datasets/AkshaySasi/hypershadow

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2607.15271 2026-07-17 cs.CV cs.GR cs.LG 新提交 81%

Online Neural Space Time Memory for Dynamic Novel View Synthesis

用于动态新视角合成的在线神经时空记忆

Baback Elmieh, Lynn Tsai, Zeman Li, Srinivas Kaza, Tiancheng Sun, Gabor Csapo, Ali Behrouz, Yuan Deng, Stephen Lombardi, Steven M. Seitz, Xuan Luo

机构 * University of Washington(华盛顿大学) Google(谷歌)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV、cs.GR

AI总结 研究多视图流视频在线新视角合成问题,提出解耦记忆更新与应用频率的方法,通过跨视图注意力管理变形,引入辅助记忆损失和记忆缓存策略,实现实时、领先性能及微小尺度在线记忆。

Comments 15 pages. Preprint. Project page with demos and video results: https://nst-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 3 篇

2607.15054 2026-07-17 cs.CV 新提交 79%

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 57%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14588 2026-07-17 cs.HC 新提交 50%

Conversational Tactile Data Interfaces: Co-Designing Accessible Data Experiences with Blind Users Using Refreshable Tactile Displays and Conversational AI

对话式触觉数据接口:使用可刷新触觉显示器和对话式人工智能与盲人用户共同设计无障碍数据体验

Samuel Reinders, Munazza Zaib, Bongshin Lee, Ingrid Zukerman, Matthew Butler, Thien Autran, Sascha Cowley, Francois Jacobs, Lizhen Qu, Kim Marriott

专题命中 空间理解 :spatial understanding(abstract)

AI总结 研究针对盲人或视力低下者数据可视化问题,通过与盲人共同设计师协同设计,创建结合可刷新触觉显示器与对话代理的CTDI(Graphy系统),贡献设计知识与建议,得出分层展示等关键发现。

Comments Accepted to be presented at IEEE VIS 2026 and published in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他3D视觉 1 篇

2607.14935 2026-07-17 cs.CV 新提交 70%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他3D视觉 :3D vision(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏