arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-24 至 2026-06-24 共收录 23 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4 篇

2606.24829 2026-06-24 cs.CV 新提交 79%

GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction

GeoT2V-Bench: 通过3D重建基准测试文本到视频模型中的3D一致性

Chenrui Fan, Paolo Favaro

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 提出GeoT2V-Bench,通过3D重建评估相机提示的文本到视频模型能否支持刚性3D场景重建,揭示不同指标下的互补失效模式。

Comments 36 pages, 17 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14200 2026-06-24 cs.CV 版本更新 77%

Beyond a Single Light: A Large-Scale Aerial Dataset for Urban Scene Reconstruction Under Varying Illumination

超越单一光源:用于不同光照下城市场景重建的大规模航拍数据集

Zhuoxiao Li, Wenzong Ma, Taoyu Wu, Jinjing Zhu, Shuai Zhang, Jing OU, Tongyan Hua, Yinrui Ren, Rongjun Qin, Hui Xiong, Wufan Zhao

机构 * HKUST(GZ)(香港科技大学(广州)) University of Liverpool(利物浦大学) The Ohio State University(俄亥俄州立大学)

专题命中 三维重建 :Gaussian Splatting(abstract);3D reconstruction(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 针对多时相航拍数据光照不一致导致的重建伪影问题,提出SkyLume大规模真实航拍数据集,包含10个城区超10万张高分辨率图像(四个倾斜视角和天底视角),每个区域在三个时段采集以隔离光照变化,并提供LiDAR扫描和3D真值,以及用于评估逆渲染鲁棒性的时间一致性系数(TCC)。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24799 2026-06-24 cs.CV cs.AI 新提交 70%

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

OrbitForge: 通过重建锚定的视频合成实现文本到3D场景生成

Chenrui Fan, Paolo Favaro

机构 * Computer Vision Group, Institute of Computer Science University of Bern(计算机视觉组,计算机科学研究所,伯恩大学)

专题命中 三维重建 :Gaussian Splatting(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出OrbitForge,利用冻结的视频先验和每提示高斯泼溅重建优化,将单个文本生成视频转换为规范闭轨3D场景,无需任务特定微调或分数蒸馏。

Comments 40 pages, 33 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24282 2026-06-24 cs.CV 新提交 57%

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance

UniRED: 基于事件引导的统一RGB-D视频帧插值

Yinuo Zhang, Guangshun Wei, Yuanfeng Zhou, Yiran Shen

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出统一多模态框架UniRED,融合RGB外观、深度几何和事件时间线索,通过双向流估计与运动基细化实现高质量RGB-D视频帧插值,并构建RGB-D-Event数据集缓解数据稀缺。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 10 篇

2606.24796 2026-06-24 cs.CV 新提交 89%

Pocket-SLAM: Rendering-Area-Aware Pruning for Memory-Efficient 3DGS-SLAM

Pocket-SLAM:面向内存高效的3DGS-SLAM的渲染区域感知剪枝

Leshu Li, Jie Peng, Yang Zhao

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出一种渲染区域感知的剪枝策略,根据高斯点对有效渲染区域的贡献进行选择性移除,在EuRoC和KITTI数据集上实现超过60%的内存减少和2倍以上的FPS提升,同时保持定位与建图精度。

Comments 2026 IEEE International Conference on Robotics and Automation(ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24144 2026-06-24 cs.CV 新提交 85%

Geometry-Aware Style Transfer in 3D Gaussian Splatting

3D高斯泼溅中的几何感知风格迁移

Min Hyeok Bang, Jun Hyeong Kim, Seung-Wook Kim, Se-Ho Lee

机构 * Department of Computer Science and Artificial Intelligence/Center for Advanced Image Information Technology, Jeonbuk National University(全北国立大学计算机科学与人工智能系/高级图像信息技术中心) Division of Electronic and Communication Engineering, Pukyong National University(釜庆国立大学电子与通信工程系)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出一种几何感知风格迁移框架,通过解耦优化交替更新颜色和几何参数,并利用几何感知对比特征匹配(GCFM)将风格图像的结构特征迁移到高斯基元,实现外观与几何结构的同步迁移。

Comments 14 pages, 7 figures, accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17338 2026-06-24 cs.CV cs.AI 版本更新 84%

Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering

Render-FM: 用于实时逼真体积渲染的前馈模型

Zhongpai Gao, Benjamin Planche, Meng Zheng, Anwesa Choudhuri, Van Nguyen Nguyen, Terrence Chen, Ziyan Wu

机构 * United Imaging Intelligence(联合影像智能)

专题命中 Gaussian Splatting :NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出Render-FM前馈模型,直接从CT体积回归6D高斯溅射参数,实现2.8秒实时渲染,速度提升500倍,并引入解剖引导初始化提升医学图像渲染质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24628 2026-06-24 cs.RO cs.CV 新提交 81%

ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos

ArtiTwinSplat:基于RGB-D视频的高斯泼溅实现可交互数字孪生重建

Pranjal Mishra, René Zurbrügg, Max Wilder-Smith, Marco Hutter, Marc Pollefeys, Zuria Bauer, Hermann Blum

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft(微软) University of Bonn(波恩大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 提出ArtiTwinSplat框架,利用3D高斯泼溅从RGB-D视频自动构建可交互的铰接物体数字孪生,无需CAD模型或人工标注,支持实时渲染与交互操作。

Comments Presented at the ICRA 2026 Workshop on Advances and Challenges in AI-Driven Automation and Robotic System Integration with Digital Twins, Vienna, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24874 2026-06-24 cs.CV cs.AI 新提交 77%

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成

Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo

机构 * The Australian National University(澳大利亚国立大学) ByteDance(字节跳动)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出FLUX3D框架,通过扩散对齐结构化潜变量(DA-SLAT)和稀疏结构感知扩散变压器(SMDiT)解决稀疏体素表示中高频细节丢失和跨模态对齐问题,实现高保真图像到3D高斯生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交 77%

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24876 2026-06-24 cs.CV 新提交 70%

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

FLAT: 前馈潜在三角形泼溅用于几何精确的场景生成

Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari

机构 * Google Research(谷歌研究院) University of Oxford, Visual Geometry Group(牛津大学视觉几何组) TU Munich(慕尼黑工业大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出FLAT方法,首次从视频扩散潜在表示中直接解码三角形泼溅,通过射线中心旋转参数化和乘积窗口函数解决梯度流问题,在保持视觉质量的同时显著提升几何精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24257 2026-06-24 cs.CV 新提交 57%

3DCarGen: Scalable 3D Car Generation via 3D-consistent Multi-view Synthesis

3DCarGen: 通过3D一致的多视图合成实现可扩展的3D汽车生成

Hongli Xiao, Youjian Zhang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * Shanghai Jiao Tong University(上海交通大学) Academy of Military Science(军事科学院) The University of Sydney(悉尼大学) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出3DCarGen框架,利用多视图扩散模型和3D高斯泼溅,从单张真实图像生成任意数量3D一致的多视图,并通过颜色-法线联合优化重建高质量3D汽车模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24180 2026-06-24 cs.CV cs.AI 新提交 57%

Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms

三维医学场景补全的深度学习方法:从几何建模到生成范式

Afifa Khaled, Said Jadid Abdulkadir, Majdy Mohamed Eltayeb Eltahir

机构 * Universiti Teknologi PETRONAS(马来西亚国油科技大学) King Khalid University(哈立德国王大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 本文系统综述了2016-2026年间三维场景补全技术的演进,从SSCNet的体素语义补全到结合扩散先验与高斯泼溅的实时渲染新范式,讨论了多种表示范式并提出了分类法,最后给出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交 57%

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2606.24433 2026-06-24 cs.CV cs.AI cs.LG 新提交 79%

MedPCFM: Improving Medical Point Cloud Completion by Integrating Point Transformers and Flow Matching

MedPCFM: 通过集成点变换器和流匹配改进医学点云补全

Kamil Kwarciak, Marek Wodzinski

机构 * Department of Measurement and Electronics, AGH University of Krakow(AGH科技大学测量与电子系) Sano Centre for Computational Medicine(Sano计算医学中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出基于PTv3的流匹配方法PCFM用于医学点云补全,在三个数据集上达到最优生成性能,采样步数远少于扩散模型,且PTv3带来高达7倍的速度提升。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24175 2026-06-24 cs.CV 新提交 79%

Tri-Efficient Transfer Learning for Point Cloud Videos

点云视频的三效迁移学习

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) SIGS, Tsinghua University(清华大学深圳国际研究生院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出PoinTriE框架,通过伪运动轨迹合成、几何-运动对偶网络和时空侧网络,实现数据、参数和内存三方面高效的点云视频迁移学习,在动作识别和语义分割任务上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24301 2026-06-24 cs.CV 新提交 70%

MM-TRELLIS: Point-Cloud Guided Multi-Modal 3D Vehicle Generation in Autonomous Driving

MM-TRELLIS: 自动驾驶中基于点云引导的多模态3D车辆生成

Hongli Xiao, Youjian Zhang, Yucai Bai, Chaoyue Wang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Academy of Military Science(军事科学院) Bosch innovation software development (Wuxi) Co., Ltd.(博世创新软件开发(无锡)有限公司) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Shopee Pte. Ltd.(Shopee私人有限公司)

专题命中 点云 :Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV

AI总结 提出MM-TRELLIS,融合多视图图像与LiDAR点云,通过点云引导和体素过滤策略,实现高质量3D车辆生成,在Waymo数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24464 2026-06-24 cs.CV 新提交 57%

Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation

通过几何感知蒸馏提升文本驱动视频分割

Tianyu Zhu, Yingping Liang, Hesong Li, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 点云 :spatial understanding(abstract);分类 cs.CV

AI总结 提出GeoLaV两阶段框架,通过单目几何预训练和几何感知蒸馏,将3D几何知识从图像迁移到视频,提升文本驱动视频分割的时空一致性和语言定位能力,在多个基准上达到最优。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24178 2026-06-24 cs.CV cs.AI 新提交 57%

Zero-Shot Test-Time Canonicalization using Out-of-Distribution Scoring

零样本测试时规范化使用分布外评分

Dominik Lindner, Johann Schmidt, Tom Siegl, Martin Becker, Sebastian Stober

机构 * Artificial Intelligence Lab, Otto-von-Guericke University Magdeburg(马格德堡大学人工智能实验室) University of Rostock(罗斯托克大学) Becker Lab, University of Marburg(马尔堡大学贝克尔实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出将测试时规范化重新定义为分布外检测问题,系统评估约20种OOD评分和9种搜索算法,发现基于距离的评分配合随机搜索与局部细化效果最佳,并引入门控机制保护分布内精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23834 2026-06-24 cs.CE 新提交 50%

Efficient implementation of graph autoencoders for model-order reduction of systems with sharp gradients

用于具有尖锐梯度的系统模型降阶的图自编码器高效实现

Liam K Magargal, Parisa Khodabakhshi

专题命中 点云 :point cloud(abstract)

AI总结 提出图自编码器与算子学习结合的GNN-LaSDI框架,用于高维动力系统的非线性降阶,在尖锐梯度区域比POD方法更准确,计算成本介于GD-LSPG和POD-LaSDI之间。

Comments 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 3D生成 2 篇

2606.24206 2026-06-24 cs.CV cs.AI 新提交 79%

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation

包容性交互碰撞:多视图一致组合式3D生成

Chang Liu, Mingwen Shao, Xiang Lv, Xinyuan Chen, Lingzhuang Meng, Qiao Zhang, Zhengyi Gong, Jinghao Hu

机构 * School of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳理工大学人工智能研究院) College of Computer Science, Northwest University(西北大学计算机科学学院)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 提出I2C-3D方法,通过包容性交互碰撞策略和多视图自适应分数蒸馏采样,实现多视图一致、物理合理的组合式3D场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21945 2026-06-24 cs.CV 版本更新 57%

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D:通过桥接2D先验和3D一致性的生成式非完整3D建模

Junwei Zhou, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出GENA3D框架,结合2D生成先验与3D几何推理,在部分遮挡下生成完整且几何一致的3D物体,优于现有方法。

Comments Paper accepted by ECCV 2026. Project page: https://colezwhy.github.io/gena3d/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2606.23717 2026-06-24 eess.IV 新提交 50%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 空间理解 :spatial understanding(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏