arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-29 至 2026-06-29 共收录 12 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 2 篇

2606.27862 2026-06-29 cs.CV 新提交 57%

ScaLe-INR: Scale and Learn Implicit Neural Representations

ScaLe-INR:尺度化与学习隐式神经表示

Buwaneka Epakanda, Athulya Ratnayake, Pandula Thennakoon, Mario De Silva, Avishka Ranasinghe, Roshan Godaliyadda, Parakrama Ekanayake

机构 * eng.pdn.ac.lk(彭达大学) ee.pdn.ac.lk(电子工程学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出多分支架构ScaLe-INR,通过方向坐标缩放匹配频谱与网络最优工作区域,并设计方向边缘引导损失消除频谱串扰,在图像、音频和3D重建任务上超越现有方法。

Comments Submitted as a conference paper to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交 57%

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2606.27584 2026-06-29 cs.CV cs.AI 新提交 85%

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn:基于高斯泼溅引导的全面2D-3D修复

Hana Kim, Minje Kim, Tae-Kyun Kim

机构 * LG Electronics(LG电子) KAIST(韩国科学技术院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28321 2026-06-29 cs.CV 新提交 74%

StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views

StructSplat: 从无标定稀疏视图进行可泛化的3D高斯泼溅

Jia-Chen Zhao, Beiqi Chen, Xinyang Chen, Guangcong Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Guangzhou CloudButterfly Technology Co., Ltd.(广州云蝴蝶科技有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 提出StructSplat,一种前馈式可泛化3D高斯重建框架,无需相机参数,通过结构化表示分离几何、语义和纹理线索,在多个基准上显著超越现有方法。

Comments Project page: https://structsplat.github.io Code: https://github.com/J-C-Zhao/StructSplat

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 2 篇

2606.27509 2026-06-29 cs.CV 新提交 84%

Structured-Li-GS: Structured 3D Gaussians Splatting with LiDAR Incorporation and Spatial Constraints

Structured-Li-GS:结合LiDAR与空间约束的结构化3D高斯泼溅

Huaiyuan Weng, Huibin Li, Chul Min Yeum

机构 * University of Waterloo(滑铁卢大学)

专题命中 点云 :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);3D reconstruction(abstract);point cloud(abstract)

AI总结 提出Structured-Li-GS框架,利用LiDAR-惯性-视觉SLAM生成密集彩色点云,通过锚定高斯原语并初始化椭球参数,结合光度、扁平化、偏移、深度和法向损失训练,无需高斯密集化即可实现高质量3D重建,模型适中且性能优于现有方法。

Comments 9 pages, ISPRS Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27491 2026-06-29 cs.CV 新提交 79%

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

SelectAnyTree: 一种用于3D森林LiDAR点云的可提示实例分割模型

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Julian Frey, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN(理化学研究所) University of Freiburg(弗莱堡大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(特温特大学) KC Machine Learning Lab(KC机器学习实验室) Hanoi University of Science and Technology(河内科技大学) Ritsumeikan University(立命馆大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出SelectAnyTree模型,通过点击提示和树冠高度模型引导的首次提示,实现3D森林点云中任意单木的实例分割,在交互和实例级别上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2606.27575 2026-06-29 cs.CV 新提交 57%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 3 篇

2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27923 2026-06-29 cs.CV cs.AI 新提交 57%

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, Yindong Kong, Jing Li, Qi Wu, Feng Zhang, Jianan Jiang, Ruigao Yang

机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。

Comments 18 pages, 10 figures, 2 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27738 2026-06-29 cs.HC 新提交 50%

HandMade: Spatial Prompting for Generative 3D Creation with Part-Labeled VR Sketches

HandMade: 基于部分标注的VR草图的空间提示生成式3D创作

Jialin Huang, Rana Hanocka, Ariel Shamir, Yotam Gingold

专题命中 3D生成 :3D generation(abstract)

AI总结 提出HandMade工作流,结合VR 3D草图和语言进行开放域3D资产生成,将粗粒度部分标注的3D草图作为空间提示,通过多视图部分引导和结构化提示实现空间布局与语言描述的协同创作。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2606.28049 2026-06-29 cs.CV 新提交 57%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2606.27444 2026-06-29 cs.CV 新提交 57%

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

SemCityLoc: 使用语义3D城市模型的航空6自由度定位

Jingfeng Mao, Xuyang Chen, Qilin Zhang, Oussema Dhaouadi, Guangming Wang, Brian Sheil, Daniel Cremers, Yan Xia, Olaf Wysocki

机构 * Technical University of Munich(慕尼黑工业大学) University of Cambridge(剑桥大学) University of Science and Technology of China(中国科学技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出SemCityLoc,通过语义-几何对齐将航空位姿估计转化为结构化表面配准,利用基础模型视觉先验和标准化LoD城市模型,在重复遮挡环境中提升位姿判别性,并引入首个真实基准SemCityLockeD,实现定位误差从9.89m降至2.62m。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏