arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-29 至 2026-06-29 共收录 22 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2505.05517 2026-06-29 cs.CV cs.LG cs.RO 版本更新 62%

Web2Grasp: Learning Functional Grasps from Web Images of Hand-Object Interactions

Web2Grasp:从网络手物交互图像中学习功能性抓取

Hongyi Chen, Yunchao Yao, Yufei Ye, Zhixuan Xu, Homanga Bharadhwaj, Jiashun Wang, Arthur Jakobsson, Ruihan Zhao, Shubham Tulsiani, Zackory Erickson, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Nvidia(英伟达) National University of Singapore(新加坡国立大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 提出从网络图像中提取人手抓取信息,利用3D重建和交互中心模型学习功能性抓取,在仿真和真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27862 2026-06-29 cs.CV 新提交 57%

ScaLe-INR: Scale and Learn Implicit Neural Representations

ScaLe-INR:尺度化与学习隐式神经表示

Buwaneka Epakanda, Athulya Ratnayake, Pandula Thennakoon, Mario De Silva, Avishka Ranasinghe, Roshan Godaliyadda, Parakrama Ekanayake

机构 * eng.pdn.ac.lk(彭达大学) ee.pdn.ac.lk(电子工程学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出多分支架构ScaLe-INR,通过方向坐标缩放匹配频谱与网络最优工作区域,并设计方向边缘引导损失消除频谱串扰,在图像、音频和3D重建任务上超越现有方法。

Comments Submitted as a conference paper to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交 57%

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 8 篇

2410.02103 2026-06-29 cs.CV 版本更新 91%

MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis

MVGS:多视图调控的高斯泼溅用于新视角合成

Xiaobiao Du, Yida Wang, Xin Yu

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(title);NeRF(abstract,abstract_cn);3DGS(abstract,abstract_cn)

AI总结 提出多视图调控的3D高斯泼溅优化方法,通过多视图训练策略、跨内参引导、交叉射线致密化和多视图增强致密化,解决单视图过拟合问题,提升新视角合成质量和3D几何精度。

Comments ECCV2026, Project Page:https://xiaobiaodu.github.io/mvgs-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27584 2026-06-29 cs.CV cs.AI 新提交 85%

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

CoIn:基于高斯泼溅引导的全面2D-3D修复

Hana Kim, Minje Kim, Tae-Kyun Kim

机构 * LG Electronics(LG电子) KAIST(韩国科学技术院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 提出CoIn框架,通过多阶段一致性流水线桥接2D修复模型与3D高斯泼溅,支持任意形状掩码的物体移除与插入,实现双向信息流引导的3D场景修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新 81%

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);spatial understanding(abstract);分类 cs.CV

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28321 2026-06-29 cs.CV 新提交 74%

StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views

StructSplat: 从无标定稀疏视图进行可泛化的3D高斯泼溅

Jia-Chen Zhao, Beiqi Chen, Xinyang Chen, Guangcong Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Guangzhou CloudButterfly Technology Co., Ltd.(广州云蝴蝶科技有限公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 提出StructSplat,一种前馈式可泛化3D高斯重建框架,无需相机参数,通过结构化表示分离几何、语义和纹理线索,在多个基准上显著超越现有方法。

Comments Project page: https://structsplat.github.io Code: https://github.com/J-C-Zhao/StructSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13910 2026-06-29 cs.CV 版本更新 70%

Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation

绝对尺度下的场景生成:利用文本的语义和几何引导实现精确且可解释的3D室内场景生成

Stefan Ainetter, Thomas Deixelberger, Edoardo A. Dominici, Philipp Drescher, Konstantinos Vardis, Markus Steinberger

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3D generation(abstract);分类 cs.CV

AI总结 提出GuidedSceneGen框架,通过文本预测全局3D布局并利用全景扩散模型和视频扩散模型生成绝对尺度的室内场景,实现高一致性、可导航的3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19594 2026-06-29 cs.CV cs.GR 70%

Tortho-Gaussian: Splatting True Digital Orthophoto Maps

Tortho-Gaussian:真数字正射地图的生成

Xin Wang, Wendi Zhang, Hong Xie, Haibin Ai, Qiangqiang Yuan, Zongqian Zhan

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3DGS(abstract);分类 cs.CV

AI总结 本文提出Tortho-Gaussian方法,通过优化各向异性高斯核的正交撒点生成真数字正射地图,解决了传统方法中DSM不准确、遮挡检测失效等问题,提升了大范围场景重建的精度和效率。

Comments This work has been submitted to the IEEE Transactions on Geoscience and Remote Sensing for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16893 2026-06-29 cs.CV 版本更新 57%

Instant Expressive Gaussian Head Avatars at Over 100 FPS

即时表达性高斯头部虚拟化身,帧率超过100 FPS

Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出一种前馈编码器流水线,将单张野外图像转换为3D一致、快速且富有表现力的可动画化表示,通过轻量级局部融合策略实现高动画表现力,运行速度达107.31 FPS。

Comments Project website is https://research.nvidia.com/labs/amri/projects/instant4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09733 2026-06-29 cs.GR 版本更新 57%

Unified Gaussian Primitives for Scene Representation and Rendering

统一的高斯基元用于场景表示与渲染

Yang Zhou, Songyin Wu, Lingqi Yan

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.GR

AI总结 提出基于3D高斯分布的统一渲染基元,支持从光滑表面到模糊元素的外观,并实现基于物理的散射以进行全局光照,兼容蒙特卡洛路径追踪,可转换自网格和3D高斯泼溅,支持透射率优化。

Comments Accepted to ACM Transactions on Graphics (June 2026). Project page: https://mangosister.github.io/gsr_site/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 3 篇

2606.27509 2026-06-29 cs.CV 新提交 84%

Structured-Li-GS: Structured 3D Gaussians Splatting with LiDAR Incorporation and Spatial Constraints

Structured-Li-GS:结合LiDAR与空间约束的结构化3D高斯泼溅

Huaiyuan Weng, Huibin Li, Chul Min Yeum

机构 * University of Waterloo(滑铁卢大学)

专题命中 点云 :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);3D reconstruction(abstract);point cloud(abstract)

AI总结 提出Structured-Li-GS框架,利用LiDAR-惯性-视觉SLAM生成密集彩色点云,通过锚定高斯原语并初始化椭球参数,结合光度、扁平化、偏移、深度和法向损失训练,无需高斯密集化即可实现高质量3D重建,模型适中且性能优于现有方法。

Comments 9 pages, ISPRS Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27491 2026-06-29 cs.CV 新提交 79%

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

SelectAnyTree: 一种用于3D森林LiDAR点云的可提示实例分割模型

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Julian Frey, Teja Kattenborn

机构 * Nagoya University(名古屋大学) RIKEN(理化学研究所) University of Freiburg(弗莱堡大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Twente(特温特大学) KC Machine Learning Lab(KC机器学习实验室) Hanoi University of Science and Technology(河内科技大学) Ritsumeikan University(立命馆大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 提出SelectAnyTree模型,通过点击提示和树冠高度模型引导的首次提示,实现3D森林点云中任意单木的实例分割,在交互和实例级别上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新 57%

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 2 篇

2511.15022 2026-06-29 cs.CV cs.GR cs.LG 版本更新 62%

Complex-Valued 2D Gaussian Representation for Computer-Generated Holography

复值二维高斯表示用于计算机生成全息术

Yicheng Zhan, Xiangjun Gao, Long Quan, Kaan Akşit

机构 * University College London(伦敦大学学院) Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 提出基于复值二维高斯基元的全息图表示,通过最小化空间-频率不确定性并利用可微分光栅化器实现端到端优化,在减少显存和加速优化的同时,显著提升重建质量与渲染速度。

Comments 36 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27575 2026-06-29 cs.CV 新提交 57%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 4 篇

2511.14271 2026-06-29 cs.CV 版本更新 83%

Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者

Weimin Bai, Yubo Li, Weijian Luo, Zeqiang Lai, Yequan Wang, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) MMLab, CUHK(香港中文大学 MMLab) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 3D生成 :3D generation(title,abstract);spatial understanding(abstract);分类 cs.CV

AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。

Comments arXiv admin note: substantial text overlap with arXiv:2509.15772

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交 62%

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27923 2026-06-29 cs.CV cs.AI 新提交 57%

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0:面向室内设计的高保真图像到三维资产生成系统

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, Yindong Kong, Jing Li, Qi Wu, Feng Zhang, Jianan Jiang, Ruigao Yang

机构 * Alibaba Group / Taobao(阿里巴巴集团/淘宝)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 提出Home3D 1.0模块化系统,从单张参考图像生成高质量3D资产,包含几何重建、纹理预测、材质生成和部件分解四个模块,适用于室内设计和电子商务。

Comments 18 pages, 10 figures, 2 tables; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27738 2026-06-29 cs.HC 新提交 50%

HandMade: Spatial Prompting for Generative 3D Creation with Part-Labeled VR Sketches

HandMade: 基于部分标注的VR草图的空间提示生成式3D创作

Jialin Huang, Rana Hanocka, Ariel Shamir, Yotam Gingold

专题命中 3D生成 :3D generation(abstract)

AI总结 提出HandMade工作流,结合VR 3D草图和语言进行开放域3D资产生成,将粗粒度部分标注的3D草图作为空间提示,通过多视图部分引导和结构化提示实现空间布局与语言描述的协同创作。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 1 篇

2606.28049 2026-06-29 cs.CV 新提交 57%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2606.27444 2026-06-29 cs.CV 新提交 57%

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

SemCityLoc: 使用语义3D城市模型的航空6自由度定位

Jingfeng Mao, Xuyang Chen, Qilin Zhang, Oussema Dhaouadi, Guangming Wang, Brian Sheil, Daniel Cremers, Yan Xia, Olaf Wysocki

机构 * Technical University of Munich(慕尼黑工业大学) University of Cambridge(剑桥大学) University of Science and Technology of China(中国科学技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出SemCityLoc,通过语义-几何对齐将航空位姿估计转化为结构化表面配准,利用基础模型视觉先验和标准化LoD城市模型,在重复遮挡环境中提升位姿判别性,并引入首个真实基准SemCityLockeD,实现定位误差从9.89m降至2.62m。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏