arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-01 至 2026-07-01 共收录 22 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 5 篇

2606.31086 2026-07-01 cs.CV 新提交 79%

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

CasaMaestro:用于房屋级3D重建的多视角全景图

Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14307 2026-07-01 cs.CV 新提交 79%

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation

Pano3D:统一的3D重建与全景分割

Victor Barberteguy, Ahmet Iscen, Mathilde Caron, Alireza Fathi, Gül Varol, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 巴黎理工学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 提出统一框架,在3D前馈重建网络中集成全景分割,通过联合训练几何与语义损失实现互惠提升,在多个数据集上达到最优性能。

Comments Accepted at ECCV 2026. Project page: https://victorbbt.github.io/Pano3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30677 2026-07-01 cs.GR cs.CV 新提交 62%

DANTE-W: Diffuse Albedo Neural Texturing in the Wild

DANTE-W:野外场景的漫反射反照率神经纹理化

Guangyu Wang, Tianheng Lu, Ruqi Huang, Lu Fang

机构 * Tsinghua University(清华大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 提出DANTE-W神经纹理框架,利用神经表示融合生成式先验,通过物理神经渲染恢复高保真漫反射反照率纹理,提升重光照保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 57%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 57%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 7 篇

2606.30809 2026-07-01 cs.CV cs.RO 新提交 89%

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping

GaussLite:面向实时机器人建图的任务条件化3D高斯泼溅

Annika Thomas, Mason Peterson, Jonathan P. How

机构 * Aerospace Controls Laboratory, MIT(麻省理工学院航空航天控制实验室)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV、cs.RO

AI总结 提出GaussLite,一种任务驱动的3DGS建图系统,通过自然语言任务规范调节表示密度,利用LLM解析器提取目标并实时生成像素级相关性掩码,在有限资源下实现实时建图,ROI PSNR提升约2.72 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31556 2026-07-01 cs.CV 新提交 87%

AugSplat: Radiance Field-Informed Gaussian Splatting for Sparse-View Settings

AugSplat: 基于辐射场信息的高斯泼溅用于稀疏视图设置

Lorenzo Lazzaroni, Riccardo Bollati, Daniel Barath, Michael Niemeyer, Keisuke Tateno

机构 * Google(谷歌) ETH Zurich(苏黎世联邦理工学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);NeRF(abstract,abstract_cn);3D vision(abstract);分类 cs.CV

AI总结 针对稀疏视图下高斯泼溅对初始几何敏感的问题,提出AugSplat,利用辐射场合成新视角图像作为辅助监督,提升重建质量并保持实时渲染。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30869 2026-07-01 cs.GR 新提交 84%

GRay: Ray Tracing 3D Gaussians Near the Speed of Splats

GRay: 接近 Splats 速度的光线追踪 3D 高斯

Yohan Poirier-Ginter, Jean-François Lalonde, George Drettakis

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.GR

AI总结 提出 GRay,一种快速 3D 高斯光线追踪器,通过利用光线追踪的对数级图元缩放特性,在密集小高斯场景中实现接近 3DGS 的渲染和优化速度。

Comments 12 pages plus supplementary material, 33 pages total; Proceedings of the ACM on Computer Graphics and Interactive Techniques, I3D 2026

Journal ref Proc. ACM Comput. Graph. Interact. Tech. 9, 1, Article 14, 19 pages, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32036 2026-07-01 cs.CV 新提交 74%

PointSplat: Compact Gaussian Splatting via Human-Centric Prediction

PointSplat: 通过以人为中心的预测实现紧凑的高斯泼溅

Yujie Guo, Yudong Jin, Lingteng Qiu, Zehong Shen, Zhen Xu, Jing Zhang, Xianchao Shen, Hujun Bao, Sida Peng, Xiaowei Zhou

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ByteDance(字节跳动) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV

AI总结 提出PointSplat,一种以人为中心的方法,直接从输入点集推断高斯原语,通过3D空间预测减少冗余,实现紧凑表示和高质量新视角渲染。

Comments Project Page: https://zju3dv.github.io/pointsplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31050 2026-07-01 cs.CV cs.AI 新提交 70%

Learning Video Dynamics with Predictive Differentiable Rendering

基于预测可微渲染的视频动态学习

Yujin Tang, Tian Zhou, Xin Lin, Cheng Tan, Yifan Hu, Rong Jin, SouYoung Jin, Liang Sun

机构 * Dartmouth College(达特茅斯学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, San Diego(加州大学圣地亚哥分校) Westlake University(西湖大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出预测可微渲染(PDR)框架,通过2D高斯表示的轻量适配器PredGS和CUDA加速渲染器predgsplat,结合L1和SSIM损失优化,在离散像素与连续表示间架桥,显著提升视频预测的细节保真度和准确性。

Comments Accepted by ECCV 2026. 18 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31637 2026-07-01 cs.GR cs.AI 新提交 57%

Intrinsic decomposition and editing of 3D Gaussian splats

3D高斯散点的本征分解与编辑

Alexandre Lanvin, Jeffrey Hu, Simon Lucas, Adrien Bousseau, George Drettakis

机构 * Inria, Université Côte d’Azur(法国国家信息与自动化研究所,蔚蓝海岸大学) Cambridge University(剑桥大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.GR

AI总结 提出将本征分解扩展到高斯散点辐射场的方法,通过独立高斯基元、数据驱动优化和单图纹理编辑实现场景的材质与光照分离及编辑。

Comments 18 pages

Journal ref Proc. ACM Comput. Graph. Interact. Tech. 9, 1, Article 10 (May 2026), 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30861 2026-07-01 cs.GR 新提交 57%

Editable Physically-based Reflections in Raytraced Gaussian Radiance Fields

可编辑的基于物理的光线追踪高斯辐射场反射

Yohan Poirier-Ginter, Jeffrey Hu, Jean-François Lalonde, George Drettakis

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.GR

AI总结 提出一种基于3D高斯泼溅的方法,通过提取漫反射和镜面反射缓冲区,结合路径追踪和快速光线追踪算法,实现可编辑的物理基镜面反射,支持多跳反射和粗糙度编辑。

Comments 12 pages plus supplementary material, 20 pages total; SIGGRAPH Asia 2025 Conference Papers

Journal ref Proceedings of ACM SIGGRAPH Asia 2025 Conference Papers, Article 201, 12 pages, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 6 篇

2606.32023 2026-07-01 cs.CV cs.AI 新提交 57%

FLORA: A deep learning approach to predict forest attributes from heterogeneous LiDAR data

FLORA: 一种从异构LiDAR数据预测森林属性的深度学习方法

Emilie Vautier, Clément Mallet, Cédric Vega

机构 * Univ Gustave Eiffel, Géodata Paris, IGN, LASTIG(古斯塔夫·埃菲尔大学,巴黎地理数据,IGN,LASTIG) Univ Gustave Eiffel, Géodata Paris, IGN, LIF(古斯塔夫·埃菲尔大学,巴黎地理数据,IGN,LIF) Université de Lorraine, Géodata Paris, IGN, LIF(洛林大学,巴黎地理数据,IGN,LIF)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出FLORA框架,利用八叉树骨干网络与生态时空辅助变量,从异构LiDAR点云预测六种森林属性,在法国32,052个样地验证,主导高rRMSE约12.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交 57%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31579 2026-07-01 cs.GR 新提交 57%

DualBrep: A Dual-Field Continuous Representation for B-rep Modelling

DualBrep:用于B-rep建模的双场连续表示

Yilin Liu, Pradeep Jayaraman, Chinthala Reddy, Xiang Xu, Hooman Shayani

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 提出DualBrep,通过有符号距离函数和无符号距离场双场统一B-rep的几何与拓扑,结合隐空间流匹配实现无误差累积的生成建模,并支持从点云逆向工程和生成建模。

Comments Published in SIGGRAPH 2026; Code is available at https://github.com/AutodeskAILab/DualBrep

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31570 2026-07-01 cs.CV cs.AI 新提交 57%

Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning

缓解3D掩码自编码器中的位置泄漏以实现鲁棒表示学习

Xu Yan, Huiqun Wang, Chen Wang, Lei Ren, Di Huang

机构 * SKLCCSE, Beihang University(北京航空航天大学软件开发环境国家重点实验室) SCSE, Beihang University(北京航空航天大学计算机学院) NERCBDS, EIRI, Tsinghua University(清华大学电子工程系智能技术与系统国家重点实验室) SASEE, Beihang University(北京航空航天大学自动化科学与电气工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对3D掩码自编码器中位置信息过度依赖导致语义表示弱化的问题,提出MPL-MAE框架,通过重校准位置嵌入和门控位置接口模块,平衡空间先验与语义特征,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31148 2026-07-01 cs.CV cs.AI cs.CL 新提交 57%

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround: 用于3D视觉定位的即插即用空间剪枝框架

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Knovel Engineering Lab(Knovel工程实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) ELLIS Institute(ELLIS研究所) Max Planck Institute(马克斯·普朗克研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出PruneGround框架,通过语言引导的空间剪枝、多视角描述重构和LLM定位器,在剪枝区域高效定位目标,在多个基准上取得最优结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31136 2026-07-01 cs.CV 新提交 57%

FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics

FROST:基于冻结特征和非参数统计的无训练少样本分割

Junghwan Park

机构 * TelePIX

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 提出FROST,一种无训练少样本分割方法,将参考前景和背景视为冻结DINOv3特征单位球上的点云,通过非参数密度比标记查询像素,在遥感基准上超越现有方法。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 3 篇

2606.31258 2026-07-01 cs.CV 新提交 77%

WarpHammer: Densifying Scene Warps with 3D Object Priors for Extreme View Synthesis

WarpHammer: 利用3D物体先验稠密化场景扭曲以实现极端视角合成

Michael Green, Gavriel Habib, Dvir Samuel, Tal Berkovitz Shalev, Issar Tzachor, Rami Ben-Ari, Or Litany

机构 * OriginAI, Israel(OriginAI,以色列) NVIDIA(英伟达) Technion(以色列理工学院)

专题命中 新视角合成 :3D reconstruction(abstract);point cloud(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 针对投影条件新视角合成在大轨道运动下扭曲稀疏导致生成失败的问题,提出无需训练的WarpHammer框架,通过引入3D生成先验的物体显式重建来补充缺失前景并遮挡不应可见的背景点,恢复外观和相机线索,并首次支持融合外部辅助物体视图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31679 2026-07-01 cs.GR cs.CV 新提交 62%

Practical High-Fidelity Novel-View Synthesis of Mounted Lepidoptera

实用高保真新视角合成:鳞翅目针插标本

Kristof Overdulve, Lode Jorissen, Nick Michiels

机构 * Digital Future Lab, Flanders Make, Hasselt University(数字未来实验室,弗兰德斯制造,哈瑟尔特大学)

专题命中 新视角合成 :Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 针对鳞翅目针插标本微小脆弱、景深有限及腹面拍摄困难的问题,提出结合手持焦点堆叠、非接触第一表面镜系统和无分割镜面感知3D高斯泼溅的端到端管线,实现高保真3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31585 2026-07-01 cs.CV cs.AI 新提交 57%

DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers

DPPE:重新思考基于相机的可缩放多视图Transformer的位置编码

Shun Kenney, Teppei Suzuki

机构 * Keio University(庆应义塾大学) SB Intuitions

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 针对多视图Transformer中基于相机参数的位置编码导致训练后期性能停滞的问题,提出解耦位姿位置编码(DPPE),将旋转和平移显式分离,实现稳定长训练并提升外推泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 空间理解 1 篇

2606.31688 2026-07-01 cs.CV 新提交 57%

Semantic Occupancy Prediction with Dual Range-Voxel Representation

基于双范围-体素表示的语义占用预测

Sitao Chen, Zhuangwei Zhuang, Hui Luo, Lizhao Liu, Qingyao Wu, Mingkui Tan

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院) State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, CAS(中国科学院光电技术研究所光学场操控科学与技术国家重点实验室)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 提出双范围-体素表示(DRVR),利用单扫描点云的范围视图和体素视图几何信息进行3D语义占用预测,避免多扫描带来的计算和鲁棒性问题,在nuScenes-Occupancy上mIoU提升5.4%,速度提升2.1倍。

详情

展开后加载摘要…

URL PDF HTML 收藏