arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-06-17 至 2026-06-17 共收录 17 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 6 篇

2606.18153 2026-06-17 cs.CV 新提交 81%

Neural Tree Reconstruction for the Open Forest Observatory

开放森林观测站的神经树重建

Marissa Ramirez de Chanlatte, Arjun Rewari, Trevor Darrell, Derek J. N. Young

机构 * Berkeley AI Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究) Department of Plant Sciences, University of California, Davis(加州大学戴维斯分校植物科学系)

专题命中 三维重建 :NeRF(abstract,abstract_cn);3D vision(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 针对开放森林观测站中经典运动恢复结构方法重建质量差的问题,提出引入神经辐射场提升3D树重建的细节与鲁棒性,并展望未来工作。

Comments Published as a workshop paper at "Tackling Climate Change with Machine Learning", ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18250 2026-06-17 cs.CV 新提交 79%

Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: https://fr3d-wm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17836 2026-06-17 cs.CV cs.AI cs.CG cs.GR 新提交 62%

High-Fidelity 3D Geometric Reconstruction of Pelvic Organs from MRI: A Hybrid Deep Learning and Iterative Optimization Approach

高保真盆腔器官MRI三维几何重建:一种混合深度学习与迭代优化方法

Hui Wang, Xiaowei Li, Chenxin Zhang, Yifan Feng, Jianwei Zuo, Yumeng Tang, Xiuli Sun, Jianliu Wang, Bing Xie, Jiajia Luo

机构 * Institute of Medical Technology, Peking University Health Science Center, Peking University(北京大学医学部医学技术研究院,北京大学) Biomedical Engineering Department, Institute of Advanced Clinical Medicine, Peking University(北京大学先进临床医学研究院生物医学工程系) Department of Obstetrics and Gynecology, Peking University People’s Hospital(北京大学人民医院妇产科部)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 提出混合可变形形状建模框架,结合深度学习预测与迭代优化,实现膀胱、子宫和直肠的高保真三维几何重建,在几何保真度和网格质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17480 2026-06-17 cs.CV cs.RO 新提交 62%

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) CASIA(中国科学院自动化研究所) AI 2 Robotics

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17696 2026-06-17 cs.AI cs.GR 新提交 57%

FllumaOne: A Code-Native Multimodal CAD Dataset with Executable Programs and Kernel-Validated Feature Histories

FllumaOne:一个代码原生多模态CAD数据集,包含可执行程序与内核验证的特征历史

Jizong Zhan

机构 * Qt/C++ OpenCASCADE-based CAD system(基于Qt/C++ OpenCASCADE的CAD系统)

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 提出FllumaOne数据集,通过可执行Python程序生成CAD模型,对齐程序、特征树、几何等模态,支持可编辑逆向工程等任务。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17384 2026-06-17 cs.CV 新提交 57%

Improving and Evaluating Hand-Object Interaction Detection

改进和评估手-物体交互检测

Ahmad Darkhalil, Dima Damen, David Fouhey

机构 * School of Computer Science, University of Bristol, Bristol, UK(布里斯托大学计算机科学学院) Computer Science and Electrical and Computer Engineering, New York University, NY, US(纽约大学计算机科学与电气与计算机工程系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出HOI-DETR框架,将手-物体和物体-物体交互引入Co-DETR架构,在四个数据集上显著提升检测性能,mAP提升超过20个百分点。

Comments Project page: https://ahmaddarkhalil.github.io/HOI-DETR/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 7 篇

2606.17935 2026-06-17 cs.CV 新提交 90%

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization

MoonSplat: 基于Sim(3)全局优化的单目在线高斯泼溅

Guo Pu, Yixuan Han, Haofeng Li, Yao Zhang, Hui Zhou, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Beijing Hydrogen Intelligent Tech. Co., Ltd.(北京氢元智能科技有限公司)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出一种结合Sim(3)全局优化的在线体素化3DGS框架,通过颜色残差学习策略加速收敛,实现鲁棒的相机跟踪和全局闭环,在室内外数据集上达到SOTA性能。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17432 2026-06-17 cs.GR cs.CV 新提交 84%

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting

Edit3DGS:通过2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架

Duy-Dat Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Ho Chi Minh, Vietnam(越南胡志明市国家大学) Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV、cs.GR

AI总结 提出Edit3DGS统一框架,结合2D指令引导扩散与3D高斯泼溅,实现动态3D头部的可控编辑,支持表情变换、属性修改等操作,并保持身份与运动动态的一致性。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17212 2026-06-17 cs.GR cs.NI 新提交 83%

Renderable Partial Representations for Dynamic Gaussian Splatting under Incomplete Delivery

不完整交付下动态高斯溅射的可渲染部分表示

Faruk Alpay, Levent Sarioglu, Yaser Hadri

专题命中 Gaussian Splatting :Gaussian Splatting(title);NeRF(abstract,abstract_cn);分类 cs.GR

AI总结 针对动态高斯表示在交互式渲染中因部分交付导致的退化问题,提出将基元组织为独立寻址的时空簇,通过训练部分依赖图并最小化期望失真、尾部失真等,实现不完整状态仍可直接渲染,并在实验上优于名义层序。

Comments 19 pages, 8 figures, 3 tables. Code, tests, configurations, pinned environment, and measurement records (including the partial-state oracle atlas) are provided as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17998 2026-06-17 cs.CV 新提交 79%

AIGS-Net: Compact Illumination Field Modeling via 2D Gaussian Splatting for Fast Low-Light Image Enhancement

AIGS-Net: 基于2D高斯泼溅的紧凑光照场建模用于快速低光图像增强

Yuhan Chen, Kunyang Huang, Fuchen Li, Zhuohan Qin, Guofa Li, Wenbo Chu, Keqiang Li

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·韦特海姆工程学院) School of Mathematics and Statistics, Qingdao University(青岛大学数学与统计学院) National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 提出AIGS-Net,通过输入自适应的2D高斯泼溅光照场和零参数多尺度上下文编码,以约40个可学习参数实现低光图像增强,在LOL和LSRW基准上平衡了增强质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17520 2026-06-17 cs.RO cs.CV 新提交 76%

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments

GASE:基于高斯溅射的自动化系统用于重建具身仿真环境

Jiawei Zhang, Yiming Yan, Chao Liang, Nuo Xu, Seson Sun, Qichen Zhang, Yuhao Xu, Yantai Yang, Yingqiao Wang, Qin Jin, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学SAI学院AutoLab实验室) AIM3 Lab, School of Information, Renmin University of China(中国人民大学信息学院AIM3实验室) Research Lab, Anyverse Dynamics(Anyverse Dynamics研究实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV、cs.RO

AI总结 提出GASE系统,利用全景相机阵列和多视图视频流,通过相机位姿策略提取前景物体并修复场景,独立重建后导入物理仿真器,实现高效高保真仿真环境构建,分割精度提升超10%,真实机器人部署性能差距小于10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17985 2026-06-17 cs.CV 新提交 57%

Gaussian Light Field Splatting: A Physical Prior-Driven Vision Transformer for Unsupervised Low-Light Image Enhancement

高斯光场溅射:一种物理先验驱动的视觉Transformer用于无监督低光图像增强

Yuhan Chen, Wenxuan Yu, Guofa Li, Fuchen Li, Kunyang Huang, Yicui Shi, Ying Fang, Wenbo Chu, Keqiang Li

机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·韦特海姆工程学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出GLFS模型,将高斯溅射的连续物理光照建模引入Transformer,通过各向异性高斯函数表示场景光照并引入物理引导偏置到自注意力中,配合颜色向量角损失和亮度边缘损失,实现非均匀光照下的曝光均衡和色彩校正,达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17722 2026-06-17 cs.CV 新提交 57%

GSPan: A Continuous Gaussian Primitive Representation for Arbitrary-Scale Pansharpening

GSPan:一种用于任意尺度全色锐化的连续高斯基元表示

Fangyi Li, Xiaoyuan Yang, Yixiao Li, Zongyang Sui, Kangqing Shen, Gemine Vivone

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) National Research Council - Institute of Methodologies for Environmental Analysis, CNR-IMAA(意大利国家研究委员会 - 环境分析方法研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出GSPan框架,将2D高斯溅射引入全色锐化,通过连续可学习的2D高斯基元表示残差细节,实现任意尺度融合,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 3 篇

2606.18053 2026-06-17 cs.RO 新提交 57%

A Hybrid Optimization Framework for Grasp Synthesis under Partial Observations

一种用于部分观测下抓取合成的混合优化框架

Wenzheng Zhang, Fahira Afzal Maken, Tin Lai, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) NVIDIA(英伟达)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出结合基于学习的能量模型与解析迭代最近点方法的混合框架,从部分观测点云生成鲁棒抓取,在67个物体5360次抓取尝试中平均成功率达60.9%,优于现有方法。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17562 2026-06-17 cs.CR cs.SY eess.SY 新提交 50%

Anywhere, Any-Stymie: Remote Activation of Trojan Malware on LiDAR with Modulated Signals

任意地点,任意干扰:利用调制信号远程激活LiDAR上的特洛伊恶意软件

R. Spencer Hallyburton, Miroslav Pajic

专题命中 点云 :point cloud(abstract)

AI总结 本研究设计了一种嵌入LiDAR固件的特洛伊恶意软件,并利用光学触发通过调制信号远程激活,实现虚假目标注入和真实目标抑制,威胁自动驾驶安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17185 2026-06-17 cs.LG eess.SP math.DG stat.ML 新提交 50%

Finsler Geometry, Graph Neural Networks, and You

芬斯勒几何、图神经网络与你

T. Mitchell Roddenberry, Richard G. Baraniuk

机构 * Rice University(莱斯大学)

专题命中 点云 :point cloud(abstract)

AI总结 针对图拉普拉斯只能近似各向同性算子的局限,提出基于芬斯勒拉普拉斯的图神经网络层,证明其收敛性并恢复非线性扩散方程的几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 空间理解 1 篇

2606.17561 2026-06-17 cs.CV 新提交 57%

RT-Counter: Real-Time Text-Guided Open-Vocabulary Object Counting

RT-Counter:实时文本引导的开放词汇目标计数

Hao-Yuan Ma, Li Zhang, Zhiwei Zhu, Jie Gao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 提出实时文本引导开放词汇计数框架RT-Counter,通过视觉原型文本化模块和编织Transformer层,在保持高精度的同时实现实时推理,在FSC147上MAE为13.30,速度达112.48 FPS。

详情

展开后加载摘要…

URL PDF HTML 收藏