arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 749 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 149 篇

2607.12939 2026-07-15 cs.CV 新提交 57%

Point Tracking in Surgery--The 2025 Surgical Tattoos in Infrared Challenge (STIRC2025)

手术中的点跟踪——2025年红外手术纹身挑战(STIRC2025)

Adam Schmidt, Mert Asim Karaoglu, Zijian Wu, Jiaming Zhang, Yuxin Chen, Tim Salcudean, Ho-Gun Ha, Minkang Jang, Kyungmin Jung, Ihsan Ullah, Hyunki Lee, Suresh Guttikonda, Sarah Latus, Alexander Schlaefer, Xinkai Zhao, Yuichiro Hayashi, Masahiro Oda, Takayuki Kitasaka, Kensaku Mori, Peng Liu, Chenyang Li, Stefanie Speidel, Aoife Gardiner, Agostino Stilli, Danail Stoyanov, Francisco Vasconcelos, Anwesa Choudhuri, Meng Zheng, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Terrence Chen, Ziyan Wu, Alexander Ladikos, Omid Mohareri

机构 * Intuitive Surgical Inc.(直观外科公司) ImFusion GmbH(ImFusion有限公司) Technical University of Munich(慕尼黑工业大学) University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) Daegu Gyeongbuk Institute of Science and Technology(大邱庆北科学技术院) Hamburg University of Technology(汉堡工业大学) SustAInLivWork Center of Excellence(可持续生活工作卓越中心) Graduate School of Informatics, Nagoya University(名古屋大学信息科学研究生院) Information Technology Center, Nagoya University(名古屋大学信息技术中心) Department of Information Science, Aichi Institute of Technology(爱知工业大学信息科学系) Research Center for Medical Bigdata, National Institute of Informatics(国立信息学研究所医学大数据研究中心) Department of Translational Surgical Oncology, National Center for Tumor Diseases (NCT), NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresde(德累斯顿国家肿瘤疾病中心(NCT)转化外科肿瘤学系,NCT/UCC德累斯顿,由德国癌症研究中心、医学院和卡尔·古斯塔夫·卡鲁斯大学医院、德累斯顿工业大学合作成立)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 介绍2025年手术点跟踪挑战(STIRC2025),参与者提交算法基于红外手术纹身数据集(STIR)评估,含准确性和效率两组件,作为MICCAI EndoVis 2025一部分进行,总结结果与方法,数据集和代码可获取。

Comments 9 pages, 12 figures. arXiv admin note: substantial text overlap with arXiv:2503.24306

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12379 2026-07-15 cs.CV 新提交 57%

SeamGen: Artist-Aligned UV Seam Generation via Graph Flow Matching

SeamGen:通过图流匹配生成与艺术家对齐的UV接缝

Hao Xu, Yuqing Zhang, Yiqian Wu, Xueqi Ma, Ding Liang, Yan-Pei Cao, Ying-Tian Liu, Xiaogang Jin

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) VAST(未提及,可能是一个缩写,无法准确翻译)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 研究针对3D内容创作中UV接缝放置问题,提出SeamGen模型,通过流匹配从现有接缝布局学习,设计Mesh Transformer主干,利用流模型修复能力,能生成更符合艺术家偏好的UV布局,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交 57%

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10840 2026-07-14 cs.CV 新提交 57%

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX:通过前馈轨迹场进行任意视角和任意时刻的4D重建

Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超智能安全北京重点实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 针对前馈4D重建方法局限,提出OmniX框架,通过解耦动态运动建模与静态几何预测,利用动态令牌和3D运动结构生成轨迹场,并构建数据引擎和数据集,在多任务上取得领先性能。

Comments Accepted by ECCV 2026, project page: https://omnix4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09503 2026-07-13 cs.CV cs.AI 新提交 57%

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

VGGT 对重叠的理解:探索共可见性的几何基础模型

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究三维重建和机器人定位中共可见性问题,通过探索 VGGT 模型,发现其隐式编码共可见性及层间特性,引入 Co-VGGT 方法,该方法冻结 VGGT 并训练轻量级头,在基准测试中表现出色,提升了共可见性分类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09225 2026-07-13 cs.CV 新提交 57%

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Glob3R:基于3D基础模型的全局运动恢复结构

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Nanjing University(南京大学) Fudan University(复旦大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究针对3D基础模型重建结果不准确及处理长序列或大图像集有缺陷的问题,提出Glob3R方法,通过增强主干、转换扭曲为特征轨迹、引入关联策略及进行全局优化等,实现强大准确重建,提升神经渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09125 2026-07-13 cs.CV 新提交 57%

4D Human-Scene Reconstruction from Low-Overlap Captures

从低重叠度捕获中进行4D人体场景重建

Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 三维重建 :novel view synthesis(abstract);分类 cs.CV

AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。

Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08711 2026-07-10 cs.CV cs.LG 新提交 57%

LTM: Large-scale Terrain Model for Wildfire-prone Landscapes

LTM:适用于易发生野火地区的大规模地形模型

Xiao Fu, Yue Hu, Meida Chen, Peter Anthony Beerel, Barath Raghavan

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对易发生野火地区传统地形重建方法不足,提出利用过时DEM的多模态重建框架,通过物理像素对齐降低计算复杂度,经大型地形模拟器验证,相比现有技术显著提升了重建精度与计算效率,为野火应对提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02707 2026-07-09 cs.CV 新提交 57%

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

VLRC:视觉语言重投影一致性作为用于更好的前馈3D预训练的可扩展信号

Marwane Hariat, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris(U2IS,法国国立高等先进技术学校 - 巴黎综合理工学院) Pôle Recherche, Agence Ministérielle pour l’IA de Défense(军事人工智能部研究中心)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究提出视觉语言重投影一致性(VLRC),利用冻结的视觉语言表征作为语义多视图监督,无需额外3D标注,能提升3D重建精度等,为前馈3D预训练提供可扩展辅助目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05373 2026-07-07 cs.CV 新提交 57%

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

PixWorld:在像素空间中统一3D场景生成与重建

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

机构 * Nanyang Technological University(南洋理工大学) AISphere(人工智能领域)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。

Comments Project page: https://sensengao.github.io/PixWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05247 2026-07-07 cs.CV 新提交 57%

Vision Pretraining for Dense Spatial Perception

面向稠密空间感知的视觉预训练

Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 针对现有视觉基础模型牺牲空间细节理解的问题,提出以边界为中心的掩码边界建模自监督预训练范式,提升稠密空间感知能力与下游任务性能。

Comments Tech report, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04256 2026-07-07 cs.CV 新提交 57%

AdaptiveSplat:Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction

自适应拼接:用于前馈重建的纹理感知可控3D高斯分配

Badrinath Singhal, Srihari K G, Sreehari Iyer, Ankit Dhiman, Venkatesh Babu Radhakrishnan

机构 * Vision and AI Lab, Indian Institute of Science(视觉与人工智能实验室,印度科学研究所) Samsung R & D Institute India - Bangalore(三星印度研发中心 - 班加罗尔)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究前馈3D重建中高斯原语冗余问题,提出利用局部纹理信息控制高斯数量的方法,含纹理估计、纹理感知剪枝和自适应高斯头三个关键组件,实验验证了该方法有效性。

Comments Accepted at ECCV 2026. Project page: https://badrinaths.github.io/projects/adaptive-splat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02693 2026-07-07 cs.CV cs.LG physics.geo-ph 新提交 57%

Property-Constrained 3D Porous Media Reconstruction from 2D Images via Conditional Generative Adversarial Networks

通过条件生成对抗网络从二维图像进行属性约束的三维多孔介质重建

Ali Sadeghkhani, Brandon Bennett, Arash Rabbani

机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出基于二维薄片图像训练的条件生成对抗网络框架,结合属性条件生成与二维到三维重建,无需昂贵三维训练数据,保持对岩石物理属性控制,用混合架构和增强U-Net模型,在两类碳酸盐样本上验证成功。

Comments 6 pages, 3 figures. Submitted to the 87th EAGE Annual Conference & Exhibition, Aberdeen, UK, June 2026

Journal ref 87th EAGE Annual Conference & Exhibition, 2026, Vol. 2026, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01885 2026-07-07 cs.CV 新提交 57%

Diversity-aware View Partitioning for Scalable VGGT

面向可扩展VGGT的多样性感知视图划分

Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) KAIST(韩国科学技术院) RLWRLD

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对VGGT在大量视图下注意力计算成本高且冗余视图降低性能的问题,提出基于视觉差异和空间分散的图划分方法,将视图组织为多样性感知的平衡块,减少冗余注意力交互,提升相机位姿估计、多视图深度预测和3D重建性能。

Comments 34 pages, 11 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02515 2026-07-03 cs.CV 新提交 57%

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

PointDiT: 用于单目几何估计的像素空间扩散

Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出基于纯ViT的像素空间扩散Transformer,直接在原始3D点图块上操作,无需复杂架构和潜在空间压缩,在单目几何估计中超越潜在扩散模型。

Comments ICML 2026. Project page: https://haofeixu.github.io/pointdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01454 2026-07-03 cs.RO 新提交 57%

SE(2) Navigation Mesh

SE(2)导航网格

Shuyang Shi, Kaixian Qu, Changan Chen, Ines Kast, Yuntao Ma, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 提出SE(2)导航网格,通过编码偏航依赖的可通行性,支持非圆形机器人在复杂多层环境中的高效路径规划,并开发了A*-拉绳-A*分层路径搜索策略。

Comments Project page: https://se2-navmesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01367 2026-07-03 cs.MA cs.RO 新提交 57%

Simulation Based Reward Function Validation for Multi-Agent On Orbit Inspection

基于仿真的多智能体在轨检测奖励函数验证

Patrick Quinn, Bala Prenith Reddy Gopu, George M. Nehma, Madhur Tiwari

机构 * Department of Aerospace, Physics and Space Sciences(航空航天、物理与空间科学系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 提出一种基于多智能体强化学习的广义奖励函数,通过分析在轨物体三维重建来优化检测任务,使智能体自主控制图像采集时机。

Comments 13 pages, 6 figures. This submission integrates a published correction made to the original manuscript. The DOIs for both the original manuscript as well as the correction are provided

Journal ref AIAA SCITECH 2026 Forum, AIAA Paper 2026-2042, 2026; Correction: AIAA SCITECH 2026 Forum, AIAA Paper 2026-2042.c1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11326 2026-07-03 cs.CV 新提交 57%

DarkVGGT: Seeing Through Darkness Using Thermal Geometry without Daylight Tax

DarkVGGT: 利用热几何在黑暗中透视,无需日光代价

Minseong Kweon, Wenyuan Zhao, Nuo Chen, Lulin Liu, Huiwen Han, Zihao Zhu, Srinivas Shakkottai, Chao Tian, Zhiwen Fan

机构 * University of Minnesota(明尼苏达大学) Texas A&M University(德克萨斯农工大学) Stanford University(斯坦福大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出DarkVGGT,一种RGB-T前馈几何框架,通过物理感知热建模实现低光照场景下的鲁棒3D估计,引入热分解和几何共享路由模块,在退化RGB条件下保持精度。

Comments Project Page: https://darkvggt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00829 2026-07-02 cs.CV 新提交 57%

Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns

缝合嵌入:3D服装与2D纸样的统一潜在空间

Andrea Sanchietti, Riccardo Marin, Bharat Lal Bhatnagar, Yuanlu Xu, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Meta

专题命中 三维重建 :3D vision(abstract);分类 cs.CV

AI总结 提出首个无需模拟的框架Stitched Embeddings,通过BoxMesh中间表示在统一双向潜在空间中实现3D服装重建与2D纸样推断,达到高精度高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00498 2026-07-02 cs.CV 新提交 57%

Robust 3D Alignment of Generative Reconstructions via Partial Monocular Observations

基于部分单目观测的生成式重建鲁棒3D对齐

Yuchen Zhang, Luanyuan Dai, Yiwei Wang, Xiwei Xu, Jianing Zhang, Johnny. r. zhang, Xianhui Meng, Yanbiao Ma, Jiayi Ma, Xiaoshuai Hao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院) School of Tech Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Independent Researcher(独立研究员) School of Electronic Engineering and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Robotics, Wuhan University(武汉大学机器人学院) Xiaomi EV(小米汽车)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对生成式3D重建与部分单目观测对齐的挑战,提出无训练可解释几何对齐框架,通过Sim(3)变换恢复度量尺度与位姿,引入幻觉滤波抑制异常,在基准测试中显著优于传统和学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00417 2026-07-02 cs.CV cs.AI 新提交 57%

EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

EO-VGGT:用于卫星多视角重建的轨道光线条件化3D基础模型

Qiyan Luo, Yingdong Pi, Lekang Wen, Jie Yang, Xiaoyu Wang, Haiming Zhang, Mi Wang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对卫星遥感中透视模型与轨道几何不匹配的问题,提出EO-VGGT框架,通过几何相关约束选择、传感器射线编码器和射线指向适配器,实现冻结视角驱动模型适应轨道观测,提升多视角卫星3D重建质量。

Comments This article is submitted to journal and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-07-02 cs.CV 新提交 57%

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00157 2026-07-02 cs.CV 新提交 57%

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

渐进式姿态引导的单目视频4D动物重建

Siyuan Li, Weiying Chen, Yilin Wang, Xinxin Zuo, Xingyu Li, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) Concordia University(康科迪亚大学)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出一种基于3D高斯溅射的渐进式测试时优化框架,通过解耦关节姿态与非刚性变形,实现从单目视频高保真重建4D动物,在多种物种上优于现有方法。

Comments Accepted to ECCV 2026. Camera-ready author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 57%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 57%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27862 2026-06-29 cs.CV 新提交 57%

ScaLe-INR: Scale and Learn Implicit Neural Representations

ScaLe-INR:尺度化与学习隐式神经表示

Buwaneka Epakanda, Athulya Ratnayake, Pandula Thennakoon, Mario De Silva, Avishka Ranasinghe, Roshan Godaliyadda, Parakrama Ekanayake

机构 * eng.pdn.ac.lk(彭达大学) ee.pdn.ac.lk(电子工程学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出多分支架构ScaLe-INR,通过方向坐标缩放匹配频谱与网络最优工作区域,并设计方向边缘引导损失消除频谱串扰,在图像、音频和3D重建任务上超越现有方法。

Comments Submitted as a conference paper to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27659 2026-06-29 cs.CV 新提交 57%

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

GeoFace: 基于几何约束的一致多视角人脸生成扩散模型

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出GeoFace,一种几何约束的多视角扩散框架,通过外观与几何流的共享注意力层和几何引导注意力对齐损失,实现从单张输入生成一致的多视角人脸图像和3D几何,显著提升跨视角几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25284 2026-06-25 cs.CV 新提交 57%

Evaluation Protocols and Validation for Cameras in Indoor Healthcare Monitoring

室内医疗监测中摄像头的评估协议与验证

Amirhossein Dadashzadeh, Jingjing Liu, Qianhui Men, Qiushuo Cheng, Kirsty Scott, Lisa Alcock, Ian Craddock, Majid Mirmehdi

机构 * 1 School of Engineering Mathematics Technology, University of Bristol, UK 2 School of Computer Science, University of Bristol, UK 3 Translational Clinical Research Institute, Faculty of Medical Sciences, Newcastle University, UK 4 NIHR Newcastle Biomedical Research Centre, Newcastle University The Newcastle upon Tyne Hospitals NHS Foundation Trust, UK

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出两种技术验证协议,系统评估五款摄像头在可控室内条件下的计量性能和人体姿态估计支持能力,为医疗监测中的摄像头选型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24282 2026-06-24 cs.CV 新提交 57%

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance

UniRED: 基于事件引导的统一RGB-D视频帧插值

Yinuo Zhang, Guangshun Wei, Yuanfeng Zhou, Yiran Shen

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 提出统一多模态框架UniRED,融合RGB外观、深度几何和事件时间线索,通过双向流估计与运动基细化实现高质量RGB-D视频帧插值,并构建RGB-D-Event数据集缓解数据稀缺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23653 2026-06-23 cs.CV 新提交 57%

Lightweight Neural Framework for Robust 3D Volume and Surface Estimation from Multi-View Images

轻量级神经框架:从多视图图像稳健估计3D体积和表面积

Diego E. Farchione, Ramzi Idoughi, Peter Wonka

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 提出一种全前馈框架,通过图解码器融合3D点云与2D特征,直接从多视图图像回归尺度归一化的体积、表面积及其不确定性,在稀疏视图下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏