Crowd4D: Scene-Aware Monocular 4D Crowd Reconstruction
Crowd4D:场景感知单目4D人群重建
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 针对单目视频恢复大规模场景下4D人群运动的难题,提出Crowd4D框架,通过多阶段优化联合优化人群与场景,引入HSIP解决对齐问题、CSCR提升时间稳定性,实验证明其性能优于现有方法,可实现复杂场景下单目4D人群稳健重建。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
Crowd4D:场景感知单目4D人群重建
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 针对单目视频恢复大规模场景下4D人群运动的难题,提出Crowd4D框架,通过多阶段优化联合优化人群与场景,引入HSIP解决对齐问题、CSCR提升时间稳定性,实验证明其性能优于现有方法,可实现复杂场景下单目4D人群稳健重建。
IGGT4D:流式4D实例关联几何变换器
机构 * Horizon Robotics(地平线机器人公司) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对现实世界空间智能中视频流场景理解问题,提出IGGT4D流式实例关联几何变换器,通过因果时空建模更新统一表示,还构建数据集。实验证明其在长动态序列在线推理上优于现有基线。
Comments Project Page: https://iggt4d.github.io
基于参数曲面的自回归 B-Rep 形状生成
机构 * The University of Hong Kong(香港大学) ; Deemos Technology Co., Ltd.(迪莫斯科技有限公司) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; ShanghaiTech University(上海科技大学) ; Texas A&M University(德克萨斯A&M大学)
专题命中 三维重建 :3D generation(abstract);分类 cs.CV
AI总结 研究提出 ParaCAD 自回归框架,用于点云条件 B-Rep 生成,直接在原生参数曲面上运行,通过以曲面为中心的令牌化编码面信息,先生成参数曲面再构建 B-Rep,实验证明其在多方面优于基于点的基线。
用于制造质量检测的合成3D齿轮数据集(MFGNet-Gear)
机构 * University of Michigan(密歇根大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 研究针对智能制造中基于深度学习的零件质量检测数据难题,提出构建MFGNet-Gear合成3D数据集,通过参数化生成齿轮几何形状与缺陷,涵盖多种设计和质量等级,提供标注数据,助力相关检测、学习及基准测试,推动3D计量学发展。
GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; Huawei(华为)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。
Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/
ContactFusion:基于视觉和接触传感的随机泊松曲面地图
机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) ; Department of Mechanical and Mechatronics Engineering, University of Waterloo(机械与机电工程系,滑铁卢大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.RO
AI总结 研究针对机器人装配中场景理解噪声影响插入成功率的问题,提出ContactFusion方法,结合全局映射与局部接触信息,通过拒绝采样程序估计接触位置,将接触与视觉信息融合到SPSMap,验证了方法有效性并改善孔位估计。
Comments Version accepted to IROS2026
SeeSE3:视觉特征中3D空间的出现
机构 * Google DeepMind(谷歌DeepMind)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。
可微偏振路径追踪
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; Saarland Informatics Campus(萨尔兰信息学园区) ; VIA Research Center(VIA研究中心) ; Google(谷歌)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究逆渲染问题,提出偏振感知的可微路径追踪方法,通过路径重放和局部缓存组合估计无偏梯度,能在复杂场景中高效稳定优化材质和光照参数,拓宽基于物理的逆渲染适用性。
Comments Accepted at ECCV 2026
手术中的点跟踪——2025年红外手术纹身挑战(STIRC2025)
机构 * Intuitive Surgical Inc.(直观外科公司) ; ImFusion GmbH(ImFusion有限公司) ; Technical University of Munich(慕尼黑工业大学) ; University of British Columbia(英属哥伦比亚大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; Daegu Gyeongbuk Institute of Science and Technology(大邱庆北科学技术院) ; Hamburg University of Technology(汉堡工业大学) ; SustAInLivWork Center of Excellence(可持续生活工作卓越中心) ; Graduate School of Informatics, Nagoya University(名古屋大学信息科学研究生院) ; Information Technology Center, Nagoya University(名古屋大学信息技术中心) ; Department of Information Science, Aichi Institute of Technology(爱知工业大学信息科学系) ; Research Center for Medical Bigdata, National Institute of Informatics(国立信息学研究所医学大数据研究中心) ; Department of Translational Surgical Oncology, National Center for Tumor Diseases (NCT), NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresde(德累斯顿国家肿瘤疾病中心(NCT)转化外科肿瘤学系,NCT/UCC德累斯顿,由德国癌症研究中心、医学院和卡尔·古斯塔夫·卡鲁斯大学医院、德累斯顿工业大学合作成立)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 介绍2025年手术点跟踪挑战(STIRC2025),参与者提交算法基于红外手术纹身数据集(STIR)评估,含准确性和效率两组件,作为MICCAI EndoVis 2025一部分进行,总结结果与方法,数据集和代码可获取。
Comments 9 pages, 12 figures. arXiv admin note: substantial text overlap with arXiv:2503.24306
SeamGen:通过图流匹配生成与艺术家对齐的UV接缝
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; VAST(未提及,可能是一个缩写,无法准确翻译)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 研究针对3D内容创作中UV接缝放置问题,提出SeamGen模型,通过流匹配从现有接缝布局学习,设计Mesh Transformer主干,利用流模型修复能力,能生成更符合艺术家偏好的UV布局,提升感知质量。
GHOST:不透明表面纹理的几何引导幻觉
机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。
OmniX:通过前馈轨迹场进行任意视角和任意时刻的4D重建
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent Hunyuan(腾讯混元) ; HKUST(香港科技大学) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超智能安全北京重点实验室) ; School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 针对前馈4D重建方法局限,提出OmniX框架,通过解耦动态运动建模与静态几何预测,利用动态令牌和3D运动结构生成轨迹场,并构建数据引擎和数据集,在多任务上取得领先性能。
Comments Accepted by ECCV 2026, project page: https://omnix4d.github.io/
VGGT 对重叠的理解:探索共可见性的几何基础模型
机构 * University of Padova(帕多瓦大学) ; Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究三维重建和机器人定位中共可见性问题,通过探索 VGGT 模型,发现其隐式编码共可见性及层间特性,引入 Co-VGGT 方法,该方法冻结 VGGT 并训练轻量级头,在基准测试中表现出色,提升了共可见性分类效果。
Glob3R:基于3D基础模型的全局运动恢复结构
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Nanjing University(南京大学) ; Fudan University(复旦大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究针对3D基础模型重建结果不准确及处理长序列或大图像集有缺陷的问题,提出Glob3R方法,通过增强主干、转换扭曲为特征轨迹、引入关联策略及进行全局优化等,实现强大准确重建,提升神经渲染质量。
从低重叠度捕获中进行4D人体场景重建
机构 * Seoul National University(首尔国立大学)
专题命中 三维重建 :novel view synthesis(abstract);分类 cs.CV
AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。
Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/
ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; National Taiwan University(国立台湾大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。
Comments Accepted by IJCV 2026
Re$^3$Sim:通过用于机器人操作的3D逼真的真实到模拟生成高保真模拟数据
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO
AI总结 针对机器人真实数据收集难题,提出RE$^3$Sim系统,运用3D重建和神经渲染技术重现真实场景,利用特权信息收集专家演示并训练策略,验证管道有效性,仅用模拟数据实现零样本转移,还生成大规模数据集。
LTM:适用于易发生野火地区的大规模地形模型
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对易发生野火地区传统地形重建方法不足,提出利用过时DEM的多模态重建框架,通过物理像素对齐降低计算复杂度,经大型地形模拟器验证,相比现有技术显著提升了重建精度与计算效率,为野火应对提供可扩展方案。
VLRC:视觉语言重投影一致性作为用于更好的前馈3D预训练的可扩展信号
机构 * U2IS, ENSTA – Institut Polytechnique de Paris(U2IS,法国国立高等先进技术学校 - 巴黎综合理工学院) ; Pôle Recherche, Agence Ministérielle pour l’IA de Défense(军事人工智能部研究中心)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究提出视觉语言重投影一致性(VLRC),利用冻结的视觉语言表征作为语义多视图监督,无需额外3D标注,能提升3D重建精度等,为前馈3D预训练提供可扩展辅助目标。
SpatialFly:基于几何的表示对齐用于城市环境中无人机视觉与语言导航
机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Tsinghua University(清华大学) ; Department of Automation, Tsinghua University(清华大学自动化系) ; School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) ; Jianghan University(江汉大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出SpatialFly框架,通过几何引导的2D表示对齐机制,解决无人机在复杂3D环境中的视觉与语言导航问题,实验表明其在路径对齐和运动稳定性方面优于现有方法。
RayRoPE: 多视角注意力的投影位置编码
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Apple(苹果公司)
专题命中 三维重建 :3DGS(abstract);分类 cs.CV
AI总结 本文提出RayRoPE,一种基于投影坐标的位置编码方法,用于多视角Transformer,实现SE(3)不变的注意力机制,并能适应3D场景几何。
Comments Project page: https://rayrope.github.io/
MorphGS:基于形态的 articulated 3D 动作迁移从视频
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出MorphGS框架,通过图像空间监督直接优化目标形态和姿态,解决视频到3D角色动作迁移中的形态差异和姿态模糊问题,实验显示优于基线方法。
Comments ECCV 2026
FIELDS:通过直接监督学习进行表情精确推断的面部重建
机构 * KTH Royal Institute of Technology(皇家理工学院) ; Linköping University(林奈大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究单目3D面部重建,提出FIELDS框架,通过直接监督学习在几何合理性约束下获取FLAME表情代码用于面部表情识别,采用混合2D/3D监督,提升情感预测且保持几何保真度。
Syn4D:多视图合成4D数据集
机构 * VGG ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Naver Labs Europe(Naver欧洲实验室)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对动态场景稠密3D重建跟踪缺高质量标注数据集的问题,构建含多类真值标注的Syn4D数据集,支撑多下游任务,助力相关研究。
Comments 33 pages, 11 figures, project page: https://jzr99.github.io/Syn4D/
PixWorld:在像素空间中统一3D场景生成与重建
机构 * Nanyang Technological University(南洋理工大学) ; AISphere(人工智能领域)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。
Comments Project page: https://sensengao.github.io/PixWorld/
面向稠密空间感知的视觉预训练
专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV
AI总结 针对现有视觉基础模型牺牲空间细节理解的问题,提出以边界为中心的掩码边界建模自监督预训练范式,提升稠密空间感知能力与下游任务性能。
Comments Tech report, 31 pages
自适应拼接:用于前馈重建的纹理感知可控3D高斯分配
机构 * Vision and AI Lab, Indian Institute of Science(视觉与人工智能实验室,印度科学研究所) ; Samsung R & D Institute India - Bangalore(三星印度研发中心 - 班加罗尔)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 研究前馈3D重建中高斯原语冗余问题,提出利用局部纹理信息控制高斯数量的方法,含纹理估计、纹理感知剪枝和自适应高斯头三个关键组件,实验验证了该方法有效性。
Comments Accepted at ECCV 2026. Project page: https://badrinaths.github.io/projects/adaptive-splat/
通过条件生成对抗网络从二维图像进行属性约束的三维多孔介质重建
机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 提出基于二维薄片图像训练的条件生成对抗网络框架,结合属性条件生成与二维到三维重建,无需昂贵三维训练数据,保持对岩石物理属性控制,用混合架构和增强U-Net模型,在两类碳酸盐样本上验证成功。
Comments 6 pages, 3 figures. Submitted to the 87th EAGE Annual Conference & Exhibition, Aberdeen, UK, June 2026
Journal ref 87th EAGE Annual Conference & Exhibition, 2026, Vol. 2026, pp. 1-5
面向可扩展VGGT的多样性感知视图划分
机构 * POSTECH(浦项科技大学) ; GIST(光州科学技术院) ; KAIST(韩国科学技术院) ; RLWRLD
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对VGGT在大量视图下注意力计算成本高且冗余视图降低性能的问题,提出基于视觉差异和空间分散的图划分方法,将视图组织为多样性感知的平衡块,减少冗余注意力交互,提升相机位姿估计、多视图深度预测和3D重建性能。
Comments 34 pages, 11 figures, Accepted to ECCV 2026
PointDiT: 用于单目几何估计的像素空间扩散
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 提出基于纯ViT的像素空间扩散Transformer,直接在原始3D点图块上操作,无需复杂架构和潜在空间压缩,在单目几何估计中超越潜在扩散模型。
Comments ICML 2026. Project page: https://haofeixu.github.io/pointdit/