EI-Part: Explode for Completion and Implode for Refinement
EI-Part: 分解以完成,聚合以细化
专题命中 三维重建 :3D generation(abstract);分类 cs.CV
AI总结 EI-Part通过分解与聚合状态生成高质量3D部件,实现结构连贯性和几何精确性,达到部分级3D生成的最新水平。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
EI-Part: 分解以完成,聚合以细化
专题命中 三维重建 :3D generation(abstract);分类 cs.CV
AI总结 EI-Part通过分解与聚合状态生成高质量3D部件,实现结构连贯性和几何精确性,达到部分级3D生成的最新水平。
WonderVerse:基于视频生成模型的可扩展3D场景生成
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出WonderVerse框架,利用视频生成模型中的世界级先验知识生成沉浸式且几何一致的3D环境,并引入可控扩展技术与异常序列检测模块,实现高效高质量的可扩展3D场景生成。
Comments Accepted at CVM 2026
Sonar-MASt3R:在浑浊、无结构环境中实时优化声学融合
机构 * Applied Ocean Physics and Engineering, Woods Hole Oceanographic Institution, Deep Submergence Laboratory, Woods Hole, MA, USA(应用海洋物理与工程,伍兹霍尔海洋研究所,深潜实验室,马萨诸塞州伍兹霍尔,美国) ; Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院,剑桥,马萨诸塞州,美国)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO
AI总结 本文提出Sonar-MASt3R方法,通过实时提取光学相机数据的密集对应关系并与声学3D重建的几何线索结合,提升在浑浊环境中的鲁棒性。
Comments This paper has been accepted for publication in ICRA 2026. Copyright IEEE
圆柱形机械投影仪用于全方位光带投影轮廓测量
机构 * Department of Mechanical Engineering, Yonsei University(延世大学机械工程系)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出基于圆柱形机械投影仪的新型3D重建方法,通过旋转台和带有ON/OFF槽的圆柱形图案生成器实现多频相移光带的全方位投影,结合多波长解包裹算法和准校准技术,实现高精度3D重建。
从单目视频生成时空世界场景图
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Indian Institute of Technology Delhi(印度理工学院德里)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。
LongStream: 长序列流式自回归视觉几何
机构 * HKUST (GZ)(香港科技大学(广州)) ; Horizon Robotics ; ZJU(浙江大学) ; CSU(中国科学技术大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 LongStream通过抛弃首帧锚点、引入正交尺度学习和缓存一致性训练,解决长序列流式3D重建中的姿态漂移和注意力偏差问题,实现千帧级稳定重建。
Comments CVPR2026 accepted
通过骨骼潜在扩散实现高保真的医学形状生成
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 本文提出了一种骨骼潜在扩散框架,通过结合结构先验实现高效高保真医学形状生成,并构建了大规模MedSDF数据集以提升生成质量与效率。
Comments 11 pages, 5 figures, journal
TopGen:学习四边形网格生成的结构布局和交叉字段
专题命中 三维重建 :point cloud(abstract);分类 cs.GR
AI总结 TopGen通过同时预测结构布局和交叉字段,实现高效且稳健的四边形网格生成,提供直观可编辑的基础以提升几何保真度和拓扑合理性。
Comments 14 pages, 9 figures
ScanDP: 可泛化的3D扫描与扩散策略
专题命中 三维重建 :point cloud(abstract);分类 cs.RO
AI总结 ScanDP提出一种基于扩散策略的高效3D扫描框架,通过占据网格映射和混合方法提升鲁棒性和泛化能力,实现对多样化物体的高效扫描。
Comments 8 pages, 7 figures, 5 tables. Project Page: https://treeitsuki.github.io/ScanDP/
DynamicVGGT: 为自动驾驶中的4D场景重建学习动态点图
机构 * Fudan University(复旦大学) ; Huawei(华为) ; Yinwang Intelligent Technology(依文智能技术) ; Shanghai Innovation Institute(上海创新研究院) ; CUHK(香港中文大学)
专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV
AI总结 DynamicVGGT通过联合预测当前和未来点图,结合Motion-aware Temporal Attention模块和动态3D高斯点散射头,实现了自动驾驶中4D动态场景的高精度重建。
DogWeave: 通过法线融合与条件修复从单张图像实现高保真3D犬只重建
机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 DogWeave通过法线融合与条件修复技术,从单张图像实现高保真3D犬只重建,优于现有方法。
他们能看到我滚动:基于高速事件视觉的触觉滚轮传感器用于大表面检测
机构 * Advanced Research and Innovation Center(先进研究与创新中心) ; Khalifa University(卡利法大学) ; Department of Aerospace Engineering(航空航天工程系) ; Research and Development(研发部) ; Strata Manufacturing PJSC(斯特拉制造公司)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO
AI总结 本文提出了一种基于高速事件视觉的触觉滚轮传感器,实现高速连续高分辨率的大面积表面检测,扫描速度达0.5m/s,精度达100微米以内,且通过多参考贝叶斯融合策略提升准确性。
Comments Accepted to IEEE T-RO - Project Page: https://akramekhairi.github.io/TheySeeMeRolling/
LangSurf: 语言嵌入的表面高斯用于3D场景理解
机构 * Brain and Artificial Intelligence Lab, Northwestern Polytechnical University(脑科学与人工智能实验室,西北工业大学) ; Tsinghua University(清华大学) ; Shanghai Jiaotong University(上海交通大学) ; Peking University(北京大学) ; School of Artifical Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)
专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV
AI总结 LangSurf通过语言嵌入的表面高斯实现3D场景理解,提升2D和3D分割精度,扩展了下游任务如去除和编辑。
Comments \url{https://langsurf.github.io}
CanoVerse: 3D对象可扩展规范化的数据集用于生成和姿态
机构 * SDU(1 南开大学) ; LIGHTSPEED(2 LIGHTSPEED) ; UNC Chapel Hill(3 匹兹堡大学柴尔德斯分校) ; HKUST(4 香港理工大学) ; PKU(5 北京大学)
专题命中 三维重建 :3D generation(abstract);分类 cs.CV
AI总结 CanoVerse通过大规模规范3D数据集提升3D生成稳定性,实现跨模态检索与零样本点云方向估计
优化多模态模型用于基于图像的形状检索:预对齐和硬对比学习的作用
机构 * Fraunhofer IGD(弗劳恩霍夫图像研究中心) ; Delft University of Technology(代尔夫特理工大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 本文提出通过预对齐和硬对比学习优化多模态模型,提升基于图像的形状检索性能。
SurgCUT3R: 术场景感知的连续时间3D表示理解
机构 * The Hamlyn Centre for Robotic Surgery, Imperial College London(机器人手术中心,帝国理工学院伦敦分校) ; S-Lab, College of Computing and Data Science, Nanyang Technological University(S实验室, computing and Data Science学院,南洋理工大学) ; Department of Computer Science, University of Liverpool(计算机科学系,利物浦大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 SurgCUT3R通过数据生成、混合监督和分层推理框架,解决手术场景中3D重建的准确性和效率问题,实现稳健的重建性能。
三维重建与堆料堆的分割用于尺寸和形状分析
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 本文提出了一种基于移动设备的3D成像方法,用于现场快速获取堆料颗粒的3D尺寸和形状信息,以提高道路建设材料的质量控制效率。
Comments 7 pages, 4 figures, Proceedings of the 20th International Conference on Soil Mechanics and Geotechnical Engineering
量化视觉几何基础变换器
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; ETH Zürich(苏黎世联邦理工学院) ; City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出QuantVGGT,首个针对大规模VGGT的量化框架,通过双平滑细粒度量化和噪声过滤多样化采样技术,在保持高精度的同时实现显著的内存减少和加速。
Comments Accepted by ICLR 2026
特征上采样器在2D到3D场景重建中的频谱探测
机构 * Hokkaido University(北海道大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; The University of Tokyo(东京大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出频谱诊断框架,通过六个指标评估特征上采样器对3D重建的影响,发现频谱一致性比空间细节更关键。
使VLM在卡通角色图像上通过姿态信息识别视觉幻觉
机构 * Chung-Ang University(Chung-Ang 大学) ; Coupang(韩国Coupang)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。
Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)
FaceCam: 通过尺度感知条件化实现人像视频相机控制
机构 * University of California, Merced(加州大学梅尔塞德斯分校) ; Adobe Research(Adobe研究)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。
Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam
UltraDexGrasp: 为双臂机器人学习通用灵巧抓取
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; Peking University(北京大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.RO
AI总结 UltraDexGrasp通过合成数据训练出高效抓取策略,实现双臂机器人在多种物体上的高成功率抓取。
Comments Published at International Conference on Robotics and Automation (ICRA) 2026
SGR3模型:三维场景图检索-推理模型
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Shenzhen University(深圳大学) ; Hunan University(湖南大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 SGR3模型通过多模态大语言模型与检索增强生成技术,实现无需训练的三维场景图生成,提升场景关系推理能力。
STAvatar: 基于软绑定与时间密度控制的单目3D头部人偶重建
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算技术研究所) ; SCSE, FIE, M.U.S.T(M.U.S.T)
专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV
AI总结 STAvatar通过软绑定与时间密度控制方法,实现了单目视频中高保真3D头部人偶的重建,尤其在细粒度细节和遮挡区域的重建上表现优异。
Comments Accepted to CVPR 2026. Project page: https://jiankuozhao.github.io/STAvatar/
Point2Act: 多模态大语言模型的高效3D蒸馏用于零样本情境感知抓取
机构 * Seoul National University(首尔国立大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO
AI总结 Point2Act通过多模态大语言模型高效蒸馏实现零样本情境感知抓取,生成空间定位响应以支持实际操作任务。
Comments Accepted to ICRA 2026
神经电磁场用于高分辨率材料参数重建
机构 * Xidian University(西安电子科技大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 三维重建 :NeRF(abstract);分类 cs.CV
AI总结 NEMF通过非侵入式物理反演构建功能数字孪生,实现高精度材料参数重建与物理模拟。
Comments 10 pages, 5 figures
MERG3R: 一种用于大规模神经视觉几何的分而治之方法
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 MERG3R通过分而治之的方法提升大规模神经视觉几何重建的准确性、内存效率和可扩展性。
Comments Project page: https://leochengkx.github.io/MERG3R/
physfusion: 一种基于Transformer的双流雷达与视觉融合框架用于开放水域表面目标检测
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 PhysFusion通过物理引导雷达编码器和Transformer融合模块,实现开放水域表面目标的高效检测,取得高精度检测结果。
UNCLE-Grasp: 有不确定性意识的叶片遮挡草莓抓取
机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.RO
AI总结 UNCLE-Grasp通过建模遮挡和形状补全的几何不确定性,提出了一种在部分遮挡下可靠抓取草莓的方法,通过多假设评估和保守置信界标准提升抓取可靠性。
立体视觉中的仿射对应关系:理论、实践与局限性
机构 * L. Hajder Faculty of Informatics, E\"otv\"os Lor\' ; University, P\'azm\'any P\'eter stny. 1/C, Budapest, H-1117, Hungary
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 本文研究了仿射变换在立体视觉中的应用,提出新的局部仿射变换估计方法,并通过实验验证了其在3D重建中的精度与有效性。