When Does An Extra View Help? Adapting Single-View 3D Reconstruction with Extra Imagery
额外视角何时有用?适配带额外图像的单视图3D重建
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV、cs.GR
AI总结 本文提出ASV3D框架,通过零样本适配和优化适配两种策略,改进单视图3D重建,在基准及真实数据集上提升了重建精度与鲁棒性,效果优于基线方法。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
额外视角何时有用?适配带额外图像的单视图3D重建
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV、cs.GR
AI总结 本文提出ASV3D框架,通过零样本适配和优化适配两种策略,改进单视图3D重建,在基准及真实数据集上提升了重建精度与鲁棒性,效果优于基线方法。
DA-NBV:一种用于海上船舶高效3D重建的方向感知最优下一个视点规划器
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.RO
AI总结 针对海上船舶3D重建中现有NBV策略忽略方向观测历史的问题,本文提出DA-NBV策略,结合PAF等方法,在SeaShip-3D数据集与仿真环境下实现了更高效的船舶3D重建性能。
Comments 16pages, 11 figures
RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建
机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)
专题命中 三维重建 :point cloud(abstract);分类 cs.RO
AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。
RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全
专题命中 三维重建 :3D vision(abstract);分类 cs.CV
AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。
MVMD:用于增强镜面检测的多视图方法
机构 * University of Houston(休斯顿大学)
专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV
AI总结 针对现有镜面检测仅关注单图像的局限,提出多视图镜面检测方法MVMD及首个多视图镜面检测数据库,通过三个模块提升检测效果,使准确率和IoU分别最高提升2.6%和11.1%,增强了镜面密集环境下的三维重建准确性。
Comments This work has already published at WACV 2025, just want more accessibility
Journal ref 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)
DoRF++:面向鲁棒Wi-Fi感知的多普勒辐射场球面表示学习
机构 * University of Toronto(多伦多大学)
专题命中 NeRF :NeRF(summary_cn,abstract);分类 cs.CV
AI总结 本文针对Wi-Fi感知的跨用户泛化难题,提出DoRF++模型,将NeRF概念引入Wi-Fi感知,结合球面Transformer实现手势识别,在单多天线AP场景下的困难手势识别中性能优于现有方法。
JSGS:基于混合质量视图的3D高斯溅射的JPEG状态引导监督
专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 针对混合质量JPEG图像损坏3D高斯溅射(3DGS)跨视图高斯更新的问题,提出JSGS方法,利用JPEG量化表构建观测算子并结合块差异正则化,在7个场景和3种设置下获最优指标且渲染速度约150 FPS。
EvTrajGS:基于无姿态事件流的精确高效3D高斯溅射(Gaussian Splatting)方法
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(机器智能与先进计算教育部重点实验室) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息技术学院)
专题命中 Gaussian Splatting :Gaussian Splatting(title,title_cn);3D reconstruction(abstract);分类 cs.CV
AI总结 本文提出EvTrajGS框架,针对无姿态事件流实现精确高效的3D高斯溅射,通过连续时间轨迹参数化、时间耦合姿态更新及损失加权事件采样,在提升重建与姿态精度的同时降低计算开销,性能优于现有方法。
FlexSplat:无需点云对应关系的灵活前馈三维高斯溅射方法
机构 * Tri-Institutional Georgia Institute of Technology/Georgia State University/Emory University Center for Translational Research in Data Science and Neuroimaging (TReNDS)(三机构佐治亚理工学院/佐治亚州立大学/埃默里大学转化数据科学与神经影像中心(TReNDS)) ; Georgia State University(佐治亚州立大学) ; Duke University(杜克大学) ; University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)
专题命中 Gaussian Splatting :Gaussian Splatting(title);point cloud(title);novel view synthesis(abstract);分类 cs.CV
AI总结 FlexSplat是一种无需相机位姿的前馈三维高斯溅射框架,联合训练几何Transformer与高斯解码器,在ShapeNet-SRN和GSO数据集上实现了与已知位姿方法相当的新视图合成性能。
Comments Accepted to the British Machine Vision Conference (BMVC) 2026. Code: https://github.com/amir-sbg/FlexSplat
EndoMD-SLAM:光学退化下的内窥镜高斯溅射SLAM,具备记忆与静态-瞬态分解能力
机构 * Texas A&M University(德克萨斯农工大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Minnesota(明尼苏达大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3D reconstruction(abstract);分类 cs.CV
AI总结 EndoMD-SLAM是针对内窥镜光学退化问题的SLAM框架,通过记忆驱动门控、静态-瞬态分解等机制,在结肠镜检查基准上实现了轨迹误差降低91%、PSNR提升9.9 dB的效果。
Comments Project page: https://endomd-slam.github.io/
ERF-GS:从不相交的事件-RGB视点重建快速运动
机构 * The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);NeRF(abstract_cn);Gaussian Splatting(abstract);分类 cs.CV
AI总结 ERF-GS框架将事件信息融入高斯溅射流水线,脱离RGB输入实现基于事件的学习,在含模糊帧和不相交视点的数据集上,性能优于4DGS与E-D3DGS,可用于复杂自然视频的快速运动重建。
Comments 18 pages, 12 figures
XClipGS: 用于医学体高斯溅射的精确半空间裁剪
专题命中 Gaussian Splatting :Gaussian Splatting(title);分类 cs.CV、cs.GR
AI总结 本文提出XClipGS精确裁剪方法,通过闭式逐像素算子实现医学体高斯溅射的半空间精确裁剪,在8组CT/MRI数据集上,其PSNR、SSIM等指标均优于现有方法,渲染速度超650 FPS且泄漏量显著降低。
高斯混合模型之间的熵正则化部分最优传输与部分格罗莫夫-瓦瑟斯坦距离
专题命中 Gaussian Splatting :point cloud(abstract)
AI总结 本文针对高斯混合模型,开发熵正则化部分最优传输并定义部分混合格罗莫夫-瓦瑟斯坦距离,证明其极小值存在唯一性等性质,经数值实验验证该方法对异常值匹配具有鲁棒性。
Comments 7 figures
基于原始和合成深度图像的点云数据模型的手语识别
机构 * Erzurum Technical University(埃尔祖鲁姆技术大学) ; Trabzon University(特拉布宗大学)
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 该研究利用Depth Anything V2生成合成深度图像,结合三个手语数据集,采用PointNet等模型对比原始与合成深度图像点云的手语识别性能,发现多数模型中原始数据性能更优,部分模型合成数据更优。
基于三维数据分析与视觉基础模型二维投影的三维点云数据损伤分类
机构 * City College of New York(纽约城市学院) ; Air Force Research Lab(空军研究实验室)
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 本研究针对三维点云损伤分类的挑战,提出3PDA与2PDA两种算法,2PDA准确率略低但计算成本大幅降低且泛化性更强,为相关任务提供了高效替代方案。
SUMI:用于三维点云推理的可扩展统一模型
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 针对点云补全由粗到精范式中局部细节重构不足的问题,提出扩散增强细化模块SUMI,可集成到现有模型,在多个基准数据集上实现性能提升。
用于奶牛乳头长度表型分析的3D乳房点云高斯过程模型
专题命中 点云 :point cloud(title,abstract)
AI总结 针对奶牛乳房点云乳头标志自动检测难题,提出基于高斯过程的乳头长度估计方法,通过低秩近似降低计算复杂度,较现有方法精度更高、速度更快,鲁棒性更强,适配大规模自动化表型分析。
基于GeDi与ICP及伪口腔扫描数据真值的颌骨CT与口腔扫描数据的由粗到精配准
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本研究提出伪IOS评估框架,结合GeDi与ICP实现颌骨CT与口腔扫描数据的由粗到精配准,实验表明该方法精度优于单独使用GeDi,且受金属伪影影响较小。
Comments 9 pages, 2 figures, 1 table
TeaMatch:用于2D-3D匹配的可教学跨模态表示学习
机构 * Shandong University of Science and Technology(山东科技大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本研究提出TeaMatch框架,将可教学性作为跨模态表示学习准则,提升2D-3D匹配鲁棒性,可无缝集成到现有匹配流水线,在相关基准上实现SOTA性能。
基于锚的人工智能方法:利用汽车雷达中的微多普勒特征进行碰撞前目标检测
专题命中 点云 :point cloud(abstract);分类 cs.RO
AI总结 该研究提出基于锚的AI模型,结合雷达微多普勒特征与创新雷达图像膨胀技术,提升碰撞前目标检测性能,在动态场景中优于现有汽车雷达跟踪方法。
从单个激光雷达扫描数据重新思考三维分割:SIP基准上的入射角感知采样
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 针对单个激光雷达扫描的三维分割,本研究在SIP基准上提出入射角感知采样策略,提升了非平面构件等的分割性能,降低了对采样分辨率的敏感性。
几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪
机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) ; PinPark, Inc.(PinPark公司)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。
超相对论重离子碰撞中标度不变空间涨落的拓扑分析
专题命中 点云 :point cloud(abstract)
AI总结 本文针对重离子碰撞中临界涨落信号微弱难以提取的问题,提出结合TDA与深度学习的两阶段拓扑机器学习框架,成功恢复归一化阶乘矩的幂律标度,确立了拓扑机器学习探测QCD临界点的工具价值。
Comments 16 pages, 12 figures
适用于视图一致的2D到3D生成的视图自适应渲染器
专题命中 3D生成 :3D generation(title,abstract);NeRF(abstract,abstract_cn);3D reconstruction(abstract);分类 cs.CV、cs.GR
AI总结 针对单目2D转3D生成的视图不一致与计算负担问题,提出视图自适应神经渲染框架,结合自注意力融合模块,在无扩散SDS监督下实现高效高保真3D重建,性能接近当前最优。
Journal ref Multimedia Systems, vol.32, pp. 511, Aug 2026
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。
优势引导门:重塑基于视觉的空间智能的开放式推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学) ; Durham University(杜伦大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。
用于评估心脏介入效率、精度和深度感知潜在提升的增强型实时六自由度扩展现实导管跟踪技术
专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO
AI总结 本研究开发基于XR的实时6-DOF导管跟踪平台,经20名医学生测试,其可使心脏介入操作速度提升超5倍、导管移动距离减约5倍,还能提高精度、降低变异性,优化操作体验。
GLocFM:面向三维室内无线定位的几何感知基础模型
专题命中 SLAM与定位 :NeRF(abstract,abstract_cn);point cloud(abstract)
AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。
Comments 13 pages, single column