OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction
OmniMech:面向3D重建的全合一多模态机械基准
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV
AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。
视觉与机器人
三维重建、NeRF、Gaussian Splatting、点云和空间智能。
OmniMech:面向3D重建的全合一多模态机械基准
专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV
AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。
ErgoSurf:用于未知表面覆盖的遍历控制
机构 * German Aerospace Center (DLR)(德国航空航天中心) ; Technical University of Munich (TUM)(慕尼黑工业大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.RO
AI总结 提出ErgoSurf框架,结合GPIS模型与触觉传感,实现未知表面的遍历覆盖与几何在线学习,经仿真和真实机器人实验验证有效。
Bi-PT:用于从稀疏心脏MRI数据重建四腔心的双向交叉注意力点变换器
机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; New York University(纽约大学)
专题命中 三维重建 :point cloud(abstract);分类 cs.CV
AI总结 针对从稀疏心脏MRI数据重建四腔心的问题,Bi-PT通过双向点交叉注意力学习点特征,结合逐点语义标签改进对应估计,将变形场公式化为神经常微分方程,集成语义标签损失和添加平滑正则化,实验证明其性能准确且稳健。
PD-GS:音素驱动的3DGS用于音频驱动的说话头生成
机构 * Southeast University(东南大学) ; School of Computer Science and Engineering(计算机科学与工程学院)
专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract)
AI总结 针对3DGS说话头渲染的漏嘴伪影问题,提出PD-GS模型,通过LFM融合音频与音素信息,在HDTF数据集上实现最优嘴唇几何,提升神经化身的语言忠实度。
Comments Accepted to ACM MM 2026
置信度很重要:利用多视图几何先验实现基于3D高斯溅射(3DGS)的重建
机构 * University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
专题命中 Gaussian Splatting :3DGS(title_cn,summary_cn);Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV、cs.GR
AI总结 该研究针对3D高斯溅射(3DGS)几何重建不佳的问题,提出融入多视图几何先验并利用其附带的置信度图加权,在标准基准及含镜面物体的复杂场景中实现了重建质量的显著提升。
RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)
专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。
Comments Under submission
G$^2$ARD-GS:几何引导的锚点正则化高斯溅射蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; Jishu Technology Co., Ltd.(集度科技有限公司)
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV
AI总结 针对3D高斯溅射模型基元过多导致成本高的问题,提出G$^2$ARD-GS几何引导蒸馏方法,在MatrixCity数据集上实现最优压缩性能,提升了外观适配与配准精度。
ESVR:基于椭球的稀疏体绘制方法,通过结构感知基元学习与逐基元光线采样实现
专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.GR
AI总结 针对现有3DGS方法依赖DVR图像学习导致信息损失与传递函数控制受限的问题,提出ESVR框架,结合结构感知基元学习与逐基元光线采样等技术,实现大规模稀疏体数据的高效压缩与实时高质量渲染。
Comments IEEE VIS 2026 accepted
基于前馈二维高斯溅射标记化的通用视频表示
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV
AI总结 本研究提出基于前馈2DGS标记化的GVT框架,通过STGE与GSP策略实现通用视频表示,在四项视频任务的多数据集评估中,其重建、压缩性能达先进水平,动作识别提升,生成性能可与MAGVIT-v2媲美。
Comments Accepted by ACM MM 2026, Rio de Janeiro, Brazil
GSBF:面向环境感知波束成形的高斯溅射
专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)
AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。
CDSeg:用于图像到3D标签迁移的可渲染高斯载体
机构 * University of Waterloo(滑铁卢大学) ; Sun Yat-sen University(中山大学) ; University of Calgary(卡尔加里大学)
专题命中 Gaussian Splatting :Gaussian Splatting(abstract);point cloud(abstract);分类 cs.CV
AI总结 CDSeg是基于高斯溅射的跨域分割接口,无需特定任务3D分割训练,可复用2D掩码实现多视图标签迁移,在多个数据集上取得高mIoU,能快速处理大规模场景。
Comments 15 pages, 8 figures
ASTRA:基于轨迹对齐的异步时空重建
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)
专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);分类 cs.CV
AI总结 针对动态三维场景重建中多相机异步导致的问题,提出ASTRA框架,通过轨迹对齐联合优化时间偏移与三维表示,在实验中实现了显著的性能提升。
Comments We wish to withdraw this preprint because the current statistical analysis of the experimental data is incomplete and requires re-verification. We plan to submit a revised and thoroughly checked version in the near future
PathCover:基于点云的随机迭代空间划分(RISP)沿路径的快速凸分解
机构 * University of Delaware(特拉华大学) ; Athena Research Center(雅典娜研究中心) ; National Technical University of Athens(雅典国家技术大学) ; HERON–Center of Excellence in Robotics(赫伦机器人卓越中心)
专题命中 点云 :point cloud(title,abstract);分类 cs.RO
AI总结 PathCover是基于点云的快速凸分解框架,采用RISP算法,可高效生成无障碍物多面体,速度较现有方法提升一个数量级,经仿真与实机验证适用于机器人导航。
Comments 13 pages, 5 figures
用于三维点云生成的分层流匹配
机构 * Shandong Normal University(山东师范大学) ; University of Macau(澳门大学)
专题命中 点云 :point cloud(title,abstract);分类 cs.CV
AI总结 针对现有三维点云生成方法的缺陷,提出分层流匹配(HFM),将流匹配扩展为双级结构,在ShapeNet等基准上实现了有竞争力的生成性能。
点云上的梯度下降及其在学习算子校正中的应用
专题命中 点云 :point cloud(title,abstract)
AI总结 该研究针对点云隐式未知流形上的能量最小化问题,提出了一种保持在流形邻域内的梯度下降格式,并将其应用于逆问题的学习算子校正。
UQ-Loc:感知不确定性的激光雷达场景坐标回归
机构 * Warsaw University of Technology(华沙理工大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 UQ-Loc扩展LightLoc架构,添加各向同性高斯协方差头,采用NLL损失结合kNN正则化训练,改进SC2-PCR求解器推理,提升6自由度定位精度并校准不确定性。
用于三维人体配准的有序扩散模型
机构 * University of Tübingen(蒂宾根大学) ; Tübingen AI Center(蒂宾根人工智能中心) ; Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。
Comments Accepted at GCPR 2026
SR-JEPA:在3D场景中学习预测性隐状态
机构 * Boston University(波士顿大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 本文提出SR-JEPA,一种面向场景级点云的原生点JEPA,通过仅使用自包含的3D EMA目标训练,在3D场景实体缺失时可查询预测隐状态,在ARKitScenes和Sr3D数据集上取得了良好的语义预测性能,揭示了可组合的3D预测状态。
Comments 17 pages, 5 figures, 9 tables
基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化
机构 * Emory University School of Medicine(埃默里大学医学院) ; The University of Chicago(芝加哥大学) ; Winship Cancer Institute(温希普癌症研究所)
专题命中 点云 :3D vision(abstract);分类 cs.CV
AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。
CADRE:基于隐式接触描述符和任务适配恢复可供性的动态抓取
机构 * Honda Research Institute USA(本田美国研究院)
专题命中 点云 :point cloud(abstract);分类 cs.RO
AI总结 该研究针对灵巧操作中物体掉落的问题,提出CADRE强化学习框架,结合NDF提取接触特征与隐式恢复可供性函数,可高效成功恢复并零样本泛化到不同几何的未见物体。
多表示几何层次融合:一种用于鲁棒三维地点识别的隐式子图驱动框架
机构 * College of Information and Technology, Beijing University of Chemical Technology(信息与技术学院,北京化工大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Research Institute of Mine Artificial Intelligence, China Coal Research Institute(矿山人工智能研究院,中国煤炭科研院)
专题命中 点云 :point cloud(abstract);分类 cs.CV
AI总结 针对激光雷达地点识别中描述子不稳定与表示脆弱性问题,本文提出隐式神经点驱动的多表示几何层次融合框架,在多数据集上实现鲁棒性能,平衡了精度、效率与内存占用。
相交欧拉特征轮廓:球并集拓扑交互的欧拉演算与稳定性
专题命中 点云 :point cloud(abstract)
AI总结 该研究提出相交欧拉特征轮廓(Intersection ECP),基于欧拉演算刻画多球并集拓扑交互,具多项稳定性,可高效计算,其细化能解析精细交互,稠密采样下可恢复基础形状的同调与欧拉特征。
在生活语境中看世界:统一的室内-室外城市世界生成
专题命中 3D生成 :3D generation(abstract);分类 cs.CV
AI总结 HoloWorld是首个统一室内-室外生成的3D城市世界框架,通过跨尺度语境实现对应,在城市外部生成上优于SOTA,且保持室内外对应与跨街区连续性。
Comments 9 pages, 4 figures
拥挤场景中基于深度引导的视频目标计数
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究针对拥挤场景视频目标计数的局限性,提出DG-Det与后处理流水线、去重框架,发布新数据集,使MAE降62.01%且RMSE提升。
Comments Accepted at ACM Multimedia 2026
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。
超越静态预测:利用世界模型进行移动交通外推
专题命中 空间理解 :spatial understanding(abstract)
AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。
ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Harvard University(哈佛大学)
专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO
AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。
Comments Project webpage: https://rsathua.github.io/ARGUS/