arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-21 至 2026-07-21 共收录 46 信号源:cs.CV, cs.GR, cs.RO

1. 点云 18 篇

2603.25623 2026-07-21 cs.RO 版本更新 57%

Neural Surface and Reflectance Modelling from 3D Radar Data

从3D雷达数据进行神经表面和反射率建模

Judith Treffler, Vladimír Kubelka, Henrik Andreasson, Martin Magnusson

机构 * Örebro University(厄勒布鲁大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 提出一种神经隐式方法,从雷达点云联合建模场景几何和视角相关雷达强度,利用混合特征编码学习连续SDF,生成更平滑准确的3D表面重建。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05610 2026-07-21 cs.CV 版本更新 57%

NormalView: tree species classification from backpack and aerial lidar data using geometric projections

NormalView:利用几何投影从背包和航空激光雷达数据进行树种分类

Juho Korkeala, Jesse Muhojoki, Josef Taher, Klaara Salolahti, Matti Hyyppä, Antero Kukko, Juha Hyyppä

机构 * Finnish Geospatial Research Institute FGI(芬兰地理研究 institute FGI) The National Land Survey of Finland(芬兰国家土地调查局) Department of Remote Sensing and Photogrammetry(遥感与摄影测量系) Department of Built Environment, School of Engineering(环境系,工程学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究利用NormalView方法,通过将几何信息嵌入二维投影并输入YOLOv11网络进行树种分类,在移动和航空激光雷达数据上测试,发现多传感器强度信息有益,该方法仅依赖几何信息,公开了相关数据集,取得较好分类结果。

Comments 25 pages, 10+4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11585 2026-07-21 cs.CV cs.AI 版本更新 57%

OV-MAP: Open-Vocabulary Zero-Shot 3D Instance Segmentation Map for Robots

OV-MAP:用于机器人的开放词汇零样本3D实例分割地图

Juno Kim, Yesol Park, Hye-Jung Yoon, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(人工智能交叉学科项目,首尔国立大学) Artificial Intelligence Institute, Seoul National University(人工智能研究所,首尔国立大学) Department of Computer Science, Seoul National University(计算机科学系,首尔国立大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究针对移动机器人开放世界3D映射,提出OV-MAP方法,通过集成开放特征到3D地图提升物体识别能力,利用类无关分割模型等克服相邻体素特征重叠问题,经实验验证其在多环境下零样本性能、鲁棒性和适应性优越。

Comments 7 pages, 7 figures. Published in the Proceedings of the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024)

Journal ref 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024, pp. 13780-13786

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17962 2026-07-21 cs.LG cs.AI stat.ML 新提交 50%

Topological Signatures of Context-Level Reliability in TabPFN

TabPFN中上下文级可靠性的拓扑特征

James Hu, Mahdi Ghelichi

机构 * TD Bank(道明银行)

专题命中 点云 :point cloud(abstract)

AI总结 研究TabPFN在复杂表格几何上的内部行为,用曲折持久同调将其层表示视为点云,构建合成表格任务基准。发现其内部表示几何拓扑与数据集级可靠性相关,复杂几何有双重拓扑特征,相关描述符与多种指标有关,能诊断可靠性及运行状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17442 2026-07-21 cs.LG stat.ML 新提交 50%

Calibrated Alzheimer's Conversion Risk in Mild Cognitive Impairment: Persistent Homology of Clinical Trajectories with Conformal Guarantees

轻度认知障碍中经过校准的阿尔茨海默病转化风险:具有共形保证的临床轨迹的持久同调

Navin Bondade

机构 * Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所)

专题命中 点云 :point cloud(abstract)

AI总结 研究旨在预测MCI到AD的转化,将持久同调用于临床轨迹点云,结合多种特征构建堆叠集成模型。校正泄漏源,经交叉验证等实验,模型有竞争力的准确性,提出H0持久熵为拓扑生物标志物,实现个体层面不确定性量化。

Comments 17 pages, 6 figures, 2 tables. Data from the Alzheimer's Disease Neuroimaging Initiative (ADNI). Code available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18043 2026-07-21 cs.LG cs.NA math.AP math.NA 新提交 50%

Adaptive Mamba Neural Operators

自适应曼巴神经算子

Zeyuan Song, Zheyu Jiang

专题命中 点云 :point cloud(abstract)

AI总结 研究如何准确求解任意几何形状和各种网格上的偏微分方程,提出自适应曼巴神经算子,通过构建竹内 - 马尔姆奎斯特系统集成再生核,在多个领域的基准问题上,其相对\(L^2\)误差优于现有求解器,为神经算子框架设计提供新范例。

Comments 22 pages, accepted by ICLR 2026 conference (https://openreview.net/forum?id=OenyzvFZPs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17318 2026-07-21 math.NA cs.NA 新提交 50%

FEVessel: Mesh-Independent Analysis of 3D Pressure Vessels with the Label-Free Pretrained Finite Element Method

FEVessel:基于无标签预训练有限元方法的三维压力容器网格无关分析

Yipin Sun, Yizheng Wang, Yuzhou Lin, Baiyang Zheng, Xiaoying Zhuang, Timon Rabczuk

专题命中 点云 :point cloud(abstract)

AI总结 研究针对三维压力容器分析中有限元方法的局限,提出FEVessel,通过编码点云、预训练算子及热启动求解器,实现跨材料等通用分析,降低误差,加速求解,能在不同网格转换且无需标签,消除手动网格修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17033 2026-07-21 cs.LG physics.chem-ph 新提交 50%

ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

ChemFusion:用于反应产率预测的多模态交叉注意力网络

Qiwei Han, Chi Zhou

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 点云 :point cloud(abstract)

AI总结 研究过渡金属催化反应产率预测难题,提出ChemFusion多模态交叉注意力网络,融合电子特征与3D原子坐标,用交叉注意力机制,在交叉偶联库基准测试中性能出色,还能自主学习识别和惩罚空间位阻,提供物理可解释性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30868 2026-07-21 math.NA cs.NA hep-lat math-ph math.MP 版本更新 50%

Vector alignment in matrix Lie groups

矩阵李群中的向量对齐

Congzhou M Sha

专题命中 点云 :point cloud(abstract)

AI总结 提出一种李代数方法,通过伪逆、矩阵对数、投影到李代数和矩阵指数四步,实现任意矩阵李群中向量对齐的精确求解,并给出牛顿校正以优化噪声数据下的性能。

Comments 23 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02531 2026-07-21 cs.CL cs.AI 50%

Losses that Cook: Topological Optimal Transport for Structured Recipe Generation

让烹饪失败:用于结构化食谱生成的拓扑最优传输

Mattia Ottoborgo, Daniele Rege Cambrin, Paolo Garza

机构 * Trustpilot Politecnico di Torino(托里诺理工学院)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出拓扑损失用于生成结构化食谱,提升食材和步骤的准确性,同时改进时间与温度的精确度,实验表明模型在多个指标上表现优异。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 3D生成 3 篇

2607.16352 2026-07-21 cs.CV cs.AI cs.CL cs.GR cs.MA 新提交 73%

Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration

执行前澄清:用于解决3D工具编排中意图不对称的自进化智能体

Xiaoye Zhu, Weixin Li, Junan Huo, Bozhong Wang, Jia Zeng, Yi Yang, Cen Chen, Qi Liu

专题命中 3D生成 :point cloud(abstract);3D generation(abstract);分类 cs.CV、cs.GR

AI总结 研究3D资产创建中用户指令模糊与工具要求精确的意图不对称问题,提出自进化智能体CLARE,通过解耦生成管道、模拟多轮交互自我进化澄清策略,在新基准测试中取得领先性能,证明主动澄清对3D执行的关键作用。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026). 26 pages including appendix, 8 figures. Code: https://github.com/xyzhu1225/CLARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16805 2026-07-21 cs.CV 新提交 57%

Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning

Scene-SAM3D:无需微调的多视图场景资产生成

Yuqi Zhang, Yadan Luo, Xiangyu Sun, Fengyi Zhang, Zi Huang, Xin Tan

机构 * The University of Queensland(昆士兰大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV

AI总结 研究针对现实场景中3D生成难题,提出无需训练的Scene-SAM3D框架,通过选互补视图、潜在速度融合及高斯优化,实现多视图场景资产生成,实验证明其在减少场景级CD和降低计算成本上有显著成效。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18953 2026-07-21 cs.CV 版本更新 57%

Symmetry Matters: Auditing and Symmetrizing 3D Generative Models

对称性至关重要:审计和对称化3D生成模型

Nicolas Caytuiro, Ivan Sipiran

机构 * University of Chile(智利大学)

专题命中 3D生成 :point cloud(abstract);分类 cs.CV

AI总结 本文研究了无条件点云生成中对称性的保持问题,通过审计多个3D生成模型的对称性并计算基于Chamfer距离的归一化对称性分数,发现现有模型在对称性意识评估协议下存在持续的对称性差距。通过分析训练数据和引入对称性意识干预,作者提出了在半对象数据集上训练生成模型并在采样时进行反射重建的方法,从而提高几何一致性和视觉合理性。

Comments 12 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 空间理解 2 篇

2606.27412 2026-07-21 cs.CV cs.AI cs.GR eess.IV 版本更新 62%

From Scene-Centric to Observer-Centric: Modeling Observer-Aware Relations for 3D Scene Graph Generation

并非所有关系都同样旋转:面向视角鲁棒的3D场景图生成的变换感知解耦

Jingjun Sun, Chaowei Wang, Zhirui Liu, Jiaxu Tian, Ming Yang, Yaoxing Wang, Yan Di, Shan Gao

机构 * Northwestern Polytechnical University(西北工业大学) ShanghaiTech University(上海科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.GR

AI总结 提出变换感知解耦(TAD)框架,通过将关系推理分解为视角稳定和视角变化两部分,结合视角稳定的对象表示,实现3D场景图生成在偏航视角变化下的鲁棒性,无需训练时旋转增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 57%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 空间理解 :3D reconstruction(abstract);分类 cs.RO

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他3D视觉 1 篇

2607.17342 2026-07-21 cs.CV cs.AI 新提交 57%

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition

STAR:用于交互识别的骨骼令牌对齐与重排

Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(北京大学深圳研究生院通用人工智能国家重点实验室) University at Buffalo SUNY(纽约州立大学布法罗分校) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 针对人机和人与人交互识别,提出STAR方法,通过骨骼令牌对齐与重排,利用实体重排、交互式时空令牌及视觉交互编码等组件,结合骨骼与RGB视频数据学习特征,经对比学习对齐表示,实验验证其性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (IEEE TMM)

Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 4652-4665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏