arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-07-17 至 2026-07-17 共收录 28 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2607.15211 2026-07-17 cs.CV 新提交 79%

MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos

MAGiSt3R:基于单目RGB视频的多智能体前馈3D重建

Ziren Gong, Xiaohan Li, Fabio Tosi, Ninghui Xu, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

机构 * University of Bologna(博洛尼亚大学) The University of Hong Kong(香港大学) Southeast University(东南大学) Monash University(莫纳什大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 研究基于单目RGB视频的多智能体3D重建问题,核心方法是用3R家族前馈模型和MAGMA合并模型,并进行姿态图优化,主要贡献是在合成和真实数据集上验证该框架相比现有方法有更高重建和相机跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09815 2026-07-17 cs.RO cs.CV 版本更新 62%

RASR: Range-Aware Scale Recovery for Metric UAV Navigation

RASR:用于度量无人机导航的距离感知尺度恢复

Hongtao Liang, Xinyu Shao, Chenxu Wang, Yiyao Wan, Jiahuan Ji, Fangwei Ye, Fuhui Zhou, Qihui Wu

机构 * College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学电子信息工程学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Noah Ark Lab, Huawei(华为诺亚方舟实验室) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 研究在GNSS信号阻断时无人机精确最后一米导航问题,提出RASR方法,将尺度恢复核心与校准模块分离,核心压缩几何成描述符并全局校准,校准模块进行残差校正和对齐,在PairUAV评估中取得较好结果。

Comments 5 pages, 4 figures. Technical report for the UAVM 2026 PairUAV Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 57%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2605.10174 2026-07-17 cs.CV 版本更新 57%

BathyFacto: Refraction-Aware Two-Media Neural Radiance Fields for Bathymetry

BathyFacto:考虑折射的双介质神经辐射场用于水深测量

Markus Brezovsky, Anatol Günthner, Frederik Schulte, Lukas Winiwarter, Boris Jutzi, Gottfried Mandlburger

机构 * Department of Geodesy and Geoinformation, TU Wien(维也纳技术大学测绘与地理信息系) Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院测绘与遥感研究所) Unit of Geometry and Surveying, University of Innsbruck(因斯布鲁克大学几何与测绘单位)

专题命中 NeRF :point cloud(abstract);分类 cs.CV

AI总结 BathyFacto通过整合Nerfacto,利用折射-aware的双介质神经辐射场技术,提高水下点云的测量精度,解决了水面折射带来的系统性深度偏差问题。

Comments 16 pages, 8 figures, 3 tables. Submitted to ISPRS Open Journal of Photogrammetry and Remote Sensing, Special Issue "3D Underwater Mapping from Above and Below"

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 11 篇

2607.01578 2026-07-17 cs.CV 版本更新 87%

MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting

MVFusion-GS:基于运动方差引导的时间注意力实现高质量动态高斯泼溅

Jianwei Hu, Tingxuan Huang, Hengyu Zhou, Ningna Wang, Xiaohu Guo, Jinshan Lai, Bin Wang

机构 * Tsinghua University(清华大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV

AI总结 提出MVFusion-GS,通过运动方差引导细化与MotionFormer时间注意力模块增强变形网络,显式建模运动强度与时间一致性,在动态场景重建和无干扰重建任务中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04043 2026-07-17 cs.CV 版本更新 87%

AnyStyle: Single-Pass Multimodal Stylization for 3D Gaussian Splatting

AnyStyle: 单次传递多模态风格化用于3D高斯点云

Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski

机构 * Warsaw University of Technology(华沙技术大学) Sano Centre for Computational Medicine(Sano计算医学中心) Jagiellonian University(雅盖隆大学) Microsoft(微软公司)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);3D reconstruction(abstract);分类 cs.CV

AI总结 AnyStyle通过多模态条件化实现姿态无关的零样本风格化,支持文本和视觉输入,提升3D重建的风格可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14513 2026-07-17 cs.CV eess.IV 新提交 85%

Compression of 3D Gaussian Splatting Data Using GPU-friendly Graphics Texture Coding

使用 GPU 友好型图形纹理编码压缩 3D 高斯点云数据

Amir Said, Randall Rauwendaal

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 研究 3D 高斯点云数据压缩,提出用专为 GPU 并行解码设计的纹理压缩方案压缩 SH 颜色系数,引入比特率控制策略,实验表明该方法能有效压缩数据且不影响渲染视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18242 2026-07-17 cs.CV 版本更新 85%

GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations

GSVisLoc:用于高斯喷溅场景表示的通用视觉定位

Fadi Khatib, Dror Moran, Guy Trostianetsky, Yoni Kasten, Meirav Galun, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究所) NVIDIA(英伟达)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract,abstract_cn);分类 cs.CV

AI总结 GSVisLoc是用于3D高斯喷溅场景表示的视觉定位方法,通过匹配3D高斯生成的场景特征与图像特征来估计相机位姿,分三步进行,无需修改、再训练或额外图像,在标准基准上性能优且能有效推广到新场景。

Comments Accepted to ICCV 2025 Workshops (CALIPOSE). Project page: https://gsvisloc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14203 2026-07-17 cs.GR cs.AI cs.CV 新提交 85%

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation

即时NuRec:用于驾驶场景模拟的前馈3D高斯重建

NVIDIA, :, Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning Xu, Qi Wu, Janick Martinez Esturo, Shengyu Huang, Nick Schneider, Laura Leal-Taixe, Zan Gojcic, Sanja Fidler

机构 * NVIDIA

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV、cs.GR

AI总结 针对自动驾驶3D模拟平台中神经模拟方法存在的速度慢和需逐场景调整问题,提出即时NuRec这一前馈神经重建模型,可快速将多视图驾驶日志转为3DGS世界,在数据集上PSNR表现出色,还能用于闭环模拟。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/instant-nurec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14481 2026-07-17 cs.CV 新提交 84%

Immediate 3D Gaussian Splat Reconstruction of Unordered Input with Global Consistency

具有全局一致性的无序输入的即时3D高斯点云重建

Andreas Meuleman, Linus Franke, Boris Zhestiankin, Camille Montemagni, George Drettakis

机构 * Inria, Université Côte d’Azur(法国蔚蓝海岸大学 - 法国国家信息与自动化研究所) EPFL(洛桑联邦理工学院)

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究针对无序输入的辐射场捕获,提出利用视觉位置识别模型等实现快速匹配找关键帧,结合GPU优化等进行局部重建,再用基于聚类方法实现回环闭合,引入渐进层次结构处理大场景,提供具全局一致性的即时反馈3DGS重建。

Journal ref SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14470 2026-07-17 cs.CV cs.RO 新提交 79%

G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction

G$^2$SR:基于几何方法的快速且内存高效的高斯曲面重建

Dasong Gao, Vivienne Sze, Sertac Karaman

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 Gaussian Splatting :3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 研究少视图曲面重建问题,提出G2SR方法,利用跨视图2D平铺对应关系,通过轻量级神经前端和解析后端,实现快速且内存高效的高斯曲面重建,在多个数据集上几何精度高且内存占用小。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17386 2026-07-17 cs.CV cs.AI cs.RO 版本更新 62%

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

TerraTransfer: 无需专家示范的端到端驾驶策略学习

Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

机构 * Applied Intuition UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV、cs.RO

AI总结 提出一种无需专家示范的端到端驾驶方法,通过向量化模拟器中的自博弈预训练策略,再与预训练视觉骨干对齐,降低了数据成本并达到或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 57%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.RO

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12356 2026-07-17 cs.RO 版本更新 57%

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

VistaVLA:用于机器人操作的几何和语义感知3D高斯基础VLA

Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University(南洋理工大学EmPACT实验室) Institute for Infocomm Research (I2R), A*STAR(资讯通信研究院(I2R),新加坡科技研究局)

专题命中 Gaussian Splatting :point cloud(abstract);分类 cs.RO

AI总结 研究针对VLA模型缺乏3D表示的问题,提出VistaVLA框架,通过3D高斯原语构建几何和语义感知的3D认知表示,利用MtQ机制压缩令牌,在模拟和真实环境评估中有效提升VLA性能,尤其在真实场景中显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09243 2026-07-17 cs.CV 版本更新 57%

A$^2$TG: Adaptive Anisotropic Textured Gaussians for Efficient 3D Scene Representation

A$^2$TG:用于高效3D场景表示的自适应各向异性纹理高斯方法

Sheng-Chi Hsu, Ting-Yu Yen, Shih-Hsuan Hung, Hung-Kuo Chu

机构 * National Tsing Hua University(国立清华大学)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究针对高斯体素化表示中纹理固定的问题,提出自适应各向异性纹理高斯(A$^2$TG)方法,通过梯度引导规则确定纹理参数,提升效率与质量,实验证明该方法在内存需求低的情况下能实现高渲染保真度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 7 篇

2607.14639 2026-07-17 cs.RO cs.CV 新提交 81%

Image-to-Point Cloud Registration Made Easy with Rectified Flow-based LiDAR Upsampling

基于整流流的激光雷达上采样实现图像到点云配准简化

Reon Tabata, Kenji Koide, Shuji Oishi, Masashi Yokozuka, Taku Okawara, Aoki Takanose, Jun Miura

机构 * Department of Computer Science and Engineering, Toyohashi University of Technology(丰桥技术科学大学计算机科学与工程系) National Institute of Advanced Industrial Science and Technology(国立先进工业科学技术研究所)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV、cs.RO

AI总结 研究图像到点云配准难题,提出将激光雷达视为成像传感器的方法,通过条件整流流、特征匹配等步骤估计位姿,经自监督预训练和少量数据微调,实现高精度快速配准,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14946 2026-07-17 cs.CV 新提交 79%

DINE: Distance Is Not Enough -- Learning Global Deformation Priors for Robust Soft-Tissue Point Cloud Registration

DINE:距离并不够——学习用于鲁棒软组织点云配准的全局变形先验

Sara Monji-Azad, Rohit Beer, Marvin Kinz, Claudia Scherl, Jürgen Hesser

机构 * Mannheim Institute for Intelligent Systems in Medicine (MIISM), Medical Faculty Mannheim, Heidelberg University(曼海姆医学智能系统研究所(MIISM),海德堡大学曼海姆医学院) Department of Radiation Oncology, Brigham and Women’s Hospital, Dana-Farber Cancer Institute, Harvard Medical School(布莱根妇女医院放射肿瘤学系,达纳-法伯癌症研究所,哈佛医学院) Department of Otorhinolaryngology, Head and Neck Surgery, University Medical Center Mannheim, Medical Faculty Mannheim, Heidelberg University(海德堡大学曼海姆医学院曼海姆大学医学中心耳鼻咽喉头颈外科) Department of Otolaryngology, Head and Neck Surgery, Campus Klinikum Bielefeld Mitte, University Hospital OWL of Bielefeld University(比勒费尔德大学OWL大学医院比勒费尔德市中心校区耳鼻咽喉头颈外科) Interdisciplinary Center for Scientific Computing (IWR), Heidelberg University(海德堡大学跨学科科学计算中心(IWR)) Central Institute for Computer Engineering (ZITI), Heidelberg University(海德堡大学中央计算机工程研究所(ZITI)) CZS Heidelberg Center for Model-Based AI, Heidelberg University(海德堡大学CZS基于模型的人工智能中心)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 研究针对软组织点云配准中对应估计难题,提出DINE框架,通过学习统计先验增强基于距离的配准,应用于两个主干并采用两阶段策略,实验表明其能降低平均倒角距离,提高对变形和噪声的鲁棒性,凸显全局变形合理性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14778 2026-07-17 eess.SP 新提交 78%

Conditional Generative Learning Enabled Wireless UAV Sensing and Tracking via Point Cloud Imaging

基于点云成像的条件生成学习实现无线无人机感知与跟踪

Xinhong Dai, Yuan Gao, Hao Jiang, Xiaojun Yuan, Xin Wang

专题命中 点云 :point cloud(title,abstract)

AI总结 研究无人机感知与跟踪问题,提出AUGUST方法,集成条件信道编码与生成解码模块,通过位置和信噪比嵌入及加权训练目标的扩散模型,实现更准确的无人机点云重建与定位,提升对其姿态和形状信息的捕获能力。

Comments 16pages, 13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13891 2026-07-17 cs.LG cs.CV eess.SP stat.ML 交叉投稿 57%

PiVoT: A Variational Solution for Real-time Large-scale Multi-object Detection and Tracking under Heavy Clutter

PiVoT:一种用于在严重杂波下实时大规模多目标检测与跟踪的变分解决方案

Runze Gan, Qing Li, Simon J. Godsill, Mike E. Davies, James R. Hopgood

机构 * Institute for Imaging, Data and Communications (IDCOM), University of Edinburgh(爱丁堡大学成像、数据与通信研究所(IDCOM)) Department of Engineering, University of Cambridge(剑桥大学工程系) School of Mathematics, University of Edinburgh(爱丁堡大学数学学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对数据稀缺雷达应用中多目标检测跟踪难题,PiVoT通过联合推断目标多方面信息,无需外部聚类或检测器,利用变分推断创新实现快速抗杂波跟踪,实验证明其在多方面性能出色,优于现有贝叶斯跟踪器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14839 2026-07-17 cs.CV 版本更新 57%

MapAnything: Evaluating Monocular Metric Depth Models for 3D Urban Asset Localization

MapAnything: 评估单目度量深度模型用于3D城市资产定位

Miriam Louise Carnot, Jonas Kunze, Erik Quinten Fastermann, Eric Peukert, André Ludwig, Bogdan Franczyk

机构 * ScaDS.AI (University of Leipzig)(ScaDS.AI(莱比锡大学)) University of Leipzig(莱比锡大学) Kühne Logistics University(库赫内物流大学) Wrocław University of Economics(沃拉夫经济大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出MapAnything框架,通过单目图像自动映射城市物体和事件,利用度量深度估计模型计算物体坐标,验证其在复杂城市环境中的精度,展示其在交通标志和道路损坏等实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08068 2026-07-17 cs.CV 版本更新 57%

Simulating Automotive Radar with Lidar and Camera Inputs

利用激光雷达和相机输入模拟汽车雷达

Peili Song, Dezhen Song, Yifan Yang, Enfan Lan, Jingtai Liu

机构 * Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) Tianjin Key Laboratory of Intelligent Robotics(天津智能机器人重点实验室) TBI center, Nankai University(南开大学TBI中心) Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(人工智能 Mohamed Bin Zayed 大学机器人系)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究利用相机图像、激光雷达点云和自身速度模拟汽车雷达信号的方法,基于DIS-Net和RSS-Net两个神经网络,经实验验证能生成高保真信号,用其增强数据训练的目标检测网络性能更优,助力基于雷达的自动驾驶研发。

Comments Accepted by 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14419 2026-07-17 cs.LG cs.CG 新提交 50%

HyperShadow: A Benchmark for Detecting 3D Projections of Higher-Dimensional Spatial Objects

HyperShadow:用于检测高维空间对象3D投影的基准测试

Akshay Sasi

专题命中 点云 :point cloud(abstract)

AI总结 HyperShadow是用于检测高维空间对象3D投影的基准测试,通过190k参数点网络及零参数刚性见证进行检测,能在不同损坏层级达到高准确率和泛化率,为研究三维解释不兼容性提供工具,数据等已公开。

Comments 8 pages, 5 figures. Code: https://github.com/AkshaySasi/hypershadow. Dataset: https://huggingface.co/datasets/AkshaySasi/hypershadow

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 1 篇

2607.15271 2026-07-17 cs.CV cs.GR cs.LG 新提交 81%

Online Neural Space Time Memory for Dynamic Novel View Synthesis

用于动态新视角合成的在线神经时空记忆

Baback Elmieh, Lynn Tsai, Zeman Li, Srinivas Kaza, Tiancheng Sun, Gabor Csapo, Ali Behrouz, Yuan Deng, Stephen Lombardi, Steven M. Seitz, Xuan Luo

机构 * University of Washington(华盛顿大学) Google(谷歌)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV、cs.GR

AI总结 研究多视图流视频在线新视角合成问题,提出解耦记忆更新与应用频率的方法,通过跨视图注意力管理变形,引入辅助记忆损失和记忆缓存策略,实现实时、领先性能及微小尺度在线记忆。

Comments 15 pages. Preprint. Project page with demos and video results: https://nst-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 3 篇

2607.15054 2026-07-17 cs.CV 新提交 79%

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 57%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14588 2026-07-17 cs.HC 新提交 50%

Conversational Tactile Data Interfaces: Co-Designing Accessible Data Experiences with Blind Users Using Refreshable Tactile Displays and Conversational AI

对话式触觉数据接口:使用可刷新触觉显示器和对话式人工智能与盲人用户共同设计无障碍数据体验

Samuel Reinders, Munazza Zaib, Bongshin Lee, Ingrid Zukerman, Matthew Butler, Thien Autran, Sascha Cowley, Francois Jacobs, Lizhen Qu, Kim Marriott

专题命中 空间理解 :spatial understanding(abstract)

AI总结 研究针对盲人或视力低下者数据可视化问题,通过与盲人共同设计师协同设计,创建结合可刷新触觉显示器与对话代理的CTDI(Graphy系统),贡献设计知识与建议,得出分层展示等关键发现。

Comments Accepted to be presented at IEEE VIS 2026 and published in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏

7. SLAM与定位 1 篇

2507.19474 2026-07-17 cs.CV 版本更新 84%

DINO-SLAM: DINO-informed RGB-D SLAM for Neural Implicit and Explicit Representations

DINO-SLAM:用于神经隐式和显式表示的基于DINO的RGB-D SLAM

Ziren Gong, Xiaohan Li, Fabio Tosi, Youmin Zhang, Stefano Mattoccia, Jun Wu, Matteo Poggi

机构 * University of Bologna, Italy(博洛尼亚大学) Faculty of Dentistry, The University of Hong Kong, China(香港大学牙科学院) Rawmantic AI, China(Rawmantic AI) Fudan University, Shanghai, China(复旦大学)

专题命中 SLAM与定位 :NeRF(summary_cn,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究提出DINO-SLAM,通过DINO增强SLAM系统隐式与显式表示。利用场景几何编码器将DINO特征变为几何感知特征,在此基础上为NeRF和GS SLAM系统提出两种范式,相比现有方法在多个数据集上性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他3D视觉 1 篇

2607.14935 2026-07-17 cs.CV 新提交 70%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他3D视觉 :3D vision(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏