arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 8 信号源:cs.CV, cs.GR, cs.RO

1. 其他3D视觉 8 篇

2608.05579 2026-08-07 cs.RO 新提交 79%

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models

ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构

Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 其他3D视觉 :3D vision(title,abstract);分类 cs.RO

AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。

Comments Project webpage: https://rsathua.github.io/ARGUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-07-17 cs.CV 新提交 70%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他3D视觉 :3D vision(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交 57%

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17342 2026-07-21 cs.CV cs.AI 新提交 57%

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition

STAR:用于交互识别的骨骼令牌对齐与重排

Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(北京大学深圳研究生院通用人工智能国家重点实验室) University at Buffalo SUNY(纽约州立大学布法罗分校) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 针对人机和人与人交互识别,提出STAR方法,通过骨骼令牌对齐与重排,利用实体重排、交互式时空令牌及视觉交互编码等组件,结合骨骼与RGB视频数据学习特征,经对比学习对齐表示,实验验证其性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (IEEE TMM)

Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 4652-4665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26894 2026-06-26 cs.CV 新提交 57%

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI

多模态3D MRI中的局部、全局和跨模态上下文建模

Minh Duc Do, Tillmann Rheude, Noel Kronenberg, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health at Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林夏里特医学院) Health Data Science Unit, Heidelberg University Hospital and BioQuant(海德堡大学医院与BioQuant健康数据科学部) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究所) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出MICViT,一种3D视觉Transformer,通过四种注意力机制显式建模模态内和跨模态的局部与全局交互,在多数据集脑龄预测任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-06-09 cs.CV 新提交 57%

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07529 2026-06-09 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 57%

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

CAPruner: 概念相邻场景图剪枝器以增强大语言模型的3D空间推理

Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) SpatialTemporal AI(时空人工智能)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出概念相邻场景图剪枝器(CAPruner),通过融合模糊语义相关性和空间邻近性估计关系重要性,在任务特定上下文中选择关键关系,避免关系级标注,显著提升大语言模型在3D视觉语言任务上的空间推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏