arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 107 信号源:cs.CV, cs.GR, cs.RO

1. 其他3D视觉 107 篇

2607.17342 2026-07-21 cs.CV cs.AI 新提交 57%

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition

STAR:用于交互识别的骨骼令牌对齐与重排

Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(北京大学深圳研究生院通用人工智能国家重点实验室) University at Buffalo SUNY(纽约州立大学布法罗分校) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 针对人机和人与人交互识别,提出STAR方法,通过骨骼令牌对齐与重排,利用实体重排、交互式时空令牌及视觉交互编码等组件,结合骨骼与RGB视频数据学习特征,经对比学习对齐表示,实验验证其性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (IEEE TMM)

Journal ref IEEE Transactions on Multimedia, vol. 28, pp. 4652-4665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30313 2026-07-03 cs.CV cs.LG 版本更新 57%

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment

TRACE:用于纵向3D胶质母细胞瘤反应评估的概念瓶颈模型

Alia Tarek, Hamsa Saberr, Hamza Elghonemy, Youssef Afify, Tamer Basha, Omair Shahzad Bhatti, Abdulrahman M. Selim, Hasan Md Tusfiqur Alam, Daniel Sonntag

机构 * Department of Biomedical and Healthcare Data Engineering, Faculty of Engineering, Cairo University(生物医学与健康数据工程系,工程学院,开罗大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Oldenburg(奥尔登堡大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出TRACE模型,通过概念瓶颈架构将RANO 2.0标准融入深度学习,实现可解释的4类胶质母细胞瘤纵向反应分类,在LUMIERE数据集上达到4类宏F1为0.4769,并支持概念校正。

Comments Accept in the EXPLIMED: Explainable Artificial Intelligence for the Medical Domain workshop in IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26894 2026-06-26 cs.CV 新提交 57%

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI

多模态3D MRI中的局部、全局和跨模态上下文建模

Minh Duc Do, Tillmann Rheude, Noel Kronenberg, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health at Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林夏里特医学院) Health Data Science Unit, Heidelberg University Hospital and BioQuant(海德堡大学医院与BioQuant健康数据科学部) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究所) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出MICViT,一种3D视觉Transformer,通过四种注意力机制显式建模模态内和跨模态的局部与全局交互,在多数据集脑龄预测任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19964 2026-06-25 cs.CV 版本更新 57%

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

2K Retrofit: 熵引导的高效稀疏细化用于高分辨率3D几何预测

Tianbao Zhang, Zhenyu Liang, Zhenbo Song, Nana Wang, Xiaomei Zhang, Xudong Cai, Zheng Zhu, Kejian Wu, Gang Wang, Zhaoxin Fan

机构 * BUAA(北京航空航天大学) SJTU(上海交通大学) GigaAI XREAL NUST(南京理工大学) RUC(清华大学) NUDT(国防科技大学) UCAS(中国科学技术大学) BIBMS(北京工业大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出2K Retrofit框架,通过快速粗预测和基于熵的稀疏细化,在不修改基础模型的情况下实现高效2K分辨率几何预测,达到SOTA精度和速度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08305 2026-06-23 cs.CV cs.AI 版本更新 57%

Retrieval-Augmented Anatomical Guidance for Text-to-CT Generation

检索增强的解剖引导用于文本到CT生成

Daniele Molino, Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma, Rome, Italy(人工智能与计算机系统单位,工程系,罗马生物医学大学,意大利罗马) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University, Umeå, Sweden(诊断与介入系,生物医学工程与放射物理,乌梅大学,瑞典乌梅)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出检索增强方法,通过检索相关临床案例的解剖标注作为结构代理,注入文本条件潜在扩散模型,实现文本到CT生成中语义与解剖信息的融合,提升图像保真度和临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14193 2026-06-15 cs.CV eess.IV q-bio.NC 版本更新 57%

QualiaNet: An Experience-Before-Inference Network

QualiaNet:一种先验体验的推理网络

Paul Linton

机构 * Columbia University(哥伦比亚大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出QualiaNet,模拟人类立体视觉的两阶段架构:先通过视差图模拟体验,再用CNN从视差梯度估计距离,验证了从视差梯度恢复距离的可行性。

Journal ref Extended abstract presented at the 9th Conference on Cognitive Computational Neuroscience, New York, NY, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-06-09 cs.CV 新提交 57%

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07529 2026-06-09 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 57%

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

CAPruner: 概念相邻场景图剪枝器以增强大语言模型的3D空间推理

Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) SpatialTemporal AI(时空人工智能)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 提出概念相邻场景图剪枝器(CAPruner),通过融合模糊语义相关性和空间邻近性估计关系重要性,在任务特定上下文中选择关键关系,避免关系级标注,显著提升大语言模型在3D视觉语言任务上的空间推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16385 2026-04-16 cs.CV 57%

Adaptive Multi-Scale Channel-Spatial Attention Aggregation Framework for 3D Indoor Semantic Scene Completion Toward Assisting Visually Impaired

自适应多尺度通道-空间注意力聚合框架用于3D室内语义场景补全以协助视障人士

Qi He, XiangXiang Wang, Jingtao Zhang, Yongbin Yu, Hongxiang Chu, Manping Fan, JingYe Cai, Zhenglin Yang

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出自适应多尺度注意力聚合框架,解决2D到3D特征提升中的噪声扩散和多尺度融合结构不稳定问题,通过通道-空间注意力机制和分层自适应门控策略提升小物体和桌子的识别精度,实验表明在NYUv2基准上mIoU达27.88%。

Comments We need to optimize the experiment, the changes are quite significant

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11809 2026-04-14 cs.CV 57%

Who Handles Orientation? Investigating Invariance in Feature Matching

谁负责方向?在特征匹配中研究不变性

David Nordström, Johan Edstedt, Fredrik Kahl, Georg Bökman

机构 * Chalmers University of Technology(挑战者技术大学) Linköping University(林奈大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 研究在现代稀疏匹配流程中,特征描述符和匹配器中引入旋转不变性对性能的影响,发现早期在描述符中学习旋转不变性可提升匹配效率并提高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30038 2026-04-01 cs.CV 57%

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

在3D几何计算机视觉中评估博士级别的编程能力

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao

机构 * AIR, Tsinghua University(清华大学智能产业研究院) Qiuzhen College, Tsinghua University(清华大学求真书院) BAAI(北京智源人工智能研究院) Peking University(北京大学) Nanjing University(南京大学) University of Toronto(多伦多大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。

Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 57%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25336 2026-03-27 cs.CV 57%

HeSS: Head Sensitivity Score for Sparsity Redistribution in VGGT

HeSS:用于VGGT中稀疏性再分配的头部敏感度评分

Yongsung Kim, Wooseok Song, Jaihyun Lew, Hun Hwangbo, Jaehoon Lee, Sungroh Yoon

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出HeSS方法,通过量化头部稀疏性敏感度来优化VGGT的稀疏性再分配,提升模型在高稀疏度下的鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12071 2026-03-17 cs.CV cs.AI 57%

LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments

LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理

Zhaoyang Jiang, Zhizhong Fu, David McAllister, Yunsoo Kim, Honghan Wu

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05159 2026-03-06 cs.CV eess.IV 57%

Generic Camera Calibration using Blurry Images

使用模糊图像进行通用相机校准

Zezhun Shi

机构 * Independent Researcher(独立研究者)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出了一种利用模糊图像进行通用相机校准的方法,通过几何约束和局部照明模型同时估计特征位置和点扩散函数,有效解决平移模糊问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV 57%

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17251 2026-01-27 cs.RO 57%

EMPM: Embodied MPM for Modeling and Simulation of Deformable Objects

EMPM:基于具身的MPM用于变形物体建模与仿真

Yunuo Chen, Yafei Hu, Lingfeng Sun, Tushar Kusnur, Laura Herlant, Chenfanfu Jiang

机构 * Robotics and AI Institute(机器人与人工智能研究院) UCLA(加州大学洛杉矶分校)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.RO

AI总结 EMPM通过基于可微MPM的框架,结合多视角视频重建与在线参数优化,实现对复杂变形物体的高效仿真与操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12530 2026-01-21 cs.CV 57%

XRefine: Attention-Guided Keypoint Match Refinement

XRefine: 基于注意力的关节点匹配精修

Jan Fabian Schmid, Annika Hagemann

机构 * Bosch Research(博世研究)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 XRefine是一种基于注意力机制的通用关节点精修方法,通过图像块进行亚像素关节点精修,提升3D视觉任务的几何估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18573 2025-12-23 cs.CV cs.AI cs.LG 57%

Placenta Accreta Spectrum Detection Using an MRI-based Hybrid CNN-Transformer Model

基于MRI的混合CNN-Transformer模型用于胎盘黏连谱检测

Sumaiya Ali, Areej Alhothali, Ohoud Alzamzami, Sameera Albasri, Ahmed Abduljabbar, Muhammad Alwazzan

机构 * Department of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University(计算机科学系,计算与信息科技学院,国王阿卜杜勒阿齐兹大学) Faculty of Medicine, King Abdulaziz University(医学学院,国王阿卜杜勒阿齐兹大学) Department of Radiology, King Abdulaziz University Hospital(放射科,国王阿卜杜勒阿齐兹大学医院)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出基于MRI的混合CNN-Transformer模型,用于提高胎盘黏连谱检测的准确性和及时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16113 2025-12-19 cs.CV 57%

Flexible Camera Calibration using a Collimator System

基于校准系统的灵活相机校准

Shunkun Liang, Banglei Guan, Zhenbao Yu, Dongcai Tan, Pengju Sun, Zibin Liu, Qifeng Yu, Yang Shang

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出了一种基于校准系统的灵活相机校准方法,通过引入角度不变约束和球面运动模型,实现了无需相机运动的快速校准。

Journal ref Liang S, Guan B, Yu Z, et al. Flexible Camera Calibration using a Collimator System[J]. International Journal of Computer Vision, 2025, 133(11): 8127-8150

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00858 2025-12-16 cs.RO cs.AI cs.HC 57%

Enhancing Interpretability and Interactivity in Robot Manipulation: A Neurosymbolic Approach

提升机器人操作的可解释性和交互性:一种神经符号方法

Georgios Tziafas, Hamidreza Kasaei

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.RO

AI总结 本文提出一种神经符号方法,通过结合语言引导的视觉推理与机器人操作,提升可解释性和交互性,实现80.2%的成功率。

Comments Published in International Journal of Robotics Research (IJRR) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11722 2025-12-03 cs.LG cs.AI cs.CV cs.SY eess.SY 57%

Fast 3D Surrogate Modeling for Data Center Thermal Management

快速三维代理建模用于数据中心热管理

Soumyendu Sarkar, Antonio Guillen-Perez, Zachariah J Carmichael, Avisek Naug, Refik Mert Cam, Vineet Gundecha, Ashwin Ramesh Babu, Sahand Ghorbanpour, Ricardo Luna Gutierrez

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

AI总结 本文提出基于视觉的快速三维代理建模方法,用于实时预测数据中心温度分布,实现高效的冷却控制与能耗降低。

Comments Submitted to AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09883 2025-11-18 cs.CV cs.AI 57%

3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation

Seonho Lee, Jiho Choi, Inha Kang, Jiwook Kim, Junsung Park, Hyunjung Shim

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08668 2025-11-06 cs.CV 57%

Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding

Songtao Jiang, Yuan Wang, Sibo Song, Tianxiang Hu, Chenyi Zhou, Bin Pu, Yan Zhang, Zhibo Yang, Yang Feng, Joey Tianyi Zhou, Jin Hao, Zijian Chen, Ruijia Wu, Tao Tang, Junhui Lv, Hongxia Xu, Hongwei Wang, Jun Xiao, Bin Feng, Fudong Zhu, Kenli Li, Weidi Xie, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学计算机科学与技术学院) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine(浙江大学口腔医院) Alibaba Inc(阿里巴巴集团) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Angelalign Technology Inc.(Angelalign技术有限公司) CFAR & IHPC, Agency for Science, Technology and Research(CFAR与IHPC,新加坡科技研究局) Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University(上海第九人民医院正畸科,上海交通大学口腔医学院)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24907 2025-10-30 cs.CV cs.AI cs.LG 57%

Understanding Multi-View Transformers

Michal Stary, Julien Gaubil, Ayush Tewari, Vincent Sitzmann

机构 * TUM(慕尼黑技术大学) Claude Bernard University Lyon 1(里昂第一大学) University of Cambridge(剑桥大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

Comments Presented at the ICCV 2025 E2E3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09912 2025-10-14 cs.CV cs.AI 57%

SpectralCA: Bi-Directional Cross-Attention for Next-Generation UAV Hyperspectral Vision

D. V. Brovko

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

Comments The work consists of three chapters, includes 12 figures, 4 tables, 31 references, and 1 appendix. A version of this work has been accepted for presentation at the 2025 IEEE 8th International Conference on Methods and Systems of Navigation and Motion Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14053 2025-09-18 cs.CV 57%

Stereo Anything: Unifying Zero-shot Stereo Matching with Large-Scale Mixed Data

Xianda Guo, Chenming Zhang, Youmin Zhang, Ruilin Wang, Dujun Nie, Wenzhao Zheng, Matteo Poggi, Hao Zhao, Mang Ye, Qin Zou, Long Chen

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Bologna(博洛尼亚大学) Tsinghua University(清华大学) Waytous Inc.(waytous公司)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

Comments Code will be available at \url{https://github.com/XiandaGuo/OpenStereo}

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08226 2025-09-10 cs.CV cs.LG 57%

Efficient Deep Learning-based Forward Solvers for Brain Tumor Growth Models

Zeineb Haouari, Jonas Weidner, Yeray Martin-Ruisanchez, Ivan Ezhov, Aswathi Varma, Daniel Rueckert, Bjoern Menze, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Zurich(苏黎世大学)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

Journal ref Bildverarbeitung fuer die Medizin 2025, Informatik aktuell, Springer Vieweg, Wiesbaden (2025), pp. 57--62

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01401 2025-08-29 cs.CV 57%

Language-to-Space Programming for Training-Free 3D Visual Grounding

Boyu Mi, Hanqing Wang, Tai Wang, Yilun Chen, Jiangmiao Pang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10322 2025-08-19 cs.CV cs.LG 57%

LieRE: Lie Rotational Positional Encodings

Sophie Ostmeier, Brian Axelrod, Maya Varma, Michael E. Moseley, Akshay Chaudhari, Curtis Langlotz

机构 * Computer Science Department, Stanford University, USA(斯坦福大学计算机科学系) Radiology Department, Stanford University, USA(斯坦福大学放射学系)

专题命中 其他3D视觉 :3D vision(abstract);分类 cs.CV

Comments Final proceedings version at ICML

详情

展开后加载摘要…

URL PDF HTML 收藏