arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2603.19660 2026-04-02 cs.CV cs.SD 50%

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 50%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29437 2026-04-01 cs.CV 50%

SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering

SeGPruner: 用于3D问答的语义-几何视觉令牌修剪器

Wenli Li, Kai Zhao, Haoran Jiang, Enquan Yang, Yi Su, Dan Zeng

机构 * Shanghai University(上海大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SeGPruner,通过语义和几何引导的令牌减少框架提升3D问答效率,显著降低视觉令牌预算和推理延迟,同时保持竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29428 2026-04-01 cs.CV 50%

Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions

看到证据,却错失答案:基于工具引导的视觉语言模型在视觉错觉中的应用

Xuesong Wang, Harry Wang

机构 * Wayne State University(韦恩州立大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种工具引导的推理框架,通过通用图像处理工具和提示系统,解决视觉语言模型在处理视觉错觉时的系统性偏差问题,并展示其在不同结构错觉变体上的跨结构泛化能力。

Comments CVPR 2026 DataCV Workshop, code: https://github.com/Davidxswang/cvpr_2026_datacv_submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29095 2026-04-01 cs.HC 50%

VueBuds: Visual Intelligence with Wireless Earbuds

VueBuds:集成摄像头的无线耳机实现视觉智能

Maruchi Kim, Rasya Fawwaz, Zhi Yang Lim, Brinda Moudgalya, Hexi Wang, Yuanhao Zeng, Shyamnath Gollakota

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VueBuds通过集成摄像头的无线耳机实现视觉智能,利用低功耗单色摄像头和视觉语言模型进行实时场景理解与文本阅读,其性能与智能眼镜相当。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25165 2026-04-01 cs.CV 50%

Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds

迈向3D场景理解的基础模型:点云的实例感知自监督学习

Bin Yang, Mohamed Abdelsamad, Miao Zhang, Alexandru Paul Condurache

机构 * Bosch Research, Robert Bosch GmbH(博世研究,罗伯特·博世有限公司) Institute for Neuro- and Bioinformatics, University of Lübeck(神经与生物信息学研究所,吕贝克大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出PointINS框架,通过几何感知学习增强点云表示,引入ODR和SCR正则化策略,提升实例定位性能,在多个数据集上实现更优的mAP和PQ指标。

Comments The paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV 50%

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27797 2026-03-31 cs.RO 50%

Which Reconstruction Model Should a Robot Use? Routing Image-to-3D Models for Cost-Aware Robotic Manipulation

机器人应使用哪种重建模型?为成本感知的机器人操作路由图像到3D模型

Akash Anand, Aditya Agarwal, Leslie Pack Kaelbling

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SCOUT框架,通过分离重建评分的两个组件,为机器人操作选择适合的3D重建模型,支持动态调整和多维成本约束。

Comments 8 pages, 7 tables, 3 figures. Supplementary material included. Project page: https://scout-model-routing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 50%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV 50%

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26942 2026-03-31 cs.HC 50%

The Observability Gap: Why Output-Level Human Feedback Fails for LLM Coding Agents

可观性缺口:为何输出级人类反馈在LLM编码代理中失效

Yinghao Wang, Cheng Wang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究发现,LLM编码代理在缺乏预定义功能的情况下,通过轻量级人类反馈构建可重用函数库时,输出反馈无法有效识别根因,导致持续失败模式。

Comments Accepted to CHI 2026 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26938 2026-03-31 cs.CV 50%

From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching

从3D姿态到 prose:基于生物力学的视觉-语言指导框架

Yuyang Ji, Yixuan Shen, Shengjie Zhu, Yu Kong, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BioCoach通过融合视觉和3D骨骼运动学,提出一种生物力学导向的视觉-语言框架,利用三阶段流程生成精准文本反馈,提升健身指导的个性化和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26541 2026-03-30 cs.CV 50%

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

OVI-MAP:开放词汇实例语义映射

Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Zurich(苏黎世大学) TU Munich(慕尼黑工业大学) Microsoft(微软)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25411 2026-03-27 cs.CV 50%

HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

HiSpatial:在视觉-语言模型中驯服层次化3D空间理解

Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。

Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25004 2026-03-27 cs.CV cs.MM 50%

Interpretable Zero-shot Referring Expression Comprehension with Query-driven Scene Graphs

可解释的零样本指代表达理解与查询驱动的场景图

Yike Wu, Necva Bolucu, Stephen Wan, Dadong Wang, Jiahao Xia, Jian Zhang

机构 * Faculty of Engineering and IT, University of Technology Sydney(悉尼科技大学工程与信息技术学院) Data61, Commonwealth Scientific and Industrial Research Organisation(澳大利亚联邦科学与工业研究组织 Data61)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SGREC方法,通过查询驱动的场景图作为结构化中介,结合视觉语言模型和大语言模型,实现可解释的零样本指代表达理解,在多个基准测试中取得优异成绩。

Comments Accepted by T-MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 50%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23957 2026-03-26 cs.CV 50%

PointRFT: Explicit Reinforcement Fine-tuning for Point Cloud Few-shot Learning

PointRFT:针对点云少样本学习的显式强化微调

Yankai Wang, Yiding Sun, Qirui Wang, Pengbo Li, Chaoyi Lu, Dongxu Zhang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) International School, Beijing University of Posts and Telecommunications(北京邮电大学国际学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出PointRFT,一种专为点云表示学习设计的强化微调方法,通过定制奖励函数提升训练稳定性,实验表明其在多种基准上优于传统监督微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV 50%

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23390 2026-03-25 cs.CV eess.IV 50%

Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation

利用轻量级Transformer与上下文协同增强进行高效的3D医学图像分割

Xinyu Liu, Zhen Chen, Wuyang Li, Chenxin Li, Yixuan Yuan

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR(电子工程系,香港中文大学(深圳)Hong Kong SAR) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong SAR(人工智能与机器人中心(CAIR),香港科学与创新研究院,中国科学院,Hong Kong SAR)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Light-UNETR,通过轻量级维度缩减注意力模块和紧凑门控线性单元提升模型效率,结合上下文协同增强策略提高数据效率,在少量标注数据下实现高效3D医学图像分割。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23370 2026-03-25 cs.CV 50%

Object Pose Transformer: Unifying Unseen Object Pose Estimation

物体姿态转换器:统一未见物体姿态估计

Weihang Li, Lorenzo Garattoni, Fabien Despinoy, Nassir Navab, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Object Pose Transformer,通过任务分解统一解决未见实例姿态估计问题,同时预测深度、点云图、相机参数和归一化物体坐标,实现类别级绝对姿态和未见物体相对姿态估计。

Comments Project Page: https://colin-de.github.io/OPT-Pose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 50%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 50%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22706 2026-03-25 cs.CV cs.SE 50%

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

VLMs在视觉缺陷检测中能走多远?研究41小时游戏录像中的19,738个关键帧

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究通过分析41小时游戏录像中的19,738个关键帧,评估VLMs在实际场景中检测视觉缺陷的能力,发现其性能有限,需结合混合方法提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22170 2026-03-24 cs.MA 50%

Human-Inspired Pavlovian and Instrumental Learning for Autonomous Agent Navigation

受人类启发的经典条件反射与工具性学习用于自主体导航

Jingfeng Shan, Francesco Guidi, Mehrdad Saeidi, Enrico Testi, Elia Favarelli, Andrea Giorgetti, Davide Dardari, Alberto Zanella, Giorgio Li Pira, Francesca Starita, Anna Guerra

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种融合经典条件反射、工具性MF和工具性MB组件的混合强化学习架构,通过地理参考环境特征塑造内在价值信号,提升自主体在不确定环境中的导航安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05162 2026-03-24 cs.GR cs.CV 50%

GenAI-DrawIO-Creator: A Framework for Automated Diagram Generation

GenAI-DrawIO-Creator:自动化图表生成的框架

Jinze Yu, Dayuan Jiang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GenAI-DrawIO-Creator框架,利用大语言模型实现基于XML的图表自动生成与修改,通过高级系统设计和提示工程提升XML输出质量,展示原型能从自然语言或代码生成准确图表,并通过模拟评估证明其在图表创建效率和结构精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05905 2026-03-24 cs.CV 50%

SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations

SCAIL:通过上下文学习3D一致姿态表示实现工作室级角色动画

Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SCAIL通过创新的3D姿态表示和全上下文姿态注入机制,提升角色动画的结构保真度和时间一致性,实现工作室级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09935 2026-03-24 cs.CV 50%

LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning

LEO-VL:面向可扩展3D视觉-语言学习的高效场景表示

Jiangyong Huang, Xiaojian Ma, Xiongkun Linghu, Junchao He, Qing Li, Song-Chun Zhu, Yixin Chen, Baoxiong Jia, Siyuan Huang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出LEO-VL,一种基于高效场景表示CFG的3D视觉-语言模型,通过改进训练数据和引入SceneDPO提升鲁棒性,在多个3D-VL基准测试中取得最佳性能。

Comments Project page: https://leo-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21269 2026-03-24 cs.RO 50%

DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation

DyGeoVLN: 将动态几何基础模型注入视觉-语言导航

Xiangchen Liu, Hanghan Zheng, Jeil Jeong, Minsung Yoon, Lin Zhao, Zhide Zhong, Haoang Li, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(JD探索学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出DyGeoVLN框架,通过跨分支特征融合将动态几何基础模型注入视觉-语言导航,实现显式3D空间表示和视觉-语义推理,并引入新的无姿态自适应分辨率令牌剪枝策略以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21051 2026-03-24 cs.RO 50%

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

皮层策略:一种双流视图变换器用于机器人操作

Xuening Zhang, Qi Lv, Xiang Deng, Miao Zhang, Xingbo Liu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Cortical Policy,通过双流视图变换器提升机器人操作中的空间和动态推理能力,实验证明其在复杂任务中的优越性。

Comments Published as a conference paper at ICLR 2026. 10 pages, 4 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 50%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏