arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3352 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3352 篇

2605.10002 2026-05-12 cs.CV 78%

Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models

Med-StepBench:一种用于评估医学视觉-语言模型幻觉的分层推理框架

Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari, Tuan Dung Nguyen, Mai Hong Son, Mai Huy Thong, Quang Huy Nguyen, Thanh Trung Nguyen, Reza Farahbakhsh, Noel Crespi, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,越南科学与技术大学) SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,法国电信南巴黎学院,巴黎理工学院) Military Central Hospital, Vietnam(越南108军中心医院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出Med-StepBench,首个针对3D肿瘤PET/CT图像的分步幻觉检测基准,通过12000张图像和100万对图像-陈述数据,揭示了现有VLMs在多步临床推理中的系统性缺陷。

Comments Accepted at IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09053 2026-05-12 cs.CV 78%

LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation

LCGNav: 本地候选感知的几何增强以实现连续环境中的通用拓扑规划

Jiankun Peng, Jianyuan Guo, Yiguang Yang, Yue Liu, Jiashuang Yan, Ying Xu

机构 * The Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing(中国科学院航空航天信息研究所,北京) The School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing(中国科学院大学电子电气与通信工程学院,北京) The Department of Computer Science, City University of Hong Kong, Hong Kong, SAR, China(香港城市大学计算机科学系,香港特别行政区,中国)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 LCGNav通过本地几何增强框架解决连续环境视觉语言导航中局部深度信息冗余和候选前沿关注不足的问题,提升拓扑规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 78%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 78%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26934 2026-04-30 cs.CV 78%

World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

World2VLM: 将世界模型的想象能力蒸馏到VLM中以实现动态空间推理

Wanyue Zhang, Wenxiang Wu, Wang Xu, Jiaxin Luo, Helu Zhi, Yibin Huang, Shuo Ren, Zitao Liu, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出World2VLM框架,通过蒸馏生成式世界模型的空间想象能力到VLM中,提升动态空间推理性能,优于基线模型和测试时世界模型耦合方法。

Comments The code is available at https://github.com/WanyueZhang-ai/World2VLM. The dataset is available at https://huggingface.co/datasets/WanyueZhang/World2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23934 2026-04-28 eess.SY cs.SY 78%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08592 2026-04-28 cs.CV 78%

Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations

通过几何参考的3D场景表示提升MLLM空间推理能力

Jiangye Yuan, Gowri Kumar, Baoyuan Wang

机构 * Zillow Group(智域集团)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16046 2026-04-28 cs.RO cs.CV 78%

DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

DextER:基于语言的灵巧抓取生成与具身推理

Junha Lee, Eunha Park, Minsu Cho

机构 * Pohang University of Science and Technology(釜山科学技术大学) RLWRLD

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DextER通过具身推理生成灵巧抓取,结合任务语义与物理约束,提升抓取成功率与意图对齐度。

Comments CVPR 2026, Project page: https://junha-l.github.io/dexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV 78%

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 78%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19302 2026-04-22 cs.CV 78%

Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing

弥合语义与几何:一种解耦的LVLM-SAM框架用于光学遥感中的推理分割

Xu Zhang, Junyao Ge, Yang Zheng, Kaitai Guo, Jimin Liang

机构 * School of Electronic Engineering, Xidian University, Xi'an, Shaanxi 710071, China(西安电子科技大学电子工程学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出解耦的LVLM-SAM框架,通过结构化几何提示优化,提升光学遥感中推理分割的性能,实现语义与几何的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02972 2026-04-21 cs.CV cs.RO 78%

TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation

TagaVLM:面向视觉语言导航的拓扑感知全局动作推理

Jiaxing Liu, Zexi Zhang, Xiaoyan Li, Boyue Wang, Yongli Hu, Baocai Yin

机构 * School of Information Science and Technology, Beijing University of Technology, China(信息科学与技术学院,北京理工大学,中国) Imperial College London, U.K.(伦敦帝国理工学院,英国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 TagaVLM通过引入拓扑结构增强视觉语言模型,提升空间推理能力,在R2R基准中取得最佳性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16617 2026-04-21 cs.CV cs.MM cs.SD 78%

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

AVRT:通过单模态教师模型实现音频-视觉推理迁移

Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen, Germany(图宾根大学) MIT, Cambridge MA, USA(麻省理工学院) IBM Research, USA(IBM研究院) MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center, Germany(图宾根人工智能中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM 78%

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14512 2026-04-15 cs.CV 78%

SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks

SIRI-Bench: 通过复杂推理任务挑战VLMs的空间智能

Zijian Song, Xiaoxin Lin, Qiuming Huang, Sihan Qin, Guangrun Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SIRI-Bench通过空间接地推理任务评估VLMs的空间结构智能,包含9000个视频问题答案三元组,实验表明先进VLMs在结构空间推理上面临挑战。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11177 2026-04-14 cs.CV 78%

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

推理流是否重要?评估Gemini视觉-语言模型在视频场景理解中的推理能力

Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究评估了Gemini视频语言模型中推理流对视频场景理解的影响,提出三个评估指标,并发现增加推理量对输出质量的提升迅速达到平台期,Flash Lite在质量和token使用之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 78%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09201 2026-04-13 cs.CV 78%

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08726 2026-04-13 cs.RO 78%

Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning

基于VLM引导的语义-几何推理的任务感知双臂 affordance 预测

Fabian Hahne, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters, Alap Kshirsagar

机构 * Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系) German Research Center for AI (DFKI)(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特工业大学认知科学中心) Hessian Center for Artificial Intelligence (Hessian.AI), Darmstadt(黑森州人工智能中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出一种任务感知双臂 affordance 预测框架,通过VLM实现跨物体类别和任务描述的泛化,融合多视角RGB-D数据生成全局6自由度抓取候选,结合语义和几何过滤提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08068 2026-04-10 cs.CV 78%

Brain3D: EEG-to-3D Decoding of Visual Representations via Multimodal Reasoning

Brain3D: 通过多模态推理实现EEG到3D视觉表示的解码

Emanuele Balloni, Emanuele Frontoni, Chiara Matti, Marina Paolanti, Roberto Pierdicca, Emiliano Santarnecchi

机构 * Università Politecnica delle Marche(马尔凯理工大学) University of Macerata(马切拉塔大学) Horizon Intelligence Labs(地平线智能实验室) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出Brain3D,通过多模态推理实现EEG到3D解码,分阶段生成3D网格,提升神经解码的几何理解与应用性。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18100 2026-04-09 cs.CV 78%

Spatial-Conditioned Reasoning in Long-Egocentric Videos

长时自体视频中的空间条件推理

James Tribble, Hao Wang, Si-En Hong, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03995 2026-04-07 cs.CV cs.SD 78%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 78%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00867 2026-04-02 cs.CV 78%

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

一种用于无训练代理推理的4D表示

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab

机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12545 2026-04-02 cs.CV 78%

Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA

空间推理并非免费午餐:对LLaVA的受控研究

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

机构 * Cohere Labs Community(Cohere Labs社区) Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Imperial College London(伦敦帝国学院) Eisai Inc.(卫材公司) EleutherAI Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文通过LLaVA框架探讨了空间推理能力不足的原因,发现图像编码器设计和位置编码结构对空间理解有显著影响,但无法完全解决空间推理问题。

Comments Accepted as a poster at ICLR 2026 workshop ICBINB, typo fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV 78%

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 78%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 78%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 78%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26362 2026-03-30 cs.CV 78%

HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models

HandVQA: 评估视觉-语言模型中手部精细空间推理的诊断与改进

MD Khalequzzaman Chowdhury Sayem, Mubarrat Tajoar Chowdhury, Yihalem Yimolal Tiruneh, Muneeb A. Khan, Muhammad Salman Ali, Binod Bhattarai, Seungryul Baek

机构 * UNIST(蔚山科学技术院) University of Aberdeen(阿伯丁大学) University College London(伦敦大学学院) Fogsphere (Redev.AI Ltd), UK(Fogsphere (Redev.AI Ltd),英国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 HandVQA通过视觉问答评估VLM对手部解剖的精细空间理解,发现现有模型在手部关节空间关系推理上的系统性缺陷,并通过3D数据训练提升模型在手部姿态识别和手-物交互任务中的性能。

Comments Accepted in CVPR 2026; Project page, code, and dataset: https://kcsayem.github.io/handvqa/

详情

展开后加载摘要…

URL PDF HTML 收藏