arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 174 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 17 篇

2602.04712 2026-05-12 cs.CV cs.AI eess.IV 91%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 视觉问答 :MLLM(title,title_cn);visual question answering(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10739 2026-05-12 eess.IV cs.AI cs.CV 89%

Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

基于多模态大语言模型的遥感活动检测的时空感知

David F. Ramirez, Tim Overman, Kristen Jaskie, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司) Intelligence Advanced Research Projects Activity(智能高级研究计划局)

专题命中 视觉问答 :multimodal large language model(title);LLaVA(abstract,abstract_cn);MLLM(abstract,abstract_cn);visual question answering(abstract)

AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09384 2026-05-12 cs.CV cs.AI q-bio.QM 86%

LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

LiteMedCoT-VL: 用于医疗视觉问答的参数高效适应

Runze Ma, Shunbo Jia, Haonan Lyu, Guo Liu, Caizhi Liao

机构 * School of Information Technology(信息科技学院) Monash University Malaysia(墨尔本大学马来西亚分校) Faculty of Innovation Engineering(创新工程学院) Macau University of Science and Technology(澳门科学技术大学) Department of Bioelectronics(生物电子系) Faculty of Biomedical Engineering(生物医学工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LiteMedCoT-VL,通过LoRA微调将大模型的推理过程转移到小模型,实现医疗视觉问答的高效部署,实验显示2B模型在准确率上超越4B模型。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 85%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10850 2026-05-12 cs.CV 81%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 81%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 视觉问答 :grounding(summary_cn,abstract);分类 cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV 79%

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10772 2026-05-12 cs.CV cs.AI eess.IV 73%

Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition

迈向MSTAR自动目标识别的大型语言-视觉问答模型

David F. Ramirez, Tim L. Overman, Kristen Jaskie, Marv Kleine, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group

专题命中 视觉问答 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文探讨了将大型语言-视觉模型应用于遥感图像描述和视觉问答任务,特别是在合成孔径雷达图像中的自动目标识别挑战,通过参数高效微调实现了98%的准确率。

Comments Accepted to SPIE Defense + Commercial Sensing, Automatic Target Recognition XXXV

Journal ref Proc. SPIE 13463, Automatic Target Recognition XXXV, 134630D (29 May 2025);

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 73%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27629 2026-05-12 cs.AI 70%

WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning

WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习

Ke Xu, Zhongyuan Lian

机构 * Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司) Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出WaferSAGE框架,利用小规模视觉-语言模型进行晶圆缺陷视觉问答。通过合成数据生成和评分引导强化学习,解决半导体制造中的数据稀缺问题,展示小型模型在特定工业视觉理解中的优势。

Comments 16 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09906 2026-05-12 cs.AI cs.SD 70%

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

先分后融:通过模态特定的推理链减轻音频视觉大语言模型中的跨模态干扰

Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing(天津认知计算实验室) Tianjin University(天津大学) Huiyan Technology Company, Ltd.(慧颜科技有限公司) Chinese Academy of Sciences(中国科学院) Tencent(腾讯)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.AI

AI总结 本文提出SFFL框架,通过模态特定的推理链减少跨模态干扰,提升音频视觉问答的准确性和鲁棒性,实验显示在通用AVQA基准和跨模态幻觉基准上分别提升5.16%和11.17%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 62%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10791 2026-05-12 cs.AI 57%

PathISE: Learning Informative Path Supervision for Knowledge Graph Question Answering

PathISE: 通过信息路径监督学习知识图谱问答

Shengxiang Gao, Chao Lei, Jey Han Lau, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉问答 :grounding(abstract_cn);分类 cs.AI

AI总结 PathISE通过学习高质量的中间监督信号提升知识图谱问答性能,利用轻量级Transformer估计关系路径信息,生成可复用的监督信号以增强现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10761 2026-05-12 cs.CV 57%

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

RadThinking:放射学中纵向临床推理的数据集

Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei Zhou

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Clinic of Radiology and Nuclear Medicine, University Hospital Basel(巴塞尔大学医院放射科与核医学科) Department of Oncology, Johns Hopkins School of Medicine(约翰霍普金斯医学院肿瘤科)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 RadThinking数据集通过三个难度层级的VQA任务,提供放射学纵向临床推理的训练和评估框架,支持多步骤推理和临床指南标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 57%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10877 2026-05-12 cs.CL cs.IR 50%

Neural at ArchEHR-QA 2026: One Method Fits All: Unified Prompt Optimization for Clinical QA over EHRs

神经网络在ArchEHR-QA 2026中的应用:一种方法适用于所有:面向电子健康记录的临床问答的统一提示优化

Abrar Majeedi, Viswanatha Reddy Gajjala, Sai Prasanna Teja Reddy Bogireddy, Siddhant Rai

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出Neural1.5方法,通过分阶段的提示优化提升电子健康记录中的临床问答性能,实现多任务统一优化,展现系统性提示优化的有效性。

Comments Accepted to CL4Health @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10199 2026-05-12 cs.CL eess.AS 50%

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

LLMs在说话时应该如何倾听?对全双工语音对话中用户流路由的探讨

Hui Lu, Xueyuan Chen, Huimeng Wang, Shuhai Peng, Shiyin Kang, Xixin Wu, Zhiyong Wu

机构 * The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 研究探讨了全双工语音对话中用户流路由对LLM的影响,通过对比通道融合与交叉注意力路由策略,发现通道融合在语义接地和问答性能上更优,但易受上下文干扰;交叉注意力路由更稳健,但问答表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 37 篇

2605.01345 2026-05-12 cs.CV cs.AI cs.LG 91%

The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design

视觉语言模型中的感知带宽瓶颈:通过顺序实验设计实现主动视觉推理

Anjie Liu, Ziqin Gong, Yan Song, Yuxiang Chen, Xiaolong Liu, Hengtong Lu, Kaike Zhang, Chen Wei, Jun Wang

机构 * The Hong Kong University of Science(香港科学与技术大学) University College London, London, United Kingdom(伦敦大学学院, 英国伦敦) ShanghaiTech University, Shanghai, China(上海科技大学, 中国上海) AI Lab, The Yangtze River Delta, China(人工智能实验室, 长江三角洲, 中国)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过顺序贝叶斯最优实验设计实现主动视觉推理,解决视觉语言模型中感知带宽瓶颈问题,提升高分辨率视觉推理能力。

Comments 27 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI 89%

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 视觉推理 :grounding(title,title_cn);visual reasoning(title);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08201 2026-05-12 cs.LG cs.AI cs.CV 88%

Weakly Supervised Concept Learning for Object-centric Visual Reasoning

弱监督概念学习用于以对象为中心的视觉推理

Sparsh Tiwari, Bettina Finzel, Gesina Schwalbe

机构 * University of Lübeck(吕贝克大学) University of Bamberg(巴马克大学) University of Ulm(乌尔姆大学)

专题命中 视觉推理 :grounding(summary_cn,abstract);visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种高效的弱监督方案,结合槽式架构和VAE实现对象中心推理任务中的符号 grounding,减少监督至1%并提升域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 86%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09719 2026-05-12 cs.CV cs.AI 86%

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

将3D空间推理蒸馏到轻量级视觉-语言模型中:利用推理链

Alaa Asfour, Christopher Indris, Leihan Chen, Tejas Vyas, Guanghui Wang

机构 * Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出一种知识蒸馏框架,将7B教师模型的3D空间推理能力转移到2.29B学生模型,实现8.7倍更低的推理延迟和3倍模型压缩,同时保留54-72%的性能。引入隐藏推理链提升推理能力,学生模型联合执行空间描述、深度估计和目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 86%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06969 2026-05-12 cs.CV 85%

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

将多模态大语言模型引入红外-可见图像融合质量评估

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09152 2026-05-12 cs.CL q-bio.NC 85%

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

Meow-Omni 1:用于猫类行为学的多模态大语言模型

Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

机构 * University College London(伦敦大学学院) Tsinghua University(清华大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG 83%

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10172 2026-05-12 cs.CV cs.CL 83%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08412 2026-05-12 cs.CV 83%

SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding

SYNCR: 一个具有合成接地的跨视频推理基准

Sara Ghazanfari, Siddharth Garg, Prashanth Krishnamurthy, Farshad Khorrami

机构 * New York University(纽约大学)

专题命中 视觉推理 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SYNCR通过合成数据评估多视频推理能力,发现现有模型在物理空间推理上表现不足,参数扩展和训练后优化能提升时间对齐能力,但无法可靠解决细粒度物理跟踪和全局空间合成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10564 2026-05-12 cs.CV cs.RO 81%

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶

Lingjun Zhang, Changjie Wu, Linzhe Shi, Jiangyang Li, Jiaxin Liu, Lei Yang, Hang Zhang, Mu Xu, Hong Wang

机构 * Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团Amap) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 81%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏