arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4463 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4463 篇

2605.14068 2026-05-19 cs.CV cs.LG 73%

CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

CurveBench:一种用于嵌套乔丹曲线精确拓扑推理的基准

Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Sardari

机构 * Maastricht University(马斯特里赫特大学) Cornell University(康奈尔大学) TU Wien(维也纳技术大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 CurveBench是一个用于从视觉输入中进行层次拓扑推理的基准,包含756张非相交的乔丹曲线图像,通过结构预测任务恢复由曲线诱导的根树结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 73%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14704 2026-05-15 cs.CV cs.AI cs.RO 73%

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

SceneFunRI:为任务驱动的功能物体定位推理不可见区域

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SceneFunRI通过半自动化流程构建了855个实例的基准,要求模型根据任务指令和常识推理推断不可见功能物体的位置,现有模型在推理稳定性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12586 2026-05-14 cs.CV cs.AI cs.DB 73%

3D Primitives are a Spatial Language for VLMs

3D基元是一种视觉语言模型的空间语言

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

机构 * Unity Technologies

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过3D基元作为中间表示来提升视觉语言模型的空间理解能力,通过SpatialBabel基准、Code-CoT推理策略和S³-FT自监督微调三种贡献,展示了基元在空间任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11462 2026-05-13 cs.CV cs.AI 73%

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

SpatialForge: 从开放世界2D图像中提升3D感知空间推理

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

机构 * Lingnan University(岭南大学) XPENG Robotics(小鹏机器人)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialForge,通过大规模合成数据提升空间推理能力,构建了包含1000万对空间问答的大型数据集,验证了2D数据扩展对3D空间推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09900 2026-05-12 cs.AI cs.CL cs.CV 73%

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

为视觉语言模型解开 Gordian 结:图式结理作为一项难题基准

Hao Liu, Jicheng Liu

机构 * Department of Psychology(心理学系) New York University(纽约大学) Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 KnotBench 基准,通过 858,318 张图像与 Regina 签名验证,评估 VLMs 在结图识别、预测和跨模态接地任务中的能力,发现模型在结操作模拟上存在显著不足。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15879 2026-05-12 cs.CV cs.AI cs.CL 73%

GRIT: Teaching MLLMs to Think with Images

GRIT: 教授大语言模型通过图像思考

Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) UC Santa Barbara(加州大学圣芭芭拉分校) eBay

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 73%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10941 2026-05-01 cs.CV cs.AI 73%

Mull-Tokens: Modality-Agnostic Latent Thinking

Mull-Tokens: 通用模态的潜在思考

Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

机构 * Google(谷歌) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。

Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27472 2026-05-01 cs.AI cs.LG cs.RO 73%

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS:通过对比表示实现的原始推理与任务系统

Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 73%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 73%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08476 2026-04-10 cs.CV cs.AI 73%

Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理

Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha, Vineeth N Balasubramanian, Tanuja Ganu

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-04-09 cs.CL cs.AI cs.CV 73%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 73%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11109 2026-04-07 cs.CV cs.AI cs.GR 73%

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

通过交错多模态推理的视觉-反图形代理

Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Impossible, Inc.(Impossible公司)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。

Comments Project page: https://fugtemypt123.github.io/VIGA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02991 2026-04-03 cs.CV cs.AI 73%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20964 2026-03-30 cs.CV cs.AI 73%

Evidence-based diagnostic reasoning with multi-agent copilot for human pathology

基于多智能体助手的证据驱动诊断推理

Luca L. Weishaupt, Chengkuan Chen, Drew F. K. Williamson, Richard J. Chen, Guillaume Jaume, Tong Ding, Bowen Chen, Anurag Vaidya, Long Phi Le, Guillaume Jaume, Ming Y. Lu, Faisal Mahmood

机构 * Health Sciences and Technology, Harvard-MIT(哈佛-MIT健康科学与技术) Department of Pathology, Massachusetts General Hospital, Harvard Medical School(麻省总医院病理科,哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(哈佛-MIT博德研究所癌症项目) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(麻省理工学院电气工程与计算机科学) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PathChat+,一种专为人类病理设计的多模态大语言模型,通过大量病理特定指令样本训练,显著优于现有模型,在多图像理解与自主诊断推理方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06663 2026-03-27 cs.CV cs.AI 73%

Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting

图标记:通过基于图的视觉提示提升多模态语言模型的空间推理能力

Giacomo Frisoni, Lorenzo Molfetta, Mattia Buzzoni, Gianluca Moro

机构 * University of Bologna(博洛尼亚大学)

专题命中 视觉推理 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Graph-of-Mark,一种基于图的视觉提示方法,通过在输入图像上叠加场景图来增强多模态语言模型的空间推理能力,实验表明其在视觉问答和定位任务中提升了11个百分点的准确率。

Comments Please cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24961 2026-03-27 cs.AI cs.CL cs.CV 73%

Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math

能够理解学生的思维吗?解析手写数学中的多模态错误分析

Dingjie Song, Tianlong Xu, Yi-Fan Zhang, Hang Li, Zhiling Yan, Xing Fan, Haoyang Li, Lichao Sun, Qingsong Wen

机构 * Lehigh University(里海大学) Squirrel Ai Learning(松鼠AI学习) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Michigan State University(密歇根州立大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ScratchMath基准测试,用于解释和分类学生手写数学草稿中的错误,评估16种MLLMs显示其在视觉识别和逻辑推理方面存在显著差距,专有模型表现更优。

Comments Accepted by the 27th International Conference on Artificial Intelligence in Education (AIED'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19517 2026-03-23 cs.CV cs.LG 73%

ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding

ReXInTheWild:医疗照片理解的统一基准

Oishi Banerjee, Sung Eun Kim, Alexandra N. Willauer, Julius M. Kernbach, Abeer Rihan Alomaish, Reema Abdulwahab S. Alghamdi, Hassan Rayhan Alomaish, Mohammed Baharoon, Xiaoman Zhang, Julian Nicolas Acosta, Christine Zhou, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究所) Department of Medicine, Division of Gastroenterology, Massachusetts General Hospital(麻省总医院内科与消化内科部门) Department of Neuroradiology, Heidelberg University Hospital(海德堡大学医院神经放射科部门) King Abdulaziz Medical City, National Guard Health Affairs(国王阿卜杜勒-阿齐兹医疗城,国民守卫健康事务局) Division of Pulmonary, Critical Care, and Sleep Medicine, University of Cincinnati(辛辛那提大学肺科、重症医学及睡眠医学部门)

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ReXInTheWild基准,通过484张医学文献来源的照片和7个临床主题的955个多项选择问题,评估视觉-语言模型对医疗照片内容的理解能力,揭示不同模型在细粒度图像理解和医学推理上的性能差异。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16289 2026-03-19 cs.CV cs.AI 73%

VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents

VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试

Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong, Qimeng Wu, Yumeng Liu, Feier Wu, Yihe Tian, Yuhao Liang, Zitong Shan, Wanke Xia, Yi-Fan Zhang, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * CASIA Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) RUC(清华大学) FZU(福建师范大学) THU(清华大学) USTB(北京科技大学) PKU(北京大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16967 2026-03-19 cs.CV cs.AI 73%

MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing

MSRAMIE:多模态结构推理代理用于多指令图像编辑

Zhaoyuan Qiu, Ken Chen, Xiangwei Wang, Yu Xia, Sachith Seneviratne, Saman Halgamuge

机构 * University Of Melbourne(墨尔本大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MSRAMIE基于多模态大语言模型构建无需训练的代理框架,通过结构化多模态推理处理多指令图像编辑任务,提升复杂指令遵循度和完成概率,同时保持图像质量和一致性。

Comments 14 pages, 6 figures, 3 tables, appendix and references provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14440 2026-03-18 cs.AI cs.CL cs.LG 73%

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

VisTIRA: 通过结构化工具集成缩小图像-文本模态差距以提升视觉数学推理

Saeed Khaki, Ashudeep Singh, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 VisTIRA通过结构化工具集成框架,解决图像形式数学问题的推理难题,改进视觉数学推理能力,实验表明工具监督和OCR定位能有效缩小模态差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12597 2026-03-16 cs.LG cs.AI cs.HC cs.MA cs.SE 73%

Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs

Feynman: 一种融合知识的图表生成代理,用于可扩展的视觉设计

Zixin Wen, Yifu Cai, Kyle Lee, Sam Estep, Josh Sunshine, Aarti Singh, Yuejie Chi, Wode Ni

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Feynman代理,通过知识组件枚举和代码规划生成高质量图表-描述对,构建了可扩展的图表生成流水线,并创建了视觉语言基准Diagramma。

Comments A previous version was submitted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI 73%

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12225 2026-03-16 cs.CV cs.LG 73%

HoneyBee: Data Recipes for Vision-Language Reasoners

HoneyBee: 用于视觉-语言推理器的数据食谱

Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出HoneyBee数据集,通过数据整理方法提升视觉-语言推理能力,发现上下文来源策略和数据干预显著提升性能,并提出测试时缩放策略以降低解码成本。

Comments 32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12176 2026-03-13 cs.CV cs.AI 73%

BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning

BehaviorVLM: 无需微调的统一行为理解与视觉-语言推理

Jingyang Ke, Weihan Li, Amartya Pradhan, Jeffrey Markowitz, Anqi Wu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 BehaviorVLM通过无需微调的视觉-语言框架,实现了姿态估计和行为理解的统一,利用详细推理步骤减少人工标注,提升多动物行为分析的可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22018 2026-03-13 cs.CV cs.AI 73%

MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis

MedEyes: 学习动态视觉聚焦以进行医学逐步诊断

Chunzheng Zhu, Yangfang Lin, Shen Chen, Yijun Wang, Jianxin Lin

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 MedEyes通过动态视觉聚焦和双模式探索策略,提升医学逐步诊断的准确性与临床相关性。

Comments AAAI 2026, Medical Chain-of-Thought (CoT), Reinforcement Learning with Verifiable Rewards (RLVR), Multimodal Grounded Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06704 2026-03-10 cs.CV cs.LG 73%

On the Generalization Capacities of MLLMs for Spatial Intelligence

关于多模态大语言模型在空间智能中的泛化能力

Gongjie Zhang, Wenhao Li, Quanhao Qian, Jiuniu Wang, Deli Zhao, Shijian Lu, Ran Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) HuPan Lab(虎朋实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Camera-Aware MLLM框架,通过注入相机内参、数据增强和蒸馏几何先验,提升多模态大语言模型在空间任务中的泛化能力与鲁棒性。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏