arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2607.29052 2026-08-03 cs.RO 新提交 88%

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

结果引导蒸馏:一种提升自动驾驶中视觉语言模型推理能力的师生框架

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(晨昇科技公司)

专题命中 视觉推理 :VLM(title,summary_cn);vision-language model(abstract)

AI总结 本研究提出结果引导蒸馏的师生框架,将VLM的显式推理与几何轨迹生成结合,在Waymo基准上使自动驾驶性能提升约24%,优于经典推理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新 88%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08201 2026-05-12 cs.LG cs.AI cs.CV 88%

Weakly Supervised Concept Learning for Object-centric Visual Reasoning

弱监督概念学习用于以对象为中心的视觉推理

Sparsh Tiwari, Bettina Finzel, Gesina Schwalbe

机构 * University of Lübeck(吕贝克大学) University of Bamberg(巴马克大学) University of Ulm(乌尔姆大学)

专题命中 视觉推理 :grounding(summary_cn,abstract);visual reasoning(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种高效的弱监督方案,结合槽式架构和VAE实现对象中心推理任务中的符号 grounding,减少监督至1%并提升域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10905 2025-08-07 cs.AI cs.CV cs.LG 88%

Learning to Inference Adaptively for Multimodal Large Language Models

Zhuoyan Xu, Khoi Duc Nguyen, Preeti Mukherjee, Saurabh Bagchi, Somali Chaterji, Yingyu Liang, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);LLaVA(abstract);visual reasoning(abstract);MLLM(abstract)

Comments Published at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新 88%

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24794 2026-05-26 cs.CV cs.CL 88%

DUEL: Adversarial Self-Play for Multimodal Reasoning

DUEL: 用于多模态推理的对抗性自我对弈

Lin Qiu, Hanqing Zeng, Yao Liu, Bingjun Sun, Guangdeng Liao, Ji Liu

机构 * Meta AI

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 提出DUEL框架,通过对抗性自我对弈从预训练VLM生成监督信号,结合长度归一化对数似然奖励,无需人工标注即可提升视觉推理与判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26934 2026-04-30 cs.CV 88%

World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning

World2VLM: 将世界模型的想象能力蒸馏到VLM中以实现动态空间推理

Wanyue Zhang, Wenxiang Wu, Wang Xu, Jiaxin Luo, Helu Zhi, Yibin Huang, Shuo Ren, Zitao Liu, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 视觉推理 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出World2VLM框架,通过蒸馏生成式世界模型的空间想象能力到VLM中,提升动态空间推理性能,优于基线模型和测试时世界模型耦合方法。

Comments The code is available at https://github.com/WanyueZhang-ai/World2VLM. The dataset is available at https://huggingface.co/datasets/WanyueZhang/World2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 88%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26324 2026-03-03 cs.RO cs.AI cs.MA 88%

COMRES-VLM: Coordinated Multi-Robot Exploration and Search using Vision Language Models

COMRES-VLM: 基于视觉语言模型的多机器人协同探索与搜索

Ruiyang Wang, Hao-Lun Hsu, David Hunt, Jiwoo Kim, Shaocheng Luo, Miroslav Pajic

专题命中 视觉推理 :vision language model(title,abstract);VLM(title,abstract);分类 cs.AI

AI总结 COMRES-VLM通过视觉语言模型实现多机器人系统的协同探索与搜索,提升探索效率和目标物体搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13444 2026-02-12 cs.CL cs.CV 88%

ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models

ChartMuseum: 测试大型视觉-语言模型的视觉推理能力

Liyan Tang, Grace Kim, Xinyu Zhao, Thom Lake, Wenxuan Ding, Fangcong Yin, Prasann Singhal, Manya Wadhwa, Zeyu Leo Liu, Zayne Sprague, Ramya Namuduri, Bodun Hu, Juan Diego Rodriguez, Puyuan Peng, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);分类 cs.CV

AI总结 ChartMuseum通过评估复杂视觉和文本推理能力,揭示了大型视觉-语言模型在视觉推理上的不足。

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09214 2026-02-11 cs.CV 88%

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

VLM-UQBench:一种用于视觉语言模型中模态特定和跨模态不确定性的基准

Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 视觉推理 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 VLM-UQBench通过评估不同UQ方法在模态特定和跨模态不确定性上的表现,揭示了现有方法在细粒度不确定性检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 88%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title,abstract);分类 cs.CV

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18135 2025-11-11 cs.CV 88%

MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation

Jiaxin Huang, Runnan Chen, Ziwen Li, Zhengqing Gao, Xiao He, Yandong Guo, Mingming Gong, Tongliang Liu

机构 * MBZUAI The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学) AI2Robotic

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18142 2025-10-07 cs.CV 88%

Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models

Jingming Liu, Yumeng Li, Boyuan Xiao, Yichang Jian, Ziang Qin, Tianjia Shao, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(title,abstract);分类 cs.CV

Comments Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00053 2025-09-03 cs.MM cs.AI cs.CL 88%

Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?

Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12670 2025-05-20 cs.CV 88%

TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning

Lihong Chen, Hossein Hassani, Soodeh Nikan

机构 * Department of Electrical and Computer Engineering, Western University(电气与计算机工程系,西方大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19355 2025-03-27 cs.CV 88%

ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models

Dohwan Ko, Sihyeon Kim, Yumin Suh, Vijay Kumar B. G, Minseo Yoon, Manmohan Chandraker, Hyunwoo J. Kim

专题命中 视觉推理 :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06697 2026-08-18 cs.CV cs.AI 版本更新 88%

Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs

通过目光思考:将眼动作为视觉推理监督用于医学视觉语言模型

Yiwei Li, Yifan Zhou, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Xiang Li, Quanzheng Li, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Computer Science and Engineering, University of Texas, Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(title);分类 cs.CV、cs.AI

AI总结 通过引入眼动标记,利用时间有序的注视轨迹引导医学VLM的视觉推理,提升放射学任务的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21396 2026-08-06 cs.CV cs.AI 88%

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim

机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 视觉推理 :visual reasoning(title);LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)

AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00261 2026-08-04 cs.CL cs.AI cs.CV cs.MA q-bio.NC 新提交 88%

Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind

前沿视觉语言模型的心智理论跨任务解离

Kejia Zhang, Youran Sun, Chugang Yi, Haizhao Yang

机构 * University of Maryland(马里兰大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究评估9个前沿VLM在两项心理学衍生ToM任务中的表现,发现其ToM特征存在跨任务解离,无模型在两项任务中均接近典型发展成人,推理可改善部分模型在导演任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25066 2026-06-25 cs.AI cs.CV 新提交 88%

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

视觉-语言模型的搜索方式与人类相似吗?经典视觉搜索范式中推理标记作为反应时间类似物

Farahnaz Wick

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究视觉-语言模型(VLM)在经典视觉搜索任务中是否表现出类似人类的行为模式,通过推理标记数量作为搜索努力度的指标,发现模型复现了部分人类特征但也存在关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 88%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30713 2026-06-01 cs.LG cs.CV cs.MM 88%

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

多样性至关重要:重新审视视觉-语言模型中的测试时计算

Yijie Tong, Yifan Hou, Shaobo Cui, Antoine Bosselut, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11651 2026-05-27 cs.CV cs.AI cs.CL 88%

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

Hide to See: 面向VLM蒸馏中视觉锚定思维的推理前缀掩码

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) POSTECH(POSTECH大学)

专题命中 视觉推理 :VLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 提出一种推理前缀掩码蒸馏框架,通过掩码学生模型的显著推理前缀,迫使其在推理过程中更依赖视觉证据,从而缓解长推理轨迹中的视觉遗忘问题,提升多模态推理性能。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 88%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19937 2026-04-23 cs.CV cs.AI 88%

Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning

Infection-Reasoner: 一种用于伤口感染分类的紧凑视觉-语言模型,结合证据支撑的临床推理

Palawat Busaranuvong, Reza Saadati Fard, Emmanuel Agu, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong

机构 * Worcester Polytechnic Institute(沃斯特理工学院) UMass Chan Medical School(UMass Chan医学院)

专题命中 视觉推理 :vision-language model(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Infection-Reasoner,一种紧凑的视觉-语言模型,通过两阶段训练提升伤口感染分类和推理生成的准确性与解释性,实验结果显示其在分类和推理质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.16564 2021-03-31 cs.CV cs.AI cs.CL cs.LG cs.SC 88%

Grounding Physical Concepts of Objects and Events Through Dynamic Visual Reasoning

Zhenfang Chen, Jiayuan Mao, Jiajun Wu, Kwan-Yee Kenneth Wong, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(title);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2021. Project page: http://dcl.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02794 2026-08-21 cs.AI 版本更新 87%

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding

CharTool: 集成工具的视觉推理用于图表理解

Situo Zhang, Yifan Zhang, Zichen Zhu, Da Ma, Lei Pan, Danyang Zhang, Zihan Zhao, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室) AISpeech Co., Ltd.(思必驰科技股份有限公司)

专题命中 视觉推理 :visual reasoning(title);MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract)

AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21186 2026-08-14 cs.CV 版本更新 87%

Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning

Spa3R:用于3D视觉推理的预测空间场建模

Haoyi Jiang, Liu Liu, Xinjie Wang, Yonghao He, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics D-Robotics Intern at D-Robotics(D-Robotics 实习生)

专题命中 视觉推理 :visual reasoning(title);VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)

AI总结 Spa3R通过自监督学习从多视角图像中提取统一的空间表示,提升3D视觉推理能力,实现与VLMs的结合,达到3D VQA任务的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23399 2026-08-12 cs.AI 版本更新 87%

GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning

GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架

Jusheng Zhang, Yijia Fan, Wenjun Lin, Ruiqi Chen, Haoyi Jiang, Wenhao Chai, Jian Wang, Keze Wang

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(title);分类 cs.AI

AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。

Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏