arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4463 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4463 篇

2504.18397 2025-07-16 cs.CV 77%

Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization

Kesen Zhao, Beier Zhu, Qianru Sun, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理大学)

专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06167 2025-07-11 cs.CL cs.CV 77%

Skywork-R1V3 Technical Report

Wei Shen, Jiangbo Pei, Yi Peng, Xuchen Song, Yang Liu, Jian Peng, Haofeng Sun, Yunzhuo Hao, Peiyu Wang, Jianhao Zhang, Yahui Zhou

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10768 2025-07-04 cs.AI 77%

MAPS: Advancing Multi-Modal Reasoning in Expert-Level Physical Science

Erle Zhu, Yadi Liu, Zhe Zhang, Xujun Li, Jin Zhou, Xinjie Yu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group(对话人工智能小组) Department of Computer Science & Technology(计算机科学与技术系) Department of Electrical Engineering(电子工程系)

专题命中 视觉推理 :visual language model(abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.AI

Journal ref Proceedings of the 13th International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19406 2025-05-27 cs.AI 77%

Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model

Tianle Li, Jihai Zhang, Yongming Rao, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan Research(腾讯文言研究院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07867 2025-04-11 cs.CV 77%

SAMJAM: Zero-Shot Video Scene Graph Generation for Egocentric Kitchen Videos

Joshua Li, Fernando Jose Pena Cantu, Emily Yu, Alexander Wong, Yuchen Cui, Yuhao Chen

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16260 2025-03-21 cs.CV 77%

Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data

Zijian Li, Jingjing Fu, Lei Song, Jiang Bian, Jun Zhang, Rui Wang

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11327 2025-01-24 cs.CV 77%

ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension

Tianren Ma, Lingxi Xie, Yunjie Tian, Boyu Yang, Qixiang Ye

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

Comments ICLR 2025. Code is available at github.com/martian422/ClawMachine

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16418 2024-12-24 cs.CV 77%

Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities

Huan Liu, Lingyu Xiao, Jiangjiang Liu, Xiaofan Li, Ze Feng, Sen Yang, Jingdong Wang

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01928 2024-06-12 cs.CV 77%

Visual Transformation Telling

Wanqing Cui, Xin Hong, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉推理 :LLaVA(abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08651 2024-02-20 cs.RO cs.AI 77%

Toward Grounded Commonsense Reasoning

Minae Kwon, Hengyuan Hu, Vivek Myers, Siddharth Karamcheti, Anca Dragan, Dorsa Sadigh

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

Comments IEEE International Conference on Robotics and Automation 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交 76%

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.LG

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 76%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10042 2026-04-14 cs.CV cs.AI 76%

Fake-HR1: Rethinking Reasoning of Vision Language Model for Synthetic Image Detection

Fake-HR1: 重新思考视觉语言模型在合成图像检测中的推理方式

Changjiang Jiang, Xinkuan Sha, Fengchang Yu, Jingjing Liu, Jian Liu, Mingqi Fang, Chenfeng Zhang, Wei Lu

机构 * Wuhan University(武汉大学) AntGroup(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 视觉推理 :vision language model(title);分类 cs.CV、cs.AI

AI总结 Fake-HR1通过两阶段训练框架实现自适应推理,提升合成图像检测性能与效率,优于现有LLMs。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22361 2026-04-14 cs.CL cs.AI cs.LG 76%

MERMAID: Memory-Enhanced Retrieval and Reasoning with Multi-Agent Iterative Knowledge Grounding for Veracity Assessment

MERMAID:基于多智能体迭代知识接地的记忆增强检索与推理用于真实性评估

Yupeng Cao, Chengyang He, Yangyang Yu, Ping Wang, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉推理 :grounding(title);分类 cs.AI、cs.LG

AI总结 MERMAID通过整合智能体驱动搜索、结构化知识表示和持久记忆模块,提升事实核查和主张验证的效率与一致性,实现检索、推理与记忆的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29281 2026-04-01 cs.CV cs.AI cs.RO 76%

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型

Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy, Narsimha Menga, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29165 2026-04-01 cs.CV cs.AI cs.RO 76%

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08921 2026-03-11 cs.CV cs.LG 76%

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

视觉-语言模型编码临床指南以实现基于概念的医学推理

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi

机构 * Queen’s University(女王大学) University of British Columbia(不列颠哥伦比亚大学) McMaster University(麦马斯特大学) Vector Institute(向量研究所)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.LG

AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15040 2026-03-05 cs.CV cs.CL cs.LG 76%

Composition-Grounded Data Synthesis for Visual Reasoning

基于组成性的数据合成用于视觉推理

Xinyi Gu, Jiayuan Mao, Zhang-Wei Hong, Zhuoran Yu, Pengyuan Li, Dhiraj Joshi, Rogerio Feris, Zexue He

机构 * MIT(麻省理工学院) UW-Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.LG

AI总结 COGS通过分解种子问题并重新组合生成合成数据,提升MLLMs在图表和网页等人工图像领域的推理能力。

Comments ICLR2026 camera-ready version. Project page: https://cogsynthesis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22623 2026-02-27 cs.LG cs.AI cs.CL 76%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 视觉推理 :MLLM(title);分类 cs.AI、cs.LG

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05249 2026-02-19 cs.CV cs.AI 76%

COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization

COGITAO:一个用于研究组合性与泛化能力的视觉推理框架

Yassine Taoudi-Benchekroun, Klim Troyan, Pascal Sager, Stefan Gerber, Lukas Tuggener, Benjamin Grewe

机构 * Institute of Neuroinformatics, University of Zurich(神经信息研究所,苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Centre for Artificial Intelligence, Zurich University of Applied Sciences(人工智能中心,应用科学大学)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI

AI总结 COGITAO提出了一种模块化数据生成框架,用于研究视觉领域中的组合性与泛化能力,通过规则任务和灵活的参数控制生成大量任务规则,验证了现有视觉模型在泛化能力上的不足。

Comments 10 main pages, 3 figure, appendix available

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08057 2026-02-10 cs.CV cs.AI 76%

Weak to Strong: VLM-Based Pseudo-Labeling as a Weakly Supervised Training Strategy in Multimodal Video-based Hidden Emotion Understanding Tasks

弱到强:基于VLM的伪标签作为多模态视频隐藏情绪理解任务中的弱监督训练策略

Yufei Wang, Haixu Liu, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing

机构 * The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学) The University of Sydney, Sydney, New South Wales, Australia(悉尼大学) School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院) Shandong University of Technology, Beijing, China(山东理工大学)

专题命中 视觉推理 :VLM(title);分类 cs.CV、cs.AI

AI总结 本文提出基于VLM的伪标签弱监督方法,用于多模态视频隐藏情绪识别,提升准确率至0.69并建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14339 2026-01-22 cs.CV cs.AI 76%

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments

CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试

Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京研究院) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06157 2025-12-29 cs.CV cs.AI 76%

UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces

UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能

Baining Zhao, Jianjie Fang, Zichao Dai, Ziyou Wang, Jirong Zha, Weichen Zhang, Chen Gao, Yue Wang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。

Comments 22 pages

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09251 2025-12-11 cs.CV cs.AI 76%

GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model

GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理

Lalit Maurya, Saurabh Kaushik, Beth Tellman

机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)

专题命中 视觉推理 :multimodal large language model(title);分类 cs.CV、cs.AI

AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24115 2025-10-29 cs.AI cs.LG 76%

HistoLens: An Interactive XAI Toolkit for Verifying and Mitigating Flaws in Vision-Language Models for Histopathology

Sandeep Vissapragada, Vikrant Sahu, Gagan Raj Gupta, Vandita Singh

机构 * Indian Institute of Technology(印度理工学院) All India Institute of Medical Sciences(全印度医学科学研究所)

专题命中 视觉推理 :vision-language model(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06077 2025-10-08 cs.CV cs.AI 76%

When Thinking Drifts: Evidential Grounding for Robust Video Reasoning

Mi Luo, Zihui Xue, Alex Dimakis, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC Berkeley(伯克利大学) Bespoke Labs(Bespoke实验室)

专题命中 视觉推理 :grounding(title);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025, Project page: https://vision.cs.utexas.edu/projects/video-ver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23757 2025-09-30 cs.AI cs.CV 76%

Transparent Visual Reasoning via Object-Centric Agent Collaboration

Benjamin Teoh, Ben Glocker, Francesca Toni, Avinash Kori

机构 * Imperial College London, UK(伦敦帝国学院)

专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00045 2025-07-02 cs.CV cs.AI cs.CL 76%

CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning

Ming Li, Chenguang Wang, Yijun Liang, Xiyao Wang, Yuhang Zhou, Xiyang Wu, Yuqing Zhang, Ruiyi Zhang, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2025-06-12 cs.CV cs.AI 76%

AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions

Zhaoyang Wei, Chenhui Qiang, Bowen Jiang, Xumeng Han, Xuehui Yu, Zhenjun Han

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01293 2025-06-03 cs.CV cs.AI cs.CL 76%

Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation

Yichi Zhang, Zhuo Chen, Lingbing Guo, Yajing Xu, Min Zhang, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :MLLM(title);分类 cs.CV、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏