arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4447 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4447 篇

2410.06765 2024-10-10 cs.CL cs.CV 83%

To Preserve or To Compress: An In-Depth Study of Connector Selection in Multimodal Large Language Models

Junyan Lin, Haoran Chen, Dawei Zhu, Xiaoyu Shen

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09788 2024-09-17 cs.CV cs.CL 83%

Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models

Yuan-Hong Liao, Rafid Mahmood, Sanja Fidler, David Acuna

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02231 2024-08-06 cs.CV 83%

REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models

Agneet Chatterjee, Yiran Luo, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project Page : https://agneetchatterjee.com/revision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19666 2024-07-30 cs.CV 83%

Take A Step Back: Rethinking the Two Stages in Visual Reasoning

Mingyu Zhang, Jiting Cai, Mingyu Liu, Yue Xu, Cewu Lu, Yong-Lu Li

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

Comments ECCV 2024, Project page: https://mybearyzhang.github.io/projects/TwoStageReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16500 2024-07-30 cs.CV 83%

LLMGA: Multimodal Large Language Model based Generation Assistant

Bin Xia, Shiyin Wang, Yingfan Tao, Yitong Wang, Jiaya Jia

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments The paper is accepted by ECCV2024. The code is available at https://github.com/dvlab-research/LLMGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12884 2024-07-23 cs.CV 83%

HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning

Fucai Ke, Zhixi Cai, Simindokht Jahangard, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by ECCV2024. Project page: https://hydra-vl4ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02666 2024-07-04 cs.RO cs.AI 83%

Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models

Annie S. Chen, Alec M. Lessing, Andy Tang, Govind Chada, Laura Smith, Sergey Levine, Chelsea Finn

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02042 2024-07-03 cs.CL cs.AI 83%

Fake News Detection and Manipulation Reasoning via Large Vision-Language Models

Ruihan Jin, Ruibo Fu, Zhengqi Wen, Shuai Zhang, Yukun Liu, Jianhua Tao

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15359 2024-06-25 cs.CL cs.CV 83%

Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models

Jesse Atuhurra, Iqra Ali, Tatsuya Hiraoka, Hidetaka Kamigaito, Tomoya Iwakura, Taro Watanabe

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15915 2024-06-21 cs.CV 83%

ChartBench: A Benchmark for Complex Visual Reasoning in Charts

Zhengzhuo Xu, Sinan Du, Yiyan Qi, Chengjin Xu, Chun Yuan, Jian Guo

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06865 2024-06-12 cs.AI 83%

Eyeballing Combinatorial Problems: A Case Study of Using Multimodal Large Language Models to Solve Traveling Salesman Problems

Mohammed Elhenawy, Ahmed Abdelhay, Taqwa I. Alhadidi, Huthaifa I Ashqar, Shadi Jaradat, Ahmed Jaber, Sebastien Glaser, Andry Rakotonirainy

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01031 2024-05-28 cs.CL cs.AI 83%

Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks

Fakhraddin Alwajih, El Moatez Billah Nagoudi, Gagan Bhatia, Abdelrahman Mohamed, Muhammad Abdul-Mageed

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16006 2024-04-25 cs.CV 83%

MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI

Kaining Ying, Fanqing Meng, Jin Wang, Zhiqian Li, Han Lin, Yue Yang, Hao Zhang, Wenbo Zhang, Yuqi Lin, Shuo Liu, Jiayi Lei, Quanfeng Lu, Runjian Chen, Peng Xu, Renrui Zhang, Haozhe Zhang, Peng Gao, Yali Wang, Yu Qiao, Ping Luo, Kaipeng Zhang, Wenqi Shao

专题命中 视觉推理 :vision-language model(title,abstract);InternVL(abstract);分类 cs.CV

Comments 77 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03052 2024-04-08 cs.CV cs.CL 83%

Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models

Yushi Hu, Otilia Stretcu, Chun-Ta Lu, Krishnamurthy Viswanathan, Kenji Hata, Enming Luo, Ranjay Krishna, Ariel Fuxman

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12966 2024-03-22 cs.CV 83%

Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models

Zuyan Liu, Yuhao Dong, Yongming Rao, Jie Zhou, Jiwen Lu

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Project Page: https://sites.google.com/view/chain-of-spot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11574 2024-02-20 cs.CV cs.CL 83%

Visual In-Context Learning for Large Vision-Language Models

Yucheng Zhou, Xiang Li, Qianning Wang, Jianbing Shen

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08670 2024-02-14 cs.AI 83%

Rec-GPT4V: Multimodal Recommendation with Large Vision-Language Models

Yuqing Liu, Yu Wang, Lichao Sun, Philip S. Yu

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11035 2024-01-23 cs.CV 83%

Image Safeguarding: Reasoning with Conditional Vision Language Model and Obfuscating Unsafe Content Counterfactually

Mazal Bethany, Brandon Wherry, Nishant Vishwamitra, Peyman Najafirad

专题命中 视觉推理 :vision language model(title);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06805 2024-01-19 cs.CL cs.AI 83%

Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning

Yiqi Wang, Wentao Chen, Xiaotian Han, Xudong Lin, Haiteng Zhao, Yongfei Liu, Bohan Zhai, Jianbo Yuan, Quanzeng You, Hongxia Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16217 2023-12-29 cs.CV cs.RO 83%

ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation

Xiaoqi Li, Mingxu Zhang, Yiran Geng, Haoran Geng, Yuxing Long, Yan Shen, Renrui Zhang, Jiaming Liu, Hao Dong

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06739 2023-12-13 cs.CV 83%

SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models

Yuzhou Huang, Liangbin Xie, Xintao Wang, Ziyang Yuan, Xiaodong Cun, Yixiao Ge, Jiantao Zhou, Chao Dong, Rui Huang, Ruimao Zhang, Ying Shan

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://yuzhou914.github.io/SmartEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11860 2023-11-28 cs.CV 83%

LION : Empowering Multimodal Large Language Model with Dual-Level Visual Knowledge

Gongwei Chen, Leyang Shen, Rui Shao, Xiang Deng, Liqiang Nie

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report. Project page: https://rshaojimmy.github.io/Projects/JiuTian-LION Code: https://github.com/rshaojimmy/JiuTian

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04901 2023-11-09 cs.CV 83%

GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEs

Zhenfang Chen, Rui Sun, Wenjun Liu, Yining Hong, Chuang Gan

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03964 2023-11-08 cs.CV 83%

Enhancing Multimodal Compositional Reasoning of Visual Language Models with Generative Negative Mining

Ugur Sahin, Hang Li, Qadeer Khan, Daniel Cremers, Volker Tresp

专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to WACV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.07526 2020-10-16 cs.CL cs.CV 83%

Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs

Ana Marasović, Chandra Bhagavatula, Jae Sung Park, Ronan Le Bras, Noah A. Smith, Yejin Choi

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted to Findings of EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.05268 2019-01-24 cs.CV 83%

Transparency by Design: Closing the Gap Between Performance and Interpretability in Visual Reasoning

David Mascharka, Philip Tran, Ryan Soklaski, Arjun Majumdar

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

Comments CVPR 2018 pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03631 2018-12-12 cs.CV 83%

Spatial Knowledge Distillation to aid Visual Reasoning

Somak Aditya, Rudra Saha, Yezhou Yang, Chitta Baral

专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV

Comments Equal contribution by first two authors. Accepted in WACV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12876 2026-08-14 cs.CV cs.AI 新提交 82%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06938 2026-08-10 cs.CV cs.AI 新提交 82%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 视觉推理 :grounding(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05131 2026-08-07 cs.CV cs.AI 版本更新 82%

OPD-V: Visual On-Policy Self-Distillation with Modality Balance

OPD-V:结合模态平衡的视觉在线策略自蒸馏

Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型的模态不平衡问题,提出视觉在线策略自蒸馏范式OPD-V,通过正、负教师模型实现模态平衡,在多基准与骨干上提升推理性能并降低训练成本。

Comments Corrected the uploaded manuscript. Project Page:https://github.com/aniri15/OPD-V

详情

展开后加载摘要…

URL PDF HTML 收藏