arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25909 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2308.16493 2023-09-01 cs.AI cs.RO 85%

Expanding Frozen Vision-Language Models without Retraining: Towards Improved Robot Perception

Riley Tavassoli, Mani Amani, Reza Akhavian

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.AI

Comments Preprint submitted to Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03932 2023-06-08 cs.CV 85%

Q: How to Specialize Large Vision-Language Models to Data-Scarce VQA Tasks? A: Self-Train on Unlabeled Images!

Zaid Khan, Vijay Kumar BG, Samuel Schulter, Xiang Yu, Yun Fu, Manmohan Chandraker

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);visual question answering(abstract)

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18406 2024-03-28 cs.CV cs.AI cs.CL cs.LG 85%

An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM

Wonkyun Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

专题命中 视觉问答 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Our code is available at https://github.com/imagegridworth/IG-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11811 2026-07-16 cs.RO cs.AI cs.CV 版本更新 85%

RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset

RADAR: 通过语义规划和自主因果环境重置实现闭环机器人数据生成

Yongzhong Wang, Keyu Zhu, Yong Zhong, Liqiong Wang, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Spatialtemporal AI(时空人工智能)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 RADAR通过语义规划和自主因果环境重置实现闭环机器人数据生成,具备高适应性和可扩展性,在仿真和现实部署中均表现出卓越的性能。

Comments 8 pages, 4 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://radar-iros.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04344 2026-07-07 cs.CV cs.AI 新提交 85%

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统

Hao Wei, Wenjin Qi, Dasen Dai, Minqing Zhang, Wu Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12106 2026-06-11 cs.CV cs.AI 新提交 85%

MSUE: Multi-Modal Soccer Understanding Expert

MSUE:多模态足球理解专家

Litao Li, Yibo Yu, Yufeng Hu, Zhuo Yang, Jiali Wen, Yixin Chen, Yixi Zhou

机构 * South China University of Technology(华南理工大学) Johns Hopkins University(约翰霍普金斯大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MSUE多专家问答架构,结合VLM数据合成管道与LLM动态调度文本、图像、视频专家,在SoccerNet VQA挑战中达到0.95准确率,获第三名。

Comments 6 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06407 2026-06-09 cs.CV cs.IR cs.LG eess.IV 版本更新 85%

A Vision-language Framework for Comparative Reasoning in Radiology

放射学中比较推理的视觉语言框架

Tengfei Zhang, Ziheng Zhao, Xiaoman Zhang, Lisong Dai, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Radiology, Renmin Hospital of Wuhan University(武汉大学仁民医院放射科) Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University(上海交通大学附属第六人民医院)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 提出一个实体感知的跨图像推理框架,通过构建大规模比较影像数据集MedReCo-DB和开发MedReCo及MedReCo-VLM模型,实现了参考病例检索和时间比较解读,显著提升了放射学比较推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02463 2026-06-02 cs.CV cs.AI 85%

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

MASER: 面向具身3D空间智能的模态自适应专家路由

Hilton Raj, Vishnuram AV

机构 * Boston University(波士顿大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。

Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30698 2026-06-01 cs.CV cs.AI cs.MA 85%

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

先见后议:用视觉证据对齐多智能体共识

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Shandong University(山东大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13294 2026-05-22 cs.CV cs.AI 85%

VisPhyWorld: Probing Physical Reasoning via Code-Driven Video Reconstruction

VisPhyWorld: 通过代码驱动的视频重建探测物理推理

Jiarong Liang, Max Ku, Ka-Hei Hui, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Autodesk AI Lab(Autodesk人工智能实验室) Independent Researcher(独立研究者)

专题命中 视觉问答 :MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPhyWorld框架,通过要求模型从视觉观察生成可执行的模拟器代码来评估物理推理能力,引入VisPhyBench基准测试集,验证模型在重建外观和模拟物理运动方面的能力,发现最先进的MLLM在准确推断物理参数和模拟一致的物理动态方面存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 85%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19324 2026-04-22 cs.CV cs.AI 85%

PLaMo 2.1-VL Technical Report

PLaMo 2.1-VL 技术报告

Tommi Kerola, Yuya Masuda, Takashi Masuko, Toshiki Nakanishi, Daisuke Nishino, Kuniyuki Takahashi, Hanqin Wang, Yoshihiro Yamada

机构 * Preferred Networks, Inc.

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 PLaMo 2.1-VL 是一种轻量级视觉语言模型,适用于自主设备的本地和边缘部署,支持日语操作。该模型在视觉问答和视觉定位任务中表现优异,应用于工厂任务分析和基础设施异常检测,取得了显著的性能提升。

Comments 35 pages, 9 figreus

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17771 2025-10-21 cs.AI cs.CV 85%

Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs

Zhining Liu, Ziyi Chen, Hui Liu, Chen Luo, Xianfeng Tang, Suhang Wang, Joy Zeng, Zhenwei Dai, Zhan Shi, Tianxin Wei, Benoit Dumoulin, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Penn State University(宾夕法尼亚州立大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);InternVL(abstract)

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28346 2026-07-24 cs.CL 版本更新 85%

When Discourse Pressures Conflict: Information Structure in Vision-Language Model Outputs

当话语压力冲突时:视觉-语言模型输出中的信息结构

Marcell Fekete, Johannes Bjerva, Tamás Káldi

机构 * Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) Department of Psycholinguistics and Neurolinguistics, ELTE Research Centre for Linguistics(ELTE语言研究中心心理学语言学与神经语言学系) ELTE Bárczi Gusztáv Faculty of Special Needs Education(ELTE巴尔茨吉斯塔夫特殊教育学院)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 研究视觉-语言模型在视觉问答中是否区分话语旧主题和新焦点,发现模型虽产生信息结构相关结构但过度正则化,倾向于窄响应模板,类似模式崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21397 2026-06-02 cs.CV cs.AI cs.CL cs.LG 85%

Understanding the Effects of Distractors on Reasoning Vision-Language Models

理解干扰项对推理视觉语言模型的影响

Jiyun Bae, Hyunjong Ok, Sangwoo Mo, Jaeho Lee

机构 * Pohang University of Science and Technology (POSTECH)(坡山科学技术大学(POSTECH))

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过构建包含语义和数值维度干扰项的视觉问答数据集Idis,研究视觉干扰项如何影响视觉语言模型的测试时缩放行为,发现视觉干扰项以与文本干扰项根本不同的方式降低准确率而不增加推理长度,并提出简单提示策略缓解干扰项驱动的预测。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 85%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 85%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn)

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22678 2026-04-27 cs.CL 85%

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne

机构 * Department of Engineering(工程系)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(abstract,abstract_cn)

AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20503 2026-04-20 cs.CL 85%

Protecting multimodal large language models against misleading visualizations

保护多模态大语言模型免受误导性可视化的影响

Jonathan Tonglet, Tinne Tuytelaars, Marie-Francine Moens, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系,德累斯顿技术大学及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系,鲁文大学) Department of Computer Science, KU Leuven(计算机科学系,鲁文大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 研究发现多模态大语言模型在面对误导性可视化时回答准确性显著下降,提出两种有效方法提升其处理能力,同时保持非误导性可视化下的准确性。

Comments Preprint. Code and data available at https://github.com/UKPLab/arxiv2025-misleading-visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06084 2026-03-09 cs.RO 85%

Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划

Cristiano Battistini, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14989 2026-02-17 cs.CV cs.AI cs.LG 85%

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准

Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。

Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19616 2026-01-30 cs.LG cs.AI cs.CV 85%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10054 2026-01-21 q-bio.OT 85%

SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model

SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能

Yaoqian Li, Xikai Yang, Dunyuan Xu, Yang Yu, Litao Zhao, Xiaowei Hu, Jinpeng Li, Pheng-Ann Heng

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11625 2025-10-07 cs.CL cs.AI cs.CV cs.LG 85%

MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering

Varun Srivastava, Fan Lei, Srija Mukhopadhyay, Vivek Gupta, Ross Maciejewski

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学) Department of Computer Science(计算机科学系) International Institute of Information Technology(国际信息科技研究所)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17588 2025-09-23 cs.CV cs.AI cs.LG 85%

Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models

Jinyeong Kim, Seil Kang, Jiwoo Park, Junhyeok Kim, Seong Jae Hwang

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18687 2025-08-27 cs.CL 85%

Knowing or Guessing? Robust Medical Visual Question Answering via Joint Consistency and Contrastive Learning

Songtao Jiang, Yuxi Chen, Sibo Song, Yan Zhang, Yeying Jin, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University, Zhejiang, China(浙江大学) Alibaba Group, Zhejiang, China(阿里巴巴集团) Angelalign Technology Inc., Shanghai, China(Angelalign技术有限公司) ChohoTech Inc., Hangzhou, China(楚合科技有限公司) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence, Zhejiang, China(浙江省医学影像人工智能重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07785 2025-06-10 cs.CV cs.AI cs.LG 85%

Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger

Qi Yang, Chenghao Zhang, Lubin Fan, Kun Ding, Jieping Ye, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所MAIS部) Alibaba Cloud Computing, China(阿里巴巴云计算)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2025 Spotlight. 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04353 2025-06-06 cs.CV cs.AI cs.CE cs.CL cs.LG 85%

ReXVQA: A Large-scale Visual Question Answering Benchmark for Generalist Chest X-ray Understanding

Ankit Pal, Jung-Oh Lee, Xiaoman Zhang, Malaikannan Sankarasubbu, Seunghyeon Roh, Won Jung Kim, Meesun Lee, Pranav Rajpurkar

机构 * Saama AI Research(Saama AI研究机构) Seoul National University(首尔国立大学) Harvard Medical School(哈佛医学院)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11479 2025-06-04 cs.CL 85%

Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media Contexts

Jingxuan Li, Yuning Yang, Shengqi Yang, Linfan Zhang, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00806 2025-06-03 cs.CL 85%

Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering

Songtao Jiang, Chenyi Zhou, Yan Zhang, Yeying Jin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Byte Dance(字节跳动) National University of Singapore(新加坡国立大学) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏