arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 25909 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3115 篇

2602.13650 2026-02-17 cs.CV cs.AI cs.CL 81%

KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination

KorMedMCQA-V: 一种用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试

Byungjin Choi, Seongsu Bae, Sunjun Kweon, Edward Choi

机构 * Ajou University School of Medicine(阿乔大学医学院) KAIST(韩国科学技术院)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 KorMedMCQA-V是一个用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试,展示了不同模型在医疗领域中的表现差异。

Comments 17 pages, 2 figures, 6 tables. (Includes appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 81%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09210 2026-02-12 cs.CV cs.AI 81%

MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models

MME-Emotion:多模态大语言模型情感智能的综合评估基准

Fan Zhang, Zebang Cheng, Chong Deng, Haoxuan Li, Zheng Lian, Qian Chen, Huadai Liu, Wen Wang, Yi-Fan Zhang, Renrui Zhang, Ziyu Guo, Zhihong Zhu, Hao Wu, Haixin Wang, Yefeng Zheng, Xiaojiang Peng, Xian Wu, Kun Wang, Xiangang Li, Jieping Ye, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab(通义实验室) SZTU(深圳技术大学) Peking University(北京大学) Tongji University(同济大学) CASIA(中国科学院自动化所) Tencent(腾讯) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(国立大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04142 2026-02-06 cs.CV cs.AI 81%

JSynFlow: Japanese Synthesised Flowchart Visual Question Answering Dataset built with Large Language Models

JSynFlow:利用大语言模型构建的日本合成流程图视觉问答数据集

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究所有限公司)

专题命中 视觉问答 :visual question answering(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 JSynFlow利用大语言模型生成日本流程图视觉问答数据集,提升VLM在流程图问答任务中的性能。

Comments 7 pages, 1 figure

Journal ref Proceedings of the Annual Conference of JSAI, JSAI2025:2Win587-2Win587, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06750 2026-01-13 cs.CV cs.AI cs.CL 81%

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models

医疗多模态大语言模型的视点临床意图理解能力基准测试

Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng, Wenting Chen, Jie Liu, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11939 2026-01-09 cs.CL cs.AI cs.CV cs.MM 81%

POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering

POLYCHARTQA: 通过多语言图表问答基准评估大视觉-语言模型

Yichen Xu, Liangyu Chen, Liang Zhang, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 PolyChartQA是首个大规模多语言图表问答基准,通过多语言图表生成和评估,揭示英语与其他语言在图表理解上的性能差距,并提供训练集提升多语言模型表现。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24022 2026-01-01 cs.CV cs.AI 81%

FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing

FUSE-RSVLM:用于遥感的特征融合视觉-语言模型

Yunkai Dang, Donghao Wang, Jiacheng Yang, Yifan Jiang, Meiyi Zhu, Yuekun Yang, Cong Wang, Qi Fan, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 FUSE-RSVLM通过多特征融合技术提升遥感图像的视觉-语言处理能力,有效解决细粒度特征提取和视觉遗忘问题,在遥感分类、图像描述和VQA任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15649 2025-12-24 cs.CV cs.AI cs.CL 81%

VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?

VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?

Hongbo Zhao, Meng Wang, Fei Zhu, Wenzhuo Liu, Bolin Ni, Fanhu Zeng, Gaofeng Meng, Zhaoxiang Zhang

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 School of Artificial Intelligence, University of Chinese Academy of Sciences 3 Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, CAS 4 Independent Researcher

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15952 2025-12-22 cs.CV cs.AI 81%

VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance

VideoGameQA-Bench: 评估用于视频游戏质量保证的视觉-语言模型

Mohammad Reza Taesiri, Abhijay Ghildyal, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VideoGameQA-Bench是一个用于评估视觉-语言模型在视频游戏质量保证中性能的综合基准,涵盖视觉测试、故障检测和bug报告生成等多种任务。

Comments Project website with code and data: https://asgaardlab.github.io/videogameqa-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25374 2025-12-09 cs.AI cs.CV 81%

Saliency Guided Longitudinal Medical Visual Question Answering

基于显著性的纵向医学视觉问答

Jialin Wu, Xiaofeng Liu

机构 * Dept. of Computer Science and Engineering University of California, San Diego(计算机科学与工程系,加州大学圣地亚哥分校) Dept. of Radiology and Biomedical Imaging Yale University(放射学与生物医学成像系,耶鲁大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于显著性的纵向医学视觉问答模型,通过显著性引导的编码器-解码器结构,在保持空间一致性的同时实现高效的临床变化识别。

Comments Published in NeurIPS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05137 2025-12-08 cs.CV cs.AI 81%

ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images

ChromouVQA:在色度伪装图像下评估视觉-语言模型的基准测试

Yunfei Zhang, Yizhuo He, Yuanxun Shao, Zhengtao Yao, Haoyan Xu, Junhao Dong, Zhen Yao, Zhikang Dong

机构 * Amazon(亚马逊公司) Google(谷歌公司) MurcuryMind(MurcuryMind公司) University of Southern California(南加州大学) Nanyang Technological University(南洋理工大学) Lehigh University(莱斯大学) Stony Brook University(石溪大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 ChromouVQA通过色度伪装图像评估视觉-语言模型在复杂背景下的表现,提出对比度配方提升形状恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03463 2025-12-04 cs.CV cs.AI cs.CL 81%

Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models

文本打印图像:为以文本为中心的大型视觉-语言模型训练弥合图像-文本模态差距

Shojiro Yamabe, Futa Waseda, Daiki Shiono, Tsubasa Takahashi

机构 * Turing Inc.(图灵公司) Institute of Science Tokyo(东京科学研究院) The University of Tokyo(东京大学) Tohoku University(东北大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出文本打印图像(TPI)技术,通过生成合成图像弥合图像-文本模态差距,提升以文本为中心的大型视觉-语言模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17881 2025-11-25 cs.CV cs.AI 81%

MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use

MGA-VQA:具有记忆引导保护的图增强视觉问答系统,以防止未经授权的知识使用

Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Dheeraj Kulshrestha, Rajiv Ramnath

机构 * Ohio State University(俄亥俄州立大学) Flairsoft(Flairsoft公司)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

AI总结 MGA-VQA通过整合图增强推理和记忆引导机制,实现了更安全且可解释的文档视觉问答系统,提升了准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01357 2025-11-04 cs.CV cs.AI 81%

CMI-MTL: Cross-Mamba interaction based multi-task learning for medical visual question answering

Qiangguo Jin, Xianyao Zheng, Hui Cui, Changming Sun, Yuqi Fang, Cong Cong, Ran Su, Leyi Wei, Ping Xuan, Junbo Wang

机构 * School of Software, Northwestern Polytechnical University, Shaanxi, China(西北工业大学软件学院) Yangtze River Delta Research Institute of Northwestern Polytechnical University, Taicang, China(西北工业大学长江三角研究 institute) Department of Computer Science and Information Technology, La Trobe University, Melbourne, Australia(拉筹伯大学计算机科学与信息技术系) CSIRO Data61, Sydney, Australia(CSIRO Data61) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院) Australian Institute of Health Innovation (AIHI), Macquarie University, Australia(麦考瑞大学健康创新研究所) School of Computer Software, College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University, Macao Special Administrative Region of China(澳门理工学院人工智能驱动药物发现中心) Department of Computer Science, School of Engineering, Shantou University, Guangdong, China(汕头大学计算机科学系)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments The paper has been accepted by the 33rd Pacific Conference on Computer Graphics and Applications (Pacific Graphics 2025)

Journal ref PG2025 Conference Papers, Posters, and Demos, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01213 2025-11-04 cs.CV cs.AI 81%

Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering

Riddhi Jain, Manasi Patwardhan, Parijat Deshpande, Venkataramana Runkana

机构 * TCS-Research(TCS研究)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 10 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23344 2025-09-30 cs.CV cs.AI 81%

DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice

Zijie Meng, Jin Hao, Xiwei Dai, Yang Feng, Jiaxiang Liu, Bin Feng, Huikai Wu, Xiaotang Gai, Hengchuan Zhu, Tianxiang Hu, Yangyang Wu, Hongxia Xu, Jin Li, Jun Xiao, Xiaoqiang Liu, Joey Tianyi Zhou, Fudong Zhu, Zhihe Zhao, Lunguo Xia, Bing Fang, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Zhejiang University, Hangzhou(牙科医院,口腔医学院,浙江大学医学院,浙江大学,杭州) College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University, Hangzhou(计算机科学与技术学院,浙江大学-伊利诺伊大学 Urbana-Champaign 院,浙江大学,杭州) Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University School of Medicine(正畸科,上海第九人民医院,口腔医学院,上海交通大学医学院) Angelalign Technology Inc.(Angelalign 技术公司)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20884 2025-09-26 cs.CV cs.AI 81%

Integrating Object Interaction Self-Attention and GAN-Based Debiasing for Visual Question Answering

Zhifei Li, Feng Qiu, Yiran Wang, Yujing Xia, Kui Xiao, Miao Zhang, Yan Zhang

机构 * School of Computer Science, Hubei University(湖北大学计算机学院)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures. ACCEPTED for publication as a REGULAR paper in the IEEE Transactions on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09159 2025-09-12 cs.CV cs.AI 81%

A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering

Zhiyue Liu, Sihang Liu, Jinyuan Liu, Xinru Zhang

机构 * School of Computer, Electronics and Information(计算机、电子与信息学院) Guangxi University(广西大学) Guangxi Key Laboratory of Multimedia Communications and Network Technology(广西多媒体通信与网络技术重点实验室)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by the IEEE International Conference on Multimedia and Expo (ICME 2025) for oral presentation. © 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00102 2025-09-09 cs.CV cs.CL cs.LG 81%

ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?

Pragati Shuddhodhan Meshram, Swetha Karthikeyan, Bhavya Bhavya, Suma Bhat

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22369 2025-09-03 cs.CV cs.AI 81%

Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring

Sinh Trong Vu, Hieu Trung Pham, Dung Manh Nguyen, Hieu Minh Hoang, Nhu Hoang Le, Thu Ha Pham, Tai Tan Mai

机构 * Banking Academy of Vietnam(越南银行学院) Dublin City University(都柏林城市大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13184 2025-08-20 cs.LG cs.CV 81%

BERT-VQA: Visual Question Answering on Plots

Tai Vu, Robert Yang

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12430 2025-08-19 cs.CV cs.AI cs.CL 81%

Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations

Yahsin Yeh, Yilun Wu, Bokai Ruan, Honghan Shuai

机构 * National Yang Ming Chiao Tung University(阳明大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12036 2025-08-19 cs.CV cs.AI 81%

Q-FSRU: Quantum-Augmented Frequency-Spectral Fusion for Medical Visual Question Answering

Rakesh Thakur, Yusra Tariq

机构 * Amity Centre for Artificial Intelligence, Amity University, Noida(阿米蒂人工智能中心,阿米蒂大学,诺伊达)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments 8 pages, 4 figures Submitted to AAAI 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10869 2025-08-15 cs.CV cs.AI 81%

Medico 2025: Visual Question Answering for Gastrointestinal Imaging

Sushant Gautam, Vajira Thambawita, Michael Riegler, Pål Halvorsen, Steven Hicks

机构 * SimulaMet - Simula Metropolitan Center for Digital Engineering, Oslo, Norway(SimulaMet - Simula Metropolitan Center for Digital Engineering,挪威奥斯陆) Simula Research Laboratory, Oslo, Norway(Simula研究实验室,挪威奥斯陆) OsloMet - Oslo Metropolitan University, Oslo, Norway(OsloMet - 奥斯陆 Metropolitan 大学,挪威奥斯陆)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08137 2025-08-12 cs.LG cs.AI cs.SY eess.SY 81%

MuaLLM: A Multimodal Large Language Model Agent for Circuit Design Assistance with Hybrid Contextual Retrieval-Augmented Generation

Pravallika Abbineni, Saoud Aldowaish, Colin Liechty, Soroosh Noorzad, Ali Ghazizadeh, Morteza Fayazi

机构 * University of Utah(犹他大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21586 2025-08-08 cs.CL cs.AI cs.CV 81%

Can Vision Language Models Understand Mimed Actions?

Hyundong Cho, Spencer Lin, Tejas Srinivasan, Michael Saxon, Deuksin Kwon, Natali T. Chavez, Jonathan May

机构 * Information Sciences Institute(信息科学研究所) Institute for Creative Technologies(创意技术研究所) Department of Computer Science(计算机科学系) University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Aristotle University of Thessaloniki(希腊雅典纳大学)

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04469 2025-07-29 cs.CV cs.AI 81%

Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering

Imad Eddine Marouf, Enzo Tartaglione, Stephane Lathuiliere, Joost van de Weijer

机构 * LTCI, Télécom-Paris, Institut Polytechnique de Paris(LTCI, Télécom-Paris, Institut Polytechnique de Paris) Inria, LJK, Univ. Grenoble Alpes(Inria, LJK, 火车头 Grenoble Alpes) Universitat Autónoma de Barcelona(Autonomous University of Barcelona)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments ICCV 2025, 8 pages. Code: https://github.com/IemProg/QUAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08870 2025-07-01 cs.CL cs.AI cs.LG 81%

The Limited Impact of Medical Adaptation of Large Language and Vision-Language Models

Daniel P. Jeong, Pranav Mani, Saurabh Garg, Zachary C. Lipton, Michael Oberst

机构 * Carnegie Mellon University(卡内基梅隆大学) Abridge Mistral AI Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Extended version of EMNLP 2024 paper arXiv:2411.04118. Includes additional results on clinical note QA tasks and supervised fine-tuning evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18322 2025-06-24 cs.CV cs.LG 81%

Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?

Yiwei Yang, Chung Peng Lee, Shangbin Feng, Dora Zhao, Bingbing Wen, Anthony Z. Liu, Yulia Tsvetkov, Bill Howe

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17903 2025-06-24 cs.CV cs.AI 81%

Cause-Effect Driven Optimization for Robust Medical Visual Question Answering with Language Biases

Huanjia Zhu, Yishu Liu, Xiaozhao Fang, Guangming Lu, Bingzhi Chen

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong University of Technology(广东工业大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏