arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2602.16689 2026-02-19 cs.CV cs.LG 62%

Are Object-Centric Representations Better At Compositional Generalization?

基于对象中心表示的组合泛化能力是否更强?

Ferdinand Kapl, Amir Mohammad Karimi Mamaghan, Maximilian Seitzer, Karl Henrik Johansson, Carsten Marr, Stefan Bauer, Andrea Dittadi

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) KTH Royal Institute of Technology(皇家理工学院) MPI for Intelligent Systems, Tübingen(图宾根人工智能研究所) Institute of AI for Health, Computational Health Center, Helmholtz Munich(健康人工智能研究所,计算健康中心,海德堡慕尼黑)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过三个视觉世界基准,发现对象中心表示在组合泛化任务中表现更优,尤其在数据受限时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 62%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 62%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00029 2026-02-03 cs.CL cs.AI cs.LG 62%

Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management

构建、对齐与推理:面向企业知识管理的大型本体模型

Yao Zhang, Hongyin Zhu

机构 * Yonyou AI Lab(用友人工智能实验室) Yonyou Network Technology Co., Ltd.(用友网络技术有限公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大型本体模型(LOM),通过构建、对齐和推理框架,实现企业知识管理中多源异构数据的整合与复杂语义推理,实验表明其在复杂图推理任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20705 2026-01-29 cs.CV cs.AI 62%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 62%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20298 2026-01-27 cs.CL cs.AI cs.CV 62%

MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding

MangaVQA和MangaLMM:多模态漫画理解的基准和专用模型

Jeonghun Baek, Kazuki Egashira, Shota Onohara, Atsuyuki Miyai, Yuki Imajuku, Hikaru Ikuta, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MangaVQA和MangaLMM,用于多模态漫画理解的基准和专用模型,通过视觉问答和文本识别任务提升漫画叙事理解能力。

Comments EACL 2026 Findings. Project page: https://manga109.github.io/MangaVQA_LMM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18536 2026-01-27 cs.CV cs.CL cs.IR cs.LG 62%

FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA

FilterRAG: 零样本引导式检索增强生成以缓解视觉问答中的幻觉

Nobin Sarwar

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 FilterRAG通过结合BLIP-VQA与检索增强生成,利用外部知识源减少视觉问答中的幻觉问题,提升模型在知识驱动和分布外场景的鲁棒性。

Comments 12 pages, 6 figures and 2 tables; Accepted at ICCV 2025 Workshop on Building Foundation Models You Can Trust (T2FM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 62%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18177 2026-01-21 cs.CV cs.LG cs.MA 62%

Scene-Aware Vectorized Memory Multi-Agent Framework with Cross-Modal Differentiated Quantization VLMs for Visually Impaired Assistance

具有跨模态差异化量化功能的场景感知向量内存多智能体框架用于视障辅助

Xiangxiang Wang, Xuanyu Wang, YiJia Luo, Yongbin Yu, Manping Fan, Jingtao Zhang, Liyong Ren

机构 * School of Information Software Engineering, University of Electronic Science Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Faculty of Computing, Harbin Institute of Technology, Harbin, China

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种具有跨模态差异化量化的多智能体框架,通过减少内存消耗和提升处理效率,为视障人士提供更高效的环境感知与辅助导航支持。

Comments 28 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00138 2026-01-16 cs.AI cs.CV 62%

Explicit Abstention Knobs for Predictable Reliability in Video Question Answering

可预测可靠性中的显式回避调节器用于视频问答

Jorge Ortiz

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Rutgers University(罗格斯大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过置信度阈值控制视频问答中的错误率,验证了在分布偏移下置信度回避机制的可靠性。

Comments Preprint. Diagnostic study of confidence-based abstention under evidence truncation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD 62%

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21518 2026-01-15 cs.CV cs.CL cs.LG 62%

Head Pursuit: Probing Attention Specialization in Multimodal Transformers

头部追踪:探究多模态转换器中的注意力专业化

Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello, Alberto Cazzaniga

机构 * Area Science Park(面积科学公园) Sapienza University of Rome(罗马萨皮恩扎大学) Institute of Science and Technology(科学与技术研究所)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过分析多模态转换器中注意力头的专业化,揭示了模型内部可控的结构,并展示了通过编辑少量头部以增强或抑制特定概念的可行性。

Comments Accepted at NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06189 2026-01-13 cs.AI cs.LG 62%

Rational Synthesizers or Heuristic Followers? Analyzing LLMs in RAG-based Question-Answering

理性合成器还是启发式追随者?分析基于检索增强生成的问答系统

Atharv Naphade

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文通过GroupQA数据集分析LLM在基于检索增强生成的问答系统中如何整合冲突证据,发现模型倾向于优先证据且解释不忠实,表明LLM作为脆弱的启发式追随者。

Comments 13 pages, 9 figures, ACL ARR submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06097 2026-01-13 cs.CV cs.AI 62%

Semantic Event Graphs for Long-Form Video Question Answering

语义事件图用于长视频问答

Aradhya Dixit, Tianxi Liang

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 语义事件图通过轻量级符号接口提升长视频问答效率,减少令牌使用并保持推理能力。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17722 2026-01-09 cs.CV cs.AI 62%

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu

机构 * Fudan University(复旦大学) NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。

Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02382 2026-01-07 cs.NI cs.AI cs.IR cs.LG 62%

How to Discover Knowledge for FutureG: Contextual RAG and LLM Prompting for O-RAN

如何为未来G发现知识:面向O-RAN的上下文RAG和LLM提示

Nathan Conger, Nathan Scollar, Kemal Davaslioglu, Yalin E. Sagduyu, Sastry Kompella

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出上下文RAG方法,通过引导文档检索和上下文增强LLM性能,提升ORAN领域问答的准确性和效率,同时保持低运行时间和碳排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24340 2026-01-01 cs.CV cs.AI cs.CL 62%

DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images

DermaVQA-DAS:皮肤科评估方案(DAS)及用于患者生成皮肤科图像中封闭式问答与分割的数据库

Wen-wai Yim, Yujuan Fu, Asma Ben Abacha, Meliha Yetisgen, Noel Codella, Roberto Andres Novoa, Josep Malvehy

机构 * Microsoft Health AI(微软健康人工智能) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Hospital Clinic of Barcelona(巴塞罗那医院诊所)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DermaVQA-DAS引入了皮肤科评估方案DAS,支持封闭式问答与分割任务,通过专家标注数据集和多模态模型评估,提升患者为中心的皮肤科视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00743 2026-01-01 cs.CL cs.AI cs.LG 62%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI 62%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17213 2025-12-22 cs.CV cs.LG 62%

CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency

CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化

Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院) School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CheXPO-v2通过知识图谱一致性奖励机制,提升胸片VLMs的临床可靠性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14017 2025-12-17 cs.CV cs.AI 62%

KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding

KFS-Bench: 长视频理解中关键帧采样的全面评估

Zongyao Li, Kengo Ishida, Satoshi Yamazaki, Xiaotong Ji, Jianquan Liu

机构 * Visual Intelligence Research Laboratories, NEC Corporation(NEC公司视觉智能研究实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 KFS-Bench通过多场景标注评估关键帧采样策略,提出新度量标准和方法提升问答性能。

Comments WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13164 2025-12-17 cs.CV cs.AI 62%

A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis

语义增强的生成基础模型提升病理图像合成

Xianchao Guan, Zhiyuan Fan, Yifeng Wang, Fuqiang Chen, Yanjiang Zhou, Zengyang Che, Hongxue Meng, Xin Li, Yaowei Wang, Hongpeng Wang, Min Zhang, Heng Tao Shen, Zheng Zhang, Yongbing Zhang

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 CRAFTS通过语义增强的生成基础模型提升病理图像合成质量,生成多样化病理图像并增强多种临床任务性能。

Comments 68 pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11872 2025-12-17 cs.RO cs.AI cs.CV 62%

WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving

WAM-Diff: 一种结合MoE和在线强化学习的掩码扩散VLA框架用于自动驾驶

Mingwang Xu, Jiahao Cui, Feipeng Cai, Hanlin Shang, Zhihao Zhu, Shan Luan, Yifang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(云网智能科技有限公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 WAM-Diff通过结合MoE和在线强化学习的掩码扩散框架,提升自动驾驶轨迹生成的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19094 2025-12-04 cs.CV cs.AI 62%

SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring

SATORI-R1: 通过显式视觉锚定激励多模态推理

Chuming Shen, Wei Wei, Xiaoye Qu, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 SATORI-R1通过显式视觉锚定提升多模态推理,采用三个可验证阶段和VQA-Verify数据集,在VQA任务中实现15.7%的准确率提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02485 2025-12-03 cs.CV cs.AI 62%

UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making

UCAgents: 视觉证据锚定的多智能体医学决策收敛

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 UCAgents通过结构化证据审计和单向收敛机制,在医疗视觉问答中提升准确率并降低计算成本,平衡视觉证据揭示与文本干扰避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14227 2025-12-02 cs.CV cs.AI 62%

VoQA: Visual-only Question Answering

VoQA:仅视觉的问题回答

Jianing An, Luyang Jiang, Jie Luo, Wenjun Wu, Lei Huang

机构 * SKLCCSE, School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州国际创新研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 VoQA通过仅依赖视觉信息回答问题,改进了传统VQA的局限性,通过问题对齐微调策略提升纯视觉推理能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 62%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14914 2025-11-27 cs.CV cs.CL cs.LG 62%

CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness

CAPability: 一个全面的视觉描述基准,用于评估正确性和全面性

Zhihang Liu, Chen-Wei Xie, Bin Wen, Feiwu Yu, Jixuan Chen, Pandeng Li, Boqiang Zhang, Nianzu Yang, Yinglu Li, Zuan Gao, Yun Zheng, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 CAPability是一个全面的视觉描述基准,通过12个维度评估描述的正确性和全面性,利用人类标注数据和启发式指标提升多模态模型的描述能力分析。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 62%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏