The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?
感知挑战:多模态大语言模型能否解决简单感知问题?
机构 * IIT Delhi(德里印度理工学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
感知挑战:多模态大语言模型能否解决简单感知问题?
机构 * IIT Delhi(德里印度理工学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。
Chat-TS: 提升时间序列与自然语言数据的多模态推理能力
机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) ; Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) ; Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)
专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。
多阶段验证导向框架用于缓解多模态RAG中的幻觉
机构 * The University of New South Wales(新南威尔士大学)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。
Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task
感知、理解和推理,一个用于视频虚假新闻检测的多模态基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学)
专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出POVFNDB多模态基准,通过10个任务系统评估MLLMs在视频虚假新闻检测中的感知、理解和推理能力,并通过微调Qwen2.5VL-7B-Instruct达到最先进的性能。
ROMA: 实时多模态助手与交互式流式理解
机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。
Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show
GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。
Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material
如果TSF:一个用于将预测重新框架化为基于场景的多模态预测的基准
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 What If TSF是一个用于评估模型是否能根据上下文文本,特别是未来场景,进行多模态预测的基准。
Comments 30 pages, 5 figures
MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性
机构 * Beijing Jiaotong University(北京交通大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Renmin University of China(中国人民大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。
Comments AAAI2026 Oral
PulseMind: 一种多模态医学模型用于真实世界临床诊断
机构 * Ant Group(蚂蚁集团)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 PulseMind通过整合多模态数据集和定制训练框架,提升真实世界临床诊断的准确性与实用性。
Comments Accepted to AAAI 2026
SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准
机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。
Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices
MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估
机构 * University of Notre Dame(诺丁汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Montreal(蒙特利尔大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。
Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings
PsOCR:用于低资源帕什托语言光学字符识别的大型多模态模型基准测试
机构 * organization= Shien-Ming Wu School of Intelligent Manufacturing, South China University of Technology , city= Guangzhou , postcode= 511442 , country= China ; organization= Artificial Intelligence Department, Guangdong CAS Angels Biotechnology Co. Ltd. , city= Foshan , country= China ; organization= Department of Software Engineering, Faculty of Electrical \& Computer Engineering, University of Engineering \& Technology , city= Peshawar , postcode= 25000 , country= Pakistan
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 PsOCR通过合成数据评估大型多模态模型在低资源帕什托语言OCR中的性能,发现Gemini表现最佳,Qwen-7B在开源模型中表现突出。
AtomThink: 多模态慢思考与原子步骤推理
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; ETH Zurich(苏黎世联邦理工学院) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Hong Kong(香港大学) ; Noah’s Ark Lab(诺亚实验室) ; Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。
Comments TPAMI accepted
MT-Video-Bench: 一个多轮对话中评估多模态大语言模型的综合视频理解基准
机构 * Fudan University(复旦大学) ; NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) ; University of Science and Technology of China(中国科学技术大学) ; Kuaishou Technology(快手科技)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 MT-Video-Bench通过评估多轮对话中多模态大语言模型的6项核心能力,揭示其在处理多轮视频对话任务中的性能差异和局限性。
Comments Project Website: https://github.com/NJU-LINK/MT-Video-Bench
注意你的推理:一种用于多模态立场检测双推理的元认知直观-反思网络
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM
AI总结 MIND通过元认知直观-反思机制,在多模态立场检测中实现双推理,提升立场判断的准确性和泛化能力。
利用多模态深度学习进行胎盘增生谱检测
机构 * Department of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University(计算机科学系,计算与信息科技学院,国王阿卜杜勒阿齐兹大学) ; Department of Radiology, King Abdulaziz University Hospital(放射科,国王阿卜杜勒阿齐兹大学医院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出多模态深度学习方法,通过整合3D MRI和2D US数据,提高胎盘增生谱检测的准确率和AUC值,有效提升产前风险评估能力。
OFFSIDE: 多模态大语言模型中误信信息消除的基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) ; National University of Singapore(新加坡国立大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。
UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。
TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM
AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。
Comments AAAI 2026 Oral
OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析
机构 * Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) ; Southern Medical University(南方医科大学) ; Zhongshan Hospital, Fudan University(复旦大学中山医院) ; Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。
跨模态反事实解释:在主观分类中揭示决策因素和数据集偏见
机构 * EPFL(瑞士联邦理工学院)
专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出DeX框架,通过跨模态分解和图像特定概念生成自然语言反事实解释,揭示主观分类中的决策因素和数据集偏见,提升模型公平性。
脸上微笑,眼中悲伤:通过眼和面部行为的多模态数据集弥合情感差距
机构 * School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) ; School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机科学学院) ; School of Computing, Engineering and Mathematical Sciences, La Trobe University(拉筹伯大学计算科学、工程与数学科学学院)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文通过构建包含眼行为和面部行为的多模态数据集EMER,提出EMERT模型以提升情感识别的鲁棒性。
Comments Accepted by TMM
MMGR:多模态生成推理
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Michigan State University(密歇根州立大学) ; University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Adelaide(阿德莱德大学) ; Salesforce AI Research(Salesforce人工智能研究) ; Microsoft(微软) ; Adobe Research(Adobe研究)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL
AI总结 MMGR提出一个多模态生成推理评估框架,通过物理、逻辑、空间和时间五个能力评估视频和图像生成模型,揭示其在抽象推理和具身导航中的性能不足。
Comments work in progress
少样本多模态医学影像:一个理论框架
机构 * The University of Tulsa 800 S Tucker Dr, Tulsa, OK 74104, USA(塔尔萨大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出少样本多模态医学影像的理论框架,通过样本复杂性、不确定性量化和可解释性分析,为低资源环境下的高效、可靠诊断模型设计提供理论基础。
Comments 6 Pages
Octopus: 六种能力协同的代理多模态推理
机构 * Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。
MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Snap Inc(Snap公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。
大规模多模态数据集与基准用于人类活动场景理解和推理
机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学) ; University of Pittsburgh(匹兹堡大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。
CAuSE:利用忠实的自然语言解释解码多模态分类器
机构 * Indian Institute of Technology Patna(印度理工学院帕纳瓦分校) ; Queen’s University Belfast(贝尔法斯特女王大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 CAuSE提出了一种生成多模态分类器忠实自然语言解释的新框架,通过因果抽象和交换干预提升解释的因果忠实性,并在多模态设置中验证其有效性。
Comments Accepted at Transactions of the Association for Computational Linguistics (TACL). Pre-MIT Press publication version
OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方
机构 * MiroMind AI ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; LMMs-Lab Team(多模态实验室团队)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。
FireSentry: 一种多模态时空基准数据集用于细粒度野火蔓延预测
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; College of Soil and Water Conservation, Southwest Forestry University(西南林业大学水土保持学院) ; College of Civil Engineering, Southwest Forestry University(西南林业大学土木工程学院)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 FireSentry提出了一种多模态野火数据集和FiReDiff双模态范式,用于细粒度野火预测和动态灾害模拟,显著提升了视频和火斑掩膜的预测精度。