arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1439 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 301 篇

2501.19274 2026-06-26 cs.RO 版本更新 82%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract)

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27278 2026-08-04 cs.CV 版本更新 81%

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00056 2026-08-13 cs.CY cs.AI cs.CL 版本更新 81%

How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?

VLMs在帮助人类推断从多模态简答中获得的思维模型质量的有效性如何?

Pritam Sil, Durgaprasad Karnam, Vinay Reddy Venumuddala, Pushpak Bhattacharyya

机构 * Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔分校计算机科学与工程系) Center for Educational Technology, IIT Bombay(印度理工学院班加罗尔分校教育技术中心) School of Management, Mahindra University(马恒达大学管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMGrader方法,通过概念图框架从多模态回答推断学生思维模型质量,发现最佳模型在人类水平上表现不足,但能有效辅助教师改进教学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17332 2026-08-13 cs.CV cs.AI 版本更新 81%

P2MFDS: A Privacy-Preserving Multimodal Fall Detection System for Elderly People in Bathroom Environments

P2MFDS:面向浴室环境老年人的隐私保护多模态跌倒检测系统

Haitian Wang, Yiren Wang, Xinyu Wang, Yumeng Miao, Yuliang Zhang, Yu Zhang, Atif Mansoor

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对浴室环境老年人跌倒检测的单模态系统准确率受限问题,本文提出P2MFDS多模态系统,融合毫米波雷达与3D振动传感,构建大规模隐私保护数据集,双流网络结合多尺度特征,提升了跌倒检测的准确率与召回率。

Comments Accepted to appear in the 2025 IEEE International Workshop on AIoT and Smart Systems (AIoTSys'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 81%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03162 2026-08-11 cs.CY cs.AI cs.CL cs.LG 版本更新 81%

MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks

MateInfoUB:用于测试大型语言模型(LLMs)在竞争性、多语言及多模态教育任务中表现的真实世界基准

Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了双语多模态计算机科学竞赛题数据集,评估当前最先进LLMs在该数据集上的表现,揭示其优劣势及语言选择的影响,还发布了教育应用以支持罗马尼亚学生自我评估。

Comments 14 pages (9 paper, 2 references, 3 annexes). Accepted for BEA 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22144 2026-08-04 cs.CV cs.AI 版本更新 81%

SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis

SAGE:面向多模态学习与幻觉分析的专家标注南亚胃肠内镜数据集

Niyoj Oli, Sachin Acharya, Sandesh Pokhrel, Sanjay Bhandari, Ramesh Rana, Nikesh Mani Shrestha, Ram Bahadur Gurung, Yash Raj Shrestha, Prashnna K Gyawali, Binod Bhattarai

机构 * Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所) GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科) Univesity of Lausanne(洛桑大学) University of West Virginia(西弗吉尼亚大学) University of Utah(犹他大学) University of Aberdeen(阿伯丁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 为解决南亚地区胃肠癌诊断数据缺乏问题,构建了包含1300张图像、标注和问答对的SAGE数据集,并评估了模型在人口偏移下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23886 2026-08-03 cond-mat.mtrl-sci cs.AI cs.CL cs.DL cs.IR 版本更新 81%

Harnessing X-ray Absorption Spectroscopy Data through Multimodal Mining of Battery Literature

通过电池文献的多模态挖掘利用X射线吸收光谱数据

Tanjin He, Aikaterini Vriza, Logan Ward, Xu Huang, Yiming Chen, Anubhav Jain, Gerbrand Ceder, Rajeev S. Assary, Ian T. Foster, Maria K. Y. Chan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用多模态文献挖掘将电池文献中分散的X射线吸收光谱数据转化为可用于人工智能的实验数据资源,开发数字化管道并应用于电池文献,产生开放数据集,为相关分析、比较及材料发现提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27069 2026-07-31 cs.CV cs.AI 版本更新 81%

Visual Credit Audit for Multimodal Spatial Reasoning

多模态空间推理的视觉信用审计

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

专题命中 多模态评测 :multimodal(title);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。

Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14546 2026-07-29 cs.CV cs.AI 版本更新 81%

Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research

利用ChatGPT的多模态视觉能力按贫困水平对卫星图像进行排名:推进社会科学研究工具

Hamid Sarmadi, Ola Hall, Thorsteinn Rögnvaldsson, Mattias Ohlsson

机构 * Center for Applied Intelligent Systems Research (CAISR), Halmstad University, Sweden(应用智能系统研究中心(CAISR),哈马斯特德大学,瑞典) Department of Human Geography, Lund University, Sweden(人类地理系,吕勒奥大学,瑞典) Department of Earth and Environmental Sciences, Lund University, Sweden(地球与环境科学系,吕勒奥大学,瑞典)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究利用具视觉能力的大语言模型分析卫星图像预测村级贫困,通过成对比较方法证明ChatGPT能按贫困水平排名卫星图像,准确性与专家相当,凸显LLMs在社会经济研究中的前景与局限,为贫困监测等提供基础并引发对公共数据集可靠性的思考。

Comments A code and data availability statement, along with the repository address, has been added to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07263 2026-07-28 cs.HC cs.CV cs.MM 版本更新 81%

BATON: A Multimodal Benchmark for Bidirectional Automation Transition Observation in Naturalistic Driving

BATON:一种多模态基准,用于自然驾驶中的双向自动化过渡观察

Yuhang Wang, Yiyao Xu, Chaoyun Yang, Lingyao Li, Jingran Sun, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 BATON通过多模态数据捕捉真实驾驶自动化场景,定义了驾驶动作理解、手柄预测和接管预测三个任务,证明多模态数据融合对提升自动化过渡预测的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08884 2026-07-14 cs.CV cs.CL cs.LG 版本更新 81%

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

SpurLens:多模态大语言模型中虚假线索的自动检测

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23916 2026-07-08 cs.CV cs.AI 版本更新 81%

DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning

DecepGPT: 基于多文化数据集和鲁棒多模态学习的模式驱动欺骗检测

Jiajian Huang, Dongliang Zhu, Zitong YU, Hui Ma, Jiayu Zhang, Chunmei Zhu, Xiaochun Cao

机构 * Great Bay University(Great Bay大学) Wuhan University(武汉大学) Sun Yat-sen University(孙中山大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DecepGPT,通过构建包含结构化线索描述和推理链的推理数据集,释放多文化数据集T4-Deception,并提出SICS和DMC模块,实现多模态欺骗检测的鲁棒学习,实验表明其在领域内和跨领域场景中均取得最佳性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01858 2026-07-07 cs.CL cs.AI 版本更新 81%

Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents

Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理

Yuhan Guo, Cong Guo, Aiwen Sun, Hongliang He, Xinyu Yang, Yue Lu, Yingji Zhang, Xuntao Guo, Dong Zhang, Jianzhuang Liu, Jiang Duan, Yijia Xiao, Liangjian Wen, Hai-Ming Xu, Yong Dai

机构 * Southwestern University of Finance and Economics(西南财经大学) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) Hithink Research(Hithink研究) Westlake University(西湖大学) Harbin Institute of Technology(哈尔滨工业大学) University of Manchester(曼彻斯特大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Adelaide(阿德莱德大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。

Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15320 2026-07-07 q-bio.QM cs.CV cs.LG cs.MM q-bio.GN 版本更新 81%

GestaltMML: Enhancing Rare Genetic Disease Diagnosis through Multimodal Machine Learning Combining Facial Images and Clinical Text

GestaltMML:通过结合面部图像和临床文本的多模态机器学习增强罕见遗传病诊断

Da Wu, Zhanliang Wang, Hongzhuo Chen, Jingye Yang, Cong Liu, Tzung-Chien Hsieh, Elaine Marchi, Justin Blair, Peter Krawitz, Chunhua Weng, Wendy Chung, Gholson J. Lyon, Ian D. Krantz, Jennifer M. Kalish, Kai Wang

机构 * Raymond G. Perelman Center for Cellular and Molecular Therapeutics, Children’s Hospital of Philadelphia(雷蒙德·G·佩尔曼细胞与分子治疗中心,费城儿童医院) Department of Mathematics, University of Pennsylvania(数学系,宾夕法尼亚大学) Department of Biomedical Informatics, Columbia University Irving Medical Center(生物医学信息学系,哥伦比亚大学伊万斯医疗中心) Department of Human Genetics, New York State Institute for Basic Research in Developmental Disabilities, Staten Island, NY, USA(人类遗传学系,纽约州发育障碍基础研究机构,纽约州史泰登岛) Division of Human Genetics, Children’s Hospital of Philadelphia(人类遗传学部,费城儿童医院) Department of Pediatrics, Boston Children’s Hospital, Harvard Medical School(儿科系,波士顿儿童医院,哈佛医学院) Biology PhD Program, The Graduate Center, The City University of New York(生物学博士项目,纽约市立大学研究生中心) Department of Genetics, Perelman School of Medicine, University of Pennsylvania(遗传学系,宾夕法尼亚大学佩尔曼医学学院) Department of Pediatrics, Perelman School of Medicine, University of Pennsylvania(儿科系,宾夕法尼亚大学佩尔曼医学学院) Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学佩尔曼医学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 研究针对罕见遗传病诊断难题,提出基于Transformer架构的多模态机器学习方法GestaltMML,整合面部图像、人口统计学信息和临床笔记,提升预测准确性,缩小诊断差距。

Comments Preprint updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10873 2026-06-19 cs.CV cs.AI 版本更新 81%

CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation

CADBench:一个用于AI辅助CAD程序生成的多模态基准

Anna C. Doris, Jacob Thomas Sony, Ghadi Nehme, Era Syla, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CADBench,一个统一的多模态CAD程序生成基准,包含18000个样本和六类基准,评估11种视觉语言模型,揭示了CAD程序生成中的三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-06-12 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14342 2026-06-09 cs.CV cs.AI 版本更新 81%

AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning

AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理

Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgroOmni数据集,通过288K视觉问答对覆盖56个专业任务类别,解决多视角跨尺度农业多模态推理中的尺度偏差问题,提出AgroNVILA模型在AgroMind基准上达到62.32%的SOTA成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02983 2026-06-09 cs.CL cs.CV 版本更新 81%

Hummus: A Dataset of Humorous Multimodal Metaphor Use

Hummus:幽默多模态隐喻使用数据集

Xiaoyu Tong, Zhi Zhang, Pia Sommerauer, Martha Lewis, Ekaterina Shutova

机构 * ILLC, University of Amsterdam, the Netherlands(阿姆斯特丹大学语言学研究所,荷兰) Vrije Universiteit Amsterdam, the Netherlands(阿姆斯特丹自由大学,荷兰)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出幽默多模态隐喻数据集Hummus,基于不一致理论和概念隐喻理论设计标注方案,测试多模态大语言模型在检测和理解幽默多模态隐喻上的表现,发现现有模型仍存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 81%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11192 2026-07-16 cs.CV 版本更新 80%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新 80%

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23733 2026-08-13 cs.CL 版本更新 79%

Multimodal QUD: Inquisitive Questions from Scientific Figures

多模态QUD:来自科学图表的探究性问题

Yating Wu, William Rudman, Venkata S Govindarajan, Alexandros G. Dimakis, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Ithaca College(伊萨卡学院) UC Berkeley, BespokeLabs.ai(伯克利大学,BespokeLabs.ai)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态QUD数据集,通过结合图表与文本上下文生成探究性问题,提升多模态推理能力,实现更高质量的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 79%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05844 2026-08-10 cs.CV 版本更新 79%

Curia-MAE: Multi-Modal Multi-Anatomy MAE Pre-Training for 3D Medical Image Segmentation

Curia-MAE:面向3D医学图像分割的多模态多解剖区域掩码自编码器预训练方法

Théo Danielou, Antoine Saporta, Léo Alberge, Corentin Dancette

机构 * Raidium(雷迪厄姆)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Curia-MAE,通过改进MAE预训练目标,在30万张CT和MRI图像上预训练的多模态多解剖区域模型,可提升冻结编码器下的3D医学图像分割性能,尤其适用于标注数据稀缺的病灶任务。

Comments Accepted at ECCV 2026 Workshop AI4M3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13108 2026-08-10 cs.RO cs.CV eess.IV 版本更新 79%

Panoramic Multimodal Semantic Occupancy Prediction for Quadruped Robots

四足机器人全景多模态语义占用预测

Guoqiang Zhao, Zhe Yang, Sheng Wu, Fei Teng, Mengfei Duan, Yuanfan Zheng, Kai Luo, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PanoMMOcc数据集和VoxelHound框架,通过垂直抖动补偿和多模态信息融合提升四足机器人全景多模态3D感知性能。

Comments The dataset and code will be publicly released at https://github.com/SXDR/PanoMMOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04514 2026-08-07 cs.CL 版本更新 79%

RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

RESPClinBench:呼吸专科医疗中的多模态临床决策与纵向疾病管理基准测试

Mouxiao Bian, Zhi Chen, Ruiyao Chen, Lu Lu, Hengrui Liang, Chaoyi Huang, Yiluo Lin, Jingru Ding, Yun Zhong, Yueming Su, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Macau University of Science and Technology(澳门科技大学) First Affiliated Hospital of Guangzhou Medical University(广州医科大学附属第一医院) Guangzhou Institute of Respiratory Health(广州呼吸健康研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究开发了呼吸专科多模态临床决策与纵向疾病管理基准RESPClinBench,在两个数据集上评估7种大模型,识别模型在肺结节评估和COPD管理的局限,为模型选择提供临床依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21105 2026-08-06 cs.CV 版本更新 79%

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

HalluScope:多模态大语言模型的细粒度幻觉诊断

Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, Zhonghai Wu

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型的幻觉问题,提出细粒度幻觉诊断任务,开发数据集并设计奖励函数,训练HalluScope-4B和HalluScope-8B模型,在多个基准测试中达最优,其诊断解释能有效指导目标模型纠正幻觉。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10783 2026-08-06 cs.CV 版本更新 79%

LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content

LiveXiv —— 基于 arXiv 论文内容的多模态实时基准测试集

Nimrod Shabtay, Felipe Maia Polo, Sivan Doveh, Wei Lin, M. Jehanzeb Mirza, Leshem Choshen, Mikhail Yurochkin, Yuekai Sun, Assaf Arbelle, Leonid Karlinsky, Raja Giryes

机构 * Faculty of Engineering Tel-Aviv University(特拉维夫大学工程学院) IBM Research(IBM研究院) Department of Statistics, University of Michigan(密歇根大学统计学系) JKU Linz, Austria(林茨大学,奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM(麻省理工学院-IBM)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对多模态模型训练中测试数据污染问题,提出基于 arXiv 论文的 LiveXiv 实时基准,自动生成 VQA 对,用部分模型评估降低成本,验证了其性能差异极小,数据集已在 HuggingFace 公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05938 2026-08-04 cs.AI 版本更新 79%

ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

ICU-Bench: 多模态大语言模型持续反学习基准测试

Yuhang Wang, Wenjie Mei, Junkai Zhang, Guangyu He, Zhenxing Niu, Haichang Gao

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ICU-Bench,用于评估多模态大语言模型在持续隐私删除中的性能,包含1000个敏感资料和9500张图像,引入新指标分析遗忘效果与稳定性,揭示现有方法在持续场景下的局限。

Comments 21 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏