arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 298 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 298 篇

2601.21173 2026-07-01 cs.RO cs.CV 版本更新 83%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05913 2026-06-10 cs.CV 版本更新 83%

A fine-grained attention and geometric correspondence model for musculoskeletal risk classification in athletes using multimodal visual and skeletal features

基于多模态视觉和骨骼特征的运动员肌肉骨骼风险分类的细粒度注意力与几何对应模型

Md. Abdur Rahman, Mohaimenul Azam Khan Raiaan, Tamanna Shermin, Md Rafiqul Islam, Mukhtar Hussain, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, Dhaka(应用人工智能与智能系统实验室,达卡)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ViSK-GAT多模态框架,融合图像和骨骼坐标特征,通过细粒度注意力模块和几何对应模块实现运动员肌肉骨骼风险八级分类,关键指标超93%。

Comments Published in Computers and Electrical Engineering

Journal ref Computers and Electrical Engineering, Vol. 138, 111281, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 82%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 多模态评测 :MLLM(title_cn,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 82%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19634 2026-08-11 cs.CL cs.AI cs.CV cs.SD 版本更新 82%

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

MCIF: 多模态跨语言指令遵循基准从科学讲座

Sara Papi, Maike Züfle, Marco Gaido, Beatrice Savoldi, Danni Liu, Ioannis Douros, Luisa Bentivogli, Jan Niehues

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MCIF是首个多模态跨语言指令遵循基准,通过科学讲座数据评估模型在跨语言、多模态环境下处理不同输入长度的任务能力。

Comments Data available at https://huggingface.co/datasets/FBK-MT/MCIF | Evaluation, outputs, and baselines available at https://github.com/hlt-mt/mcif

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27723 2026-08-10 cs.LG 版本更新 82%

TMTE: Effective Multimodal Graph Learning with Task-aware Modality and Topology Co-evolution

TMTE: 有效多模态图学习中的任务感知模态与拓扑共进化

Yinlin Zhu, Xunkai Li, Di Wu, Wang Luo, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University(中山大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出TMTE框架,通过任务感知的模态与拓扑共进化方法,解决多模态图学习中图拓扑质量不足的问题,实现多视角度量学习与跨模态对齐,提升下游任务性能。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04954 2026-08-04 cs.LG hep-ex hep-ph physics.comp-ph physics.data-an 版本更新 82%

Amortized Inference of Multi-Modal Posteriors using Likelihood-Weighted Normalizing Flows

利用似然加权归一化流进行多模态后验的平均推断

Rajneil Baruah

机构 * Department of Physics, SEAS, Bennett University, Greater Noida, Uttar Pradesh, India, 201310(物理系,Bennett大学,Greater Noida,印度)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本文提出利用归一化流和似然加权重要性采样进行多模态后验推断,通过高斯混合模型初始化提升重建质量。

Comments 27 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12775 2026-07-21 cs.MM cs.AI cs.CL 版本更新 82%

Unsupervised Multimodal Clustering for Semantics Discovery in Multimodal Utterances

用于多模态话语语义发现的无监督多模态聚类

Hanlei Zhang, Hua Xu, Fei Long, Xin Wang, Kai Gao

机构 * State Key Laboratory of Intelligent Technology and Systems, Department of Computer Science and Technology, Tsinghua University(智能技术与系统国家重点实验室,计算机科学与技术系,清华大学) School of Information Science and Engineering, Hebei University of Science and Technology(信息科学与工程学院,河北科技大学) Samton (Jiangxi) Technology Development Co.,Ltd(江西松通科技发展有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本文针对多模态话语语义发现问题,提出无监督多模态聚类方法UMC。通过构建增强视图预训练、动态选样及自动确定参数优化样本选择,在基准数据集上实验,UMC比现有方法聚类指标提升2-7%,取得开创性成果。

Comments Accepted by ACL 2024, Main Conference, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 82%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03430 2026-07-14 cs.RO 版本更新 82%

ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response

ProAct:用于结构感知主动响应的基准和多模态框架

Xiaomeng Zhu, Fengming Zhu, Weijie Zhou, Ye Tian, Zhenlin Hu, Yufei Huang, Yuchun Guo, Xinyu Wu, Zhengyou Zhang, Fangzhen Lin, Xuantang Xiong

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) Tencent, Shenzhen, China(腾讯(中国深圳)) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract)

AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19274 2026-06-26 cs.RO 版本更新 82%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract)

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27278 2026-08-04 cs.CV 版本更新 81%

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00056 2026-08-13 cs.CY cs.AI cs.CL 版本更新 81%

How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?

VLMs在帮助人类推断从多模态简答中获得的思维模型质量的有效性如何?

Pritam Sil, Durgaprasad Karnam, Vinay Reddy Venumuddala, Pushpak Bhattacharyya

机构 * Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔分校计算机科学与工程系) Center for Educational Technology, IIT Bombay(印度理工学院班加罗尔分校教育技术中心) School of Management, Mahindra University(马恒达大学管理学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMGrader方法,通过概念图框架从多模态回答推断学生思维模型质量,发现最佳模型在人类水平上表现不足,但能有效辅助教师改进教学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17332 2026-08-13 cs.CV cs.AI 版本更新 81%

P2MFDS: A Privacy-Preserving Multimodal Fall Detection System for Elderly People in Bathroom Environments

P2MFDS:面向浴室环境老年人的隐私保护多模态跌倒检测系统

Haitian Wang, Yiren Wang, Xinyu Wang, Yumeng Miao, Yuliang Zhang, Yu Zhang, Atif Mansoor

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Department of Computer Science and Software Engineering, The University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对浴室环境老年人跌倒检测的单模态系统准确率受限问题,本文提出P2MFDS多模态系统,融合毫米波雷达与3D振动传感,构建大规模隐私保护数据集,双流网络结合多尺度特征,提升了跌倒检测的准确率与召回率。

Comments Accepted to appear in the 2025 IEEE International Workshop on AIoT and Smart Systems (AIoTSys'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 81%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03162 2026-08-11 cs.CY cs.AI cs.CL cs.LG 版本更新 81%

MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks

MateInfoUB:用于测试大型语言模型(LLMs)在竞争性、多语言及多模态教育任务中表现的真实世界基准

Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了双语多模态计算机科学竞赛题数据集,评估当前最先进LLMs在该数据集上的表现,揭示其优劣势及语言选择的影响,还发布了教育应用以支持罗马尼亚学生自我评估。

Comments 14 pages (9 paper, 2 references, 3 annexes). Accepted for BEA 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22144 2026-08-04 cs.CV cs.AI 版本更新 81%

SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis

SAGE:面向多模态学习与幻觉分析的专家标注南亚胃肠内镜数据集

Niyoj Oli, Sachin Acharya, Sandesh Pokhrel, Sanjay Bhandari, Ramesh Rana, Nikesh Mani Shrestha, Ram Bahadur Gurung, Yash Raj Shrestha, Prashnna K Gyawali, Binod Bhattarai

机构 * Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所) GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科) Univesity of Lausanne(洛桑大学) University of West Virginia(西弗吉尼亚大学) University of Utah(犹他大学) University of Aberdeen(阿伯丁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 为解决南亚地区胃肠癌诊断数据缺乏问题,构建了包含1300张图像、标注和问答对的SAGE数据集,并评估了模型在人口偏移下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23886 2026-08-03 cond-mat.mtrl-sci cs.AI cs.CL cs.DL cs.IR 版本更新 81%

Harnessing X-ray Absorption Spectroscopy Data through Multimodal Mining of Battery Literature

通过电池文献的多模态挖掘利用X射线吸收光谱数据

Tanjin He, Aikaterini Vriza, Logan Ward, Xu Huang, Yiming Chen, Anubhav Jain, Gerbrand Ceder, Rajeev S. Assary, Ian T. Foster, Maria K. Y. Chan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用多模态文献挖掘将电池文献中分散的X射线吸收光谱数据转化为可用于人工智能的实验数据资源,开发数字化管道并应用于电池文献,产生开放数据集,为相关分析、比较及材料发现提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27069 2026-07-31 cs.CV cs.AI 版本更新 81%

Visual Credit Audit for Multimodal Spatial Reasoning

多模态空间推理的视觉信用审计

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

专题命中 多模态评测 :multimodal(title);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。

Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14546 2026-07-29 cs.CV cs.AI 版本更新 81%

Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research

利用ChatGPT的多模态视觉能力按贫困水平对卫星图像进行排名:推进社会科学研究工具

Hamid Sarmadi, Ola Hall, Thorsteinn Rögnvaldsson, Mattias Ohlsson

机构 * Center for Applied Intelligent Systems Research (CAISR), Halmstad University, Sweden(应用智能系统研究中心(CAISR),哈马斯特德大学,瑞典) Department of Human Geography, Lund University, Sweden(人类地理系,吕勒奥大学,瑞典) Department of Earth and Environmental Sciences, Lund University, Sweden(地球与环境科学系,吕勒奥大学,瑞典)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究利用具视觉能力的大语言模型分析卫星图像预测村级贫困,通过成对比较方法证明ChatGPT能按贫困水平排名卫星图像,准确性与专家相当,凸显LLMs在社会经济研究中的前景与局限,为贫困监测等提供基础并引发对公共数据集可靠性的思考。

Comments A code and data availability statement, along with the repository address, has been added to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07263 2026-07-28 cs.HC cs.CV cs.MM 版本更新 81%

BATON: A Multimodal Benchmark for Bidirectional Automation Transition Observation in Naturalistic Driving

BATON:一种多模态基准,用于自然驾驶中的双向自动化过渡观察

Yuhang Wang, Yiyao Xu, Chaoyun Yang, Lingyao Li, Jingran Sun, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 BATON通过多模态数据捕捉真实驾驶自动化场景,定义了驾驶动作理解、手柄预测和接管预测三个任务,证明多模态数据融合对提升自动化过渡预测的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08884 2026-07-14 cs.CV cs.CL cs.LG 版本更新 81%

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

SpurLens:多模态大语言模型中虚假线索的自动检测

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23916 2026-07-08 cs.CV cs.AI 版本更新 81%

DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning

DecepGPT: 基于多文化数据集和鲁棒多模态学习的模式驱动欺骗检测

Jiajian Huang, Dongliang Zhu, Zitong YU, Hui Ma, Jiayu Zhang, Chunmei Zhu, Xiaochun Cao

机构 * Great Bay University(Great Bay大学) Wuhan University(武汉大学) Sun Yat-sen University(孙中山大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DecepGPT,通过构建包含结构化线索描述和推理链的推理数据集,释放多文化数据集T4-Deception,并提出SICS和DMC模块,实现多模态欺骗检测的鲁棒学习,实验表明其在领域内和跨领域场景中均取得最佳性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01858 2026-07-07 cs.CL cs.AI 版本更新 81%

Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents

Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理

Yuhan Guo, Cong Guo, Aiwen Sun, Hongliang He, Xinyu Yang, Yue Lu, Yingji Zhang, Xuntao Guo, Dong Zhang, Jianzhuang Liu, Jiang Duan, Yijia Xiao, Liangjian Wen, Hai-Ming Xu, Yong Dai

机构 * Southwestern University of Finance and Economics(西南财经大学) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) Hithink Research(Hithink研究) Westlake University(西湖大学) Harbin Institute of Technology(哈尔滨工业大学) University of Manchester(曼彻斯特大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Adelaide(阿德莱德大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。

Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15320 2026-07-07 q-bio.QM cs.CV cs.LG cs.MM q-bio.GN 版本更新 81%

GestaltMML: Enhancing Rare Genetic Disease Diagnosis through Multimodal Machine Learning Combining Facial Images and Clinical Text

GestaltMML:通过结合面部图像和临床文本的多模态机器学习增强罕见遗传病诊断

Da Wu, Zhanliang Wang, Hongzhuo Chen, Jingye Yang, Cong Liu, Tzung-Chien Hsieh, Elaine Marchi, Justin Blair, Peter Krawitz, Chunhua Weng, Wendy Chung, Gholson J. Lyon, Ian D. Krantz, Jennifer M. Kalish, Kai Wang

机构 * Raymond G. Perelman Center for Cellular and Molecular Therapeutics, Children’s Hospital of Philadelphia(雷蒙德·G·佩尔曼细胞与分子治疗中心,费城儿童医院) Department of Mathematics, University of Pennsylvania(数学系,宾夕法尼亚大学) Department of Biomedical Informatics, Columbia University Irving Medical Center(生物医学信息学系,哥伦比亚大学伊万斯医疗中心) Department of Human Genetics, New York State Institute for Basic Research in Developmental Disabilities, Staten Island, NY, USA(人类遗传学系,纽约州发育障碍基础研究机构,纽约州史泰登岛) Division of Human Genetics, Children’s Hospital of Philadelphia(人类遗传学部,费城儿童医院) Department of Pediatrics, Boston Children’s Hospital, Harvard Medical School(儿科系,波士顿儿童医院,哈佛医学院) Biology PhD Program, The Graduate Center, The City University of New York(生物学博士项目,纽约市立大学研究生中心) Department of Genetics, Perelman School of Medicine, University of Pennsylvania(遗传学系,宾夕法尼亚大学佩尔曼医学学院) Department of Pediatrics, Perelman School of Medicine, University of Pennsylvania(儿科系,宾夕法尼亚大学佩尔曼医学学院) Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学佩尔曼医学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 研究针对罕见遗传病诊断难题,提出基于Transformer架构的多模态机器学习方法GestaltMML,整合面部图像、人口统计学信息和临床笔记,提升预测准确性,缩小诊断差距。

Comments Preprint updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10873 2026-06-19 cs.CV cs.AI 版本更新 81%

CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation

CADBench:一个用于AI辅助CAD程序生成的多模态基准

Anna C. Doris, Jacob Thomas Sony, Ghadi Nehme, Era Syla, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CADBench,一个统一的多模态CAD程序生成基准,包含18000个样本和六类基准,评估11种视觉语言模型,揭示了CAD程序生成中的三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-06-12 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14342 2026-06-09 cs.CV cs.AI 版本更新 81%

AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning

AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理

Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgroOmni数据集,通过288K视觉问答对覆盖56个专业任务类别,解决多视角跨尺度农业多模态推理中的尺度偏差问题,提出AgroNVILA模型在AgroMind基准上达到62.32%的SOTA成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02983 2026-06-09 cs.CL cs.CV 版本更新 81%

Hummus: A Dataset of Humorous Multimodal Metaphor Use

Hummus:幽默多模态隐喻使用数据集

Xiaoyu Tong, Zhi Zhang, Pia Sommerauer, Martha Lewis, Ekaterina Shutova

机构 * ILLC, University of Amsterdam, the Netherlands(阿姆斯特丹大学语言学研究所,荷兰) Vrije Universiteit Amsterdam, the Netherlands(阿姆斯特丹自由大学,荷兰)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出幽默多模态隐喻数据集Hummus,基于不一致理论和概念隐喻理论设计标注方案,测试多模态大语言模型在检测和理解幽默多模态隐喻上的表现,发现现有模型仍存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 81%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏