arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-24 至 2026-04-24 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2510.03247 2026-04-24 cs.LG cs.AI 83%

Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data

迈向多模态主动学习:在有限配对数据下高效学习

Jiancheng Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出首个处理对齐数据的多模态主动学习框架,结合不确定性与多样性原则,实现线性时间获取,降低多模态标注成本且保持性能。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL 82%

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21575 2026-04-24 cs.CV cs.GR 79%

OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction

OmniFit:通过尺度无关密集地标预测实现多模态3D身体拟合

Zeyu Cai, Yuliang Xiu, Renke Wang, Zhijing Shao, Xiaoben Li, Siyuan Yu, Chao Xu, Yang Liu, Baigui Sun, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) Westlake University(西湖大学) iROOTECH Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniFit通过尺度无关的密集地标预测,实现对多模态输入(如完整扫描、部分深度观测和图像)的无缝处理,首次在日常和宽松服装场景中超越多视图优化基线,达到毫米级精度。

Comments Project Page: https://zcai0612.github.io/OmniFit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM 79%

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21102 2026-04-24 cs.CV cs.AI 76%

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

利用多模态大语言模型进行基于街景图像的建筑环境和住房属性评估

Siyuan Yao, Siavash Ghorbany, Kuangshi Ai, Arnav Cherukuthota, Meghan Forstchen, Alexis Korotasz, Matthew Sisk, Ming Hu, Chaoli Wang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出利用大语言模型和谷歌街景图像自动评估美国全国建筑状况,通过微调Gemma 3 27B模型并结合知识蒸馏,实现高效准确的建筑评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05563 2026-04-24 cs.CV cs.SI 74%

What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews

未被言说之物:检测和纠正多模态新闻预告中的误导性省略

Fanxiao Li, Jiaying Wu, Tingchao Fu, Dayang Li, Herun Wan, Wei Zhou, Min-Yen Kan

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学) School of Engineering, Yunnan University(云南大学工程学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出MM-Misleading基准,通过多阶段流程评估开源LVLMs,发现省略性误导的盲区,并提出OMGuard结合细调和引导修正,提升检测与纠正效果,揭示局部叙事变化导致的误导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18908 2026-04-24 cs.AI 74%

Multimodal Bayesian Network for Robust Assessment of Casualties in Autonomous Triage

多模态贝叶斯网络用于自主分诊的稳健评估

Szymon Rusiecki, Cecilia G. Morales, Kimberly Elenberg, Leonard Weiss, Artur Dubrawski

机构 * AGH University of Krakow(AGH克拉科夫大学) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文提出一种融合多计算机视觉模型输出的贝叶斯网络,通过专家定义规则提升伤员评估准确性,在DARPA分诊挑战中显著优于视觉基线。

Comments Presented at NeurIPS 2025 Workshop: Structured Probabilistic Inference & Generative Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21346 2026-04-24 cs.AI cs.CL cs.CV 67%

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

符号 grounding 揭示了抽象视觉推理中的表征瓶颈

Mohit Vaishnav, Tanel Tammet

机构 * Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia(塔林技术大学应用人工智能小组,爱沙尼亚) Kimova AI, Tallinn, Estonia(Kimova AI,塔林,爱沙尼亚)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过Bongard-LOGO基准测试,发现符号输入能显著提升抽象视觉推理性能,揭示了表征能力是核心瓶颈。

Journal ref 30th Conference on Computational Natural Language Learning (CoNLL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21144 2026-04-24 cs.CL cs.AI cs.HC 62%

Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue

利用机器心智 imagery 代表情境对话中的共同背景

Biswesh Mohapatra, Giovanni Duca, Laurent Romary, Justine Cassell

机构 * Inria University of Trento(特伦托大学) Inria, Carnegie Mellon University(Inria 和卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种主动视觉支架框架,通过将对话状态转化为持久的视觉历史,减少代表模糊并提高对话理解。

Comments Work under review. Biswesh Mohapatra and Giovanni Duca both contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21478 2026-04-24 cs.CV 57%

Rethinking Cross-Domain Evaluation for Face Forgery Detection with Semantic Fine-grained Alignment and Mixture-of-Experts

重新思考面向面部伪造检测的跨领域评估:基于语义细粒度对齐和专家混合

Yuhan Luo, Tao Chen, Decheng Liu

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学信息工程学院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 本文提出Cross-AUC评估指标和SFAM框架,通过语义细粒度对齐和专家混合提升面部伪造检测的跨领域鲁棒性,实验证明方法在多个数据集上优于现有技术。

Comments The source code is available at https://github.com/Yuhan-Luo/Semantic-Fine-grained-Alignment-and-Mixture-of-Experts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC 57%

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20697 2026-04-24 cs.SD cs.AI 57%

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

音乐乐谱理解基准:评估大型语言模型对完整乐谱的理解能力

Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MSU-Bench基准,评估大型语言模型和视觉-语言模型对完整乐谱的理解能力,发现模型在模态间存在显著差距,通过微调可提升多层级正确性,为多模态推理研究提供基础。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏