arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2603.28183 2026-04-02 cs.AI 83%

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10495 2026-04-02 cs.CV 83%

IMTBench: A Multi-Scenario Cross-Modal Collaborative Evaluation Benchmark for In-Image Machine Translation

IMTBench: 一种多场景跨模态协作评估基准用于图像机器翻译

Jiahao Lyu, Pei Fu, Zhenhang Li, Weichao Zeng, Shaojie Zhang, Jiahui Yang, Can Ma, Yu Zhou, Zhenbo Luo, Jian Luan

机构 * Institute of Information Engineering, Chinese Academy of Science(中国科学院信息工程研究所) MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学) The University of Tokyo(东京大学) School of Cyber Security, University of Chinese Academy of Science(中国科学院大学网络空间安全学院)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 IMTBench通过2500个图像翻译样本覆盖四个场景和九种语言,提供多方面评估,包括翻译质量、背景保持、整体图像质量和跨模态对齐得分,揭示不同场景和语言间的性能差距,推动图像文本翻译研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06328 2026-04-02 cs.CV 83%

Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection

通过模态优化和动态主模态选择改进多模态情感分析

Dingkang Yang, Mingcheng Li, Xuecheng Wu, Zhaoyu Chen, Kaixun Jiang, Keliang Liu, Peng Zhai, Lihua Zhang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MODS框架,通过动态主模态选择和模态优化提升多模态情感分析性能,有效平衡模态贡献并消除冗余噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18919 2026-04-02 cs.CL cs.AI cs.CV 82%

MemeMind: A Large-Scale Multimodal Dataset with Chain-of-Thought Reasoning for Harmful Meme Detection

MemeMind: 一个具有链式推理的大型多模态数据集用于有害迷因检测

Hexiang Gu, Qifan Yu, Yuan Liu, Zikang Li, Saihui Hou, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MemeMind数据集,通过链式推理标注支持对迷因隐含意图的细粒度分析,并提出MemeGuard框架提升检测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00940 2026-04-02 cs.CV 79%

YieldSAT: A Multimodal Benchmark Dataset for High-Resolution Crop Yield Prediction

YieldSAT:一个用于高分辨率作物产量预测的多模态基准数据集

Miro Miranda, Deepak Pathak, Patrick Helber, Benjamin Bischke, Hiba Najjar, Francisco Mena, Cristhian Sanchez, Akshay Pai, Diego Arenas, Matias Valdenegro-Toro, Marcela Charfuelan, Marlon Nuske, Andreas Dengel

机构 * RPTU Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) DFKI GmbH(德国人工智能研究中心) Vision Impulse GmbH(Vision Impulse 有限公司) University of Groningen(格罗宁根大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出YieldSAT数据集,通过多模态数据提升高分辨率作物产量预测的准确性,包含1220万样本及多光谱图像,展示了大规模像素回归任务的潜力及领域适应方法的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29630 2026-04-02 cs.CV 79%

BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation

BigEarthNet.txt: 一个大规模多传感器图像-文本数据集和地球观测基准

Johann-Ludwig Herzog, Mathis Jürgen Adler, Leonard Hackel, Yan Shu, Angelos Zavras, Ioannis Papoutsis, Paolo Rota, Begüm Demir

机构 * BIFOLD(柏林智能数据与机器学习研究所) Technische Universität Berlin(柏林工业大学) University of Trento(特伦托大学) National Technical University(雅典国家技术大学) National Observatory of Athens(雅典国家天文台)

专题命中 多模态评测 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出BigEarthNet.txt,一个大规模多传感器图像-文本数据集,用于提升地球观测中的指令驱动图像-文本学习,包含9.6M文本注释,涵盖土地利用/覆盖类、空间关系及环境背景描述,通过对比分析证明其在文本丰富性和注释类型多样性上的优势。

Comments For details, see https://txt.bigearth.net

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18551 2026-04-02 cs.CV 79%

A 3D Cross-modal Keypoint Descriptor for MR-US Matching and Registration

一种用于MRI-US匹配和配准的3D跨模态关键点描述符

Daniil Morozov, Reuben Dorent, Nazim Haouchine

机构 * Harvard Medical School(哈佛医学院) Brigham and Women’s Hospital(布莱根妇女医院) Inria(法国国家信息与自动化研究所) Sorbonne Université(索邦大学) Institut du Cerveau - Paris Brain Institute - ICM, CNRS, Inserm, AP-HP, Hôpital de la Pitié Salpêtrière(巴黎大脑研究所 - ICM, 法国国家科学研究中心, 法国国家健康与医学研究院, 巴黎公立医院集团, 皮提耶-萨勒佩特里医院) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种3D跨模态关键点描述符,通过合成iUS体积进行患者特异性匹配,学习共享描述空间,实现鲁棒且旋转不变的配准。

Comments Accepted in IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20209 2026-04-02 cs.CL cs.AI 73%

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

儿童智力测试对大语言模型构成挑战?KidGym:一种基于二维网格的推理基准测试用于大语言模型

Hengwei Ye, Yuanting Guan, Yuxuan Ge, Tianying Zhu, Zhenhan Guan, Yijia Zhong, Yijing Zhang, Han Zhang, Yingna Wu, Zheng Tian

机构 * ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KidGym,一种基于二维网格的推理基准测试,用于评估大语言模型的执行、感知推理、学习、记忆和规划能力,通过12个独特任务测试模型适应性和发展潜力,揭示当前模型的局限性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00677 2026-04-02 cs.CV 70%

CL-VISTA: Benchmarking Continual Learning in Video Large Language Models

CL-VISTA:视频大语言模型持续学习基准测试

Haiyang Guo, Yichen Shi, Fei Zhu, Wenzhuo Liu, Hongbo Zhao, Fanhu Zeng, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 70%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV 70%

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20507 2026-04-02 cs.CV cs.AI 62%

Electrolyzers-HSI: Close-Range Multi-Scene Hyperspectral Imaging Benchmark Dataset

电解槽-HSI:近景多场景高光谱成像基准数据集

Elias Arbash, Ahmed Jamal Afifi, Ymane Belahsen, Margret Fuchs, Pedram Ghamisi, Paul Scheunders, Richard Gloaguen

机构 * Helmholtz-Zentrum Dresden-Rossendorf (HZDR) - Helmholtz Institute Freiberg for Resource Technology (HIF)(亥姆霍兹德累斯顿罗森多夫研究中心(HZDR)- 弗莱贝格亥姆霍兹资源技术研究所(HIF)) University of Antwerp(安特卫普大学) National School of Applied Sciences of Oujda(乌季达国立应用科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出电解槽-HSI数据集,用于加速关键原材料回收,通过准确的电解槽材料分类支持定量和定性分析,评估了多种机器学习和深度学习方法以优化材料识别效率。

Journal ref Sci Data 12, 1818 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14377 2026-04-02 cs.CL cs.IR cs.LG 57%

PluriHopRAG: Exhaustive, Recall-Sensitive QA Through Corpus-Specific Document Structure Learning

PluriHopRAG: 通过语料库特定文档结构学习实现全面、召回敏感的问答

Mykolas Sveistrys, Richard Kunert

机构 * Turbit Systems GmbH

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出PluriHopRAG,通过学习语料库特定文档结构分解查询,改进多跳问答任务的召回敏感性和全面性,在PluriHopWIND和Loong基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06788 2026-04-02 cs.CV cs.HC 57%

Visual Neural Decoding via Improved Visual-EEG Semantic Consistency

通过改进的视觉-脑电语义一致性实现视觉神经解码

Hongzhou Chen, Lianghua He, Yihang Liu, Longzhen Yang, Shaohua Shang, MengChu Zhou

机构 * School of Computer Science and Technique, Tongji University(同济大学计算机科学与技术学院) Shanghai Eye Disease Prevention and Treatment Center(上海市眼病防治中心) Helen and John C. Hartmann Department of Electrical and Computer Engineering, New Jersey Institute of Technology(新泽西理工学院Helen and John C. Hartmann电气与计算机工程系)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出视觉-脑电联合语义空间及两种新方法,提升跨模态表示的一致性,验证了在大规模视觉-脑电数据集上的有效性,提升了解码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01967 2026-04-02 cs.CV 57%

Harnessing the Power of Local Representations for Few-Shot Classification

利用局部表示力提升少样本分类

Shi Tang, Guiming Luo, Xinchen Ye, Zhiyi Xia

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出通过改进的预训练方法和适应性度量机制,提升少样本分类中对新类别的泛化能力,取得新state-of-the-art成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00175 2026-04-02 cs.LG cs.CV 57%

Sit-to-Stand Transitions Detection and Duration Measurement Using Smart Lacelock Sensor

利用智能Lacelock传感器进行站起过渡检测与持续时间测量

Md Rafi Islam, Md Rejwanul Haque, Elizabeth Choma, Shannon Hayes, Siobhan McMahon, Xiangrong Shen, Edward Sazonov

机构 * The University of Alabama(阿拉巴马大学) Genesis Medtech USA Inc(Genesis Medtech 美国公司) Whitworth University(惠特沃斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用智能Lacelock传感器检测站起过渡及测量持续时间的方法,通过多模态信号特征训练四个分类器,实现高准确率的检测与测量,为老年人跌倒风险评估提供新工具。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00075 2026-04-02 q-bio.GN 50%

Large Language Models for Variant-Centric Functional Evidence Mining

基于变体的函数证据挖掘的大型语言模型

Ali Saadat, Jacques Fellay

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出利用大型语言模型挖掘变体功能证据,通过基准测试评估两种模型在文献筛选和证据提取中的表现,开发了AcmGENTIC管道以提升功能证据整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00065 2026-04-02 q-bio.GN cs.LG 50%

Genetic algorithms for multi-omic feature selection: a comparative study in cancer survival analysis

基于多组学特征选择的遗传算法:癌症生存分析中的比较研究

Luca Cattelani, Vittorio Fortino

机构 * Institute of Biomedicine, School of Medicine , University of Eastern Finland , Yliopistonranta 8 , 70210 , Finland

专题命中 多模态评测 :cross-modal(abstract)

AI总结 本文提出Sweeping*算法,结合单视和多视优化,通过多组学层间交互提升生存预测精度,验证了多组学整合在癌症生存分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏