arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-26 至 2026-03-26 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 18 篇

2603.23521 2026-03-26 cs.CL cs.AI cs.CV 85%

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Chitrakshara:一种用于印度语言的大型多语言多模态数据集

Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Chitrakshara数据集,涵盖11种印度语言,旨在提升多模态模型对印度语言的表示能力,通过大规模预训练和图像文本对的构建,促进更文化包容的视觉语言模型发展。

Comments Accepted at "CVPR 2025: Workshop Vision Language Models For All"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-03-26 cs.CL 83%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23510 2026-03-26 cs.CL cs.AI 81%

Visuospatial Perspective Taking in Multimodal Language Models

多模态语言模型中的视觉空间视角转换

Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

机构 * University of Cambridge(剑桥大学) Department of Psychology(心理学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估多模态语言模型在视觉空间视角转换任务中的表现,发现其在需抑制自身视角以采用他人视角的层面2视角转换中存在显著缺陷,揭示了当前模型在协作场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24294 2026-03-26 cs.CV 79%

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

VERIA:面向长尾3D目标检测的验证导向多模态实例增强

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Naver Labs(Naver实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 VERIA通过多模态实例增强方法提升长尾分布下3D目标检测性能,利用基础模型生成同步RGB-LiDAR实例并进行语义与几何验证,改进稀有类别的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24059 2026-03-26 cs.CV 79%

AD-Reasoning: Multimodal Guideline-Guided Reasoning for Alzheimer's Disease Diagnosis

AD-Reasoning:多模态指南引导推理用于阿尔茨海默病诊断

Qiuhui Chen, Yushan Deng, Xuancheng Yao, Yi Hong

机构 * School of Information Science and Engineering(信息科学与工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AD-Reasoning框架,结合结构MRI和六种临床模态,生成符合NIA-AA标准的诊断,通过强化学习提升透明度和指南一致性。

Comments ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24358 2026-03-26 cs.HC cs.LG 78%

A Neuro-Symbolic System for Interpretable Multimodal Physiological Signals Integration in Human Fatigue Detection

一种用于人类疲劳检测中可解释多模态生理信号整合的神经符号系统

Mohammadreza Jamalifard, Yaxiong Lei, Parasto Azizinezhad, Javier Fumanal-Idocin, Javier Andreu-Perez

机构 * School of Computer Science and Electronic Engineering(计算机科学与电子工程学院) University of Essex(埃塞克斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出一种神经符号系统,通过注意力编码器整合可解释的生理概念,结合可微近似推理规则,提升疲劳检测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 78%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 70%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23883 2026-03-26 cs.CV 70%

BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment

BioVITA: 生物数据集、模型和基准用于视觉-文本-音频对齐

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Kuniaki Saito, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究所) OMRON SINIC X

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出BioVITA框架,通过大规模数据集、模型和跨模态检索基准,实现生物物种的多模态对齐,提升生物多样性理解。

Comments CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11809 2026-03-26 cs.HC cs.RO 67%

HiSync: Spatio-Temporally Aligning Hand Motion from Wearable IMU and On-Robot Camera for Command Source Identification in Long-Range HRI

HiSync: 从可穿戴IMU和机器人摄像头同步手部运动以在远距离HRI中进行命令源识别

Chengwen Zhang, Chun Yu, Borong Zhuang, Haopeng Jin, Qingyang Wan, Zhuojun Li, Zhe He, Zhoutong Ye, Yu Mei, Chang Liu, Weinan Shi, Yuanchun Shi

机构 * Department of Computer Science Technology, BNRist Tsinghua University Beijing China Technology, BNRist, College of AI Tsinghua University Beijing China Technology Tsinghua University Beijing China Beijing University of Posts Academy of Arts \& Design Tsinghua University Beijing China Qinghai University Xining China Tsinghua University Technology, BNRist, College of AI Technology Tsinghua University Academy of Arts \& Design Tsinghua University Qinghai University

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 HiSync通过同步机器人摄像头光流与手环IMU信号,提取频域手部运动特征并融合多模态数据,实现远距离多用户HRI中的高准确率命令源识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02441 2026-03-26 cs.CV cs.AI 66%

Understanding Pure Textual Reasoning for Blind Image Quality Assessment

理解纯文本推理在盲图像质量评估中的应用

Yuan Li, Shin'ya Nishida

机构 * Kyoto University(京都大学)

专题命中 多模态评测 :image-text(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文从信息流角度探讨文本信息对图像质量预测的贡献,通过对比现有模型与三种文本推理方法,发现文本信息在质量预测中效果有限,但Self-Consistency方法显著缩小了图像与文本预测间的差异。

Comments Code available at https://github.com/AnonymousUserPublish/Bridging-Image-Text-Gap-for-BIQA/tree/main. This work is accepted by ICME (IEEE International Conference on Multimedia and Expo) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23627 2026-03-26 cs.CV cs.AI 62%

Ukrainian Visual Word Sense Disambiguation Benchmark

乌克兰视觉词义消歧基准

Yurii Laba, Yaryna Mohytych, Ivanna Rohulia, Halyna Kyryleyza, Hanna Dydyk-Meush, Oles Dobosevych, Rostyslav Hryniv

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个评估乌克兰视觉词义消歧任务的基准,通过八种多语言大模型测试,发现乌克兰与英语在该任务上存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11442 2026-03-26 cs.AI cs.CV 62%

GPT4o-Receipt: A Dataset and Human Study for AI-Generated Document Forensics

GPT4o-Receipt:用于AI生成文档取证的数据库和人类研究

Yan Zhang, Simiao Ren, Ankit Raj, En Wei, Dennis Ng, Alex Shen, Jiayu Xue, Yuxin Zhang, Evelyn Marotta

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨人类是否能比机器更有效检测AI生成的财务文档,通过GPT4o-Receipt数据库和人类研究揭示了AI生成文档中的算术错误对机器学习模型的影响。

Comments 12 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23481 2026-03-26 cs.CL 57%

IDP Accelerator: Agentic Document Intelligence from Extraction to Compliance Validation

IDP加速器:从提取到合规验证的智能文档智能

Md Mofijul Islam, Md Sirajus Salekin, Joe King, Priyashree Roy, Vamsi Thilak Gudi, Spencer Romo, Akhil Nooney, David Kaleko, Boyi Xie, Bob Strahan, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出IDP加速器框架,通过DocSplit、可配置提取模块、代理分析模块和规则验证模块实现端到端文档智能,展示在医疗行业达到98%准确率和77%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 57%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 56%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 多模态评测 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20150 2026-03-26 cs.RO 50%

HortiMulti: A Multi-Sensor Dataset for Localisation and Mapping in Horticultural Polytunnels

HortiMulti:一种用于温室局部化与建图的多传感器数据集

Shuoyuan Xu, Zhipeng Zhong, Tiago Barros, Matthew Coombes, Cristiano Premebida, Hao Wu, Cunjia Liu

机构 * Department of Aeronautical and Automotive Engineering, Loughborough University(航空航天与汽车工程系,洛桑大学) Department of Electrical and Computer Engineering, Institute of Systems and Robotics, University of Coimbra(电气与计算机工程系,系统与机器人研究所,科英布拉大学) Antobot Ltd, Arise Innovation Hub(Antobot公司,Arise创新中心)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出HortiMulti数据集,用于解决温室环境中局部化与建图的挑战,通过多传感器数据验证现有方法的不足,为农业机器人提供可靠资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23583 2026-03-26 q-bio.BM cs.LG 50%

ZeroFold: Protein-RNA Binding Affinity Predictions from Pre-Structural Embeddings

ZeroFold:从预结构嵌入预测蛋白质- RNA结合亲和力

Josef Hanke, Sebastian Pujalte Ojeda, Shengyu Zhang, Werngard Czechtizky, Leonardo De Maria, Michele Vendruscolo

机构 * Centre for Misfolding Diseases, Yusuf Hamied Department of Chemistry, University of Cambridge(错误折叠疾病中心,尤斯夫·哈米埃德化学系,剑桥大学) Medicinal Chemistry, Research and Early Development, Respiratory and Immunology, BioPharmaceuticals R&D, AstraZeneca(药物化学,研发与早期开发,呼吸与免疫学,生物制药研发,阿斯利康)

专题命中 多模态评测 :cross-modal(abstract)

AI总结 本文提出ZeroFold模型,利用预结构嵌入预测蛋白质- RNA结合亲和力,通过跨模态注意力机制结合蛋白质和RNA的预结构嵌入,构建了PRADB数据集并验证了模型性能。

Comments 16 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏