arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2603.29977 2026-04-15 cs.LG cs.AI q-bio.QM 88%

Quantifying Cross-Modal Interactions in Multimodal Glioma Survival Prediction via InterSHAP: Evidence for Additive Signal Integration

通过InterSHAP量化多模态胶质瘤生存预测中的跨模态交互:证据显示信号整合是加性的

Iain Swift, JingHua Ye, Ruairi O'Reilly

机构 * Department of Computer Science, Munster Technological University, Cork, Ireland(莫斯堡技术大学计算机科学系,爱尔兰科克)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文通过InterSHAP评估多模态深度学习在胶质瘤生存预测中的跨模态交互,发现性能提升源于互补信号聚合而非协同效应,为模型审计和联邦学习提供新视角。

Comments 8 pages, 1 figure, under review at XAI 2026 LBW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12700 2026-04-15 cs.AI 83%

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

MISID:一种多模态多轮对话数据集,用于战略欺骗游戏中复杂意图识别

Shufang Lin, Muyang Chen, Xiabing Zhou, Rongrong Zhang, Dayou Zhang, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出MISID数据集,用于复杂战略欺骗游戏中多模态多轮对话的意图识别,通过系统评估发现现有多模态大语言模型在复杂场景中存在缺陷,并提出FRACTAM框架提升性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21652 2026-04-15 eess.IV cs.AI physics.med-ph 79%

Enabling Ultra-Fast Cardiovascular Imaging Across Heterogeneous Clinical Environments with A Generalist Foundation Model and Multimodal Database

通过通用基础模型和多模态数据库实现跨异构临床环境的超快速心血管成像

Zi Wang, Mingkai Huang, Zhang Shi, Hongjie Hu, Lan Lan, Hui Zhang, Yan Li, Xi Hu, Qing Lu, Zongming Zhu, Qiong Yao, Yuxiang Dai, Fanwen Wang, Yinzhe Wu, Jun Lyu, Qianqian Gao, Guangming Xu, Zhenxuan Zhang, Haosen Zhang, Qing Li, Guangming Wang, Tianxing He, Lizhen Lan, Siyue Li, Le Xue, Mengting Sun, Yuntong Lyu, Junpu Hu, Jiayu Zhu, Rizwan Ahmad, Zhengyu Bu, Xianling Qian, Guanke Cai, Ruiyu Cao, Weirui Cai, Chang Xu, Yuyang Ren, Feidan Yu, Siying Ma, Ziqiang Xu, Xinran Chen, Sha Hua, Daniel Kim, Yajing Zhang, Chen Ouyang, Wenjia Bai, Jing Qin, Yucheng Yang, Daniel Rueckert, He Wang, Qian Tao, Claudia Prieto, Michael Markl, Alistair Young, Lianming Wu, Shuo Wang, Chen Qin, Mengsu Zeng, Xihong Hu, Haibo Xu, Xiaobo Qu, Hao Li, Guang Yang, Chengyan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CardioMM模型,通过统一语义理解和物理约束数据一致性,实现跨不同扫描仪、协议和患者情况的稳健重建,验证了24倍加速仍能保持关键心脏表型和诊断图像质量。

Comments Github: https://github.com/wangziblake/CardioMM_MMCMR-427K

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12315 2026-04-15 cs.CV cs.MM 73%

GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality

GTPBD-MM:一种具有多模态的全球梯田地块和边界数据集

Zhiwei Zhang, Xingyuan Zeng, Xinkai Kong, Kunquan Zhang, Haoyuan Liang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.MM

AI总结 本文提出GTPBD-MM数据集,用于复杂梯田地块提取,结合高分辨率影像、文本描述和DEM数据,提出ETTerra模型,通过文本和地形信息提升提取精度。

Comments 15 pages, 11 figures. Submitted to ACM Multimedia 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 62%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12512 2026-04-15 cs.CV cs.AI 62%

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1)

Guanyi Qin, Jie Liang, Bingbing Zhang, Lishen Qu, Ya-nan Guan, Hui Zeng, Lei Zhang, Radu Timofte, Jianhui Sun, Xinli Yue, Tao Shao, Huan Hou, Wenjie Liao, Shuhao Han, Jieyu Yuan, Chunle Guo, Chongyi Li, Zewen Chen, Yunze Liu, Jian Guo, Juan Wang, Yun Zeng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Xinjie Zhang, Qiang Li, Li Yan, Wei Dong, Qingsen Yan, Xingcan Li, Shenglong Zhou, Manjiang Yin, Yinxiang Zhang, Hongbo Wang, Jikai Xu, Zhaohui Fan, Dandan Zhu, Wei Sun, Weixia Zhang, Kun Zhu, Nana Zhang, Kaiwei Zhang, Qianqian Zhang, Zhihan Zhang, William Gordon, Linwei Wu, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Cici Liu, Yaokun Shi

机构 * NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)(NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NTIRE 2026挑战赛,聚焦专业图像质量评估,通过多模态大语言模型提升图像评估的准确性与解释性,吸引200多团队参与,推动专业IQA领域的发展。

Comments NTIRE Challenge Report. Accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19328 2026-04-15 cs.CV cs.LG 57%

BAH Dataset for Ambivalence/Hesitancy Recognition in Videos for Digital Behavioural Change

用于数字行为改变视频中矛盾/犹豫识别的BAH数据集

Manuela González-González, Soufiane Belharbi, Muhammad Osama Zeeshan, Masoumeh Sharafi, Muhammad Haseeb Aslam, Marco Pedersoli, Alessandro Lameiras Koerich, Simon L Bacon, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔埃克塞特学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与IT工程系,蒙特利尔埃克塞特学院,加拿大) Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(健康、运动科学与应用生理学系,康科迪亚大学,蒙特利尔,加拿大) Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,北岛-蒙特利尔医疗与社会服务委员会,加拿大)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BAH数据集,用于多模态识别视频中的矛盾/犹豫,包含1427个视频,旨在为机器学习模型提供训练数据,通过专家标注和基准测试展示识别挑战。

Comments 46 pages, 21 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12162 2026-04-15 cs.CL 57%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12329 2026-04-15 cs.CR cs.SI 50%

UniDetect: LLM-Driven Universal Fraud Detection across Heterogeneous Blockchains

UniDetect: 基于大语言模型的跨异构区块链通用欺诈检测

Shuyi Miao, Wangjie Qiu, Shengda Zhuo, Fei Shen, Dan Lin, Xingtong Yu, Chua Tat-Seng, Zhiming Zheng

专题命中 多模态评测 :multimodal(abstract)

AI总结 UniDetect利用大语言模型生成跨异构区块链账户的交易摘要文本,结合两阶段交替训练策略,提升欺诈检测性能,在多个区块链上实现5.57%-7.58%的KS提升,跨链零样本检测准确率超94.58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12001 2026-04-15 cs.CE 50%

Divergence-Guided Particle Swarm Optimization

基于分歧的粒子群优化

Kleyton da Costa, Bernardo Modenesi, Ivan F. M. Menezes, Hélio Lopes

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出DPSO,通过引入 modulation 项来引导粒子避免过早收敛,提升了多模态问题的优化性能,同时保持了单模态问题的探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 50%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏