arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-17 至 2026-07-17 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2607.14189 2026-07-17 cs.CV cs.SD 新提交 84%

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

MultiRef-Compass:迈向多参考到音频-视频生成的综合评估

Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

专题命中 多模态评测 :MLLM(summary_cn,abstract);audio-visual(abstract);分类 cs.CV

AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 82%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15241 2026-07-17 cs.CL cs.CV 新提交 81%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15240 2026-07-17 cs.CL 新提交 79%

TikStance: A Multimodal and Hierarchical Dataset for Multi-target Stance Analysis in TikTok Political Conversations

TikStance:用于TikTok政治对话中多目标立场分析的多模态分层数据集

Yazhi Zhang, Fuqiang Niu, Bowen Zhang

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究针对TikTok政治对话中多目标立场分析,提出多模态分层数据集TikStance,涵盖2024年美国选举周期三位政治人物,结合多目标覆盖、分层对话与人工注释,支持多模态立场检测等多领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 79%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14683 2026-07-17 cs.AI 新提交 79%

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

InCarEmo:用于车内情感识别和驾驶员状态监测的多模态数据集

Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES(赛力斯)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有车内情感计算数据集局限,引入多模态InCarEmo数据集,整合多种数据支持情感识别、疲劳检测和分心监测等任务,构建中英文基准并给出基线结果,证明多模态融合优势,为车内情感理解奠基,推动人车交互发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-07-17 cs.CV 新提交 79%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13800 2026-07-17 cs.CV 版本更新 79%

Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space

超越医学诊断:医学多模态大语言模型如何在空间中思考

Quoc-Huy Trinh, Xi Ding, Yang Liu, Zhenyue Qin, Xingjian Li, Gorkem Durak, Halil Ertugrul Aktas, Andrea M. Bejar, Ulas Bagci, Min Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SpatialMed基准,通过自主合成空间视觉问答数据评估医学MLLMs的3D空间智能,发现现有模型在医学影像空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14333 2026-07-17 cs.CV cs.CL 新提交 62%

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

SD-MAR:通过合成数据和强化学习进行多图像分析推理

Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang, Dmitriy Bespalov, Wesley Rose, Huzefa Rangwala

机构 * Stevens Institute of Technology(史蒂文斯理工学院) AGI Foundations for AWS(AWS的通用人工智能基金会) Amazon Web Services (AWS)(亚马逊网络服务公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29059 2026-07-17 cs.CV cs.AI 版本更新 62%

Flow Matching in Feature Space for Stochastic World Modeling

特征空间中的流匹配用于随机世界建模

Francois Porcher, Nicolas Carion, Karteek Alahari, Shizhe Chen

机构 * FAIR at Meta(Meta的FAIR)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FlowWM,在预训练特征空间中直接进行流匹配,通过可微一步投影机制实现高效训练,在合成和真实基准上提升感知性能、模式覆盖和时域鲁棒性。

Comments 24 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26842 2026-07-17 cs.LG cs.AI cs.CV 版本更新 62%

VAN-AD: Visual Masked Autoencoder with Normalizing Flow For Time Series Anomaly Detection

VAN-AD:基于归一化流的视觉掩码自编码器用于时间序列异常检测

PengYu Chen, Shang Wan, Xiaohou Shi, Yuan Chang, Yan Sun, Sajal K. Das

机构 * School of Computer Science (National Pilot Software Engineering School)(计算机学院(国家级试点软件工程学院)) Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute Beijing(中国电信研究院北京) Department of Computer Science, Missouri University of Science and Technology(计算机科学系,密苏里科技大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VAN-AD,通过归一化流模块和自适应分布映射模块改进视觉掩码自编码器,提升时间序列异常检测的泛化能力和局部感知能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 57%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交 57%

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14142 2026-07-17 physics.plasm-ph 新提交 50%

Automated Outlier-Robust Bayesian Profile Fitting for Magnetically Confined Plasmas with Modified Tanh Profiles and Good-and-Bad Gaussian Mixture Likelihoods

用于具有修正双曲正切分布和优劣高斯混合似然的磁约束等离子体的自动离群值稳健贝叶斯分布拟合

Jaewook Kim, Jekil Lee, Laurent Jung, Sang-hee Hahn, Sehyun Kwak

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对磁约束等离子体自动动力学分布拟合问题,提出基于修正双曲正切分布和优劣高斯混合似然的离群值稳健贝叶斯方法,解决相关障碍,经KSTAR实验验证,为大规模动力学分布生成提供基础。

Comments 16 pages, 8 figures; submitted to Nuclear Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏