arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9133 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9133 篇

2605.09266 2026-05-13 cs.AI 79%

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

SeePhys Pro:多模态RLVR中模态迁移和盲训练效应的诊断

Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世人工智能中心) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SeePhys Pro研究多模态RLVR中模态迁移对物理推理的影响,发现当前模型在信息从语言迁移到图像时表现下降,盲训练可提升性能,但依赖残余文本和分布特征而非有效视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11663 2026-05-13 cs.CL 79%

Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability

具有90万规模日本全国学业能力评估学生响应分布的多模态基准

Kyosuke Takami, Yuka Tateisi, Satoshi Sekine, Yusuke Miyao

机构 * Osaka Kyoiku University(大阪教养大学) University of Tokyo(东京大学) NII LLMC(日本国家信息与通信技术研究所大语言模型中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24602 2026-05-13 eess.SP cs.AI 79%

MuViS: Multimodal Virtual Sensing Benchmark

MuViS:多模态虚拟感知基准

Jens U. Brandt, Noah C. Puetz, Jobel Jose George, Niharika Vinay Kumar, Elena Raponi, Marc Hilbert, Thomas Bäck, Thomas Bartz-Beielstein

机构 * TH Köln, Germany(TH Köln大学) Leiden University(莱顿大学) Toyota Racing(丰田赛车)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MuViS基准测试平台整合多种数据集,评估多模态虚拟感知方法,证明现有方法无统一优势,需发展通用架构。

Comments Accepted at European Signal Processing Conference (EUSIPCO) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10936 2026-05-12 cs.CV 79%

Personal Visual Context Learning in Large Multimodal Models

个人视觉上下文学习在大型多模态模型中

Zihui Xue, Ami Baid, Sangho Kim, Mi Luo, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出个人视觉上下文学习(Personal VCL)以解决个性化查询,通过Personal-VCL-Bench评估,发现现有模型在利用视觉证据和聚合多视觉观察方面存在显著不足,提出Agentic Context Bank方法提升性能。

Comments Project website: https://vision.cs.utexas.edu/projects/PersonalVCL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 79%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08847 2026-05-12 cs.CL 79%

EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

EmoS:一种高保真多模态基准,用于细粒度流式情感理解

Pengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong

机构 * NLP(自然语言处理) CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学学院,澳门大学CT实验室) School of Computer Science, Central China Normal University(Central China Normal University计算机科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出EmoS基准,通过严格过滤静态片段与动态流式独白子集结合,解决现有数据集在生态效度和噪声方面的不足,提升多模态大语言模型在情感识别和共情模型训练中的性能。

Comments acl - 2026 main accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08709 2026-05-12 cs.CV 79%

UniShield: Unified Face Attack Detection via KG-Informed Multimodal Reasoning

UniShield:基于知识图谱的多模态推理统一面部攻击检测

Hongrui Li, Yichen Shi, Hongyang Wang, Yuhao Gao, Hui Ma, Jun Feng, Zitong Yu

机构 * Shijiazhuang Tiedao University(石家庄铁道大学) Shanghai Jiao Tong University(上海交通大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Great Bay University(大贝大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 UniShield通过构建面部攻击知识图谱,结合图谱一致推理优化,提升面部攻击检测的准确性和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07561 2026-05-11 cs.CV 79%

Multimodal Stepwise Clinically-Guided Attention Learning for Pathological Complete Response Prediction in Breast Cancer

多模态逐步临床引导注意力学习用于乳腺癌病理完全响应预测

Alice Natalina Caragliano, Valerio Guarrasi, Michela Gravina, Carlo Sansone, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Electrical Engineering and Information Technology, University of Naples Federico II(电气工程与信息科技系,那不勒斯费德里科二世大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态逐步临床引导注意力学习框架,通过医学引导的空间指导和多模态整合,提升乳腺MRI中病理完全响应预测的敏感性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07488 2026-05-11 cs.AI cs.LG 79%

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

通过增量优化效用实现多模态模型的数据选择效率

Jinhao Jing, Qiannian Zhao, Chao Huang, Zhan Su

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出OST框架,将数据选择转化为增量优化效用排名问题,通过轻量代理模拟单步更新估算样本边际效用,实验证明在减少训练成本的同时提升性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06728 2026-05-11 q-bio.GN cs.AI q-bio.CB 79%

OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

OmicsLM:一种多模态大语言模型用于多样本组学推理

Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński, Remigiusz Kinas, Przemysław Pietrzak, Tomasz Jetka, Rafał Powalski

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 OmicsLM通过整合定量组学数据与自然语言任务,实现多样本组学推理,其在多任务类型上表现优异,尤其在生物语言指导的推理任务中超越专用模型和通用LLM。

Comments 13 pages (main text), 14 pages (appendix), 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02206 2026-05-11 cs.CV cs.LG 79%

Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score

多模态机器去学习中的度量不可靠性:系统分析与原则统一分数

Abdullah Ahmad Khan, Hamid Laga, Ferdous Sohel

机构 * Murdoch University(墨尔本大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文系统分析了多模态去学习中度量可靠性问题,提出统一质量评分(UQS)以解决不同度量标准间的冲突,通过实验验证了UQS在稳定排序方面的有效性。

Comments 9 Pages , 6 figures, Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 79%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15884 2026-05-11 cs.CV 79%

Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching

Contrast-X:一个多模态对比图像合成基准及通用模态流匹配

Yifan Chen, Fei Yin, Hao Chen, Jia Wu, Chao Li

机构 * University of Cambridge(剑桥大学) MD Anderson Cancer Center(MD安德森癌症中心) University of Dundee(邓迪大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 Contrast-X通过多器官CT和乳腺DCE-MRI数据,提出FlowMI模型解决多模态缺失问题,评估合成图像质量及跨器官泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 79%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06371 2026-05-08 cs.AI 79%

Debiased Multimodal Personality Understanding through Dual Causal Intervention

通过双因果干预实现去偏的多模态人格理解

Yangfu Zhu, Zitong Han, Nianwen Ning, Yuting Wei, Yuandong Wang, Hang Feng, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Henan University(河南大学) University of International Relations(国际关系大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出双因果调整网络DCAN,通过因果模型消除多模态特征与人格特质间的偏见关联,提升预测准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06289 2026-05-08 stat.ML cs.AI cs.LG 79%

Multimodal Deep Generative Model for Semi-Supervised Learning under Class Imbalance

多模态深度生成模型用于类别不平衡下的半监督学习

Heegeon Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST), Daejeon, Republic of Korea(工业与系统工程系,韩国科学技术院(KAIST),大田,大韩民国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态深度生成模型,通过共享潜在变量和t分布改进类别不平衡问题,提升半监督学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05014 2026-05-08 cs.CV 79%

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22859 2026-05-08 cs.CV 79%

From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models

从盲点到收益:面向大型多模态模型的诊断驱动迭代训练

Hongrui Jia, Chaoya Jiang, Yongrui Heng, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DPE方法,通过诊断驱动的数据生成和强化学习,实现大型多模态模型的持续改进,实验表明在多个基准测试中取得稳定收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05712 2026-05-08 cs.CV 79%

EgoEMG: A Multimodal Egocentric Dataset with Bilateral EMG and Vision for Hand Pose Estimation

EgoEMG:一个用于手姿态估计的多模态自体视角数据集,包含双侧EMG和视觉信息

Ziheng Xi, Jiayi Yu, Yitao Wang, Yanbo Duan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EgoEMG数据集融合双侧EMG和视觉信息,用于手姿态估计,包含16通道EMG、IMU、RGB视频和RGB-D视频,涵盖41名参与者60种手势,提供EMG-to-pose、vision-to-pose和融合任务的基准测试。

Comments 34 pages, 13 figures, 15 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI 79%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI 79%

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01719 2026-05-08 cs.CL 79%

What MLLMs Learn about When they Learn about Multimodal Reasoning

大语言模型在学习多模态推理时所学的内容

Jiwan Chung, Neel Joshi, Pratyusha Sharma, Youngjae Yu, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MathLens基准测试,通过分解性能为感知、推理和多模态特定组件,揭示多模态推理模型评估中隐含的假设。研究显示,不同训练策略导致的能力谱系不同,多模态特定错误占比上升,表明进展反映的是子技能平衡变化而非统一提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01424 2026-05-05 cs.LG cs.AI 79%

Quantifying Multimodal Capabilities: Formal Generalization Guarantees in Pairwise Metric Learning

量化多模态能力:成对度量学习中的形式泛化保证

Richeng Zhou, Xuelin Zhang, Liyuan Liu

机构 * College of Informatics, Huazhong Agricultural Univeristy, Wuhan, China

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过理论分析多模态度量学习模型的泛化性质,揭示模态选择与算法性能的关系,推导新的泛化误差界,证明细粒度模态特征能降低假设空间复杂度,提升多模态学习系统的收敛速度和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28011 2026-05-01 cs.CV 79%

Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

Echo-α:用于超声解读的大型代理多模态推理模型

Jing Zhang, Wentao Jiang, Tao Huang, Zhiwei Wang, Jianxin Liu, Jian Chen, Ping Ye, Gang Wang, Zengmao Wang, Bo Du, Dacheng Tao

机构 * MiliLab(Mili实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Echo-α结合了精确的病变定位和整体临床推理,通过九任务监督课程和强化学习提升超声解读的准确性和可解释性。

Comments 12 pages, 4 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14602 2026-05-01 cs.RO cs.AI cs.HC 79%

K2MUSE: A human lower-limb multimodal walking dataset spanning task and acquisition variability for rehabilitation robotics

K2MUSE:一种涵盖任务和采集变异性的下肢多模态行走数据集,用于康复机器人

Jiwei Li, Bi Zhang, Xiaowei Tan, Wanxin Chen, Zhaoyuan Liu, Juanjuan Zhang, Weiguang Huo, Jian Huang, Lianqing Liu, Xingang Zhao

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) College of Artificial Intelligence, Tianjin Key Laboratory of Intelligent Robotics, Nankai University(人工智能学院,天津智能机器人重点实验室,南开大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 K2MUSE数据集通过多模态数据揭示下肢康复机器人与生物力学信息的关系,为康复机器人开发提供大规模步态样本和数据驱动方法支持。

Comments 34 pages, 30 figures,7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27259 2026-05-01 cs.CV cs.LG 79%

VTBench: A Multimodal Framework for Time-Series Classification with Chart-Based Representations

VTBench: 一种基于图表表示的多模态时间序列分类框架

Madhumitha Venkatesan, Xuyang Chen, Dongyu Liu

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VTBench,通过融合原始序列和图表可视化,系统评估了时间序列分类中图表类型、视觉编码和数据集的影响,展示了图表模型在特定领域的竞争力及多模态融合的优势。

Comments 8 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27217 2026-05-01 cs.AI 79%

Toward Personalized Digital Twins for Cognitive Decline Assessment: A Multimodal, Uncertainty-Aware Framework

迈向认知下降评估的个性化数字孪生:一种多模态、不确定性感知的框架

Bulent Soykan, Gulsah Hancerliogullari Koksalmis, Hsin-Hsiung Huang, Laura J. Brattain

机构 * Department of Mechanical, Industrial \& Manufac. Eng. The University of Toledo Toledo, OH, USA Department of Industrial Eng. Mngt. Systems University of Central Florida Orlando, FL, USA Department of Statistics Data Science University of Central Florida Orlando, FL, USA Department of Internal Medicine University of Central Florida Orlando, FL, USA

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态、不确定性感知的框架,用于从稀疏、噪声和不规则的纵向数据中建模患者特定的疾病轨迹,通过结合潜在状态空间模型、多模态融合和不确定性感知验证,实现对认知下降的个性化评估。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03583 2026-04-30 cs.MM cs.IR 79%

OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset

OpenLifelogQA:一个开放式多模态生活日志问答数据集

Quang-Linh Tran, Hoang-Bao Le, Tuong-Nghiem Diep, Binh Nguyen, Gareth J. F. Jones, Cathal Gurrin

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.MM

AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。

Comments In the proceedings of the 14th International Symposium on Information and Communication Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25618 2026-04-29 cs.MM 79%

Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding

超越孤立话语:基于提示的交互用于依赖上下文的对话多模态理解

Zhaoyan Pan, Hengyang Zhou, Xiangdong Li, Yuning Wang, Ye Lou, Jiatong Pan, Ji Zhou, Wei Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出CUCI-Net,通过结合局部模态证据与全局上下文证据,明确抽象上下文与话语之间的依赖关系,将其作为提示融入最终多模态交互阶段,实现上下文条件下的预测。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25072 2026-04-29 cs.CV 79%

Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

超越准确率:统一多模态模型跨任务一致性的基准测试

Weixing Wang, Liudvikas Zekas, Anton Hackl, Constantin Alexander Auga, Parisa Shahabinejad, Jona Otholt, Antonio Rueda-Toicen, Gerard de Melo

机构 * Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所 / 波茨坦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出XT-C-Bench,用于评估统一多模态模型跨任务的语义一致性,发现高生成或理解性能不等于强跨任务对齐,揭示一致性由模态间学习目标耦合紧密度决定。

详情

展开后加载摘要…

URL PDF HTML 收藏