arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2606.22873 2026-06-29 cs.CV cs.CL 新提交 84%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17867 2026-06-17 cs.CV cs.AI 新提交 84%

A Quantitative Analysis of Multimodal Biomarkers in Alzheimer's Disease

阿尔茨海默病多模态生物标志物的定量分析

Antonio Scardace, Daniele Ravì

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) University of Catania(卡塔尼亚大学) Department MIFT(MIFT部门) University of Messina(梅西纳大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 通过整合tau-PET、结构MRI、认知评分和APOE4数据,量化多模态生物标志物间的冗余与预测依赖关系,揭示tau拓扑与萎缩的关联,并分解tau-认知关联,为AD生物标志物选择提供可解释性。

Comments Accepted to ICTS4eHealth 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10724 2026-08-12 cs.CV 新提交 83%

InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection

InterPruner:面向多模态目标检测的、基于泰勒隐式准则与语言先验调制器的交互式结构化剪枝框架

Qi Ming, Zihan Yang, Shaoguang Huang, Si Sun, Hanqing Zhang, Nanqing Liu, Jiahui Lv, Juan Fang, Aleksandra Pizurica

机构 * Beijing University of Technology(北京工业大学) Southwest University(西南大学) China University of Geosciences Wuhan(中国地质大学(武汉)) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Yunnan Normal University(云南师范大学) Beijing Forestry University(北京林业大学) Ghent University(根特大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出首个面向红外-可见光目标检测器的交互式结构化通道剪枝框架InterPruner,结合TIC、MIRA、SPCA方法,在FLIR数据集剪枝50%通道时mAP提升0.6%,代码将发布于GitHub。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07958 2026-08-11 cs.CV 新提交 83%

LIBAD: A Multimodal Anomaly Detection Benchmark for Li-Ion Battery Electrode Manufacturing

LIBAD:面向锂离子电池电极制造的多模态异常检测基准

Wenbo Sui, Daniel Lichau, Harold Phelippeau, Zhao Liu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文推出首个面向锂离子电池电极制造的多模态异常检测基准LIBAD,提出DA-Core方法,其在核心集比例0.05时可降低误报率并缩短推理时间,优于相关基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05817 2026-08-07 cs.CL 新提交 83%

M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

M$^3$R-Bench:一个用于基于证据的多模态隐喻理解的统一基准

Hong Jiang, Junnan Zhu, Jingwang Huang, Xiao Sun, Yuming Yang, Jiang Zhong, Ruirui Chen, Jingman Shi, Hao Wu, Nayu Liu, Xinyi Jiang, Kaiwen Wei

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出多模态隐喻理解基准M$^3$R-Bench,针对现有模型的跨模态证据-映射不匹配问题,构建M$^3$R-Reasoner方法,在多指标上超越GPT-5.5等现有模型。

Comments 6 figures and 5 tables. Hong Jiang, Junnan Zhu, and Jingwang Huang contributed equally. Jiang Zhong and Kaiwen Wei are corresponding authors. Code and data are available at https://github.com/hongshi4/M3R-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05634 2026-08-07 cs.MM 新提交 83%

MEC-Patch: Visible-Infrared Cross-Modal Adversarial Attack Driven by Intrinsic Material Emissivity Laws

MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击

Zhixiang Huang, Xinbo Nie, Wenxuan Wang, Lu Yang, Xin Li, Xuelin Qian, Peng Wang

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.MM

AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 83%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 83%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 83%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 83%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 83%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 83%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31349 2026-07-01 eess.SP cs.AI 新提交 83%

PGUDA: Pressure-Guided Unsupervised Domain Adaptation with Cross-Modal Knowledge Distillation for sEMG-Based Gesture Recognition

PGUDA: 基于压力引导的无监督域适应与跨模态知识蒸馏用于sEMG手势识别

Yurui Liu, Xiao-Cong Zhong, Qisong Wang, Xuefu Wang, Dan Liu, Jinwei Sun

机构 * School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出PGUDA框架,利用压力信号的鲁棒性通过跨模态知识蒸馏引导sEMG特征对齐,在跨主体和跨会话任务中平均准确率58.08%,仅需5%标注数据即可达到全监督性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 83%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26654 2026-06-26 cs.CL cs.HC cs.IR 新提交 83%

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12716 2026-06-26 cs.CL 新提交 83%

Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review

AI审稿人是否看到全貌?攻击与防御多模态同行评审

Xinyu Zhao, Rana Muhammad Shahroz Khan, Zhen Xu, Zhen Tan, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。

Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 83%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16601 2026-06-16 cs.CV 新提交 83%

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

DifferAD-R1: 基于差异引导的多模态大语言模型工业异常定位

Dingrong Wang, Xian Tao, Zhen Qu, Hengliang Luo, Xinyi Gong, Fei Shen, Zhengtao Zhang, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences (CAS)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASI Vision Technology Co., Ltd.(中科慧远视觉技术有限公司) Shandong Laboratory of Aluminum Advanced Manufacturing in Binzhou (SLAAMB), Binzhou Institute of Technology, Weiqiao-UCAS Science and Technology Park(山东省滨州市铝先进制造实验室(SLAAMB),滨州技术学院,魏桥国科科技园) Space Information Research Institute, Hangzhou Dianzi University(杭州电子科技大学空间信息研究院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 多模态评测 :multimodal(title);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出DifferAD-R1框架,通过差异引导双图像范式将异常定位转化为一次性差异定位问题,并设计双一致性定位奖励和难度感知策略,在AD-DualDiff数据集上优于现有方法。

Comments Submitted to IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14780 2026-06-16 cs.CV cs.LG 新提交 83%

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

YTClickbait21K:面向YouTube点击诱饵检测的多模态人工标注数据集,覆盖多样频道与内容类别

Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

机构 * Department of Computer Science and Engineering, Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学计算机科学与工程系) Department of Electrical Engineering, Qatar University(卡塔尔大学电气工程系) Department of Civil and Environmental Engineering, Qatar University(卡塔尔大学土木与环境工程系) SenseNet Inc.(SenseNet公司)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 为应对视频平台点击诱饵检测缺乏大规模高质量多模态数据的问题,构建了包含21,238个视频、来自29国40频道、覆盖新闻/娱乐/教育/游戏等类别的人工标注数据集YTClickbait21K,通过三人独立标注与多数投票确保质量,为多模态语义理解和自动内容审核提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14740 2026-06-16 cs.CV 新提交 83%

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

GridVQA-X: 评估多模态可解释性方法的框架

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal

机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) University of Virginia(弗吉尼亚大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。

Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10194 2026-06-10 cs.LG cs.AI 新提交 83%

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

MMClima:多模态气候科学数据与评估框架

Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad, Ufaq Khan, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Missouri(密苏里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出MMClima,一个包含10万+专家验证问答对的多模态气候问答框架,覆盖文本、视频和图表,用于评估多模态语言模型在气候科学中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 83%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交 82%

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09654 2026-07-13 cs.CV cs.AI 新提交 82%

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

十年视觉语言人工智能模型中准确性和视觉认知错误的演变

Shravan Murlidaran, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13891 2026-08-17 cs.HC 新提交 82%

DepressionAgent: Reading, Listening, Seeing, and Deliberating Multimodal Evidence for Depression Risk Assessment

DepressionAgent:用于抑郁风险评估的阅读、倾听、观察与审议多模态证据框架

Fangjie Zhu, Haifeng Lu, Sicheng Zhao, Runhao Zeng, Xiping Hu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对现有多模态抑郁评估隐式特征融合的不足,提出以证据为中心的DepressionAgent框架,通过显式证据审议等机制在多基准上取得竞争力性能,且有效性与可检查性获多维度验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07867 2026-08-11 cs.LG 新提交 82%

CONFER: Conflict-Aware Evidence Negotiation for Regime-Calibrated Weak Supervision in Multimodal Emotion Recognition

CONFER:面向多模态情感识别中规则校准弱监督的冲突感知证据协商框架

Bojing Hou, Ruohao Li, Yitong Zhu, Luwen Yu, Yuyang Wang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出CONFER框架,针对多模态情感识别中跨模态冲突与自我报告标签不可靠问题,通过图结构的冲突感知证据协商实现弱标签校准,在多数据集严格LOSO协议下取得具竞争力的情感识别准确率,提升了对弱标签损坏的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25294 2026-07-29 cs.CV cs.AI cs.CL cs.LG 新提交 82%

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

CLBench-V:评估从基础到知识获取的多模态上下文学习

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城创新中心) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态上下文学习问题,引入CLBench-V基准,围绕上下文基础、新信息应用和新知识学习三个维度组织任务,结合公共基准与新数据集,经自动化程序构建,测试六个模型,分析相关因素,揭示多模态上下文学习远未饱和及各模型表现情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24862 2026-07-29 cs.IR 新提交 82%

KuaiLive-M3: A Multi-Modal, Multi-Domain, and Multi-Feedback Dataset for Live Streaming Recommendation

KuaiLive-M3:用于直播推荐的多模态、多领域和多反馈数据集

Ke Guo, Changle Qu, Jiayaqi Cheng, Xiao Zhang, Shijun Wang, Xiaoyu Zhang, Xueliang Wang, Le Zhang, Lantao Hu, Jun Xu

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract)

AI总结 针对现有直播数据集的局限,引入KuaiLive-M3数据集,它涵盖多领域用户交互及多模态内容,有丰富反馈记录。基于此建立多种推荐基准,经实验验证其为直播推荐研究提供了有挑战且现实的基准,凸显相关研究要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 82%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22014 2026-07-27 cs.AI cs.CL cs.CV cs.RO 新提交 82%

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

用于空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏