arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 82%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03981 2026-07-07 cs.CL cs.AI cs.CV 新提交 82%

BanglaMemeEvidence: A Multimodal Benchmark Dataset for Explanatory Evidence Detection in Bengali Memes

孟加拉语模因证据:用于孟加拉语模因中解释性证据检测的多模态基准数据集

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Pronay Debnath, Asif Iftekher Fahim, Faisal Muhammad Shah

机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究旨在检测孟加拉语模因中解释其含义和幽默的特定句子,介绍了混合任务MemeEvidenceDetect,提出数据集BanglaMemeEvidence及多模态框架BengaliMemeEvidenceNet,实验验证了框架有效性,推动低资源语言模因分析。

Comments Accepted at 6th International Conference on Innovations in Computational Intelligence and Computer Vision (ICICV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27499 2026-06-29 cs.CV cs.AI cs.CL 新提交 82%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15692 2026-06-16 eess.IV 新提交 82%

A Surface-based Multimodal Framework for Multitask Analysis in Alzheimer's Disease

基于表面的多模态框架用于阿尔茨海默病的多任务分析

Shuo Huang, Jianwei Zhang, Lujia Zhong, Jiaxin Yue, Yihao Xia, Xinkai Wang, Yonggang Shi

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出一种增强的球形数据驱动多模态框架,通过球形扩散模型生成配对皮层厚度和Tau PET SUVR数据,结合对比学习和上下文学习,实现多任务分类与回归,在ADNI数据集上优于六种基线模型。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 81%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 多模态评测 :MLLM(summary_cn,abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 81%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14958 2026-06-16 cs.CV cs.IR cs.LG 新提交 81%

MVEB: Massive Video Embedding Benchmark

MVEB:大规模视频嵌入基准

Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michelle Yang, Márton Kardos, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Harvard University(哈佛大学) SaluteDevices MIRAI Zendesk Shanghai University of Finance and Economics(上海财经大学) Google LLC Salesforce Cornell University(康奈尔大学) Astera Institute(Astera研究院) Independent Contributor(独立贡献者) Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦分校) Barclays(巴克莱银行) Aarhus University(奥胡斯大学) Stanford University(斯坦福大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MVEB基准,包含23个任务评估33种视频嵌入模型,发现无单一模型占优,音频贡献取决于标注来源,并集成到MTEB生态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14389 2026-08-17 cs.CV cs.AI 新提交 81%

GBU-Palm: A Multimodal Video Dataset and Benchmark for Palm Presentation Attack Detection

GBU-Palm:用于掌纹呈现攻击检测的多模态视频数据集与基准

Yingjie Ma, Zitong Yu, Wei Jia, Ajay Kumar, Linlin Shen

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GBU-Palm多模态掌纹PAD数据集与基准,通过控制泄漏协议分离身份与攻击谱系,测试4种视频架构,发现环境变化下架构性能下降,RGB-NIR融合未始终优于仅RGB输入,为跨环境掌纹PAD研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14075 2026-08-17 cs.AI cs.CV cs.DL 新提交 81%

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

通用科学人工智能的实现路径:科学图像的多模态理解

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) Eindhoven University of Technology(埃因霍温理工大学) Freie Universität Berlin(柏林自由大学) International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) National University of Sciences and Technology(国家科技大学) University of Warwick(华威大学) PSG College of Technology(PSG理工学院) Aalto University(阿尔托大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-13 cs.CV cs.AI 新提交 81%

Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 81%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09122 2026-08-11 cs.CV cs.AI 新提交 81%

Visual Distortion Detection in UGC Images Using Large Multimodal Models

基于大型多模态模型的UGC图像视觉失真检测

Ziheng Jia, Yingji Liang, Jiaying Qian, Xiongkuo Min

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有LMM图像失真检测方法准确率不足及合成失真泛化差距问题,提出VIGIL模型,构建VIGIL-140K数据集,利用LLM解码器多层级特征检测并缓解FG-BG分离问题,在两类任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08727 2026-08-11 cs.CV cs.AI 新提交 81%

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

TomaMMU:用于番茄叶片病害的综合多模态理解基准

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

机构 * FPT University(FPT大学) Korea University(高丽大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究推出用于番茄叶片病害多模态理解的TomaMMU数据集及TomaBench基准,评估14种VLMs时发现其细粒度识别等存在差距,微调后MCQ准确率达96.09%,为相关研究提供了方向。

Comments Accepted at ECCV CVPPA Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00446 2026-08-04 cs.CV cs.AI 新提交 81%

Structured Proxy Features for Multimodal NSCLC Survival Prediction from Pretreatment CT

用于基于治疗前CT的多模态非小细胞肺癌(NSCLC)生存预测的结构化代理特征

Huu Phong Nguyen, Delower Hossain, Ehsan Saghapour, Zhandos Sembay, Jake Y. Chen

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对NSCLC生存分层难题,用模拟衍生的6种结构化代理特征扩充多模态数据,结合TMAE模型,在Lung1队列取得优于现有方法的预测性能,验证了代理特征的互补价值。

Comments 33

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00100 2026-08-04 cs.CV cs.AI 新提交 81%

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models

SPARC-Rad:面向放射学视觉语言模型的空间与解剖推理多模态基准数据集及评估流程

Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究开发了SPARC-Rad多模态基准数据集及评估流程,用于评估放射学VLMs的空间与解剖推理能力,为相关模型的开发与部署前评估提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27393 2026-07-31 cs.CL cs.AI 新提交 81%

AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes

AHA-Memes:用于理解阿拉伯语表情包中仇恨内容的细粒度多模态基准

Mohamed Bayan Kmainasi, Ali Ezzat Shahroor, Abul Hasnat, Md. Rafiul Biswas, Wajdi Zaghouani, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Northwestern University in Qatar(卡塔尔西北大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出首个带细粒度多标签标注的阿拉伯语仇恨表情包基准AHA-Memes,构建含5000张人工标注及6.6万张银标的数据集,对多类模型基准测试并发布资源以推动相关研究。

Comments 26 pages, 14 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25947 2026-07-29 cs.AI cs.CL 新提交 81%

A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架

Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25933 2026-07-29 cs.CL cs.AI 新提交 81%

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理

Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng

机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25679 2026-07-29 cs.LG cs.AI cs.MM 新提交 81%

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

DynaBridge:用于DASS结构心理健康评估的动态摘要引导跨任务多模态融合

Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 研究针对心理健康评估中通用融合模型忽略问卷标签心理测量结构的问题,提出DynaBridge框架,通过编码多模态线索并结合语义摘要进行评估,在官方验证分割上优于基线和其他方法,展现了多模态融合与心理测量结构结合的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22352 2026-07-27 cs.CV cs.AI eess.IV 新提交 81%

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

时间反转成像:用于重建过去人类与环境交互的多模态基准和框架

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出时间反转成像范式,通过TRACE-HEI数据集及多模态推理方法,从热、紫外和可见光谱中残余物理印记推断过去人类与环境交互,为时间反转成像奠定基础,开辟场景理解新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19235 2026-07-22 cs.CL cs.CV 新提交 81%

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 81%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15241 2026-07-17 cs.CL cs.CV 新提交 81%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 81%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13826 2026-07-16 cs.CV cs.AI cs.IR cs.LG 新提交 81%

Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning

使用深度学习对胰腺癌可切除性进行多模态评估

Vincent Ochs, Christoph Kuemmerli, Florentin Bieder, Julia Wolleb, Joel L. Lavanchy, Julia Ruppel, Jan Liechti, Stephanie Taha-Mehlitz, Christian Andreas Nebiker, Beat Mueller, Giuseppe Kito Fusai, Joerg-Matthias Pollok, Anas Taha, Philippe C. Cattin, Sebastian Staubli

机构 * University of Basel(巴塞尔大学) Clarunis, University Digestive Health Centre(克拉鲁尼斯大学消化健康中心) Kantonsspital Aarau(阿劳州立医院) Royal Free Hospital(皇家自由医院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究利用深度学习框架联合分析CT与临床信息,对胰腺癌可切除性分类。通过Swin-UNETR主干获取图像特征,融合临床嵌入,经动态多任务目标训练,能将患者分入NCCN的三种可切除性类别,提高评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06633 2026-07-09 cs.CV cs.AI 新提交 81%

ProMoE-FL: Prototype-conditioned Mixture of Experts for Multimodal Federated Learning with Missing Modalities

ProMoE-FL:用于具有缺失模态的多模态联邦学习的原型条件专家混合模型

Aavash Chhetri, Bibek Niroula, Eduard Vazquez, Yash Raj Shrestha, Prashnna Gyawali, Loris Bazzani, Binod Bhattarai

机构 * NepAl Applied Mathematics and Informatics Institute(尼泊尔应用数学与信息学研究所) Fogsphere (Redev.AI Ltd)(福格球(Redev.AI有限公司)) University of Lausanne(洛桑大学) West Virginia University(西弗吉尼亚大学) University of Verona(维罗纳大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态联邦学习中缺失模态问题,提出ProMoE-FL框架,构建全局客户端感知原型库,以原型和模态索引为条件实现专家路由来动态合成缺失特征,在四个胸部X光数据集评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04727 2026-07-07 cs.SE cs.AI cs.CV 新提交 81%

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

Dashboard2Code:在重建交互式仪表板上评估多模态模型

Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究院)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态模型在交互式仪表板重建任务,介绍Dashboard2Code任务,提出DashboardMimic基准及自动化评估框架,实验发现开源与闭源模型在此任务上有差距。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04010 2026-07-07 cs.AI cs.CL cs.CY cs.LG 新提交 81%

Explainable AI for Screening Abuse-Related Trauma in Bangladeshi Children: A Training-Free Multimodal Framework Evaluated on Noise-Aware Synthetic Data

用于筛查孟加拉国儿童虐待相关创伤的可解释人工智能:基于噪声感知合成数据评估的无训练多模态框架

Salma Hoque Talukdar Koli, Fahima Haque Talukder Jely

机构 * One-Stop Crisis Centres (OCC)(一站式危机中心(OCC)) Department of Social Services (DSS)(社会服务部(DSS))

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉国儿童虐待相关心理创伤筛查工具缺失问题,提出无训练多模态融合框架ShishuRaksha AI,经噪声感知合成数据评估,该融合模型AUC达0.874,为低资源环境下儿童保护筛查提供可行性研究和设计贡献。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 81%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 81%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏