arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-19 至 2026-08-19 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 14 篇

2608.12781 2026-08-19 cs.CV 版本更新 86%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17605 2026-08-19 cs.CL cs.AI cs.SD 新提交 84%

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

多轮对话式AI:从文本到多模态交互——数据、模型、评估与开放挑战

Syeda Faiza Ahmed, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

专题命中 多模态评测 :multimodal(title,abstract);omni-modal(abstract);分类 cs.CL、cs.AI

AI总结 本研究综述多轮对话式AI的发展现状,梳理其在数据、模型等方面的进展,指出多模态交互能力提升但存在记忆等短板,并提出相关研究议程。

Comments Multi-turn Conversational AI; Multimodal Dialogue; AudioLLMs; Conversational Memory; Tool-Augmented Agents; Dialogue Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17895 2026-08-19 cs.CL cs.AI 新提交 81%

BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

BEAR-Bench:面向多模态模型的双语企业与学术推理基准

Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev

机构 * Yandex Applied AI Institute(Yandex应用人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型在文本密集专业文档推理能力评估的不足,推出英俄双语的BEAR-Bench基准,评估16个多模态大语言模型并对比幻觉检测方法,发现最强模型仍有明显性能提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17884 2026-08-19 cs.CV 新提交 79%

CFB-GBM v2.0: An Augmented Longitudinal Dataset for Multi-Modal Glioblastoma Segmentation, Radiomics, and RANO Progression Tracking

CFB-GBM v2.0:用于多模态胶质母细胞瘤分割、放射组学及RANO进展追踪的增强纵向数据集

Alexandre G. Leclercq, Noémie N. Moreau, Hugo Audebert, Andros Nassar, Thomas Cochin, Thomas Leleu, Loïc Le Henaff, Alexis Desmonts, Yoann Poirier, Aurélie Dubru, Laura Guillemette, Pascal Lecoeur, Kévin Lemasson, Cyril Jaudet, Sébastien Bougleux, Romain Hérault, Carole Brunaud, Samuel Valable, Dinu Stefan, Charlotte Raboutet, Alain Batalla, Joëlle Lacroix, Roman Rouzier, Aurélien Corroyer-Dulmont

机构 * Centre François Baclesse(弗朗索瓦·巴克莱斯中心) Université de Caen Normandie(卡昂诺曼底大学) ENSICAEN(卡昂高等工程师学院) GREYC(格雷计算机科学研究中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文发布增强版CFB-GBM v2.0纵向数据集,含264名GBM患者数据,完成所有时间点GTV勾画(完成率达97%),提供相关标注、特征及WHO分类信息,可用于多模态GBM相关研究。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08093 2026-08-19 cs.AI 版本更新 79%

A Multimodal Agentic Pathology Co-pilot via Evidence Grounded Reasoning

面向证据基础计算病理学的多模态智能体协同助手

Zhe Xu, Zhengyu Zhang, Zhiyuan Cai, Jiahao Xu, Yijie Lin, Ziyi Liu, Junlin Hou, Hongyi Wang, Yuxiang Nie, Yihui Wang, Jiabo Ma, Ling Liang, Yingxue Xu, Zhengrui Guo, Guanghao Wu, Danyi Li, Ziqi Zhou, Donglin Tan, Zhijian Cen, Ying Tan, Xiaolin Liu, Qi Xie, Xiaoying Tang, Xi Peng, Cheng Deng, Lijuan Qu, Ronald Cheong Kin Chan, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, Southern Medical University(南方医科大学南芳医院病理科) Department of Pathology, School of Basic Medical Sciences, Southern Medical University(南方医科大学基础医学学院病理科) Department of Anatomical and Cellular Pathology, Chinese University of Hong Kong(香港中文大学解剖与细胞病理学系) Guangdong Provincial Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory(锦风实验室) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) Division of Life Science, Hong Kong University of Science and Technology(香港科技大学生命科学系) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学神经系统疾病国家重点实验室) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology(香港科技大学深圳-香港协同创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出PathPocket,一种多模态AI协同助手,通过构建包含11万文档的病理证据语料库和455万实体的超图,实现基于证据的病理诊断,在20万真实案例上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00547 2026-08-19 cs.AI cs.LG 版本更新 79%

Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models

统一是否带来代价?Uni-SafeBench:一种用于统一多模态大模型的安全基准

Zixiang Peng, Yongxiu Xu, Qin-Yi Zhang, Jiexun Shen, Yi-Fan Zhang, Hongbo Xu, Yubin Wang, Gaopeng Gou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Uni-SafeBench,用于评估统一多模态大模型的安全性,发现统一过程虽提升能力但显著降低基础LLM的安全性,开源资源以促进更安全的AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17962 2026-08-19 cs.RO 新提交 78%

PRISM: Precision and contact-rich Real-world Industrial Skill dataset with Multimodal sensing

PRISM:具备多模态感知的高精度高接触真实工业技能数据集

Tengbo Yu, Jiahao Wu, Hanning Wang, Rui Chen, Chuanhou Liu, Chuang Sun, Hangxin Liu

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Delta Intelligence(三角洲智能公司) PKU-Wuhan Institute for Artificial Intelligence(北京大学武汉人工智能研究院) Hubei Humanoid Robot Innovation Center Co., Ltd.(湖北人形机器人创新中心有限公司) China Academy of Information and Communications Technology(中国信息通信研究院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文介绍PRISM——一个面向高接触工业操作的大规模多模态数据集,涵盖25余项操作任务,包含5000余条共45小时的遥操作演示,为高精度工业场景的多模态感知与控制提供真实基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17931 2026-08-19 cs.CL cs.MM cs.SD 新提交 62%

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

SpeechSense:面向细粒度语音情感分析的副语言聚焦数据集

Shicheng Ma, Wenqian Cui, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.MM

AI总结 本文针对现有语音情感分析研究的两大局限,构建了副语言聚焦的细粒度语音情感分析数据集SpeechSense,实验证实具备声学信息的模型性能优于纯文本基线,凸显了声学线索的重要性。

Comments 7 pages, 2 figures, 5 tables. Accepted to ACM Multimedia 2026 (Dataset Track). Dataset and code: this https URL (https://github.com/Sher13cked/SpeechSense)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17514 2026-08-19 cs.CV cs.MM 新提交 62%

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

机构 * Faculty of Information Technology(信息技术学院) University of Jyväskylä(于韦斯屈莱大学) Adobe Research(奥多比研究院) University of Helsinki(赫尔辛基大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 62%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14947 2026-08-19 cs.AI 版本更新 57%

RETRACE: Resilience-Guided Trait-Conditioned Craving Estimation from Wearable Physiology in Opioid Use Disorder

RETRACE:基于可穿戴生理信号的阿片类药物使用障碍中韧性引导的特质条件渴求估计

Yi Xiao, Harshit Sharma, Dessa Bergen-Cico, Asif Salekin

机构 * Arizona State University(亚利桑那州立大学) Syracuse University(雪城大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究针对阿片类药物使用障碍跨受试者渴求检测难题,提出RETRACE框架,通过双编码器结合韧性上下文实现轻量个性化,在多模态数据集上较基线提升7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-08-19 cs.SE cs.AI cs.CR cs.IR cs.LG 版本更新 57%

From Adoption to Deployment: A Qualitative Study on AI Integration in Software Development Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09812 2026-08-19 eess.IV cs.CV cs.LG 版本更新 57%

CHM-Net: Center Heatmap-driven Macro-Micro Modeling Network for MRI-based Microbial Density Stratification

CHM-Net:基于中心热图驱动的宏观-微观建模网络用于基于MRI的微生物密度分层

Jiaming Liang, Haolin Chen, Tingting Li, Bowen Yu, Qianyan Long, Tinghe Zhang, Xi Zhong, Xiaowei Hu, Xiaoqi Sheng, Hongmin Cai

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Future Technology(未来技术学院) Department of Medical Imaging(医学影像科) Affiliated Cancer Hospital, Guangzhou Medical University(广州医学院附属癌症医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究基于MRI的微生物密度分层,提出CHM-Net,通过中心热图引导小病变反应定位,构建宏观-微观证据预测微生物密度,在GBNPC 2026数据集上验证有效性,在两个3D医学图像数据集上证实鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17553 2026-08-19 cs.RO 新提交 50%

Scalix: Uncertainty-Aware Scale-Consistent Monocular SLAM

Scalix:感知不确定性的尺度一致单目SLAM

Sebastian Barbas Laina, Tianyi Zhang, Panagiotis Petropoulakis, Simon Schaefer, Simon Boche, Jaehyung Jung, Cedric Le Gentil, Stefan Leutenegger

机构 * University of Technology, Sydney(悉尼科技大学) Centre for Autonomous Systems(自主系统中心)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出实时单目SLAM框架Scalix,通过整合带不确定性的学习深度线索到概率因子图,实现度量尺度估计,在多环境基准上性能领先且实时泛化。

Comments 8 pages, 5 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏