arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-14 至 2026-04-14 共收录 33 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 33 篇

2604.10971 2026-04-14 cs.CV cs.AI 86%

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试

Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09907 2026-04-14 cs.CV cs.AI cs.CL 85%

From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping

从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析

Yu Wu, Guangzeng Han, Ibra Niang Niang, Francia Ravelombola, Maiara Oliveira, Jason Davis, Dong Chen, Feng Lin, Xiaolei Huang

机构 * University of Memphis(孟菲斯大学) University of Missouri(密苏里大学) University of Arkansas Division of Agriculture(阿肯色大学农业分部) Mississippi State University(密西西比州立大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10116 2026-04-14 cs.CV cs.AI 84%

A Dual Cross-Attention Graph Learning Framework For Multimodal MRI-Based Major Depressive Disorder Detection

一种双交叉注意力图学习框架用于多模态MRI基于重大抑郁障碍检测

Nojod M. Alotaibi, Areej M. Alhothali

机构 * King Abdulaziz University(阿卜杜勒阿齐兹国王大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双交叉注意力融合框架,通过建模结构性MRI与功能型MRI的双向交互,提升多模态MRI在重大抑郁障碍检测中的性能,实验显示其在多种脑图谱类型中表现优异。

Comments 19 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09644 2026-04-14 cs.CY cs.AI 84%

Detecting Corporate AI-Washing via Cross-Modal Semantic Inconsistency Learning

通过跨模态语义不一致性学习检测企业AI洗钱

Zhanjie Wen, Jingqiao Guo

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港浸会大学理学院计算机科学系)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract,comments);分类 cs.AI

AI总结 本文提出AWASH框架,通过跨模态主张-证据推理检测企业AI洗钱,利用AW-Bench基准测试,实现高准确率的AI能力识别。

Comments 28 pages, 6 figures, Journal Submission (Finance/Accounting & Computer Science Interdiscipline), 6 tables, 40 references, trimodal benchmark (88,412 firm-quarter observations) and end-to-end multimodal detection framework for corporate AI-washing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11589 2026-04-14 cs.CV 83%

MLLM-as-a-Judge Exhibits Model Preference Bias

基于大语言模型的自动评估存在模型偏好偏差

Shuitsu Koyama, Yuiga Wada, Daichi Yashima, Komei Sugiura

机构 * Keio University(庆应义塾大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文研究了基于多模态大语言模型(MLLM)的自动评估方法中存在模型特定偏好偏差的问题,提出Philautia-Eval工具量化这种偏差,并通过实验发现模型间存在相互偏好偏差,最后引入Pomms模型组合方法有效缓解了偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01139 2026-04-14 cs.CV cs.AI cs.CL cs.LG 82%

SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions

SCITUNE:对齐大型语言模型与人类整理的科学多模态指令

Sameera Horawalavithana, Sai Munikoti, Ian Stewart, Henry Kvinge, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SCITUNE通过多模态指令提升大语言模型在科学任务中的表现,优于现有模型并在ScienceQA基准上超越人类性能。

Comments In Proceedings of the 1st Workshop on NLP for Science, Association for Computational Linguistics

Journal ref Proc. 1st Workshop on Natural Language Processing for Science (NLP4Science 2024) (2024) 58-72

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10064 2026-04-14 cs.CV 81%

On The Application of Linear Attention in Multimodal Transformers

多模态Transformer中线性注意力的应用

Armin Gerami, Seyedehanita Madani, Ramani Duraiswami

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV;any-to-any(comments)

AI总结 本文研究了线性注意力在多模态框架中的应用,通过减少计算开销并保持性能,证明了线性注意力在多模态Transformer中的有效性。

Comments Workshop on Any-to-Any Multimodal Learning (Any2Any), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07413 2026-04-14 cs.CV cs.AI cs.LG 81%

FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

FORGE:面向制造场景的细粒度多模态评估

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang, Xikun Zhang, Chao Zhang, Guanzhi Deng, Alex Xue, Juan Du, Tianshu Yu, Garth Tarr, Linqi Song, Qiuzhuang Sun, Dacheng Tao

机构 * University of Waterloo(滑铁卢大学) University of Sydney(悉尼大学) Singapore Management University(新加坡管理大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Nanyang Technological University(南洋理工大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。

Comments Project Page:https://ai4manufacturing.github.io/forge-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14629 2026-04-14 cs.CV cs.CL 81%

VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites

VisText-Mosquito:一种统一的多模态数据集,用于蚊虫繁殖地的视觉检测、分割和文本解释

Md. Adnanul Islam, Md. Faiyaz Abdullah Sayeedi, Md. Asaduzzaman Shuvo, Shahanur Rahman Bappy, Md Asiful Islam, Swakkhar Shatabda

机构 * United International University, Bangladesh(孟加拉国联合国际大学) University of Arizona, USA(美国亚利桑那大学) BRAC University, Bangladesh(孟加拉国布拉卡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出VisText-Mosquito数据集,整合视觉和文本数据以支持自动化检测、分割和解释,通过YOLOv9s和YOLOv11n-Seg模型实现高精度检测与分割,并利用大视觉语言模型生成文本解释,强调预防胜于治疗的主题。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11709 2026-04-14 cs.AI 79%

A Mamba-Based Multimodal Network for Multiscale Blast-Induced Rapid Structural Damage Assessment

基于Mamba的多模态网络用于多尺度爆炸诱导快速结构损伤评估

Wanli Ma, Sivasakthy Selvakumaran, Dain G. Farrimond, Adam A. Dennis, Samuel E. Rigby

机构 * School of Mechanical, Aerospace

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于Mamba的多模态网络,整合多尺度爆炸载荷信息与光学遥感图像,提升爆炸后结构损伤评估的准确性和速度,通过2020年贝鲁特爆炸案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 79%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :multimodal(title);MLLM(abstract);分类 cs.CV

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 79%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21998 2026-04-14 cs.CV 79%

Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?

多模态大语言模型能否提供实时逐步任务指导?

Apratim Bhattacharyya, Bicheng Xu, Sanjay Haresh, Reza Pourreza, Litian Liu, Sunny Panchal, Pulkit Madan, Leonid Sigal, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Qualcomm Interactive Cooking基准和数据集,用于评估多模态大语言模型在实时任务指导中的能力,引入LiveMamba作为新的基线模型。

Comments Accepted to NeurIPS 2025 (Project page: https://apratimbh.github.io/livecook)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09596 2026-04-14 cs.AI cs.MA 79%

DERM-3R: A Resource-Efficient Multimodal Agents Framework for Dermatologic Diagnosis and Treatment in Real-World Clinical Settings

DERM-3R:一种资源高效的多模态代理框架,用于皮肤病诊断和治疗的现实世界临床应用

Ziwen Chen, Zhendong Wang, Chongjing Wang, Yurui Dong, Luozhijie Jin, Jihao Gu, Kui Chen, Jiaxi Yang, Bingjie Lu, Zhou Zhang, Jirui Dai, Changyong Luo, Xiameng Gai, Haibing Lan, Zhi Liu

机构 * School of Pharmacy, Nanjing University of Chinese Medicine(南京中医药大学药学院) Department of Dermatology, the Gulou Hospital of Traditional Chinese Medicine of Beijing(北京鼓楼中医医院皮肤科) Infectious disease department, Dongfang Hospital, Beijing University of Chinese Medicine(北京中医药大学东方医院感染科) College of Art and Science, university of Washington(华盛顿大学文理学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Fudan Unversity(复旦大学) Zhejiang Lab(之江实验室) University College London(伦敦大学学院) Department of Dermatology, Inner Mongolia Hospital of Traditional Chinese Medicine(内蒙古自治区中医医院皮肤科) International Campus of Zhejiang University(浙江大学国际校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DERM-3R框架,通过三个协作代理解决皮肤病诊断中的细粒度病变识别、多视角病变表示和综合推理问题,展示了其在资源受限下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05005 2026-04-14 cs.CY cs.AI cs.CL 76%

EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content

EduIllustrate:迈向可扩展的自动多模态教育内容生成

Shuzhen Bi, Mingzi Zhang, Zhuoxuan Li, Xiaolong Wang, Keqian Li, Aimin Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出EduIllustrate基准,用于评估LLM在K-12 STEM问题中生成图文结合解释的能力,通过230道题和8维度评估标准,揭示LLM在视觉一致性与成本效率上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09569 2026-04-14 cs.HC 71%

Automatic Mind Wandering Detection in Educational Settings: A Systematic Review and Multimodal Benchmarking

教育场景中的自动思维游离检测:系统综述与多模态基准评估

Anna Bodonhelyi, Augustin Curinier, Babette Bühler, Gerrit Anders, Lisa Rausch, Markus Huff, Ulrich Trautwein, Ralph Ewerth, Peter Gerjets, Enkelejda Kasneci

专题命中 多模态评测 :multimodal(title)

AI总结 本文通过系统综述和多模态基准评估,探讨教育环境中思维游离检测的方法与挑战,评估14种数据集中的EEG、面部视频、眼动追踪和生理信号等多模态数据的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07765 2026-04-14 cs.CV 70%

RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs

RemoteAgent: 通过基于强化学习的代理多模态大语言模型弥合模糊人类意图与遥感观测之间的鸿沟

Liang Yao, Shengxiang Xu, Fan Liu, Chuanyi Zhang, Bishun Yao, Rui Min, Yongjun Li, Chaoqian Ouyang, Shimin Di, Min-Ling Zhang

机构 * Hohai University(河海大学) Southeast University(东南大学) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出RemoteAgent框架,通过VagueEO数据集和强化学习微调,使多模态大语言模型能直接解决图像和稀疏区域任务,并通过模型上下文协议智能协调专用工具进行密集预测,提升遥感任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09649 2026-04-14 cs.HC cs.AI eess.SP 70%

WearBCI Dataset: Understanding and Benchmarking Real-World Wearable Brain-Computer Interfaces Signals

WearBCI 数据集:理解和评估真实世界可穿戴脑机接口信号

Haoxian Liu, Hengle Jiang, Lanxuan Hong, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出WearBCI数据集,通过同步多模态记录和系统性评估,研究运动伪影对可穿戴BCI信号的影响,并探索跨模态信号增强和多维行为理解的新应用。

Comments Accepted by Sensys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 62%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11004 2026-04-14 cs.CV cs.AI cs.LG 62%

Panoptic Pairwise Distortion Graph

全景成对失真图

Muhammad Kamran Janjua, Abdul Wahab, Bahador Rashidi

机构 * Huawei Technologies(华为技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出全景成对失真图任务,通过区域结构化组成图像对,改进现有方法对整体图像分析的局限性,构建PandaSet数据集、PandaBench基准和Panda架构,揭示多模态大语言模型在区域级失真理解上的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10666 2026-04-14 cs.CV cs.CL cs.LG 62%

Omnimodal Dataset Distillation via High-order Proxy Alignment

通过高阶代理对齐实现多模态数据集蒸馏

Yuxuan Gao, Xiaohao Liu, Xiaobo Xia, Tongliang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) The University of Sydney(悉尼大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HoPA方法,通过紧凑代理捕捉高阶跨模态对齐,解决多模态数据集蒸馏中的异质性和复杂跨模态交互问题,实现可扩展的联合蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10485 2026-04-14 cs.CV cs.AI 62%

UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation

UDAPose:无监督领域适应用于低光人类姿态估计

Haopeng Chen, Yihao Ai, Kabeen Kim, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Duksung Women’s University(德成女子大学) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UDAPose提出了一种新的框架,通过合成低光图像并动态融合视觉线索与姿态先验,提升低光环境下的人体姿态估计性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09876 2026-04-14 cs.LG cs.AI cs.CV cs.HC 62%

Efficient Personalization of Generative User Interfaces

高效生成用户界面的个性化

Yi-Hao Peng, Samarth Das, Jeffrey P. Bigham, Jason Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Purdue University(普渡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了生成用户界面个性化难题,提出基于历史设计师偏好样本的高效方法,在技术评估中优于预训练模型,并能生成更多用户偏好界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11653 2026-04-14 cs.CV 57%

GazeVaLM: A Multi-Observer Eye-Tracking Benchmark for Evaluating Clinical Realism in AI-Generated X-Rays

GazeVaLM:一个多观察者眼动基准测试,用于评估AI生成X光片的临床真实性

David Wong, Zeynep Isik, Bin Wang, Marouane Tliba, Gorkem Durak, Elif Keles, Halil Ertugrul Aktas, Aladine Chetouani, Cagdas Topel, Nicolo Gennaro, Camila Lopes Vendrami, Tugce Agirlar Trabzonlu, Amir Ali Rahsepar, Laetitia Perronne, Matthew Antalek, Onural Ozturk, Gokcan Okur, Andrew C. Gordon, Ayis Pyrros, Frank H. Miller, Amir Borhani, Hatice Savas, Eric Hart, Elizabeth Krupinski, Ulas Bagci

机构 * Northwestern University(西北大学) Loyola University Chicago(洛约拉大学芝加哥分校) DuPage Medical Group(杜佩奇医疗集团) Emory University(埃默里大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 GazeVaLM通过眼动数据和临床标签,评估AI生成X光片的临床真实性,对比人类专家与LLM的诊断准确性。

Comments This work appears in ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11579 2026-04-14 cs.CV 57%

Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions

透过触觉:基于触觉驱动的材料区域视觉定位

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出通过密集跨模态特征交互学习局部视觉-触觉对齐,生成触觉条件下的材料分割热图,提升材料区域视觉定位的鲁棒性和多样性。

Comments CVPR 2026. Project page: https://mm.kaist.ac.kr/projects/SeeingThroughTouch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11258 2026-04-14 cs.CL 57%

Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate

辩证-调解:通过反事实对抗多智能体辩论缓解诊断幻觉

Zhixiang Lu, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Dialectic-Med框架,通过多智能体对抗辩论机制缓解医疗多模态大语言模型的诊断幻觉问题,提升推理可信度和解释忠实度。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 57%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10787 2026-04-14 cs.CL 57%

When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities

当意义不再字面化:探索跨语言和模态的隐喻意义

Sarmistha Das, Shreyas Guha, Suvrayan Bandyopadhyay, Salisa Phosit, Kitsuchart Pasupa, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) King Mongkut's Institute of Technology Ladkrabang(国王科技大学拉卡邦分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Mediom多语言多模态隐喻语料库及HIDE框架,通过系统性测试揭示语言模型在隐喻理解上的缺陷,并为下一代AI系统提供文化根基的隐喻理解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10039 2026-04-14 cs.CV 57%

Counting to Four is still a Chore for VLMs

为VLMs计数仍是一项苦差事

Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文通过行为和机制分析研究VLMs的计数行为,提出COUNTINGTRICKS评估套件,揭示模型在不同布局和对抗提示下的漏洞,并验证Modality Attention Share方法能缓解计数失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏