arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-28 至 2026-05-28 共收录 111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2502.17832 2026-05-28 cs.LG cs.AI cs.CR cs.CV 86%

MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks

MM-PoisonRAG:通过局部和全局投毒攻击破坏多模态RAG

Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MM-PoisonRAG框架,通过局部投毒攻击(LPA)和全局投毒攻击(GPA)两种策略,系统研究多模态检索增强生成(RAG)在知识投毒下的脆弱性,实验表明攻击成功率高达56%且能绕过现有防御。

Comments Code is available at https://github.com/HyeonjeongHa/MM-PoisonRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22547 2026-05-28 cs.CV cs.AI 84%

Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement

基于多模态知识图谱和可靠性引导精化的病例感知医学图像分类

Yiming Xu, Yixuan Liu, Yuhang Zhang, Ling Zheng, Yihan Wang, Qi Song

机构 * University of Science and Technology of China(科学技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于多模态知识图谱的病例感知推理框架,通过构建结构化诊断记忆、自适应检索相似病例、知识传播与注入机制以及置信度校准的决策精化方案,提升医学图像分类的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21832 2026-05-28 cs.AI 79%

FLUID: From Ephemeral IDs to Multimodal Semantic Codes for Industrial-Scale Livestreaming Recommendation

FLUID:从临时ID到多模态语义编码的工业级直播推荐

Xinhang Yuan, Zexi Huang, Anjia Cao, Xudong Lu, Zikai Wang, Penghao Zhou, Chang Liu, Wentao Guo, Qinglei Wang

机构 * TikTok(字节跳动) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对直播推荐中ID冷启动问题,提出FLUID框架,通过跨域多模态编码器生成层次化语义编码LUCID替代候选侧ID,并采用分阶段预热方案,在工业级系统上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11632 2026-05-28 cs.CV 79%

KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering

KG-ViP:在多模态大语言模型中桥接知识基础与视觉感知以进行视觉问答

Zhiyang Li, Ao Ke, Yukun Cao, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,中国科学技术大学) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出KG-ViP框架,通过检索与融合场景图和常识图,统一外部知识与细粒度视觉细节,缓解多模态大语言模型在视觉问答中的知识幻觉和视觉感知不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27449 2026-05-28 cs.IR cs.AI 77%

Checking Fact with Better Retrieval: Dynamic Contrastive Learning for Evidence Retrieval

用更好的检索核查事实:用于证据检索的动态对比学习

Zhongtian Hua, Yi Luo, Meijia Yu, Yingjie Han

机构 * Zhengzhou University(郑州大学) Henan University of Science and Technology(河南科技大学)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出动态自适应对比学习方法DACLR,通过事件级特征提取、两阶段检索和动态对比损失优化,提升多模态证据检索的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23282 2026-05-28 cs.CV cs.MM 62%

Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search

弥合姿态-语义鸿沟:基于文本的人物异常搜索的级联框架

Zequn Xie, Guijin Luo, Chuxin Wang, Sihang Cai, Tao Jin, Zhou Zhao, Yixuan Tang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出结构-语义解耦级联(SSDC)框架,通过两阶段检索(结构感知粗检索和多智能体语义验证)平衡效率与语义推理,在PAB基准上达到最优性能。

Comments Accepted to ACL 2026.10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00501 2026-05-28 cs.CV 57%

CPPO: Contrastive Perception Policy Optimization for VLM Agents

CPPO: 面向VLM智能体的对比感知策略优化

Ahmad Rezaei, Mohsen Gholami, Saeed Ranjbar Alvar, Kevin Cannons, Mohammad Asiful Hossain, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * Huawei Technologies Canada Co. Ltd.(华为技术加拿大有限公司) Huawei Cloud(华为云)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种自监督的对比感知策略优化方法CPPO,通过对比感知损失增强视觉语言模型的视觉基础能力,无需额外模型或标注,在感知关键任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 15 篇

2605.27374 2026-05-28 cs.CL 89%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27993 2026-05-28 cs.CL 87%

Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation

重新思考视觉忽视:通过上下文偏好引导缓解MLLM幻觉

Jingwen Wu, Xijun Zhang, Ge Song

机构 * School of Computer and Electronic Information, Nanjing Normal University(计算机与电子信息学院,南京师范大学)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 针对多模态大语言模型的物体幻觉问题,提出无需训练的上下文偏好激活引导框架(CAS),通过提取上下文偏好向量并在中间早期MLP层注入符号残差来控制信息依赖,有效缓解幻觉且不增加解码延迟。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28733 2026-05-28 cs.AI 83%

Utility-Aware Multimodal Contrastive Learning for Product Image Generation

效用感知的多模态对比学习用于产品图像生成

Xiaohang Feng, Yiling Xie

机构 * City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 提出一种效用感知的多模态对比学习框架,通过引入效用感知InfoNCE损失优化产品图像生成,使图像在语义对齐的同时提升市场需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28678 2026-05-28 cs.AI 79%

DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution

DREAM-R: 基于强化学习的精炼草稿、精确验证与完全并行执行的多模态推测推理

Yunhai Hu, Zining Liu, Xiangyang Yin, Tianhua Xia, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出DREAM-R框架,通过强化学习优化草稿生成、阈值验证机制和完全并行执行,加速多模态模型的推理密集型任务,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27545 2026-05-28 cs.CL 79%

PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI

PAST2HARM:一种用于越狱多模态AI的简单自适应过去时攻击

Snehasis Mukhopadhyay

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡利安)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 提出PAST2HARM框架,通过过去时态改写和迭代升级策略,系统性地利用多模态文本到图像模型的安全漏洞,实现黑盒、无梯度的高成功率越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27595 2026-05-28 cs.CV cs.AI 76%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 多模态生成 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28035 2026-05-28 cs.AI cs.MM cs.SD 62%

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式

Haitian Li, Yanghao Zhou, Heyan Huang, Liangji Chen, YiMing Cheng, Xu Liu, Dian Jin, Jiajun Xu, Jingyun Liao, Tian Lan, Ziqin Zhou, Yueying Liu, Yu Bai, Changsen Yuan, Jinxing Zhou, Xian-Ling Mao, Xuefeng Chen, Yousheng Feng

机构 * Shanghai University(上海大学) Beijing Institute of Technology(北京理工大学) Shanghai Film Academy(上海电影学院) Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) Inkeverse Group Limited(Inkeverse集团有限公司) The University of Adelaide(阿德莱德大学) Beijing University of Technology(北京工业大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenNLP Lab(OpenNLP实验室)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.AI、cs.MM

AI总结 针对多说话人音视频生成中电影表现力评估不足的问题,提出MTAVG-Bench 2.0基准,通过构建涵盖表演、叙事、氛围和视听语言的高层次失败分类体系及超过1万个问答实例,系统评估全模态大语言模型诊断复杂视听失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17737 2026-05-28 cs.CV cs.AI 62%

The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

脚本即一切:一个用于长程对话到电影视频生成的智能体框架

Chenyu Mu, Xin He, Qu Yang, Wanshun Chen, Jiadi Yao, Huang Liu, Zihao Yi, Bo Zhao, Xingyu Chen, Ruotian Ma, Fanghua Ye, Erkun Yang, Cheng Deng, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一个端到端智能体框架,通过训练ScripterAgent将对话转化为精细脚本,并利用DirectorAgent跨场景连续生成策略,实现长程对话到电影视频的连贯生成,显著提升脚本忠实度和时间保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27924 2026-05-28 cs.CV 57%

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) Alibaba Group(阿里巴巴集团) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27417 2026-05-28 quant-ph cs.AI cs.LG 57%

Quantum Machine Learning-based 6G edge Network: Enabling Adaptive Communication and Model Aggregation

基于量子机器学习的6G边缘网络:实现自适应通信与模型聚合

Wenjing Xiao, Jiatai Yan, Chenglong Shi, Shixin Chen, Miaojiang Chen, Min Chen, Saif Al-Kuwari, Ahmed Farouk

机构 * School of Computer, Electronics and Information, Guangxi University(广西大学计算机电子信息学院) Guangxi Key Laboratory of Multimedia Communications and Network Technology(广西多媒体通信与网络技术重点实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Pazhou Laboratory(琶洲实验室) Qatar Center for Quantum Computing, College of Science and Engineering, Hamad Bin Khalifa University(卡塔尔量子计算中心,哈马德·本·哈利法大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对6G V2X通信中的高维状态空间、异构节点和动态环境挑战,提出量子增强框架,包含信道自适应语义通信、多模态融合、模型迁移和联邦聚合四个模块,利用量子卷积神经网络、量子注意力、量子强化学习和量子张量分解提升效率、泛化能力和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15523 2026-05-28 cs.CV 57%

Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning

自提示扩散变压器用于开放词汇场景文本编辑的上下文学习

Hongxi Li, Tong Wang, Chengjing Wu, Tianbao Liu, Jiangtao Yao, Xiaochao Qu, Xinxiao Wu, Luoqi Liu, Ting Liu

机构 * MT Lab, Meitu Inc., Beijing, China School of Computer Science \& Technology, Beijing Institute of Technology, Beijing, China

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种自提示场景文本编辑方法,通过构建风格和字形提示,利用多模态扩散变压器的上下文学习能力,实现开放词汇和风格一致的文本编辑。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02028 2026-05-28 cs.CL 57%

Why Gaussian Diffusion Models Fail on Discrete Data and How to Prevent It?

为什么高斯扩散模型在离散数据上失败以及如何防止?

Alexander Shabalin, Simon Elistratov, Viacheslav Meshchaninov, Ildus Sadrtdinov, Dmitry Vetrov

机构 * Constructor University(Constructor大学) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文研究高斯扩散模型在离散数据上采样质量差的原因,发现关键采样区间内噪声数据密度呈多峰分布导致DDPM进入低密度区域,并提出自条件化和q采样结合的方法来改善生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02019 2026-05-28 cs.LG cs.AI stat.ML 57%

Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning

扩散增强马尔可夫决策过程用于最大熵强化学习

Sebastian Sanokowski, Kaustubh Patil

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University Munich(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑) Practical Project Student Exchange Program, Technical University Munich(技术大学慕尼黑实践项目学生交换计划) MIT World Peace University(MIT和平大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文通过将最大熵强化学习扩展到扩散过程,提出扩散增强马尔可夫决策过程(DA-MDPs),以最小化反向KL散度的上界来学习最优策略轨迹分布,并成功将PPO、WPO和REPPO适配为扩散变体,在连续控制和多模态基准上取得与基线相当或更优的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28226 2026-05-28 cs.LG 50%

PhAME: Phenotype-Aware Molecular Editing via Latent Diffusion

PhAME: 基于表型感知的潜在扩散分子编辑

Łukasz Janisiów, Sebastian Musiał, Bartosz Zieliński, Dawid Rymarczyk, Tomasz Danel

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(杰洛内夫斯基大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(杰洛内夫斯基大学精确与自然科学博士学院) Jagiellonian Center for Artificial Intelligence, Jagiellonian University(杰洛内夫斯基人工智能中心) Faculty of Chemistry, Jagiellonian University(杰洛内夫斯基大学化学系) Ardigen SA(Ardigen公司)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出PhAME框架,利用潜在扩散模型在预训练图VAE的潜在空间中进行分子编辑,通过组合无分类器引导机制同时优化表型条件和结构相似性,实现高化学有效性和新颖性的多目标分子优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13177 2026-05-28 cs.RO 50%

ROOM: A Physics-Based Continuum Robot Simulator for Photorealistic Medical Datasets Generation

ROOM: 基于物理的连续体机器人模拟器,用于生成逼真的医学数据集

Salvatore Esposito, Matías Mattamala, Daniel Rebain, Francis Xiatian Zhang, Kevin Dhaliwal, Mohsen Khadem, Subramanian Ramamoorthy

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of British Columbia, Canada(不列颠哥伦比亚大学,加拿大)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出ROOM模拟框架,利用患者CT扫描生成多模态支气管镜训练数据,验证其在姿态估计和深度估计任务中的有效性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 22 篇

2601.21666 2026-05-28 cs.AI cs.CV 86%

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

SONIC-O1:用于评估多模态大语言模型在音视频理解上的真实世界基准

Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum, Deval Pandya, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Groningen(Groningen大学) York University(约克大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出SONIC-O1基准,包含60小时人工验证的音视频数据,评估多模态大语言模型在开放摘要、多项选择问答和时序定位上的能力,发现模型在时序定位上存在显著性能差距和人口统计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28013 2026-05-28 cs.CL 85%

KSAFE-MM: A Multimodal Safety Benchmark via Localized Contextualization for Korean Cultural Risks

KSAFE-MM:通过本地化语境化实现韩国文化风险的多模态安全基准

Yongwoo Kim, Sojung An, Yunjin Park, Jungwon Yoon, Dujin Lee, HyunBeom Cho, Jaewon Lee, Wonhyuk Lee, Youngchol Kim, JeongYeop Kim, Donghyun Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型在安全评估中缺乏文化特异性问题,提出KSAFE-MM基准,通过语言和视觉语境化构建通用与韩国文化特有的多模态安全测试集,揭示模型对文化攻击的脆弱性及安全性与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27820 2026-05-28 cs.AI 85%

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

机构 * Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出EgoBench,首个交互式自我中心多模态基准,通过1045个自我中心视频任务和用户-智能体-工具交互环境,联合评估视觉感知、工具增强多跳推理和动态交互能力,揭示当前最先进模型性能上限(平均准确率19.43%)。

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28714 2026-05-28 cs.CL cs.AI 81%

IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents

IPO-Mine:用于长多模态IPO文档的章节结构化分析的工具包和数据集

Michael Galarnyk, Siddharth Lohani, Vidhyakshaya Kannan, Sagnik Nandi, Aman Patel, Liqin Ye, Arnav Hiray, Rutwik Routu, Prasun Banerjee, Siddhartha Somani, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Sai University(赛大学) Duke University(杜克大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPO-Mine工具包和数据集,通过标准化解析IPO文件为章节结构化文本和图像,构建大规模多模态数据集,并建立图表评估任务,揭示多模态模型在长文档分析中的对齐挑战。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28174 2026-05-28 cs.CV cs.AI 81%

FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

FLORO:面向跨传感器与尺度的生态遥感多模态地理空间基础模型

Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas, Mariana Elias Lara, Fida Mohammad Thoker, Kasper Johansen, Bernard Ghanem, Fernando T. Maestre, Matthew F. McCabe

机构 * Biological and Environmental Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学生物与环境科学与工程 division) Computer, Electrical and Mathematical Science and Engineering Division, King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科技大学计算机、电气与数学科学与工程 division)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出FLORO多模态地理空间基础模型,通过掩码自编码在异构遥感数据上预训练,利用可用性感知输入统一异构传感器配置,在PANGAEA基准上实现强迁移性能。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 81%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21771 2026-05-28 cs.CV cs.AI 81%

MMTABREAL: Real-World Benchmark for Multimodal Table Understanding

MMTABREAL:多模态表格理解的真实世界基准

Prasham Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态表格理解,构建了包含500个真实表格和4021个问答对的人工筛选基准MMTABREAL,评估发现现有模型在视觉定位、空间对齐和多步推理上存在20-40%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28161 2026-05-28 cs.CV 79%

MeniOmni: A Structured Multimodal Benchmark for Holistic Meniscus Injury Assessment

MeniOmni:用于整体半月板损伤评估的结构化多模态基准

Shurui Xu, Siqi Yang, Weiping Ding, Hui Wang, Mengzhen Fan, Yuyu Sun, Shuyan Li

机构 * 1School of Electronics, Electrical Engineering Computer Science, Queen's University Belfast, Belfast, UK 2Radiology Department, Affiliated Nantong Clinical College of Nantong University, Nantong First People's Hospital, School of Clinical Medicine, Nantong University, Nantong, Jiangsu, China 3School of Artificial Intelligence Computer Science, Nantong University, Nantong, China 4Faculty of Data Science, City University of Macau, Macau, China 5Department of Chemistry, University of Oxford, Oxford, UK 6Orthopedics Department, Nantong First People's Hospital, Southeast University, Nantong, Jiangsu, China

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出MeniOmni基准,包含多中心MRI、临床先验和专家标注文本,支持细粒度Stoller分级和诊断报告生成,并引入风险感知序数评估和语义一致性指标Meni-Score。

Comments Accepted by IEEE International Conference on Multimedia and Expo (ICME) 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏