arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-20 至 2026-05-20 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 13 篇

2605.20033 2026-05-20 cs.CV cs.GT 83%

A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

为无训练多模态步骤验证构建纳什均衡框架

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软印度研究院) Indian Institute of Technology Hyderabad(印度海得拉巴理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种无训练的多模态步骤验证方法,将步骤验证视为专门法官之间的协调问题,并通过纳什均衡游戏形式化法官之间的交互,通过闭式解计算均衡分数,实现对分歧的敏感过滤和稳定性意识的排名,实验表明跨模态一致性(而非平均置信度)提供了鲁棒的验证信号。

Comments ICLR 2026 Workshop VerifAI-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02513 2026-05-20 cs.LG cond-mat.mtrl-sci 82%

Learning ORDER-Aware Multimodal Representations for Composite Materials Design

学习有序的多模态表示以进行复合材料设计

Xinyao Li, Hangwei Qian, Jingjing Li, Lei Zhu, Ivor Tsang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学) A*STAR CFAR(新加坡A*STAR CFAR)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本研究提出了一种基于有序性的多模态预训练框架ORDER,用于复合材料设计,通过整合异构数据源来捕捉纤维分布,从而在连续设计空间中实现有效的属性预测和微结构生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14822 2026-05-20 cs.CV cs.AI 81%

Multimodal system for skin cancer detection

多模态皮肤癌检测系统

Volodymyr Sydorskyi, Igor Krashenyi, Oleksii Yakubenko

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态皮肤癌检测系统,结合传统照片图像与表格型元数据(如患者人口统计数据和病变特征),通过多模态神经网络和两阶段模型提升检测准确率,并通过三阶段流程进一步优化预测,最终在不平衡数据集上实现显著性能提升。

Comments Accepted to System research and information technologies

Journal ref System Research and Information Technologies, no. 1, pp. 33-57, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18835 2026-05-20 cs.LG 78%

StampFormer: A Physics-Guided Material-Geometry-Coupled Multimodal Model for Rapid Prediction of Physical Fields in Sheet Metal Stamping

StampFormer: 一种基于物理的材料-几何耦合多模态模型,用于快速预测冲压板料的物理场

Jiajie Luo, Mohamed Mohamed, Osama Hassan, Haosu Zhou, Yingxue Zhao, Haoran Li, Xinrun Li, Zhutao Shao, Yang Long, Nan Li, Jichun Li

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院设计工程学院) School of Computing, Newcastle University(新castle大学计算机学院) Department of Computing, Imperial College London(帝国理工学院计算系) Multi-X Solution Limited(Multi-X解决方案有限公司) Department of Computer Science, Durham University(达勒姆大学计算机科学系) Department of Mechanical Engineering, Faculty of Engineering, Helwan University(Helwan大学工程学院机械工程系)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出StampFormer模型,通过结合材料和几何信息,实现对冲压板料物理场的快速准确预测,从而提高设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11010 2026-05-20 cs.IR cs.DL 78%

GovScape: A Public Multimodal Search System for 70 Million Pages of Government PDFs

GovScape:一个公共的多模态搜索系统,用于7000万页的政府PDF文件

Ying-Hsiang Huang, Claire Gong, Shreya Shaji, Alison Yan, Leslie Harka, Albert Du, Anjali Gopal, Samuel J Klein, Shannon Zejiang Shen, Mark Phillips, Trevor Owens, Kyle Deeds, Benjamin Charles Germain Lee

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GovScape,一个支持多模态搜索的公共系统,用于搜索7000万页的政府PDF文件,展示了其在大规模PDF数据处理中的高效性和可扩展性。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19436 2026-05-20 cs.LG cs.CL cs.CV 62%

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

CEPO: 使用对比证据策略优化进行RLVR自蒸馏

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

机构 * MBZUAI Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出CEPO,通过对比证据策略优化解决RLVR中自蒸馏的问题,通过区分关键推理步骤与填充内容来提升模型性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04065 2026-05-20 cs.CV cs.IR cs.MM 62%

Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering

使检索增强的视觉问答实现协作参数知识校准

Jiaqi Deng, Kaize Shi, Zonghan Wu, Huan Huo, Dingxian Wang, Guandong Xu

机构 * University of Technology Sydney(悉尼大学) East China Normal University(华东师范大学) The Education University of Hong Kong(香港教育大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种统一的检索增强视觉问答框架,通过协作参数知识校准来充分利用KB-VQA中的跨任务协同效应,从而提升问答准确性。

Comments 10 pages, 5 figures, Under Review

Journal ref Knowledge-Based Systems, 8 July 2026, Volume 346

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13193 2026-05-20 cs.CV 57%

FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

FIKA-Bench: 从细粒度识别到细粒度知识获取

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FIKA-Bench,一个包含311个公开来源和现实实例的细粒度知识获取基准,通过过滤和审计确保实例质量,评估最新多模态模型和代理发现细粒度识别任务仍具挑战性,需改进代理设计以提升知识获取能力。

Comments Project page with code: https://ligeng0197.github.io/FIKA-Bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25722 2026-05-20 cs.CV cs.LG 57%

No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models

无需硬负样本:基于概念的学习在不降低对比模型零样本能力的情况下实现组合性

Hai X. Pham, David T. Hoffmann, Ricardo Guerrero, Brais Martinez

机构 * Samsung AI Center(三星人工智能中心)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于概念的学习方法,无需使用硬负样本即可在不损害对比模型零样本和检索能力的情况下实现组合性,通过简单的方法改进了文本和图像编码器的全局池化问题。

Comments Accepted at CVPR 2026. 2nd rev: update github repo URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19734 2026-05-20 cs.CV 57%

GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval

GeoMamba: 一种基于几何的MambaVision框架及数据集,用于细粒度光学-雷达目标检索

Tiantong Fang, Xiuwei Wang, Jing Xiao, Wujie Zhou, Liang Liao, Mi Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Artificial Intelligence and Information Engineering, Zhejiang University of Science & Technology(浙江科技大学人工智能与信息工程学院) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GeoMamba框架,通过引入几何特征注入模块和几何一致性约束模块,提升光学-雷达细粒度目标检索的鲁棒性,并构建了新的FGOS-as数据集来评估跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18763 2026-05-20 cs.IR cs.AI 57%

Query-Conditioned Graph Retrieval for Contextualized LLM Reasoning in Personalized Wearable Data

基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理

Zhenyu Lu, Mahyar Abbasian, Amir M. Rahmani

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Irvine(加州大学 Irvine 分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19902 2026-05-20 cs.LG q-bio.QM 50%

Hierarchical Contrastive Learning for Multi-Domain Protein-Ligand Binding

多领域蛋白质-配体结合的分层对比学习

Shuo Zhang, Rongqi Hong, Huifeng Zhang, Jian K. Liu

机构 * University of Birmingham, UK(英国伯明翰大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本研究提出HCLBind框架,通过分层对比学习方法,解决多领域蛋白质-配体结合亲和力预测问题,核心方法是分离几何表示学习与亲和力回归,并采用新颖的分层诱饵策略,结合领域门控图注意力网络和跨模态注意力,提升领域界面优先级,实验表明HCLBind能有效学习判别界面特征并提供鲁棒的不确定性估计。

Comments Accepted by ISBRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19752 2026-05-20 cs.LG 50%

MSAlign: Aligning Molecule and Mass Spectra Foundation Models for Metabolite Identification

MSAlign: 用于代谢物鉴定的分子和质谱基础模型对齐方法

Paul Krzakala, Gabriel Melo, Camille Lançon, Charlotte Laclau, Rémi Flamary, Etienne Thévenot, Florence d'Alché-Buc

机构 * LTCI, Télécom Paris & CMAP, Ecole Polytechnique, Institut Polytechnique de Paris(LTCI,巴黎电信学院及巴黎高等技术学院的联合机构,CMAP,巴黎高等理工学院,巴黎高等技术学院) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎高等技术学院) CEA, INRAE, MetaboHUB, Université Paris-Saclay(CEA,国家核能研究中心,法国农业研究机构,代谢组学枢纽,巴黎萨克雷大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本研究提出MSAlign方法,通过多模态对齐技术对齐分子和质谱基础模型,以提高代谢物鉴定的准确性,并解决了数据分割策略中的分布偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏