arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-30 至 2026-07-30 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 6 篇

2506.14766 2026-07-30 cs.CV cs.CL 版本更新 92%

ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM

ASCD:用于减少多模态大语言模型(MLLM)幻觉的注意力可导向对比解码

Yujun Wang, Aniri, Jinhe Bi, Soeren Pirk, Yunpu Ma

专题命中 跨模态检索 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 该研究针对MLLM的幻觉问题,提出ASCD方法,通过正负引导调整解码时的注意力分数,在多基准上显著减少幻觉并提升VQA准确率,且无需额外训练。

Comments Accepted at AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(12): 10306-10314, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18584 2026-07-30 cs.AI cs.DL cs.IR cs.LG 版本更新 79%

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

MathNet:数学推理与检索的全球多模态基准

Shaden Alshammari, Kevin Wen, Abrar Zainal, Mark Hamilton, Navid Safaei, Sultan Albarakati, William T. Freeman, Antonio Torralba

机构 * MIT(麻省理工学院) KAUST(卡塔尔人工智能研究 institute) HUMAIN Individual Researcher(独立研究者)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。

Comments ICLR 2026; Website: http://mathnet.mit.edu

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15152 2026-07-30 cs.CV 74%

Caption-Matching: A Multimodal Approach for Cross-Domain Image Retrieval

图像跨域检索:一种多模态方法

Lucas Iijima, Nikos Giakoumoglou, Tania Stathaki

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV

AI总结 本文提出Caption-Matching方法,利用预训练视觉语言模型生成的图像描述作为中间表示,实现跨域图像检索,无需标注数据或进一步训练,在Office-Home和DomainNet上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23321 2026-07-30 cs.IR 版本更新 67%

MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models

MMEB-V3: 多模态嵌入模型性能差距的测量

Haohang Huang, Xuan Lu, Mingyi Su, Xuan Zhang, Ziyan Jiang, Ping Nie, Kai Zou, Tomas Pfister, Wenhu Chen, Wei Zhang, Xiaoyu Shen, Rui Meng

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MMEB-V3基准,评估文本、图像、视频、音频及基于代理的多模态嵌入,发现现有模型在跨模态检索中存在显著偏差和不足。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26381 2026-07-30 cs.CV cs.AI 新提交 62%

Zero-Fi: Zero-Shot Wi-Fi-Based Human Activity Recognition via Contrastive Signal-Language Alignment

Zero-Fi:基于对比信号-语言对齐的零样本Wi-Fi人体活动识别

Yitong Shen, Cheng Guo, Peiliang Wang, Jingzhe Zhang, Yi Sheng, Haopeng Zhang, Hongfei Xue, Yili Ren

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Zero-Fi是一种对比信号-语言对齐框架,可在无需新活动类标注Wi-Fi样本或模型适配的情况下,实现基于Wi-Fi的零样本人体活动识别,在大规模公开基准数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10202 2026-07-30 q-bio.QM 版本更新 50%

Robust and Generalizable Atrial Fibrillation Detection from ECG Using Time-Frequency Fusion and Supervised Contrastive Learning

基于时频融合与监督对比学习的ECG心房颤动鲁棒检测方法

Hongtao Li, Jia Wei, Jia Xiao, Yuanjun Lai, Mingyang Liu, Shuzhen Lv, Xueqiang Ouyang

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出一种结合时频融合与监督对比学习的ECG心房颤动检测方法,通过双向门控模块和跨模态学习策略提升模型鲁棒性和跨数据集泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏