arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-12 至 2026-08-12 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 84%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10857 2026-08-12 cs.LG 新提交 78%

FiGuRO: Intrinsic Dimension Estimation for Multi-Modal Data

FiGuRO:面向多模态数据的本征维度估计

Viktoria Schuster, Sana Tonekaboni, Caroline Uhler

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10524 2026-08-12 cs.CV cs.AI 新提交 62%

Rethinking Text-Based Image Retrieval in Specific Domain

重新思考特定领域的基于文本的图像检索

Jingyang Tan, Sheng Yang, Yuanpeng Chen, Jian Wang, Nianjin Ye, Chen Xing, Lanpeng Jia

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对现有TBIR基准的单匹配假设无法适配监控等特定领域的问题,构建了SecMM-TBIR基准,提出SAFT框架解决特定领域TBIR的语义压缩问题,在SecMM-TBIR上平均提升mAP@20达7.8点且优化通用领域性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11030 2026-08-12 cs.IR cs.CL 新提交 57%

Self-Knowledge Retrieval Augmented Generation Framework for Patent Matching

用于专利匹配的自知识检索增强生成框架

Jian Zhang, Songlin Lei, Zhuohao Yang, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏