arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 19 篇

2608.02148 2026-08-18 cs.IR cs.CL cs.CV 版本更新 86%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15041 2026-08-18 cs.AI cs.CL 版本更新 86%

mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA

mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Yuxuan Zhao, Zehua Xie, Jin Ma, Ying Shan, Weiming Hu

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16628 2026-08-18 cs.AI 新提交 83%

Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement

基于超图的多模态检索增强生成与增量优化

Shenao Chen, Yidan Xu, Xiangmin Han, Rundong Xue, Duanpo Wu, Yuhan Gao, Chenggang Yan, Yue Gao

机构 * Hangzhou Dianzi University(杭州电子科技大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15096 2026-08-18 cs.CV eess.IV 新提交 83%

MODAL: Multi-Modal Object Re-ID via Model-Driven Sparse Decoupling and Text-Image Differential Filtering

MODAL:基于模型驱动稀疏解耦与文本-图像差分滤波的多模态对象重识别

Chengbo Huang, Jun-Jie Huang, Long Lan, Tianrui Liu, Xueqiong Li, Yuanxi Peng, Xinwang Liu, Meng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MODAL多模态对象重识别框架,通过多模态特征稀疏解耦模块与文本-图像差分滤波模块解决现有方法的特征纠缠与模态缺失性能下降问题,在四个数据集上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-08-18 cs.CL 版本更新 83%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14763 2026-08-18 eess.IV cs.AI cs.CV cs.LG 新提交 81%

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习

Yuhao Huang, Yuanji Zhang, Yuhuan Lu, Dong Ni, P. Ellen Grant, Davood Karimi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。

Comments 17 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-08-18 cs.CL cs.AI 版本更新 81%

Multimodal Language Models Benchmarked Against the NRC Reactor Operator Licensing Examination: Fine-Tuning and Retrieval Strategies

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee, Syed Bahauddin Alam

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15662 2026-08-18 cs.LG 新提交 78%

Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce

电商中产品媒体排序的序列多模态证据优化

Prasenjit Dey, Frank McIntyre, Arnab Sinha

机构 * Amazon.com Inc.(亚马逊公司)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对电商产品媒体排序问题,本文提出SMEO框架,通过轨迹效用模型和生存加权自回归策略优化,提升转化率并减少消费者划动次数。

Comments Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14841 2026-08-18 cs.AI 新提交 74%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16536 2026-08-18 cs.CR cs.CL 新提交 70%

DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption

DSPrompt:针对M-RAG污染的动态软提示防御

Chang Liu, Yuni Lai, Mingyue Cui, Cong Tian, Yunyan Zhang, Xian Wu, Kai Zhou, Bin Xiao

专题命中 跨模态检索 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对M-RAG面临的对抗攻击问题,提出DSPrompt动态软提示防御框架,通过在冻结检索器编码器插入可学习软提示,以低开销实现了优于现有方法的防御效果,同时维持检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02583 2026-08-18 cs.CV 版本更新 70%

FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器

Wei Li, Yufan Ren, Hanqing Jiang, Jianhui Ding, Zhen Peng, Leman Feng, Yichun Shentu, Guoqiang Xu, Baigui Sun

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) Zhejiang University(浙江大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) BPIT, Sany Group(三一集团BPIT)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-18 cs.CV cs.AI cs.CL cs.HC 版本更新 67%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交 57%

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15736 2026-08-18 cs.AI 新提交 57%

Toward AI-Friendly Cartography: Understanding How Color Design Influences Foundation Model Spatial Reasoning on Sequential Choropleth Maps

面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理

Yonghe Sun, Zhenjia Liu, Hua Liao, Wenjia Xu, Nai Yang, Weihua Dong, Zhiwei Wei

机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。

Comments 42 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14666 2026-08-18 cs.AI 新提交 57%

Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring

基于因果机制监测的跨域工业故障检测

Dhiraj Neupane, Mohamed Reda Bouadjenek, Richard Dazeley, Sunil Aryal

机构 * Deakin University(迪肯大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14627 2026-08-18 eess.SP 新提交 50%

AI-Native 6G for Distributed Intelligence: Traffic Characteristics, Awareness, and AI Grid

面向分布式智能的AI原生6G:流量特性、感知与AI网格

Lopamudra Kundu, Xingqin Lin, Shuvo Chowdhury, Sree Sankar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 50%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15741 2026-08-18 cs.RO 新提交 50%

Some Modifications to Our End-to-End UAV Planner

对我们的端到端无人机规划器的若干改进

Junjie Lu, Bailing Tian

机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15624 2026-08-18 cs.IR 新提交 50%

Can Retrievers Find the Same Paper from Different Aspects? A Multi-Aspect Full-Paper Scientific Retrieval Benchmark

检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准

Yiyang Wei, Fang Guo, Qiji Zhou, Zhizhang Fu, Mengru Ding, Kai Yang, Yue Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏