arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-02 至 2026-03-02 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2509.01959 2026-03-02 cs.CV cs.AI cs.LG 84%

Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models

结构感知对比学习用于多模态模型的图表理解

Hiroshi Sasaki

机构 * The Japan Research Institute, Limited(日本研究机构)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构感知对比学习方法,通过专门的损失函数提升多模态模型对图表图像的理解能力,在图像-文本匹配和视觉问答任务中取得显著改进。

Comments 10 pages, 8 figures

Journal ref ICCVW (2025) 7463-7472

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14245 2026-03-02 cs.IR 82%

XR: Cross-Modal Agents for Composed Image Retrieval

XR:跨模态代理用于组合图像检索

Zhongyu Yang, Wei Pang, Yingfang Yuan

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

AI总结 XR通过多代理协作提升组合图像检索性能,实现38%的提升

Comments Accepted by WWW 2026. Project: https://01yzzyu.github.io/xr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23369 2026-03-02 cs.IR cs.AI cs.CL 81%

Reason to Contrast: A Cascaded Multimodal Retrieval Framework

对比之理:一种级联多模态检索框架

Xuanming Cui, Hong-You Chen, Hao Yu, Hao Yuan, Zihao Wang, Shlok Kumar Mishra, Hanchao Yu, Yonghuan Yang, Jun Xiao, Ser-Nam Lim, Jianpeng Cheng, Qi Guo, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TTE-v2框架,通过引入基于额外输入标记预算的推理驱动性能扩展,提升多模态检索的测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24134 2026-03-02 cs.CV cs.CL 62%

AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation

AgenticOCR: 为高效检索增强生成解析所需内容

Zhengren Wang, Dongsheng Ma, Huaping Zhong, Jiayu Li, Wentao Zhang, Bin Wang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 AgenticOCR通过动态解析范式提升视觉文档检索增强生成系统的效率和准确性,实现按需提取和解耦检索粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23906 2026-03-02 cs.CV 57%

Half-Truths Break Similarity-Based Retrieval

半真信息破坏基于相似性的检索

Bora Kargi, Arnas Uselis, Seong Joon Oh

机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(科纳德·祖斯卓越学习与智能系统学校(ELIZA))

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 CS-CLIP通过分解标题为实体和关系单元并改进监督方法,提升了基于相似性检索的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23890 2026-03-02 cs.CV 57%

DACESR: Degradation-Aware Conditional Embedding for Real-World Image Super-Resolution

DACESR: 退化感知条件嵌入用于现实世界图像超分辨率

Xiaoyan Lei, Wenlong Zhang, Biao Luo, Hui Liang, Weifeng Cao, Qiuting Lin

机构 * School of Electrical and Information Engineering, Zhengzhou University of Light Industry(郑州轻工业大学电气与信息工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Automation, Central South University(中南大学自动化学院) Intelligent Manufacturing Engineering at Machinery Technology Development Co.,Ltd.(机械技术发展有限公司智能制造工程) China Academy of Machinery Science and Technology Group Co.,Ltd.(中国机械科学与技术集团有限公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 DACESR通过退化感知条件嵌入提升现实世界图像超分辨率的保真度与感知质量。

Comments Accepted by TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09626 2026-03-02 cs.CV 57%

ECAM: A Contrastive Learning Approach to Avoid Environmental Collision in Trajectory Forecasting

ECAM: 一种用于轨迹预测中避免环境碰撞的对比学习方法

Giacomo Rosin, Muhammad Rameez Ur Rahman, Sebastiano Vascon

机构 * Department of Environmental Sciences, Informatics and Statistics, Ca' Foscari University of Venice, Italy(环境科学、信息学与统计学系,威尼斯卡福斯卡里大学,意大利)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 ECAM通过对比学习方法提升轨迹预测中对环境碰撞的避免能力,有效降低碰撞率。

Comments IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏