arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-23 至 2026-07-23 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 5 篇

2607.20358 2026-07-23 cs.ET cs.AR 新提交 78%

PolySim: Deterministic Polynomial Surrogates for Cross-Modal Retrieval on CiM

PolySim:用于CiM上跨模态检索的确定性多项式代理

Xinzhao Li, Charles Power, Pengyu Ren, Jongun Won, Likai Pei, Yuting Hu, Jinjun Xiong, Alptekin Vardar, Ningyuan Cao, Xiaobo Sharon Hu, Thomas Kämpfe, Kai Ni, Ruiyang Qin

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究边缘设备跨模态检索在CiM硬件部署问题,提出PolySim框架,将概率检索转为确定性管道,用低阶多项式基近似高斯嵌入维度,经实验其提升R@1,减少推理计算,是首个在CiM硬件实现概率跨模态检索的方法。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20291 2026-07-23 cs.CV 新提交 77%

Diverse-Intent Multi-Turn Fashion Image Retrieval

多样化意图的多轮时尚图像检索

Mingqiang Tang, Haokun Wen, Meng Liu, Yupeng Hu, Weili Guan, Xuemeng Song

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19061 2026-07-23 cs.CV cs.AI 版本更新 62%

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

现在你看到了仇恨:用于隐藏仇恨幻觉的自适应视图检索

Qianpu Chen, Derya Soydaner

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对仇恨性视觉错觉检测难题,提出自适应视图检索方法,将其公式化为感知检索问题,通过检索并校准框架组装视图库,该方法在多方面超越基线和其他方法,表明多模态审核需先恢复隐藏含义再判断是否有害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20238 2026-07-23 cs.CV 新提交 57%

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

并非所有补丁都一样:可见-红外预训练中的采样很重要

Qiwei Ma, Bin Deng, Junjie Zhu, Qiangjuan Huang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

机构 * Yuelushan Center for Industrial Innovation(岳麓山工业创新中心) Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对可见-红外预训练,提出重要性感知采样(IAS)方法,通过从红外结构线索导出权重、学习重要性掩码及采用补丁课程学习策略调整训练重点,在多个VIS-IR基准实验中比基线有改进。

Comments 13 pages, 11 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19830 2026-07-23 cs.CL 新提交 57%

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

VizRAG:通过超图可视化增强检索增强生成

Yanbin Wei, Yang Chen, Renling Gan, Ziru Liu, Xinyu Fu, Chun Kang, Ning Lu, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院) Beihang University(北京航空航天大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏