arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-22 至 2026-07-22 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2607.18819 2026-07-22 cs.CV 新提交 79%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19270 2026-07-22 cs.LG cs.AI 新提交 57%

GUIDED Network-Agnostic Feature Initialization for Spatial Transferability in GNN-based Models

基于GNN的模型中用于空间可迁移性的引导式网络无关特征初始化

Alessandro Scalese, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究针对交通分配问题中GNN模型空间泛化差的问题,提出网络无关初始化层GUIDED,通过在虚拟链路注入需求标量属性标准化输入空间。实验表明其能提升模型性能、鲁棒性及参数效率,减少训练时间,为相关空间问题提供通用蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19200 2026-07-22 cs.MM 新提交 57%

Enhancing Relation Modeling with Social Attributes for Social Media Popularity Prediction

利用社交属性增强关系建模以进行社交媒体人气预测

Bolun Zheng, Yuhao Luo, Wei Zhu, Ning Xu, An-An Liu, Lingyu Zhu, Canjin Wang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 针对社交媒体人气预测中检索准确率低的问题,提出关系增强检索增强框架RE-Rag,通过语义属性检索器和关系引导预测器,基于语义内容和社交属性建模UGC相似度,实验证明该方法在预测准确率和检索效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19111 2026-07-22 cs.CV 新提交 57%

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

GATE-3D:用于开放集3D形状检索的几何感知测试时自适应重排

Hao Wu, Heyi Lin, Zilin Wang, Huizai Yao, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对开放集3D形状检索中几何与外观特征融合问题,提出GATE-3D轻量级查询自适应重排方法,通过捕捉模态不一致特征预测分数调整排名,实验表明该方法优于外观检索且更稳健,提升了mAP等指标,还发现线性路由在低数据时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19046 2026-07-22 cs.CV 新提交 57%

Contrastive On-Policy Distillation

对比策略蒸馏

Jiacheng Ruan, Jun Tang, Wenzhen Yuan, Ting Liu, Shuai Bai, Dayiheng Liu, Zhibo Yang, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究提出对比策略蒸馏框架COPD,通过冻结教师模型在不同指令下对学生状态评分,以对数概率差为优势信号指导更新,减少推理长度,提升效率,且能集成到自蒸馏框架实现自对比监督。

Comments Work in progress. 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18688 2026-07-22 cs.CV 新提交 57%

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

双边同质模态相似性:迈向具有模态自适应匹配的可见-红外模态不完整行人重识别

Xin Xu, Shuhao Zhan, Wei Liu, Zheng Wang, Kui Jiang, Chia-Wen Lin

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 研究开放世界场景下可见-红外模态不完整行人重识别问题,提出模态自适应匹配Transformer(MAMT),通过散度Transformer模块和共享Transformer模块提取特征,经模态自适应匹配模块动态融合,在新构建基准上实验,证明方法有效且具适应性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18666 2026-07-22 cs.CL cs.SD 新提交 57%

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

融合嵌入:文本、图像、视频和音频的统一嵌入空间

Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra

机构 * Eximius Labs(卓越实验室) Wabash College(瓦贝什学院) Skop Intelligence Co.(斯科普智能公司)

专题命中 跨模态检索 :audio-visual(abstract);分类 cs.CL

AI总结 研究旨在构建文本、图像、视频和音频统一嵌入空间。提出融合嵌入家族,第一代训练参数少的连接器,第二代添加模态门控深度适配器,无需成对视听数据实现音频-图像检索,探索设计空间并公开相关资源。

Comments 23 pages, 5 figures. Models: https://huggingface.co/EximiusLabs/fusion-embedding-1-2b-preview and https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview. Code: https://github.com/Eximius-Labs/fusion-embedding

详情

展开后加载摘要…

URL PDF HTML 收藏