arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-19 至 2026-08-19 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 8 篇

2608.02148 2026-08-19 cs.IR cs.CL cs.CV 版本更新 86%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16929 2026-08-19 cs.LG 新提交 78%

Mr.Dec: Daily-Scale Longitudinal Multimodal Modeling for 30-Day Readmission Prediction

Mr.Dec:用于30天再入院预测的日尺度纵向多模态建模

Minjun Kim, Jong Hak Moon

机构 * Yeji X

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本研究提出Mr.Dec模型,通过Transformer解码器整合每日EHR与CXR数据,结合疾病特异性监督对比学习,在MIMIC-IV等数据集上实现30天再入院预测的SOTA性能,还可识别住院关键天数提供临床解释。

Comments MICCAI 2026 MultiTab Workshop Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18255 2026-08-19 eess.SP 版本更新 78%

WiFo-MiSAC: A Wireless Foundation Model for Multimodal Sensing and Communication Integration via Synesthesia of Machines (SoM)

WiFo-MiSAC:一种无线基础模型,通过机器的通感(SoM)实现多模态感知与通信的整合

Xuanyu Liu, Shijian Gao, Boxun Liu, Xiang Cheng, Liuqing Yang

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)

AI总结 WiFo-MiSAC通过统一空间的自监督预训练,解决通信与传感数据碎片化处理导致的泛化问题,采用共享-特定解耦的混合专家架构,实现多模态交互,实验表明其在多任务中表现优异,具备强大的少样本适应与新模态集成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST 新提交 71%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 跨模态检索 :multimodal(title)

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-19 cs.CV cs.CL 版本更新 62%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

Lingkai Bu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Jinyi Liang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17906 2026-08-19 cs.AI cs.MA 新提交 57%

AutoResearch: Insight In, Hallucination Out

AutoResearch:输入洞见,输出无幻觉

Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang

机构 * EvoMap(伊沃地图)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17144 2026-08-19 cs.HC 新提交 50%

Health Inquiry with AI: How Empathetic Expression and Conversational Contexts Shape Users' Communicative Acts

AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为

Xi Zheng, Xuyu Yang, Can Liu, Yuhan Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。

Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-19 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏