arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3460 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3460 篇

1702.08319 2017-02-28 cs.CV 57%

Visual Translation Embedding Network for Visual Relation Detection

Hanwang Zhang, Zawlin Kyaw, Shih-Fu Chang, Tat-Seng Chua

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.08680 2017-01-11 cs.CV 57%

Measuring and Predicting Tag Importance for Image Retrieval

Shangwen Li, Sanjay Purushotham, Chen Chen, Yuzhuo Ren, C. -C. Jay Kuo

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.04307 2016-08-16 cs.CV 57%

Transitive Hashing Network for Heterogeneous Multimedia Retrieval

Zhangjie Cao, Mingsheng Long, Qiang Yang

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.2306 2015-04-15 cs.CV 57%

Deep Visual-Semantic Alignments for Generating Image Descriptions

Andrej Karpathy, Li Fei-Fei

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1109.4684 2015-03-19 cs.AI cs.LG 57%

Exhaustive and Efficient Constraint Propagation: A Semi-Supervised Learning Perspective and Its Applications

Zhiwu Lu, Horace H. S. Ip, Yuxin Peng

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

Comments The short version of this paper appears as oral paper in ECCV 2010

Journal ref International Journal of Computer Vision (IJCV), 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1410.4470 2014-10-20 cs.CV cs.LG 57%

MKL-RT: Multiple Kernel Learning for Ratio-trace Problems via Convex Optimization

Raviteja Vemulapalli, Vinay Praneeth Boda, Rama Chellappa

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1312.5479 2014-02-18 cs.CV cs.DS 57%

Sparse similarity-preserving hashing

Jonathan Masci, Alex M. Bronstein, Michael M. Bronstein, Pablo Sprechmann, Guillermo Sapiro

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1204.1185 2012-04-06 cs.DB cs.IR cs.MM 57%

Query Language for Complex Similarity Queries

Petra Budikova, Michal Batko, Pavel Zezula

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
0905.4627 2009-12-01 cs.MM cs.IR 57%

CoPhIR: a Test Collection for Content-Based Image Retrieval

Paolo Bolettieri, Andrea Esuli, Fabrizio Falchi, Claudio Lucchese, Raffaele Perego, Tommaso Piccioli, Fausto Rabitti

专题命中 跨模态检索 :audio-visual(abstract);分类 cs.MM

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10655 2025-10-14 q-bio.OT 56%

Isotropy and Geometry of Pretrained Protein LMs

Sheikh Azizul Hakim, Kowshic Roy, M Saifur Rahman

专题命中 跨模态检索 :multi-modal(abstract,comments)

Comments Published in the Proceedings of the ICML 2025 Workshop on Multi-modal Foun- dation Models and Large Language Models for Life Sciences, Vancouver, Canada. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
0709.0426 2009-12-01 cs.HC 56%

Do oral messages help visual search?

Noëlle Carbonell, Suzanne Kieffer

专题命中 跨模态检索 :multimodal(abstract,journal_ref)

Comments 26 pages

Journal ref Advances in Natural Multimodal Dialogue Systems, Dordrecht (NL) Springer (Ed.) (2005) pp. 131-157

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22073 2026-08-21 cs.IR 版本更新 50%

BRIDGE: Behavior-Guided Residual Integration with Dual-Frequency Graph Evidence

基于行为的候选校准用于多模态推荐

Zesheng Li, Chengchang Pan, Honggang Qi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种基于行为的候选校准方法,通过将训练-only的共用户重叠转换为带符号的候选证据,并仅应用于多模态骨干网络生成的短名单,以提高多模态推荐系统的性能。

Comments 12 pages, 3 figures. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026). Project page: this https URL (https://lizesheng13.github.io/bridge/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17144 2026-08-19 cs.HC 新提交 50%

Health Inquiry with AI: How Empathetic Expression and Conversational Contexts Shape Users' Communicative Acts

AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为

Xi Zheng, Xuyu Yang, Can Liu, Yuhan Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。

Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-19 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14627 2026-08-18 eess.SP 新提交 50%

AI-Native 6G for Distributed Intelligence: Traffic Characteristics, Awareness, and AI Grid

面向分布式智能的AI原生6G:流量特性、感知与AI网格

Lopamudra Kundu, Xingqin Lin, Shuvo Chowdhury, Sree Sankar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 50%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15741 2026-08-18 cs.RO 新提交 50%

Some Modifications to Our End-to-End UAV Planner

对我们的端到端无人机规划器的若干改进

Junjie Lu, Bailing Tian

机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15624 2026-08-18 cs.IR 新提交 50%

Can Retrievers Find the Same Paper from Different Aspects? A Multi-Aspect Full-Paper Scientific Retrieval Benchmark

检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准

Yiyang Wei, Fang Guo, Qiji Zhou, Zhizhang Fu, Mengru Ding, Kai Yang, Yue Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08880 2026-08-11 cs.SE 新提交 50%

Fusing UI Structure & Semantics for Feature-Oriented App Screen Retrieval & Clustering

融合UI结构与语义的面向特征的应用屏幕检索与聚类

Arun Krishna Vajjala, Yanfu Yan, Ajay Krishna Vajjala, Shrunal Pothagoni, Denys Poshyvanyk, Kevin Moran

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。

Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04489 2026-08-06 quant-ph physics.app-ph physics.chem-ph 新提交 50%

Engineering Nanodiamonds for Quantum Sensing: Material Constraints at the Nanoscale

用于量子传感的纳米金刚石工程:纳米尺度下的材料约束

Ashutosh Rathi, Keisuke Oshimi, Kento Sasaki, Kensuke Kobayashi, Yutaka Shikano, Oliver Benson, Tim Schröder, Shery L. Y. Chang, Masazumi Fujiwara

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究聚焦纳米金刚石中氮-空位中心的材料约束机制,提出缓解策略,推动其作为移动量子传感器在生物传感与纳米尺度科学中的可靠应用。

Comments Published in ACS Nano under CC-BY 4.0

Journal ref ACS Nano 20, 17143 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00966 2026-08-04 cs.SE 新提交 50%

AgenTag: Attribution of AI Coding Agents from Behavioral Fingerprints

AgenTag:基于行为指纹的AI编码智能体归因

Taher A. Ghaleb

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00669 2026-08-04 cs.IR 新提交 50%

GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation

GARDRec:面向大语言模型推荐的决策级图接地方法

Yong Wang, Hongliang Sun, Jinlan Liu, Hua Zhang, Dianbo Sui, Dianhui Chu, Zhiying Tu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27077 2026-07-31 cs.LG cond-mat.dis-nn cond-mat.stat-mech 交叉投稿 50%

Equilibrium Training of Energy-Based Models with Parallel Trajectory Tempering

基于并行轨迹回火的能量基模型的均衡训练

Nicolas Béreux, Aurélien Decelle, Cyril Furtlehner, Beatriz Seoane

机构 * Université Paris-Saclay(巴黎萨克雷大学) CNRS(法国国家科学研究中心) INRIA(法国国家信息与自动化研究所) Escuela Técnica Superior de Ingenieros Industriales(工业工程师高等技术学院) Universidad Politécnica de Madrid(马德里理工大学) Universidad Complutense de Madrid(马德里康普顿斯大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究提出基于并行轨迹回火(PTT)的 EBM 训练算法,结合水库采样与自适应优化,可稳定快速训练,性能优于现有方法,使 EBM 的均衡最大似然训练更实用高效。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10202 2026-07-30 q-bio.QM 版本更新 50%

Robust and Generalizable Atrial Fibrillation Detection from ECG Using Time-Frequency Fusion and Supervised Contrastive Learning

基于时频融合与监督对比学习的ECG心房颤动鲁棒检测方法

Hongtao Li, Jia Wei, Jia Xiao, Yuanjun Lai, Mingyang Liu, Shuzhen Lv, Xueqiang Ouyang

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出一种结合时频融合与监督对比学习的ECG心房颤动检测方法,通过双向门控模块和跨模态学习策略提升模型鲁棒性和跨数据集泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25196 2026-07-29 cs.LG 新提交 50%

Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

重新思考对比解码:关于多模态大语言模型中对比解码在减轻对象幻觉方面无效性的可重复性研究与扩展

Arnav Bendre, Guneesh Gupta, Kavish Grover, Chayan Aggarwal, Shreyansh Modi

机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究多模态大语言模型中对比解码减轻对象幻觉的有效性,通过重现和扩展相关研究,进行多实验验证其在不同数据集上效果,发现其带来的改善常是虚假的,挑战了当前策略有效性,推动更可靠方法开发。

Comments 32 pages, 9 Figures, submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24760 2026-07-29 cs.IR 新提交 50%

CHaystack: Benchmarking Chinese Document Retrieval and VQA

CHaystack:中文文档检索与视觉问答基准测试

Hanxi Li

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23038 2026-07-28 cs.IR 新提交 50%

EGR: Embedding-Native Generative Retrieval with a Shared LLM

EGR:使用共享语言模型的嵌入原生生成式检索

Xiaodong Liu, Congfei Zhang, Hsiang-wei Chao, Siman Wang, Tong Zhao, Xiao Bai, Vincent Zhang, Jingxiao Ma, Zhe Liu, Wenfeng Zhuo, Zichu Li, Jitin Krishnan, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。

Comments Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21320 2026-07-24 math.LO 新提交 50%

Post Completeness in Conditional Logic

条件逻辑中的波斯特完全性

Giuliano Rosella, Yale Weiss

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文系统研究某些基本条件逻辑的波斯特完全扩张,确定了正则和正规的此类逻辑,证明相关嵌入定理类似结论,还表明某些基本条件逻辑有不可数多个扩张,其在条件规则下闭包放宽,对条件逻辑格结构及多模态逻辑有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏