Visual Translation Embedding Network for Visual Relation Detection
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
Comments The short version of this paper appears as oral paper in ECCV 2010
Journal ref International Journal of Computer Vision (IJCV), 2012
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.MM
专题命中 跨模态检索 :audio-visual(abstract);分类 cs.MM
Comments 15 pages
专题命中 跨模态检索 :multi-modal(abstract,comments)
Comments Published in the Proceedings of the ICML 2025 Workshop on Multi-modal Foun- dation Models and Large Language Models for Life Sciences, Vancouver, Canada. 2025
专题命中 跨模态检索 :multimodal(abstract,journal_ref)
Comments 26 pages
Journal ref Advances in Natural Multimodal Dialogue Systems, Dordrecht (NL) Springer (Ed.) (2005) pp. 131-157
基于行为的候选校准用于多模态推荐
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文提出了一种基于行为的候选校准方法,通过将训练-only的共用户重叠转换为带符号的候选证据,并仅应用于多模态骨干网络生成的短名单,以提高多模态推荐系统的性能。
Comments 12 pages, 3 figures. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026). Project page: this https URL (https://lizesheng13.github.io/bridge/)
AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。
Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)
基于大语言模型的生成式检索用于Snapchat内容推荐
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。
面向分布式智能的AI原生6G:流量特性、感知与AI网格
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。
Comments 8 pages, 5 figures, 1 table
结合大语言模型增强多图学习与对比对齐的兴趣点推荐
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。
对我们的端到端无人机规划器的若干改进
机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。
检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。
Sci-Surf:通过人类反馈与智能摘要实现科学文献发现
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。
融合UI结构与语义的面向特征的应用屏幕检索与聚类
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。
Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy
用于量子传感的纳米金刚石工程:纳米尺度下的材料约束
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究聚焦纳米金刚石中氮-空位中心的材料约束机制,提出缓解策略,推动其作为移动量子传感器在生物传感与纳米尺度科学中的可靠应用。
Comments Published in ACS Nano under CC-BY 4.0
Journal ref ACS Nano 20, 17143 (2026)
面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。
AgenTag:基于行为指纹的AI编码智能体归因
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。
GARDRec:面向大语言模型推荐的决策级图接地方法
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。
Comments 18 pages, 2 figures
基于并行轨迹回火的能量基模型的均衡训练
机构 * Université Paris-Saclay(巴黎萨克雷大学) ; CNRS(法国国家科学研究中心) ; INRIA(法国国家信息与自动化研究所) ; Escuela Técnica Superior de Ingenieros Industriales(工业工程师高等技术学院) ; Universidad Politécnica de Madrid(马德里理工大学) ; Universidad Complutense de Madrid(马德里康普顿斯大学)
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究提出基于并行轨迹回火(PTT)的 EBM 训练算法,结合水库采样与自适应优化,可稳定快速训练,性能优于现有方法,使 EBM 的均衡最大似然训练更实用高效。
Comments 11 pages, 7 figures
基于时频融合与监督对比学习的ECG心房颤动鲁棒检测方法
专题命中 跨模态检索 :cross-modal(abstract)
AI总结 本文提出一种结合时频融合与监督对比学习的ECG心房颤动检测方法,通过双向门控模块和跨模态学习策略提升模型鲁棒性和跨数据集泛化能力。
重新思考对比解码:关于多模态大语言模型中对比解码在减轻对象幻觉方面无效性的可重复性研究与扩展
机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)
专题命中 跨模态检索 :multimodal(abstract)
AI总结 研究多模态大语言模型中对比解码减轻对象幻觉的有效性,通过重现和扩展相关研究,进行多实验验证其在不同数据集上效果,发现其带来的改善常是虚假的,挑战了当前策略有效性,推动更可靠方法开发。
Comments 32 pages, 9 Figures, submitted to TMLR
CHaystack:中文文档检索与视觉问答基准测试
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。
EGR:使用共享语言模型的嵌入原生生成式检索
专题命中 跨模态检索 :multimodal(abstract)
AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。
Comments Accepted to RecSys 2026
条件逻辑中的波斯特完全性
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文系统研究某些基本条件逻辑的波斯特完全扩张,确定了正则和正规的此类逻辑,证明相关嵌入定理类似结论,还表明某些基本条件逻辑有不可数多个扩张,其在条件规则下闭包放宽,对条件逻辑格结构及多模态逻辑有启示。