Deep Binaries: Encoding Semantic-Rich Cues for Efficient Textual-Visual Cross Retrieval
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICCV 2017 as a conference paper
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICCV 2017 as a conference paper
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments 12 pages
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL
PaCX-MAE: 生理增强的胸部X光掩码自编码器
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Tokyo(东京大学) ; University of Michigan(密歇根大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV;multi-modal(comments)
AI总结 提出PaCX-MAE跨模态蒸馏框架,通过双对比预测目标将生理先验注入胸部X光编码器,在保持单模态推理的同时提升生理相关任务性能。
Comments Accepted at the ICML 2026 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS)
专题命中 跨模态检索 :multimodal(abstract,comments);分类 cs.AI
Comments Accepted by workshop on Multimodal Representation and Retrieval at SIGIR 2024, Washington DC
哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔
机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。
AutoResearch:输入洞见,输出无幻觉
机构 * EvoMap(伊沃地图)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。
D2-ScaleAgent:面向长文档理解的双维度缩放方法
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。
面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理
机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) ; Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) ; School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) ; School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) ; Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。
Comments 42 pages, 12 figures, 13 tables
基于因果机制监测的跨域工业故障检测
机构 * Deakin University(迪肯大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。
TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习
机构 * Uber AV Labs(优步自动驾驶实验室) ; Purdue University(普渡大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。
面向主体的多粒度对齐用于零样本EEG到图像检索
机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) ; Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications, Hangzhou, Zhejiang(浙江省脑机协同智能技术与应用重点实验室,杭州,浙江) ; College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SAMGA框架,通过多粒度对齐解决EEG到图像检索中主体依赖性和多尺度信息的问题,提升检索精度。
用于专利匹配的自知识检索增强生成框架
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
AI总结 针对专利匹配的LLM方法存在成本高、易遗忘等问题,本文提出自知识RAG框架,结合FAISS检索与生成式匹配机制,在真实专利数据集上提升了检索匹配准确率。
Comments Accepted by IEEE CSCWD 2026
FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索
机构 * Vietnamese-German University(越南-德国大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology(信息技术大学) ; Ho Chi Minh city University of Science(胡志明市科学大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
月球地质学的可验证机器解释
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
基于开放词汇概念发现的密集音乐检索控制
专题命中 跨模态检索 :multimodal(abstract);分类 eess.AS
AI总结 本研究提出一种轻量无需训练的开放词汇概念发现方法,用于可控音乐检索,可恢复与概念音频示例对齐更紧密的稀疏特征,实现更优的编辑强度与内容保留权衡。
Comments Accepted to ISMIR 2026
机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; University of Adelaide(阿德莱德大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
Comments Accepted as a conference paper at ECCV 2024; v7: Minor corrections to the adversarial robustness results and corresponding text. Conclusions unchanged
基于特权传感器引导对比学习的点目标导航鲁棒场景迁移
机构 * University of Padua(帕多瓦大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。
Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)
机构 * Southeast University(东南大学) ; The University of Adelaide(阿德莱德大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Western Australia(西澳大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
Comments Accepted by IJCAI 2025
CoCo-IR:上下文组合图像检索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google DeepMind(谷歌DeepMind) ; OpenAI
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。
Comments ECCV 2026
将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。
Dr. AGENTONOMICS:AGENTONOMICS的教学实验
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。
Comments Technical report, Technical University of Munich
UniGD:面向工业检索的统一生成-判别框架
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 UniGD是整合检索与相关性评分的统一框架,通过CAGE、CAM、HAM解决工业检索问题,在快手平台及NQ320K、MS300K数据集上均取得显著性能提升。
SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV
AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。
Comments ACMMM 26
REC中对比学习的合适嵌入空间是什么?
机构 * Stony Brook University(斯通布鲁克大学) ; EPFL(苏黎世联邦理工学院)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV
AI总结 该研究针对REC任务现有对比学习策略的局限,提出视觉嵌入空间的C-REX框架,作为即插即用模块提升REC及类别无关计数任务性能,在REC上MAE最高提升28%、RMSE提升24.5%。
Comments 15 pages, 4 figures
语法与语义融合:理解科学公式
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 本研究针对科学公式语法与语义表征不匹配问题,采用图编码器、文本编码器结合对比学习实现跨模态对齐,显著提升了学术信息检索中的跨模态检索性能。