Constrained Dominant Sets for Multimodal Document Question Answering
约束主导集用于多模态文档问答
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 提出基于查询增强亲和图的约束主导集检索方法,通过谱边界自动平衡相关性与冗余性,利用复制动态实现全局均衡,无需训练,在多模态文档问答中取得新最优结果。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
约束主导集用于多模态文档问答
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 提出基于查询增强亲和图的约束主导集检索方法,通过谱边界自动平衡相关性与冗余性,利用复制动态实现全局均衡,无需训练,在多模态文档问答中取得新最优结果。
作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解
机构 * ByteDance(字节跳动)
专题命中 跨模态检索 :multimodal(abstract,abstract_cn);cross-modal(abstract);分类 cs.CV
AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。
多样化意图的多轮时尚图像检索
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。
通过优势加权排序揭示二元抑郁检测中的潜在抑郁严重程度
机构 * South China Normal University(华南师范大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI
AI总结 研究利用视听数据检测抑郁的挑战,提出含时间编码器和相互变压器的多模态框架,核心是二元优势加权排序损失,通过两种机制优化潜在空间分布,实验表明该模型重建潜在有序结构,性能达最优。
协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础
机构 * Huazhong University of Science and Technology(华中科技大学) ; Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Anhui University(安徽大学)
专题命中 跨模态检索 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV
AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。
Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)
LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。
Comments Accpeted by ECCV 2026
弥合法医图像检索中的模态差距
机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) ; Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。
Comments 23 pages, 5 figures, paper submitted to Elsevier journal
MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理
机构 * Weill Cornell Medicine(威尔康乃尔医学院) ; University of Western Australia(西澳大利亚大学) ; Indiana University(印第安纳大学) ; Regenstrief Institute(瑞根斯特里夫研究所) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.CL
AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。
基础模型在多视图多模态心脏MRI分割与直接射血分数估算中的适配
机构 * Maastricht University(马斯特里赫特大学) ; University Hospital Münster(明斯特大学医院) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV
AI总结 本研究针对CMR-Multi挑战,微调CineMA并组合冻结CMR基础模型,实现多视图CMR分割与直接LVEF估算,验证了基础模型适配多视图CMR分析的有效性。
零成本虚拟RNA:通过跨模态WSI检索近似免疫治疗特征
机构 * Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) ; IRB Lleida(莱里达生物医学研究所)
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV
AI总结 针对胃腺癌免疫治疗RNA特征检测成本高的问题,提出VITA模型,通过H&E与RNA跨模态对齐实现仅用H&E切片近似RNA特征,取得0.72准确率等结果,提供低成本预筛选工具。
Comments Accepted to MIDL 2026 Short Paper track
关于多模态表示学习中的模态差距和对比损失
机构 * Technical University of Denmark(丹麦技术大学)
专题命中 跨模态检索 :multi-modal(title);分类 cs.CV
AI总结 研究CLIP风格双编码器对比学习中的模态差距,发现是InfoNCE公式在低温下的模式失败所致。提出xNCE方法,使用跨模态和模态内负对比对,能缩小模态差距,提升零样本分类性能且不牺牲判别几何。
一框架适用于所有:生成模型的跨模态成员推理
专题命中 跨模态检索 :cross-modal(title);分类 cs.AI
AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。
用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法
机构 * Hanoi University of Science and Technology(河内科技大学) ; University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) ; Vietnam National University, Ho Chi Minh City(胡志明市国家大学) ; VinUniversity ; Vietnamese-German University(越南德国大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。
Comments Accepted at the ECCV 2026 Workshop
通过文本条件变换控制嵌入空间
机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) ; Adobe Research(Adobe研究院)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究提出文本条件变换视觉嵌入,通过自然语言描述属性类别,网络生成仿射变换强调指定属性,能同时学习多属性,可在推理时访问,为控制嵌入空间提供统一高效框架,在多任务中展现近零推理成本的最优性能。
Comments Accepted at ECCV 2026
强化学习引导的软融合检索用于缺失模态下的鲁棒多模态模仿学习
机构 * Bournemouth University(伯恩茅斯大学)
专题命中 跨模态检索 :multimodal(title)
AI总结 提出RL4IL方法,利用强化学习策略从训练库中检索最相关专家演示,并通过软交叉注意力融合生成动作,有效处理传感器缺失问题,在LIBERO基准上超越现有方法。
GLACIER:用于分子性质预测的多模态师生基础模型
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; Department of Quantitative and Computational Biology, University of Southern California(南加州大学定量与计算生物学系) ; Amazon(亚马逊) ; Department of Medical Biochemistry and Biophysics, Science for Life Laboratory, Karolinska Institutet(卡罗林斯卡学院医学生物化学与生物物理系,生命科学实验室)
专题命中 跨模态检索 :multimodal(title)
AI总结 提出GLACIER师生框架,通过融合分子图、SMILES和物理化学描述符三种模态,并利用大模型蒸馏,实现高效准确的分子性质预测。
解耦共享表示可改进形态-转录组整合
机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) ; Sorbonne Université(索邦大学) ; CNRS(法国国家科学研究中心) ; Inserm(法国国家健康与医学研究院) ; AP-HP(巴黎公共医疗集团) ; Inria(法国国家信息与自动化研究所) ; Paris Brain Institute – ICM(巴黎脑研究所 – ICM)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。
监督之前的感知:来自反事实盲区的自包含视觉蒸馏
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Aalto University(阿尔托大学)
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。
Comments BMVC 2026
DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法
专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。
基于结构保留的细胞表型分子表示学习
机构 * Xiangtan University(湘潭大学) ; Hunan University(湖南大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Southeast University(东南大学)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。
ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测
机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) ; The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) ; Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) ; Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) ; Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) ; Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) ; Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) ; Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。
Comments 11 pages, 5 figures
学习组合:重新审视零样本组合图像检索的代理任务设计
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。
Comments Accepted by ECCV 2026
See & Sniff: 学习视觉-嗅觉表征
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Hankuk University of Foreign Studies(韩国外国语大学) ; Ulsan National Institute of Science and Technology(蔚山科学技术院)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。
Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/
IMAGINE:自适应模式-意象增强组合用于组合视频检索
机构 * Shandong University(山东大学) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对组合视频检索中修改文本隐含语义与显式视觉内容不匹配的问题,提出自适应模式-意象增强组合网络(IMAGINE),通过动态多模态原型捕获隐含概念并调制视觉特征,在三个基准上达到最优性能。
Comments Accepted by ICMR 2026
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索
机构 * University of Michigan(密歇根大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。
PHA-Net:用于文本-视频检索的基于原型的分层对齐网络
专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract)
AI总结 针对文本-视频检索中跨模态语义不匹配及计算成本高的问题,提出PHA-Net,以模态共享原型为桥梁,结合原型支持的令牌合并模块与原型对比损失,在四个基准数据集上取得显著性能提升。
DialogueVPR:迈向对话式视觉场所识别
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Shandong Computer Science Center, Qilu University of Technology(山东省计算中心(国家超级计算济南中心),齐鲁工业大学) ; Macquarie University(麦考瑞大学) ; Spatialtemporal AI(时空人工智能公司) ; University of Macau(澳门大学) ; Aerospace Information Research Institute(航天信息研究所)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对语言引导地理定位中现有方法不足,提出DlgPR,将场所识别转为对话驱动推理过程。构建DlgQuest-Cities基准及统一推理框架,用课程训练DQ-pilot,通过特定指标指导学习并实验,该方法显著优于基线。
Comments Accepted to CVPR 2026
MAGMaR 2026 共享任务结果
机构 * Johns Hopkins University(约翰霍普金斯大学) ; OpenAI ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Air Force Research Laboratory(空军研究实验室) ; Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人类语言技术卓越中心) ; University of Amsterdam(阿姆斯特丹大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 跨模态检索 :multimodal(abstract,comments);分类 cs.CV、cs.CL
AI总结 本文介绍MAGMaR 2026共享任务的结果,包括视频检索和基于检索视频的生成任务,所有提交系统均超越去年基线。
Comments Findings of the 2nd workshop on Multimodal Augmented Generation via Multimodal Retrieval (MAGMaR); Resources at this url: https://github.com/rekriz11/MAGMAR_2026
无校正控制的基础:大语言模型的真值追踪剖面
机构 * Humber Polytechnic(亨伯理工学院) ; University of Toronto(多伦多大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。
Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files
CMCNet:将超声图像嵌入与文本TI-RADS表示对齐以用于细粒度甲状腺分类
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究构建含600个甲状腺结节的STN数据集,提出CMCNet模型,通过中心间隔对比损失对齐图像与文本嵌入,实现细粒度甲状腺分类,性能优于多类基线方法。