Beyond Text: Aligning Vision and Language for Multimodal E-Commerce Retrieval
超越文本:为多模态电子商务检索对齐视觉与语言
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
超越文本:为多模态电子商务检索对齐视觉与语言
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。
2026年EXIST竞赛中的AI奇才:用于表情包中多模态性别歧视识别的分层软标签学习
机构 * EXIST Lab(EXIST实验室) ; CLEF(信息检索评价论坛) ; Swiss Data Science Center, ETH Zürich(瑞士苏黎世联邦理工学院瑞士数据科学中心) ; Everest Systems GmbH(珠穆朗玛峰系统有限公司) ; Villanova.ai S.P.A(维拉诺瓦人工智能股份公司)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 针对表情包多模态性别歧视识别,将任务分层建模为基于经验注释者分布的条件软标签预测,用轻量级门控MLP映射视觉语言表征,在竞赛中取得好成绩。
ELVA:探索排序驱动的通用多模态检索
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; MiLM Plus ; Xiaomi Inc(小米公司) ; Zhongguancun Academy(中关村学院) ; Beijing, China(北京市)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。
Comments Accepted by ECCV 2026
检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头
机构 * HKUST(香港科技大学) ; University of Edinburgh(爱丁堡大学) ; CUHK(香港中文大学) ; NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) ; Tsinghua University(清华大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。
Comments Work in Progress
KinEMbed:通过跨模态对比学习从肌电图中解码运动学
机构 * Department of Statistics, University of Oxford(牛津大学统计学系) ; School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
专题命中 跨模态检索 :cross-modal(title,abstract)
AI总结 研究从表面肌电图解码手部运动学这一挑战,提出跨模态对比学习框架KinEMbed训练双编码器,用于手部运动学回归,在NinaPro DB8数据集上优于基线方法。
Comments ICML 2026 Workshop on Structured Data for Health, Seoul, South Korea
一框架适用于所有:生成模型的跨模态成员推理
专题命中 跨模态检索 :cross-modal(title);分类 cs.AI
AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。
用于长文档理解的分层证据驱动推理
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research(科大讯飞研究院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对现有多模态RAG管道面临的问题,提出分层证据驱动的多模态RAG框架HIEVI-RAG,通过四阶段管道,包括分层问题分解、粗视觉页面检索、细粒度页面验证和内存引导迭代生成,提升长文档理解,效果显著优于现有基线。
嵌入投影的可扩展语义引导
机构 * Virginia Tech(弗吉尼亚理工学院) ; Department of Defense(国防部) ; Tulane University(路易斯安那州立大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。
Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures
DiCE-CIR:用于高效零样本合成图像检索的直接合成学习
机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)(信息通信技术规划与评估研究所(IITP)) ; Department of Artificial Intelligence, Korea University(韩国大学人工智能系)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 研究零样本合成图像检索问题,提出直接合成学习方法DiCE-CIR,直接组合参考图像和编辑文本预测合成查询表示,用大语言模型自动构建训练样本,训练轻量级模块,实验表明其性能优且效率高。
通过递归校正、频率一致性和对比流匹配实现高保真一步生成视觉运动策略
机构 * School of Safety Science and Engineering, Anhui University of Science and Technology(安徽理工大学安全科学与工程学院) ; State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学煤矿智能开采技术与装备国家重点实验室) ; School of Artificial Intelligence, Anhui University of Science and Technology(安徽理工大学人工智能学院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 研究针对生成模型多步采样有延迟、一步加速方法有偏差等问题,提出含递归校正、频率一致性和对比流匹配三机制的框架,解决相关问题,实验显示该方法在低延迟下性能优。
基于目标感知多级对比对齐的语言引导医学图像分割
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) ; Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(北京中关村学院及中关村人工智能研究院) ; Department of Molecular Imaging, Royal Prince Alfred Hospital(皇家珀斯阿尔弗雷德医院分子成像部)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV
AI总结 研究针对医学图像分割,提出目标感知多级对比对齐框架,通过引入目标敏感语义距离模块、多级对比对齐策略和语言引导目标增强模块,弥合图文模态差距,实现细粒度文本引导,实验证明性能优于现有方法。
Comments Published in Expert Systems with Applications (ESWA)
全模态扩散:基于掩码离散扩散的统一多模态理解与生成
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯云科技实验室) ; CASIA(中国科学院自动化研究所)
专题命中 多模态生成 :multimodal(title,abstract);any-to-any(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。
Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io
一次关注一个令牌的多模态生成
机构 * CVIT, IIIT Hyderabad(海得拉巴国际信息技术研究所计算机视觉与信息处理中心)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型生成时令牌级动态,按语义角色跟踪注意力转移。引入多模态任务,通过因果注意力阻断干预等方法,发现一致模式并据此提出测试时干预,提升多模态任务性能。
GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督
机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。
Comments 14 pages, 11 figures, 7 tables
通过场景感知文档合成增强关键信息提取中的大型多模态模型
机构 * Alibaba Group(阿里巴巴集团) ; Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) ; Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。
行人扩散:用于惯性导航的多模态生成去噪和密集状态估计
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 针对消费级惯性导航受MEMS随机噪声限制问题,提出PedestrianDiffusion框架,将密集6D状态估计转化为连续条件去噪过程,引入零样本语义条件机制,用ODE求解器提升性能,在多基准测试中达先进水平。
TexTailor:用于多模态扩散变压器的推理时文本引导剪裁
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。
Comments To appear in ECCV 2026
区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成
机构 * Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系) ; University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院) ; Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 提出MedRegion-CT框架,通过区域慢快标记器联合建模全局与细粒度信息、伪掩码引导关注诊断关键区域、结构化病变信息提示,实现高质量CT报告生成,在多项指标上达到最优。
Comments Accepted to ECCV 2026. 15 pages, 8 figures, 4 tables
Dress-ED:基于指令的虚拟试穿和试脱编辑
机构 * University of Modena(摩德纳大学) ; University of Trento(特伦托大学) ; University of Pisa(比萨大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。
Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/
UniVideo:视频的统一理解、生成与编辑
机构 * University of Waterloo(多伦多大学) ; Kling Team, Kuaishou Technology(快手技术团队)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。
Comments Project Website https://congwei1230.github.io/UniVideo/
EM3M:用于微观结构分割与生成的电子显微镜图像数据集
机构 * DP Technology(DP技术)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 针对深度学习分析电子显微镜图像缺乏大规模专家标注数据集的问题,引入EM3M数据集,介绍构建过程,提供文本到图像扩散模型,评估分割方法并给出优化基线,推动自动化材料分析研究。
Comments 31 pages, 13 figures, Accepted by ECCV2026
看见情感:用于脑电图情感识别的面部表情符号代理建模
机构 * Hefei University of Technology(合肥工业大学) ; PLA Information Engineering University(中国人民解放军信息工程大学) ; University of Science and Technology of China(中国科学技术大学) ; MBZUAI
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 研究将脑电图可解释性重构为跨模态生成任务,提出面部表情符号代理建模框架,把高维脑电图信号转化为面部表情符号,在相关基准测试中取得先进准确率,能生成忠实面部动画展现大脑情感演变。
Comments Accepted by ICML 2026
ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维
机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。
Comments Accepted by ECCV 2026
医学视觉语言模型的模型编辑评估与理解
机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench
FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响
机构 * Fudan University(复旦大学) ; East China University of Science and Technology(华东理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。
Comments 15 pages, 11 figures
归一化物体坐标空间中用于生成视图合成的全局姿态控制
机构 * The Chinese University of Hong Kong(香港中文大学) ; Amazon(亚马逊)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。
Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/
AI原生游戏:综述与路线图
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) ; School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) ; Game AI Research Group, Queen Mary University of London, London, United Kingdom(伦敦女王学院游戏人工智能研究组)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 本文定义AI原生游戏为运行时生成式AI构成核心循环的游戏,提出G/N分类法分析53个实例,指出核心设计问题是将语义开放性组织为稳定游戏玩法,并给出路线图。
JADAI:联合摊销自适应设计与贝叶斯推理
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; TU Dortmund University(多特蒙德技术大学) ; University of Oxford(牛津大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 针对设计变量可优化以最大化信息增益的参数估计问题,引入JADAI框架,通过端到端训练策略、历史网络和推理网络联合摊销贝叶斯自适应设计与推理,在标准基准测试中性能优越。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
数据到能量的随机动力学
机构 * University of Edinburgh(爱丁堡大学) ; CIFAR Fellow(蒙特利尔认知研究院研究员)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出了一种数据到能量的IPF方法,用于建模Schrödinger桥问题,无需数据样本即可学习多模态分布之间的传输,并改进了扩散系数的学习。
Journal ref International Conference on Learning Representations (ICLR) 2026
PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Sheffield(谢菲尔德大学)
专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。
Comments 17 Pages