Beyond Text: Aligning Vision and Language for Multimodal E-Commerce Retrieval
超越文本:为多模态电子商务检索对齐视觉与语言
专题命中 通用Image Fusion :image fusion(abstract)
AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
超越文本:为多模态电子商务检索对齐视觉与语言
专题命中 通用Image Fusion :image fusion(abstract)
AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。
GMODiff:基于扩散先验的单步增益图优化用于高动态范围重建
专题命中 多聚焦/多曝光融合 :multi-exposure(abstract);分类 cs.CV
AI总结 本文提出GMODiff,通过单步扩散框架优化增益图,提升多曝光HDR重建的动态范围和效率,实验表明其性能优于现有方法且速度提升100倍。
Comments This paper is accepted by ECCV2026
EPMF: 高效感知感知多传感器融合用于3D语义分割
机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) ; Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) ; School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) ; Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)
专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(title,abstract);分类 cs.CV
AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。
Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper
相机-激光雷达粒子滤波器中用于单船跟踪的自适应熵驱动传感器选择
机构 * Cyprus Marine and Maritime Institute(塞浦路斯海洋与航海研究所) ; Technical University of Denmark(丹麦技术大学)
专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 eess.SP、cs.RO
AI总结 研究单船跟踪问题,提出含相机-激光雷达融合的粒子滤波器及信息增益自适应传感策略,在实际海事部署中验证,该策略能依信息增益切换模态,实现精度与连续性平衡,提供实用基线。
Comments 10 pages, 5 figures, submitted and accepted FUSION 2026 conference proceedings
GestaltMML:通过结合面部图像和临床文本的多模态机器学习增强罕见遗传病诊断
机构 * Raymond G. Perelman Center for Cellular and Molecular Therapeutics, Children’s Hospital of Philadelphia(雷蒙德·G·佩尔曼细胞与分子治疗中心,费城儿童医院) ; Department of Mathematics, University of Pennsylvania(数学系,宾夕法尼亚大学) ; Department of Biomedical Informatics, Columbia University Irving Medical Center(生物医学信息学系,哥伦比亚大学伊万斯医疗中心) ; Department of Human Genetics, New York State Institute for Basic Research in Developmental Disabilities, Staten Island, NY, USA(人类遗传学系,纽约州发育障碍基础研究机构,纽约州史泰登岛) ; Division of Human Genetics, Children’s Hospital of Philadelphia(人类遗传学部,费城儿童医院) ; Department of Pediatrics, Boston Children’s Hospital, Harvard Medical School(儿科系,波士顿儿童医院,哈佛医学院) ; Biology PhD Program, The Graduate Center, The City University of New York(生物学博士项目,纽约市立大学研究生中心) ; Department of Genetics, Perelman School of Medicine, University of Pennsylvania(遗传学系,宾夕法尼亚大学佩尔曼医学学院) ; Department of Pediatrics, Perelman School of Medicine, University of Pennsylvania(儿科系,宾夕法尼亚大学佩尔曼医学学院) ; Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania(病理学与实验室医学系,宾夕法尼亚大学佩尔曼医学学院)
专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV、cs.MM
AI总结 研究针对罕见遗传病诊断难题,提出基于Transformer架构的多模态机器学习方法GestaltMML,整合面部图像、人口统计学信息和临床笔记,提升预测准确性,缩小诊断差距。
Comments Preprint updated
视频中矛盾/犹豫识别用于个性化数字健康干预
机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(ETS蒙特利尔大学系统工程系LIVIA实验室) ; LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(ETS蒙特利尔大学软件与信息工程系LIVIA实验室) ; Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(康科迪亚大学健康、运动科学与应用生理学系) ; Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,蒙特利尔北岛卫生与社会服务局)
专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文研究了通过深度学习模型在视频中进行矛盾/犹豫识别,以提升数字健康干预的个性化和成本效益,实验基于新的BAH视频数据集,发现需改进多模态模型以准确识别矛盾/犹豫。
Comments 11 pages, 4 figures, ACII 2026. arXiv admin note: substantial text overlap with arXiv:2505.19328
双模糊概率区间语言术语集及基于马尔可夫过程的动态模糊决策模型在多准则群体决策中的应用
机构 * Stanford University(斯坦福大学)
专题命中 融合架构与评测 :information fusion(abstract)
AI总结 针对概率语言术语缺陷及动态属性权重确定难问题,提出双模糊概率区间语言术语集概念,定义相关内容,开发模糊语言马尔可夫矩阵等,给出权重确定方法,并用金融风险投资案例说明其在多准则决策中的应用。
Comments submitted to IEEE Transactions on Fuzzy Systems