arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2602.20818 2026-02-25 cs.CV 83%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21154 2026-02-25 cs.AI 79%

CG-DMER: Hybrid Contrastive-Generative Framework for Disentangled Multimodal ECG Representation Learning

CG-DMER:一种用于解耦多模态ECG表示学习的对比-生成框架

Ziwei Niu, Hao Sun, Shujun Bian, Xihong Yang, Lanfen Lin, Yuxin Liu, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of information science and engineering, Ritsumeikan university(立命馆大学信息科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 CG-DMER通过对比-生成框架解耦多模态ECG表示,提升ECG信号在心血管疾病诊断中的建模能力。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02276 2026-02-25 cs.AI 79%

BioX-Bridge: Model Bridging for Unsupervised Cross-Modal Knowledge Transfer across Biosignals

BioX-Bridge:生物信号跨模态知识迁移的模型桥接

Chenqi Li, Yu Liu, Timothy Denison, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系 奥克大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 BioX-Bridge通过轻量级桥接网络实现生物信号跨模态无监督知识迁移,显著减少可训练参数并提升迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 77%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18632 2026-02-25 cs.CV 74%

Decouple, Reorganize, and Fuse: A Multimodal Framework for Cancer Survival Prediction

解耦、重组与融合:一种多模态框架用于癌症生存预测

Huayi Wang, Haochao Ying, Yuyang Xu, Qibo Qiu, Cheng Zhang, Danny Z. Chen, Ying Sun, Jian Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院血管植入设备国家重点实验室) Transvascular Implantation Devices Research Institute(血管植入设备研究院) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出DeReF框架,通过解耦-重组-融合策略提升多模态癌症生存预测的准确性与泛化能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20731 2026-02-25 cs.CV cs.AI cs.LG 62%

Communication-Inspired Tokenization for Structured Image Representations

受通信启发的结构化图像表示分词

Aram Davtyan, Yusuf Sahin, Yasaman Haghighi, Sebastian Stapf, Pablo Acuaviva, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern, Switzerland(伯恩大学计算机视觉组) VITA Lab, EPFL, Switzerland(苏黎世联邦理工学院VITA实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 COMiT通过受通信启发的分词框架,学习结构化离散视觉分词序列,提升图像重建和语义理解能力。

Comments Project website: https://araachie.github.io/comit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13647 2026-02-25 cs.RO cs.AI cs.CV 62%

An Efficient LiDAR-Camera Fusion Network for Multi-Class 3D Dynamic Object Detection and Trajectory Prediction

一种高效的激光雷达-摄像头融合网络用于多类3D动态物体检测和轨迹预测

Yushen He, Lei Zhao, Tianchen Deng, Zipeng Fang, Weidong Chen

机构 * Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University, Key Laboratory of System Control and Information Processing, Ministry of Education(医学机器人研究所和自动化系,上海交通大学,系统控制与信息处理重点实验室,教育部)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种高效的激光雷达-摄像头融合网络,用于多类3D动态物体检测与轨迹预测,通过UniMT和RTMCT模型实现高精度检测与多样化轨迹预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00795 2026-02-25 cs.CV 57%

DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

DVLA-RL:基于强化学习门控的双层视觉-语言对齐用于少样本学习

Wenhao Li, Xianjing Meng, Qiangchang Wang, Zhongyi Han, Zhibin Wu, Yilong Yin

机构 * Software School, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 DVLA-RL通过双层语义构建和强化学习门控注意力,实现少样本学习中视觉与语言的双层次对齐,提升泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20531 2026-02-25 cs.CV 57%

A Lightweight Vision-Language Fusion Framework for Predicting App Ratings from User Interfaces and Metadata

一种轻量级的视觉-语言融合框架,用于从用户界面和元数据预测应用评分

Azrin Sultana, Firoz Ahmed

机构 * Department of Computer Science, American International University–Bangladesh(计算机科学系,美国国际大学-孟加拉)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种轻量级视觉-语言融合框架,通过结合UI和语义信息预测应用评分,实现了高精度的预测效果。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20479 2026-02-25 cs.CV 57%

Path-Decoupled Hyperbolic Flow Matching for Few-Shot Adaptation

路径解耦双曲流匹配用于少样本适应

Lin Li, Ziqi Jiang, Gefan Ye, Zhenqi He, Jiahui Li, Jun Xiao, Kwang-Ting Cheng, Long Chen

机构 * The Hong Kong University of Science(香港科学与技术大学) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出路径解耦双曲流匹配方法,通过双曲几何解决少样本适应中的路径缠绕问题,实现更高效的特征传输与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏