arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 51 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2602.21142 2026-02-25 cs.CV cs.LG 74%

LUMEN: Longitudinal Multi-Modal Radiology Model for Prognosis and Diagnosis

LUMEN: 长期多模态放射学模型用于预后和诊断

Zhifan Jiang, Dong Yang, Vishwesh Nath, Abhijeet Parida, Nishad P. Kulkarni, Ziyue Xu, Daguang Xu, Syed Muhammad Anwar, Holger R. Roth, Marius George Linguraru

机构 * 1 Sheikh Zayed Institute for Pediatric Surgical Innovation, Children's National Hospital, Washington DC, USA 2 Nvidia Corporation, Santa Clara, CA, USA 3 ETSI Telecomunicaci\' o n, Universidad Polit\' e cnica de Madrid, Madrid, Spain 4 School of Medicine Health Sciences, George Washington University, Washington DC, USA

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 LUMEN模型通过多任务指令微调提升纵向放射影像的诊断与预后能力。

Comments Accepted to IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01874 2026-02-25 cs.CV cs.AI 62%

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

CogFlow:通过知识内化连接感知与推理以解决视觉数学问题

Shuhang Chen, Yunqiu Xu, Junjie Xie, Aojun Lu, Tao Feng, Zeying Huang, Ning Zhang, Yi Sun, Yi Yang, Hangjie Yuan

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 57%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18296 2026-02-25 cs.CE cs.AI 57%

Context-Aware Mapping of 2D Drawing Annotations to 3D CAD Features Using LLM-Assisted Reasoning for Manufacturing Automation

基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2602.20773 2026-02-25 cs.CV 57%

Federated Learning for Cross-Modality Medical Image Segmentation via Augmentation-Driven Generalization

通过增强驱动泛化实现跨模态医学图像分割的联邦学习

Sachin Dudda Nagaraju, Ashkan Moradi, Bendik Skarre Abrahamsen, Mattijs Elschot

机构 * Department of Circulation and Medical Imaging, Norwegian University of Science and Technology(循环医学成像系,挪威科学与技术大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种联邦学习方法,通过增强驱动泛化实现跨模态医学图像分割,提升模型泛化能力的同时保护数据隐私。

Comments Submitted to IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23055 2026-02-25 cs.AI 57%

MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents

MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力

Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(台湾大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20923 2026-02-25 cs.RO 50%

ParkDiffusion++: Ego Intention Conditioned Joint Multi-Agent Trajectory Prediction for Automated Parking using Diffusion Models

ParkDiffusion++: 基于扩散模型的多智能体轨迹预测用于自动化停车的自我意图条件联合预测

Jiarong Wei, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE

专题命中 多模态Agent :multi-modal(abstract)

AI总结 ParkDiffusion++通过联合学习多智能体轨迹预测与自我意图预测,实现自动化停车中的高效假设决策与安全预测。

Comments ICRA 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 10 篇

2602.20818 2026-02-25 cs.CV 83%

GatedCLIP: Gated Multimodal Fusion for Hateful Memes Detection

GatedCLIP:用于仇恨表情包检测的门控多模态融合

Yingying Guo, Ke Zhang, Zirong Zeng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 GatedCLIP通过门控融合和对比学习提升多模态仇恨表情包检测性能,实现0.66 AUROC优于CLIP基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21154 2026-02-25 cs.AI 79%

CG-DMER: Hybrid Contrastive-Generative Framework for Disentangled Multimodal ECG Representation Learning

CG-DMER:一种用于解耦多模态ECG表示学习的对比-生成框架

Ziwei Niu, Hao Sun, Shujun Bian, Xihong Yang, Lanfen Lin, Yuxin Liu, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of information science and engineering, Ritsumeikan university(立命馆大学信息科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 CG-DMER通过对比-生成框架解耦多模态ECG表示,提升ECG信号在心血管疾病诊断中的建模能力。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02276 2026-02-25 cs.AI 79%

BioX-Bridge: Model Bridging for Unsupervised Cross-Modal Knowledge Transfer across Biosignals

BioX-Bridge:生物信号跨模态知识迁移的模型桥接

Chenqi Li, Yu Liu, Timothy Denison, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系 奥克大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 BioX-Bridge通过轻量级桥接网络实现生物信号跨模态无监督知识迁移,显著减少可训练参数并提升迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 77%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18632 2026-02-25 cs.CV 74%

Decouple, Reorganize, and Fuse: A Multimodal Framework for Cancer Survival Prediction

解耦、重组与融合:一种多模态框架用于癌症生存预测

Huayi Wang, Haochao Ying, Yuyang Xu, Qibo Qiu, Cheng Zhang, Danny Z. Chen, Ying Sun, Jian Wu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices of the Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院血管植入设备国家重点实验室) Transvascular Implantation Devices Research Institute(血管植入设备研究院) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 本文提出DeReF框架,通过解耦-重组-融合策略提升多模态癌症生存预测的准确性与泛化能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20731 2026-02-25 cs.CV cs.AI cs.LG 62%

Communication-Inspired Tokenization for Structured Image Representations

受通信启发的结构化图像表示分词

Aram Davtyan, Yusuf Sahin, Yasaman Haghighi, Sebastian Stapf, Pablo Acuaviva, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern, Switzerland(伯恩大学计算机视觉组) VITA Lab, EPFL, Switzerland(苏黎世联邦理工学院VITA实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 COMiT通过受通信启发的分词框架,学习结构化离散视觉分词序列,提升图像重建和语义理解能力。

Comments Project website: https://araachie.github.io/comit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13647 2026-02-25 cs.RO cs.AI cs.CV 62%

An Efficient LiDAR-Camera Fusion Network for Multi-Class 3D Dynamic Object Detection and Trajectory Prediction

一种高效的激光雷达-摄像头融合网络用于多类3D动态物体检测和轨迹预测

Yushen He, Lei Zhao, Tianchen Deng, Zipeng Fang, Weidong Chen

机构 * Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University, Key Laboratory of System Control and Information Processing, Ministry of Education(医学机器人研究所和自动化系,上海交通大学,系统控制与信息处理重点实验室,教育部)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种高效的激光雷达-摄像头融合网络,用于多类3D动态物体检测与轨迹预测,通过UniMT和RTMCT模型实现高精度检测与多样化轨迹预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00795 2026-02-25 cs.CV 57%

DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

DVLA-RL:基于强化学习门控的双层视觉-语言对齐用于少样本学习

Wenhao Li, Xianjing Meng, Qiangchang Wang, Zhongyi Han, Zhibin Wu, Yilong Yin

机构 * Software School, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 DVLA-RL通过双层语义构建和强化学习门控注意力,实现少样本学习中视觉与语言的双层次对齐,提升泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20531 2026-02-25 cs.CV 57%

A Lightweight Vision-Language Fusion Framework for Predicting App Ratings from User Interfaces and Metadata

一种轻量级的视觉-语言融合框架,用于从用户界面和元数据预测应用评分

Azrin Sultana, Firoz Ahmed

机构 * Department of Computer Science, American International University–Bangladesh(计算机科学系,美国国际大学-孟加拉)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种轻量级视觉-语言融合框架,通过结合UI和语义信息预测应用评分,实现了高精度的预测效果。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20479 2026-02-25 cs.CV 57%

Path-Decoupled Hyperbolic Flow Matching for Few-Shot Adaptation

路径解耦双曲流匹配用于少样本适应

Lin Li, Ziqi Jiang, Gefan Ye, Zhenqi He, Jiahui Li, Jun Xiao, Kwang-Ting Cheng, Long Chen

机构 * The Hong Kong University of Science(香港科学与技术大学) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出路径解耦双曲流匹配方法,通过双曲几何解决少样本适应中的路径缠绕问题,实现更高效的特征传输与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2602.20918 2026-02-25 cs.AI cs.CL 81%

Predicting Sentence Acceptability Judgments in Multimodal Contexts

在多模态上下文中预测句子可接受性判断

Hyewon Jang, Nikolai Ilinykh, Sharid Loáiciga, Jey Han Lau, Shalom Lappin

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在多模态上下文中,视觉上下文对人类和LLM句子可接受性判断的影响,发现LLM在去除视觉上下文时表现更优,且不同模型的判断分布各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19760 2026-02-25 cs.RO 78%

Skin-Machine Interface with Multimodal Contact Motion Classifier

皮肤-机器接口与多模态接触运动分类器

Alberto Confente, Takanori Jin, Taisuke Kobayashi, Julio Rogelio Guadarrama-Olvera, Gordon Cheng

机构 * Department of Informatics, Technical University of Munich(技术大学慕尼黑信息学院) National Institute of Informatics(国家信息研究所) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学(SOKENDAI)) Institute for Cognitive Systems (ICS), Technical University of Munich(认知系统研究所(ICS),技术大学慕尼黑)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出了一种利用皮肤传感器作为机器人新操作接口的框架,通过多模态接触运动分类器提升机器人任务执行能力。

Comments 8 pages, 8 figures (accepted in Humanoids2025)

Journal ref Humanoids2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21042 2026-02-25 cs.CV 57%

OmniOCR: Generalist OCR for Ethnic Minority Languages

OmniOCR:面向少数民族语言的通用OCR

Bonan Liu, Zeyu Zhang, Bingbing Meng, Han Wang, Hanshuo Zhang, Chengping Wang, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniOCR通过动态LoRA和稀疏正则化技术,实现了对少数民族语言的高效OCR识别,显著提升了低资源和零样本场景下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18470 2026-02-25 cs.CY cs.AI 57%

Transforming Science Learning Materials in the Era of Artificial Intelligence

人工智能时代科学学习材料的变革

Xiaoming Zhai, Kent Crippen

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了人工智能在科学教育中如何变革学习材料,通过六个领域展示AI对个性化教学、互动模拟和多模态内容生成的影响,并强调伦理和教育价值的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏