arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 7 篇

2512.23304 2026-04-20 cs.CV cs.AI 62%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV 57%

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10096 2026-04-20 cs.CV 57%

ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents

ABot-Claw:持久、协作和自演化机器人代理的基础

Dongjie Huo, Haoyun Liu, Guoqing Liu, Dekang Qi, Zhiming Sun, Maoguo Gao, Jianxin He, Yandan Yang, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

机构 * AMAP CV Lab(AMAP CV 实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ABot-Claw通过统一的具身接口、视觉导向的多模态记忆和基于批评者的闭环反馈机制,实现了持久上下文保留、在线进度评估和自演化能力,支持开放动态环境中的机器人代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20633 2026-04-20 cs.AI 57%

Seed1.8 Model Card: Towards Generalized Real-World Agency

Seed1.8 模型卡:迈向通用的现实世界代理

Bytedance Seed

机构 * Bytedance Seed(字节跳动Seed)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 5 篇

2509.23714 2026-04-20 cs.CL 83%

Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion

融合与独立的协作:超复数驱动的鲁棒多模态知识图谱补全

Zhiqiang Liu, Yichi Zhang, Mengshu Sun, Lei Liang, Wen Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出M-Hyper方法,结合融合与独立模态表示,利用四元数代数实现多模态交互,提升知识图谱补全的鲁棒性和效率。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16264 2026-04-20 cs.CV cs.LG 70%

Information Router for Mitigating Modality Dominance in Vision-Language Models

信息路由器用于缓解视觉-语言模型中的模态主导问题

Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib

机构 * OLIVES at the Center for Signal Information Processing CSIP, School of Electrical

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MoIR信息路由器,通过在融合前减少信息差异,缓解视觉-语言模型中模态主导问题,提升鲁棒性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15856 2026-04-20 cs.CV cs.AI 62%

Robust Multispectral Semantic Segmentation under Missing or Full Modalities via Structured Latent Projection

在缺失或完整模态下通过结构化潜在投影实现鲁棒多光谱语义分割

Irem Ulku, Erdem Akagündüz, Ömer Özgür Tanrıöver

机构 * Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Department of Modeling and Simulation, Graduate School of Informatics, METU(信息学院建模与模拟系,METU)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CBC-SLP模型,通过结构化潜在投影保留模态不变和特定信息,提升多模态语义分割在缺失或完整模态下的鲁棒性和性能。

Comments 15 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 50%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15469 2026-04-20 stat.ME 50%

Sample continuation in Bayesian hierarchical model via variational inference

通过变分推断在贝叶斯分层模型中进行样本延续

Yucong Liu, Zilai Si, Alexander Strang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究通过变分推断跟踪先验参数变化对后验分布的影响,分析后验分布对先验假设的敏感性,并在先验假设显著改变时实现解的延续。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 7 篇

2502.20503 2026-04-20 cs.CL 85%

Protecting multimodal large language models against misleading visualizations

保护多模态大语言模型免受误导性可视化的影响

Jonathan Tonglet, Tinne Tuytelaars, Marie-Francine Moens, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系,德累斯顿技术大学及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系,鲁文大学) Department of Computer Science, KU Leuven(计算机科学系,鲁文大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现多模态大语言模型在面对误导性可视化时回答准确性显著下降,提出两种有效方法提升其处理能力,同时保持非误导性可视化下的准确性。

Comments Preprint. Code and data available at https://github.com/UKPLab/arxiv2025-misleading-visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15781 2026-04-20 cs.HC 80%

ReVis: Towards Reusable Image-Based Visualizations with MLLMs

ReVis:面向基于图像的可视化可重用性的方法

Xiaolin Wen, Changlin Li, Manusha Karunathilaka, Can Liu, Fangzhuo Jin, Yong Wang

专题命中 其他多模态 :MLLM(summary_cn,abstract)

AI总结 ReVis通过引入领域特定语言和MLLM管道,实现复杂可视化的灵活重用,支持分解与再现,并通过交互界面实现数据更新与编码定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16288 2026-04-20 math.AP cond-mat.stat-mech math-ph math.MP math.PR stat.ML 71%

Phase transitions in Doi-Onsager, Noisy Transformer, and other multimodal models

Doi-Onsager、Noisy Transformer及其他多模态模型中的相变

Kyunghoo Mun, Matthew Rosenzweig

专题命中 其他多模态 :multimodal(title)

AI总结 研究了在圆周上具有排斥-吸引均场自由能的相变问题,证明了临界耦合强度与线性稳定性阈值一致,且相变连续。应用于三个模型,确定了相变临界点及连续性条件。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07353 2026-04-20 cs.CL cs.AI cs.CV cs.CY cs.SI 67%

Toxic Memes: A Survey of Computational Perspectives on the Detection and Explanation of Meme Toxicities

有毒的迷因:计算视角下对迷因毒性的检测与解释的综述

Delfina Sol Martinez Pandiani, Erik Tjong Kim Sang, Davide Ceolin

机构 * organization= Centrum Wiskunde \& Informatica , addressline= Science Park 123 , city= Amsterdam , postcode= 1098 XG , country= The Netherlands organization= Netherlands eScience center , addressline= Science Park 402 , city= Amsterdam , postcode= 1098 XH , country= The Netherlands

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了计算视角下对迷因毒性的检测与解释的研究,识别了30多个数据集及毒性分类方法,提出了新的毒性分类体系,并探讨了跨模态推理、低资源语言处理等挑战。

Comments 39 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15488 2026-04-20 cs.LG cs.AI cs.CL 62%

FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models

FineSteer: 一种用于大语言模型推理时细粒度引导的统一框架

Zixuan Weng, Jinghuai Zhang, Kunlin Cai, Ying Li, Peiran Wang, Yuan Tian

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FineSteer框架,通过条件引导和细粒度向量合成两个阶段实现高效引导,保留模型效用并提升引导效果,实验显示其在安全性和真实性基准上表现优异。

Comments Accepted by ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15341 2026-04-20 cs.HC cs.AI 57%

MRGEN: A Conceptual Framework for LLM-Powered Mixed Reality Authoring Tools for Education

MRGEN:一种基于大语言模型的混合现实教育作者工具的概念框架

Mohammed Oussama Seddini, Mohamed Ez-Zaouia, Ngoc Luyen Le, Iza Marfisi

机构 * LIUM, Le Mans Université(里摩斯大学) IRISA, Université de Rennes(里莫斯大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MRGEN框架,利用大语言模型帮助教师创建适用于移动设备的混合现实学习活动,实验显示AI辅助显著缩短任务时间,90%以上参与者认为AI支持有助于构思和对齐学习目标。

Journal ref The Mobile Learning 2026 International Conference, Mar 2026, Zagreb, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14333 2026-04-20 cs.LG 50%

When Missing Becomes Structure: Intent-Preserving Policy Completion from Financial KOL Discourse

当缺失成为结构:从金融KOL言论中保留意图的策略补全

Yuncong Liu, Yuan Wan, Zhou Jiang, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种保留KOL意图的策略补全框架,通过离线强化学习补全未指定的执行决策,实验证明其在YouTube和X平台上的高收益和夏普比率。

Comments Main paper with supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏