arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-31 至 2026-07-31 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2508.04227 2026-07-31 cs.CV cs.LG 版本更新 77%

Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting

视觉语言模型的持续学习:超越遗忘的综述与分类

Yuyang Liu, Qiuhe Hong, Linlan Huang, Alexandra Gomez-Villa, Dipam Goswami, Tiantian Peng, Xialei Liu, Joost van de Weijer, Yonghong Tian

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08881 2026-07-31 cs.CV 版本更新 70%

Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models

Precise Shield:通过神经层面指导解释和对齐VLLM安全

Enyi Shi, Fei Shen, Chuancheng Shi, Shuyi Miao, Linxia Zhu, Pengyang Shao, Jinhui Tang, Tat-Seng Chua

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Beihang University(北京航空航天大学) Nanjing Forestry University(南京林业大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Precise Shield框架,通过对比有害与良性输入的激活模式识别安全神经元,并通过梯度掩码限制参数更新,提升VLLM安全性能并保持多语言多模态泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24973 2026-07-31 cs.CV cs.AI cs.CL 版本更新 67%

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

MinerU-Popo:结构化文档解析的通用后处理模型

Bangrui Xu, Ziyang Miao, Xuanhe Zhou, Yiming Lin, Zirui Tang, Xiaomeng Zhao, Fan Wu, Cheng Tan, Fan Wu, Bin Wang, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。

Comments The code is available at https://github.com/opendatalab/MinerU-Popo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-07-31 cs.CV cs.AI 版本更新 62%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 62%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12055 2026-07-31 cs.CV cs.LG 版本更新 57%

Continual Learning with Vision-Language Models via Semantic-Geometry Preservation

通过语义-几何保持实现视觉-语言模型的持续学习

Chiyuan He, Zihuan Qiu, Fanman Meng, Runtong Zhang, Linfeng Xu, Qingbo Wu, Hongliang Li

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。

Comments Accepted by IEEE TCSVT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2604.08405 2026-07-31 cs.CV 版本更新 79%

SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation

SyncBreaker:面向音频驱动生成的多模态对抗攻击框架

Wenli Zhang, Xianglong Shi, Sirui Zhao, Xinqi Chen, Guo Cheng, Yifan Xu, Tong Xu, Yong Liao

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Technology(北京工业大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2606.20919 2026-07-31 cs.CV 版本更新 74%

GIM-ENDO: A Multimodal Endoscopic Image and Video Dataset for Gastric Intestinal Metaplasia Morphology and Pathology

GIM-ENDO:用于胃肠化生形态与病理的多模态内镜图像和视频数据集

Mojgan Forootan, Mahziar Setayeshfar, Ali Darvishi, Mohammad Tashakoripour, Hamidreza Bolhasani

机构 * Gastroenterology and Liver Disease Research Center, Research Institute for Gastroenterology and Liver Diseases, Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学胃肠病与肝病研究中心,胃肠病与肝病研究所) Iran University of Medical Sciences(伊朗医科大学) Shiraz University of Medical Sciences(设拉子医科大学) Gastroenterology Department, Amiralam Hospital, Tehran University of Medical Sciences(德黑兰医科大学阿米拉拉姆医院胃肠病科) Department of Computer Engineering, Science and Research Branch, Islamic Azad University(伊斯兰阿扎德大学科学与研究分校计算机工程系)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 针对胃黏膜肠化生(GIM)公开数据集缺失的问题,构建了包含多模态内镜图像、视频及病理标注的数据集GIM-ENDO,涵盖六种主要内镜征象和亚型分级,以促进AI辅助诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23749 2026-07-31 cs.HC 版本更新 50%

StateScribe: Towards Accessible Change Awareness Across Real-World Revisits

StateScribe: 向现实世界重访中的可访问性变化意识迈进

Ruei-Che Chang, Xirui Jiang, Rosiana Natalie, Hao Chen, Vlad Roznyatovskiy, Jianzhong Zhang, Kang G. Shin, Ke Sun, Anhong Guo

专题命中 视频多模态 :multimodal(abstract)

AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2607.17184 2026-07-31 cs.IR 版本更新 78%

Learning Sparse Representations of Multimodal Content for Enhanced Cold Item Recommendation

学习多模态内容的稀疏表示以增强冷启动项目推荐

Gregor Meehan, Johan Pauwels

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对数字平台项目目录规模大及冷启动问题,提出利用稀疏嵌入优势,通过改进冷启动训练方法和设计预稀疏化激活技术,降低存储成本并提升冷启动推荐准确性,还展示了稀疏内容嵌入的可解释性与稳健性。

Comments Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2601.17151 2026-07-31 cs.CV cs.CL 版本更新 81%

Scaling medical imaging report generation with multimodal reinforcement learning

通过多模态强化学习扩展医学影像报告生成

Qianchu Liu, Sheng Zhang, Guanghui Qin, Yu Gu, Ying Jin, Sam Preston, Yanbo Xu, Sid Kiblawi, Wen-wai Yim, Timothy Ossowski, Tristan Naumann, Mu Wei, Hoifung Poon

机构 * Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出UniRG框架,通过多模态强化学习提升医学影像报告生成的性能和泛化能力,在CXR报告生成中取得新的SOTA成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06696 2026-07-31 stat.ML cs.LG stat.ME 版本更新 50%

Heat-Kernel Entropy Profiles and Geometric Effective Sample Size for Weighted Measures on Manifolds

流形上加权测度的热核熵剖面与几何有效样本量

Kisung You, Boram Cho

机构 * Baruch College(巴克尔学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究紧致流形上加权测度,引入热核熵剖面这一多尺度总结方法,通过内在热流扩散加权原子并跟踪尺度不均匀性,可计算二阶Rényi熵的几何有效样本量,实验表明其能揭示传统总结遗漏的结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05117 2026-07-31 cs.RO 版本更新 50%

SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation

SeedPolicy: 通过自进化扩散策略实现机器人操控的水平扩展

Youqiang Gui, Yuxuan Zhou, Shen Cheng, Xinyang Yuan, Haoqiang Fan, Peng Cheng, Shuaicheng Liu

机构 * Sichuan University(四川大学) Dexmal Inc.(Dexmal公司) Independent Researcher(独立研究员) UESTC

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出SEGA模块,通过门控注意力机制提升扩散策略在长时域操控中的表现,实验表明其在RoboTwin 2.0基准上优于现有方法,具有更高的效率和性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 4 篇

2509.25991 2026-07-31 cs.AI cs.CV 版本更新 84%

Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline

面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型

Haiyang Li, Yaxiong Wang, Shengeng Tang, Yuchen Zhang, Lianwei Wu, Lechao Cheng, Liu Liu, Chaofeng Dong, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 83%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27069 2026-07-31 cs.CV cs.AI 版本更新 81%

Visual Credit Audit for Multimodal Spatial Reasoning

多模态空间推理的视觉信用审计

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

专题命中 多模态评测 :multimodal(title);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。

Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00448 2026-07-31 cs.CV eess.IV 版本更新 57%

Learning from Compressed CT: Feature Attention Style Transfer and Structured Factorized Projections for Resource-Efficient Medical Image Analysis

从压缩CT学习:用于资源高效医学图像分析的特征注意力风格迁移和结构化因子化投影

Shadid Yousuf, S. M. Mahbubur Rahman, Mohammed Imamul Hassan Bhuiyan

机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology(电气电子工程系,孟加拉工程与技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FAST和SFP方法,通过压缩CT体积进行胸腔异常检测,实现低资源部署和高效数据传输,实验表明CT-Lite在压缩输入下达到接近未压缩基线的AUROC性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 1 篇

2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 57%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 3 篇

2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 88%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02916 2026-07-31 cs.IR 版本更新 85%

Towards Transfer-Efficient Multi-modal Sequential Recommendation with State Space Duality

面向高效多模态序列推荐的态空间双重视角

Hao Fan, Qingyang Liu, Hongjiu Liu, Yanrong Hu, Kai Fang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MMM4Rec模型,通过结合态空间双重视角和全局时间建模,提升多模态序列推荐的迁移效率与准确性,实验表明其在大规模下游数据集上收敛速度提升10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12268 2026-07-31 eess.IV cs.CV 版本更新 79%

Uncertainty-Aware Multimodal Fusion for Oral Lesion Classification

面向口腔病变分类的患者感知多模态RGB-HSI融合:通过增量启发式元学习

Soujanya Hazra, Rupam Mukherjee, Rajkumar Daniel, Shirin Dasgupta, Subhamoy Mandal

机构 * 1 School of Medical Science \& Technology, IIT Kharagpur, India 2 Department of Electrical Engineering, IIT Kharagpur, India 3 Dr. B.C. Roy Multispeciality Medical Research Centre, IIT Kharagpur, India

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向口腔病变分类的患者感知多模态RGB-HSI融合方法,结合深度学习、光谱分析和人口统计数据,通过增量启发式元学习提升诊断鲁棒性。

Comments Accepted at MICCAI MultiTab Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他多模态 2 篇

2410.13174 2026-07-31 eess.IV cs.CV cs.LG 版本更新 57%

Scalable Drift Monitoring in Medical Imaging AI

医学影像AI中的可扩展漂移监测

Jameson Merkow, Felix J. Dorfner, Xiyu Yang, Alexander Ersoy, Giridhar Dasegowda, Mannudeep Kalra, Matthew P. Lungren, Christopher P. Bridge, Ivan Tarapov

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究针对医学影像AI的模型漂移与可靠性问题,开发了基于CheXstray框架的增强型可扩展漂移监测框架MMC+,经真实世界数据验证可有效检测数据偏移并预警性能偏差,助力AI在临床场景的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02943 2026-07-31 stat.ME 版本更新 50%

Geometric Information Decomposition for Weighted Empirical Measures on the Sphere

球面上加权经验测度的几何信息分解

Kisung You, Boram Cho

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究单位球面上加权概率测度的方向不确定性,传统方法用von Mises-Fisher分布不完整,引入几何信息分解(GID),通过球面特征拟合最大熵投影序列,证明相关性质,实验展示不同情况下GID作用。

详情

展开后加载摘要…

URL PDF HTML 收藏