arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-23 至 2026-07-23 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2602.04802 2026-07-23 cs.CV 版本更新 70%

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2606.28445 2026-07-23 cs.SD cs.AI cs.CL cs.LG 版本更新 62%

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

基于多视角语音特征的LoRA微调大语言模型用于痴呆检测

Jonghyeon Park, Olivier Jiyoun Jung, Myungwoo Oh

机构 * NAVER Cloud(NAVER云) Division of Communication and Media, Ewha Womans University(通信与媒体系,成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出LoRA微调LLM,通过统一提示整合ASR转录、话语主题、时间流畅度和音韵序列四种语音特征,实现多视角推理,在ADReSSo上F1达90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 1 篇

2607.19061 2026-07-23 cs.CV cs.AI 版本更新 62%

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

现在你看到了仇恨:用于隐藏仇恨幻觉的自适应视图检索

Qianpu Chen, Derya Soydaner

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对仇恨性视觉错觉检测难题,提出自适应视图检索方法,将其公式化为感知检索问题,通过检索并校准框架组装视图库,该方法在多方面超越基线和其他方法,表明多模态审核需先恢复隐藏含义再判断是否有害。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 4 篇

2607.19064 2026-07-23 cs.CV cs.AI cs.LG cs.MM eess.IV 版本更新 67%

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow:用于图像生成和编辑的高效原生分辨率基础模型

Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

机构 * Microsoft Mage Team(微软Mage团队)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究针对大规模视觉生成器成本高的问题,提出Mage-Flow,由Mage-VAE和原生分辨率多模态扩散Transformer组成。通过协同设计实现高效文本到图像生成及编辑,开发完整模型家族,Turbo变体在高分辨率下生成和编辑高效,性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17612 2026-07-23 cs.CV 版本更新 57%

Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution

用于逼真图像超分辨率的稀有感知离散扩散与空间一致解码

Ao Li, Yapeng Du, Yi Xin, Lei Zhu, Le Zhang, Guangtao Zhai, Ce Zhu, Xiaohong Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对图像超分辨率,提出DiMOO-SR框架。训练时用逆频率采样处理稀有令牌,推理时用空间一致性排名提高结构连贯性。实验表明该框架仅需少量并行解码步骤就能实现有竞争力的感知质量,凸显离散扩散在图像超分辨率中的潜力。

Comments 5 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10890 2026-07-23 cs.CV 版本更新 57%

CreatiPoster: Towards Editable and Controllable Multi-Layer Graphic Design Generation

CreatiPoster:迈向可编辑和可控的多层平面设计生成

Dexiang Hong, Zhao Zhang, Weidong Chen, Yutao Cheng, Maoke Yang, Gonglei Shi, Hui Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Intelligent Creation(智能创作) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在解决平面设计难题,提出CreatiPoster框架,通过协议模型和条件背景模型生成可编辑多层构图,超越开源方法和商业系统,发布无版权语料库,推动AI辅助平面设计应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21026 2026-07-23 stat.ML cs.LG 版本更新 50%

Diffusion-based Annealed Boltzmann Generators : benefits, pitfalls and hopes

基于退火的玻尔兹曼生成器:益处、陷阱与希望

Louis Grenioux, Maxence Noble

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文研究了基于退火蒙特卡洛的玻尔兹曼生成器,探讨了扩散模型在其中的应用及其在高维多模态目标中的性能表现。

Comments TMLR camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 4 篇

2601.06550 2026-07-23 cs.CV cs.AI 版本更新 84%

Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework

生成式语义多目标跟踪:大规模基准和基于大型语言模型的推理框架

Pan Liao, Feng Yang, Di Wu, Jinwen Yu, Wang Zhao, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究将语义多目标跟踪从刚性分类提升为开放式生成推理任务,引入Grand-SMOT基准,提出LLMTrack框架,通过时空融合模块压缩轨迹为语义令牌,提升了生成语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24739 2026-07-23 cs.CV 版本更新 83%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04166 2026-07-23 cs.CV cs.CL 版本更新 62%

STEMTOX: From Collaborative Tags to Fine-Grained Toxic Meme Detection via Entropy-Guided Multi-Task Learning

STEMTOX:通过熵引导的多任务学习从社交标签到细粒度有毒迷因检测

Subhankar Swain, Naquee Rizwan, Vishwa Gangadhar S, Nayandeep Deb, Animesh Mukherjee

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出TOXICTAGS数据集及STEMTOX框架,通过熵引导的多任务学习整合社交标签生成与分类,提升多模态内容审核性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07643 2026-07-23 cs.CV 版本更新 57%

Universality Reconsidered: Rethinking the Validation of Foundation Models for General-Purpose 3D Medical Segmentation

揭示通用3D医学分割中的模态差异与泛化幻觉

Yichi Zhang, Le Xue, Feiyang Xiao, Wenbo Zhang, Gang Feng, Chenguang Zheng, Yuan Qi, Yuan Cheng, Zixin Hu

机构 * Fudan University, Shanghai, China.(复旦大学) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) Shanghai Universal Medical Imaging Diagnostic Center, Shanghai, China.(上海通用医学影像诊断中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文通过UMD数据集揭示3D医学分割中模态差异与泛化幻觉问题,指出现有基础模型在实际应用中存在显著性能差异,需转向多模态训练以提升通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 1 篇

2512.16300 2026-07-23 cs.AI 版本更新 81%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 3 篇

2606.21863 2026-07-23 cs.CV 版本更新 70%

Prompt-Calibrated SAM 3 for Open-Vocabulary Remote Sensing Semantic Segmentation

Prompt-Calibrated SAM 3 用于开放词汇遥感语义分割

Yanghui Song, Nanqing Liu, Haonan Yin, Yingjie Gao, Chengfu Yang, Qi Ming

机构 * School of Information Science and Technology, Yunnan Normal University(云南师范大学信息科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出ProC-SAM3方法,通过离线提示池、缓存文本嵌入和存在引导残差融合,解决开放词汇遥感语义分割中提示语义覆盖不足、冗余编码和噪声传播问题,在8个基准上平均mIoU达56.1%。

Comments 5 pages, 5 figures. Accepted for publication in IEEE Geoscience and Remote Sensing Letters (GRSL)

Journal ref IEEE Geoscience and Remote Sensing Letters, vol. 23, 2026, Art. no. 3713378

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17330 2026-07-23 cs.LG cs.AI 版本更新 57%

SubQuad: Near-Quadratic-Free Structure Inference with Distribution-Balanced Objectives in Adaptive Receptor framework

SubQuad:在自适应受体框架中利用分布平衡目标的近二次自由结构推断

Rong Fu, Zijian Zhang, Kun Liu, Jiekai Wu, Xianda Li, Simon Fong

机构 * University of Macau(澳门大学) University of Pennsylvania(宾夕法尼亚大学) University of Southampton(南安普顿大学) Juntendo University(顺天堂大学) University of Bologna(博洛尼亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 SubQuad通过结合抗原感知的近子二次检索、GPU加速的亲和力核、学习多模态融合和公平性约束聚类,解决大规模群体适应性免疫谱分析中的二次成本和数据不平衡问题,提升效率与公平性。

Comments 27 pages, 9 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00972 2026-07-23 cs.CV 版本更新 57%

SemICP: Semantic Non-Rigid Point Cloud Registration with Elastic Energy Regularization

SemICP:基于弹性能量正则化的语义非刚性点云配准

Wanwen Chen, Qi Zeng, Carson Studders, Zongze Li, Jamie J. Y. Kwon, Tara Kemper, Emily H. T. Pang, Eitan Prisman, Septimiu E. Salcudean

机构 * Department of Electrical and Computer Engineering, University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学) Faculty of Medicine, University of British Columbia(医学院,不列颠哥伦比亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对计算机辅助干预中点云配准问题,提出SemICP框架,结合语义信息点匹配与变形正则化,经多数据集测试,相比其他方法降低多种距离误差,结合AI分割后为多模态配准提供有效管道。

详情

展开后加载摘要…

URL PDF HTML 收藏