arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2602.20972 2026-02-25 cs.CV 83%

Are Multimodal Large Language Models Good Annotators for Image Tagging?

多模态大语言模型在图像标签任务中是好的标注者吗?

Ming-Kun Xie, Jia-Hao Xiao, Zhiqiang Kou, Zhongnian Li, Gang Niu, Masashi Sugiyama

机构 * RIKEN Center for Advanced Intelligence Project, Japan(日本先进人工智能研究中心) The University of Tokyo, Japan(东京大学) Southeast University, China(东南大学) China University of Mining(中国矿业大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出TagLLM框架,通过候选生成和标签歧义消除方法,有效缩小多模态大语言模型生成标注与人工标注之间的差距,提升图像标签任务的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20161 2026-02-25 cs.CV 83%

Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device

Mobile-O: 移动设备上的统一多模态理解和生成

Abdelrahman Shaker, Ahmed Heakl, Jaseel Muhammad, Ritesh Thawkar, Omkar Thawakar, Senmao Li, Hisham Cholakkal, Ian Reid, Eric P. Xing, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Linköping University(利尔贝里大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Mobile-O是一款在移动设备上实现统一多模态理解和生成的高效模型,通过紧凑架构和创新训练方法,在性能和速度上均优于现有模型。

Comments Project page: https://amshaker.github.io/Mobile-O/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18701 2026-02-25 cs.CV 70%

UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation

UniGenBench++: 一个统一的语义评估基准用于文本到图像生成

Yibin Wang, Zhimin Li, Yuhang Zang, Jiazi Bu, Yujie Zhou, Yi Xin, Junjun He, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniGenBench++ 提出一个统一的语义评估基准,涵盖多样化的现实场景和多语言支持,用于评估文本到图像生成模型的语义一致性。

Comments Project page: codegoat24.github.io/UniGenBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20520 2026-02-25 cs.CV cs.AI 62%

How Do Inpainting Artifacts Propagate to Language?

图像修复伪影如何传播到语言?

Pratham Yashwante, Davit Abrahamyan, Shresth Grover, Sukruth Rao

机构 * UC San Diego(圣迭戈大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究图像修复伪影对视觉-语言模型语言生成的影响,通过两阶段诊断方法分析重建保真度与描述质量的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16156 2026-02-25 cs.CV 57%

Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

可插拔剪枝与连续层蒸馏用于扩散变换器

Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本研究提出PPCL方法,通过连续层蒸馏和灵活剪枝技术,在保持图像生成质量的同时实现50%的参数压缩,适用于资源受限环境。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08019 2026-02-25 cs.CV 57%

Coherent and Multi-modality Image Inpainting via Latent Space Optimization

通过潜在空间优化实现一致性和多模态图像修复

Lingzhi Pan, Tong Zhang, Bingyuan Chen, Qi Zhou, Wei Ke, Sabine Süsstrunk, Mathieu Salzmann

机构 * Xi’an Jiaotong University(西安交通大学) EPFL(苏黎世联邦理工学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 PILOT通过潜在空间优化提升图像修复的一致性和多模态处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20644 2026-02-25 cs.SE 50%

An LLM-driven Scenario Generation Pipeline Using an Extended Scenic DSL for Autonomous Driving Safety Validation

基于扩展Scenic DSL的LLM驱动场景生成流水线用于自动驾驶安全验证

Fida Khandaker Safa, Yupeng Jiang, Xi Zheng

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于扩展Scenic DSL和LLM的场景生成流水线,实现高精度自动驾驶安全验证。

详情

展开后加载摘要…

URL PDF HTML 收藏