arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-20 至 2026-05-20 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 14 篇

2505.17726 2026-05-20 cs.CV cs.AI 93%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20090 2026-05-20 cs.CV 85%

MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling

MetaEarth-MM:基于场景中心联合建模的多模态遥感图像生成

Zhiping Yu, Chenyang Liu, Jinqi Cao, Qinzhe Yang, Siwei Yu, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航天智能科学与技术系,航天学院,北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Shenyuan Honors College, Beihang University(Shen Yuan荣誉学院,北京航空航天大学)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);cross-modal(abstract);any-to-any(abstract)

AI总结 本文提出MetaEarth-MM模型,通过统一的多模态遥感图像生成框架,实现多模态图像的联合生成和任意模态之间的转换,展示了其在多模态遥感观测中的强大生成能力和广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19798 2026-05-20 cs.CL 79%

Towards Trust Calibration in Socially Interactive Agents: Investigating Gendered Multimodal Behaviors Generation with LLMs

迈向社交互动代理的信任校准:探究LLMs生成性别化的多模态行为生成

Lucie Galland, Chloé Clavel, Magalie Ochs

机构 * LIS Laboratory, Amu(LIS实验室,Amu) Inria Paris(Inria巴黎)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文研究了LLMs生成多模态行为以反映能力与善意的不同层次,探讨了性别对行为生成的影响,并通过用户研究验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11234 2026-05-20 cs.CV 79%

RoomPilot: Controllable Indoor Scene Synthesis via Multimodal Semantic Parsing

RoomPilot: 通过多模态语义解析实现可控的室内场景合成

Wentang Chen, Shougao Zhang, Yiman Zhang, Tianhao Zhou, Ruihui Li

机构 * School of Information Science and Engineering, Hunan University(信息科学与工程学院,湖南大学)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 该研究提出RoomPilot框架,通过多模态语义解析实现可控的室内场景合成,解决了现有方法输入模态有限和生成过程隐式的问题,提高了场景结构和语义的可控性。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20147 2026-05-20 cs.CV 70%

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16819 2026-05-20 cs.CV 57%

Character-Centered Dialogue Generation from Scene-Level Prompts

从场景级提示生成以角色为中心的对话

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park, United States(马里兰大学学院市分校,美国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出了一种模块化流程,将动作级提示转化为视觉和听觉上一致的对话,丰富了基于场景的故事叙述。通过预训练的视觉-语言编码器提取高级视觉语义,并结合结构化提示引导大型语言模型生成对话。引入递归叙述银行以保持跨场景的上下文和情感一致性,最终生成具有表现力的角色条件语音,产生完整的视听叙事。

Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV 57%

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19639 2026-05-20 cs.CV 57%

Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

基于反思生成的基准测试与进化

Junjie Wang, Xinghua Lou, Jason Li, Ye Tian, Keyu Chen, Yulin Li, Bin Kang, Jacky Mai, Yanwei Li, Zhuotao Tian, Liqiang Nie

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出R^3-Bench基准和R^3-Refiner框架,用于评估和提升反思视觉生成能力,通过改进迭代推理和修正能力,提升文本到图像模型的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19250 2026-05-20 cs.AI 57%

Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

因果证据:模态冲突幻觉中的注意力头不平衡

Jinrui Jiang, Zhangtai Wu, Zhen Wu, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence(人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在模态冲突中产生幻觉的原因,通过分析注意力头的因果作用,发现驱动幻觉的头部分布更广且权重更大,而抑制幻觉的头部集中在少量重要头部,提出MACI方法在减少幻觉的同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14530 2026-05-20 cs.CV 57%

Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

缓解大扩散视觉-语言模型中的遮蔽先验漂移和位置注意力崩溃

Sujung Hong, Chanyong Yoon, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(首尔大学人工智能系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了大扩散视觉-语言模型在长形式生成中的重复生成和视觉 grounding 退化问题,提出了一种无需训练的解决方案来缓解遮蔽先验漂移和位置注意力崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04776 2026-05-20 cs.CY cs.CL 57%

Quantifying the Climate Risk of Generative AI: Region-Aware Carbon Accounting with G-TRACE and the AI Sustainability Pyramid

量化生成式人工智能的气候风险:基于G-TRACE和AI可持续性金字塔的区域感知碳核算

Zahida Kausar, Seemab Latif, Raja Khurram Shahzad, Mehwish Fatima

机构 * School of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), Islamabad, Pakistan(电气工程与计算机科学学院(SEECS),国家科学与技术大学(NUST),巴基斯坦伊斯兰阿巴德)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出G-TRACE框架,用于量化生成式人工智能在不同模态和部署地区的训练和推理相关排放,并通过AI可持续性金字塔模型提出七级治理框架,以指导可持续的人工智能部署。

Comments 27 page, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03824 2026-05-20 cs.LG cs.AI stat.ML 57%

Proximal Diffusion Neural Sampler

近端扩散神经采样器

Wei Guo, Jaemoo Choi, Yuchen Zhu, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种名为近端扩散神经采样器(PDNS)的框架,通过在路径测度空间上应用近端点方法,解决神经采样器在训练过程中遇到的多模式目标分布和模式崩溃问题,通过分阶段的简单子问题逐步逼近目标分布,促进模式的全面探索。

Comments Accepted at ICLR 2026 (https://openreview.net/forum?id=XTHQqS7ObC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19707 2026-05-20 stat.ML cs.LG stat.CO stat.ME 50%

Diffusion and Flow-based Copulas: Forgetting and Remembering Dependencies

扩散与流基copula:遗忘与记忆依赖

David Huk, Theodoros Damoulas

机构 * Department of Statistics(统计系) Department of Computer Science(计算机科学系) University of Warwick(沃里克大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于扩散和流原理的copula建模方法,通过遗忘和记忆依赖机制,有效建模多变量依赖,提升了copula模型的表示能力,适用于复杂和高维数据。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18959 2026-05-20 astro-ph.IM astro-ph.CO astro-ph.EP astro-ph.GA cs.LG 50%

Hyrax: An Extensible Framework for Rapid ML Experimentation and Unsupervised Discovery in the Era of Rubin, Roman, and Euclid

Hyrax:一个用于快速机器学习实验和无监督发现的可扩展框架,在Rubin、Roman和Euclid时代

Aritra Ghosh, Drew Oldag, Michael Tauraso, Andrew J. Connolly, Peter Ferguson, Derek Jones, Gourav Khullar, Argyro Sasli, Samarth Venkatesh, Gracia Wang, Maxine West, Dylan Berry, Neven Caplar, Colin Orion Chandler, Tanawan Chatchadanoraset, Michael W. Coughlin, Melissa DeLucchi, Alexandra Junell, Diego Miura, Felipe Fontinele Nunes, Wilson Beebe, Doug Branton, Sandro Campos, Liam Cunningham, Mi Dai, Jeremy Kubica, Konstantin Malanchev, Rachel Mandelbaum, Sean McGuire, Imad Pasha, Dan S. Taranu, Tianqing Zhang

机构 * Dept. of Astronomy \& the DiRAC Institute, University of Washington, Box 351580, Seattle, WA 98195, USA School of Physics Astronomy, University of Minnesota, Minneapolis, MN 55455, USA Department of Astronomy Planetary Science, Northern Arizona University, Flagstaff, USA McWilliams Center for Cosmology Astrophysics, Department of Physics, Carnegie Mellon University, Pittsburgh, PA 15213, USA

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Hyrax,一个支持天文领域完整机器学习生命周期的开源框架,通过五个实际应用展示了其在大规模天文数据中的无监督发现和监督检测能力,为下一代天文调查提供了系统化的机器学习基础设施。

Comments 28 pages, 20 figures, submitted to AJ

详情

展开后加载摘要…

URL PDF HTML 收藏