arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 17 篇

2604.10741 2026-04-21 cs.CL cs.AI cs.IR 84%

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17585 2026-04-21 cs.CV cs.AI cs.LG 82%

DGSSM: Diffusion guided state-space models for multimodal salient object detection

DGSSM:基于扩散引导的状态空间模型的多模态显著目标检测

Suklav Ghosh, Arijit Sur, Pinaki Mitra

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Guwahati(计算机科学与工程系,印度理工学院,果阿提)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DGSSM,一种结合扩散模型结构先验和多尺度状态空间编码的多模态显著目标检测框架,通过迭代Mamba扩散细化机制提升边界精度,实验表明其在多个评估指标上优于现有方法。

Comments Accepted at ICPR 2026. Diffusion-guided Mamba framework for multimodal salient object detection. Evaluated on 13 benchmarks (RGB, RGB-D, RGB-T)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV 81%

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 81%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 79%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 79%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16558 2026-04-21 cs.LG 78%

Cross-Modal Generation: From Commodity WiFi to High-Fidelity mmWave and RFID Sensing

跨模态生成:从商品WiFi到高保真毫米波和RFID传感

Zhixiong Yang, Long Jing, Yao Li, Shuli Cheng, Guoxuan Chi, Chenyu Wen

机构 * Xinjiang University(新疆大学) Northwest University(西北大学) Tsinghua University(清华大学)

专题命中 多模态生成 :cross-modal(title,abstract)

AI总结 本文提出RF-CMG方法,利用丰富的WiFi数据生成高保真毫米波和RFID数据,通过高频指导与低频约束解耦生成过程,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13637 2026-04-21 cs.CV cs.MM 76%

Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation

探索互惠的跨模态注意力以实现情境感知的人体可供性生成

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein

机构 * University of Technology Sydney(技术大学悉尼大学) Indian Institute of Technology, Kharagpur(印度理工学院哈里科特) Indian Statistical Institute, Kolkata(印度统计研究所科契)

专题命中 多模态生成 :cross-modal(title);分类 cs.CV、cs.MM

AI总结 本文提出一种互惠的跨模态注意力机制,通过不同模态的空间特征图互相关注,以提升2D场景中人体可供性预测的准确性与效率。

Comments Accepted in The IEEE Transactions on Artificial Intelligence (TAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14324 2026-04-21 cs.CV cs.CL 73%

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18027 2026-04-21 cs.SE cs.CL 70%

CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

CodePivot: 通过强化学习无需平行语料库提升LLM的多语言转译

Shangyu Li, Juyong Jiang, Meibo Ren, Sizhe Zhong, Huiri Tan, Yunhao Gou, Xu Han, Chun Yong Chong, Yun Peng, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Monash University(莫纳什大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :any-to-any(abstract,abstract_cn);分类 cs.CL

AI总结 CodePivot通过Python作为中间表示和Aggressive-Partial-Functional奖励机制,无需平行语料库提升LLM的多语言转译能力,在10种编程语言上实验显示其在通用和低资源语言转译任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV 70%

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 67%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06663 2026-04-21 cs.CV 57%

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17385 2026-04-21 cs.CV 57%

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

SpatialImaginer: 向空间推理的自适应视觉想象迈进

Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) MiniMax Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialImaginer框架,通过结合文本推理与视觉想象,解决多模态大语言模型在空间推理中的鲁棒性问题,实验显示其在复杂空间任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17090 2026-04-21 cs.CV 57%

Marrying Text-to-Motion Generation with Skeleton-Based Action Recognition

将文本到动作生成与基于骨架的动作识别相结合

Jidong Kuang, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CoAMD模型,结合骨架坐标进行动作理解和生成,实现统一的动作识别与生成,通过多模态动作识别器提供语义指导,实验表明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏