arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-22 至 2026-04-22 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2506.18871 2026-04-22 cs.CV cs.AI cs.CL 82%

OmniGen2: Towards Instruction-Aligned Multimodal Generation

OmniGen2:面向指令对齐的多模态生成

Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniGen2通过双解码路径和解耦图像分词器,实现文本和图像生成的统一解决方案,提升多模态生成任务的性能与一致性,同时提供开源模型和数据集支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 79%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19135 2026-04-22 cs.CV 79%

Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval

Diff-SBSR: 学习多模态特征增强的扩散模型用于零样本素描基础3D形状检索

Hang Cheng, Fanhe Dong, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用文本到图像扩散模型解决零样本素描基础3D形状检索问题,通过多模态特征增强策略提升语义上下文捕捉能力,实验表明方法在公开基准上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 57%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18967 2026-04-22 cs.CV 57%

Toward Clinically Acceptable Chest X-ray Report Generation: A Qualitative Retrospective Pilot Study of CXRMate-2

迈向临床可接受的胸部X光报告生成:CXRMate-2的定性回顾性试点研究

Aaron Nicolson, Elizabeth J. Cooper, Hwan-Jin Yoon, Claire McCafferty, Ramya Krishnan, Michelle Craigie, Nivene Saad, Jason Dowling, Ian A. Scott, Bevan Koopman

机构 * organization= Australian e-Health Research Centre, CSIRO Health organization= Princess Alexandra Hospital, Metro South Health , city= Brisbane , country= Australia organization= Queensland Digital Health Centre, University of Queensland , city= Brisbane , country= Australia Informatics Directorate, Metro South Hospital organization= School of Electrical Engineering Computer Science, University of Queensland , city= Brisbane , country= Australia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CXRMate-2模型,通过结构化多模态条件与强化学习实现胸部X光报告生成,经多数据集验证在性能和临床可接受性上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17072 2026-04-22 cs.MA 50%

CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation

CogGen:一种受认知启发的递归框架用于深度研究报告生成

Kuo Tian, Pengfei Sun, Zhen Wu, Junran Ding, Xinyu Dai

专题命中 多模态生成 :multimodal(abstract)

AI总结 CogGen通过递归架构模拟认知写作,实现灵活规划与全局重构,引入抽象视觉表示和认知负荷评估框架,提升多模态内容生成质量。

Comments 28 pages, 3 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏