MMGAN: Generative Adversarial Networks for Multi-Modal Distributions
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
Comments Submitted to IROS 2019
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
Comments 21 pages, 12 figures
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL
Comments Accepted by NAACL-HLT 2019. arXiv admin note: substantial text overlap with arXiv:1811.04498
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
Journal ref Proceedings of the 11th International Conference on Natural Language Generation, pages 129-134, Tilburg, The Netherlands, 2018
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CL
Comments Workshop on Visually Grounded Interaction and Language, NIPS, 2018
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV
Comments 9 pages, Part of this work is accepted by IEEE International Conference on Multimedia Expo 2018
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
Journal ref Proc. Computational Diffusion MRI, MICCAI Workshop, Québec City, Canada, September 2017
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
Comments CVPR 2017 Spotlight
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
Comments 23 pages
Journal ref JNIT (Journal of Next Generation Information Technology), Volume 4 Issue 5, July, 2013,Pages 87-109, ISSN 2092-8637. GlobalCIS (Convergence Information Society, Republic of Korea)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
Comments 14 pages
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
Comments Accepted to the First Conference of Machine Translation (WMT16)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
Comments Pages IEEE format, International Journal of Computer Science and Information Security, IJCSIS February 2010, ISSN 1947 5500, http://sites.google.com/site/ijcsis/
Journal ref International Journal of Computer Science and Information Security, IJCSIS, Vol. 7, No. 2, pp. 028-037, February 2010, USA
重味多模碎片化到下一代强子对撞机的S波五重态
专题命中 多模态生成 :multimodal(title,abstract)
AI总结 研究了在下一代强子对撞机中通过多模碎片化产生S波五重态的机制及现象学影响。
Comments 49 pages, 9 figures, 245 references, published in Eur. Phys. J. C. One novel set of multimodal (direct multicharm and diquark-like initial-scale inputs) "PentaQuarks with 5 heavy Quarks" (PQ5Q1.0) NLO collinear fragmentation functions released in LHAPDF format and publicly available from https://github.com/FGCeliberto/Collinear_FFs/
专题命中 多模态生成 :multimodal(title,comments);分类 cs.CV、cs.CL、cs.AI
Comments 24 pages, 10 figures, 11 tables. Code can be found at: https://github.com/SinghNayanKumar/multimodal-product-lister/
专题命中 多模态生成 :multimodal(title,abstract)
Comments 9 pages
Journal ref Journal on Multimodal Interaction (JMUI), 1 (2007) 1-9
我们现在知道了吗?TerraMind和THOR的系统比较
机构 * University of Münster(明斯特大学) ; IBM Research(IBM研究院) ; Norwegian Computing Center(挪威计算中心)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV、cs.AI
AI总结 通过对TerraMind和THOR两个地理空间基础模型对比,研究其在补丁大小、解码器复杂性等方面的差异轴,发现架构设计选择对性能差异影响更大,体现互补投资策略,还得出假设和诊断消融方法,有望推广到未来模型。
眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成
机构 * Peking University(北京大学) ; Tencent(腾讯) ; Dalian University of Technology(大连理工大学) ; Nanyang Technological University(南洋理工大学) ; University of Cambridge(剑桥大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。
CCS:放射学报告生成的临床共识选择
机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) ; School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。
Comments 17 pages, 6 figures
OmniNFT: 多模态联合音频视频生成的模态感知强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; JD Explore Academy(京东探索研究院)
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。
Comments Project page: https://zghhui.github.io/OmniNFT/
为广告设计:基于统一自回归模型的个性化广告图像和文本生成
机构 * Sun Yat-Sen University(中山大学) ; Northeastern University(东北大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。
Comments 22 pages, 19 figures, CVPR 2026
TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成
机构 * Nara Institute of Science and Technology(奈良科学技術研究所) ; The University of Tokyo(东京大学) ; Chungnam National University(Chungnam国立大学) ; Institute of Science Tokyo(东京科学研究所)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。
Comments Under review
Dynin-Omni: 多模态统一的大扩散语言模型
机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI
AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。
Comments Project Page: https://dynin.ai/omni/
机构 * MedVisAI Lab(MedVisAI实验室) ; ECE, Northwestern University(电子工程系,西北大学) ; Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究所(I2R),A*STAR,新加坡) ; Lee Kong Chian School of Medicine, Nanyang Technological University(Lee Kong Chian医学院,南洋理工大学)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
Comments To be pubilshed in CVPR 2025
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI