A Multimodal Recommender System for Large-scale Assortment Generation in E-commerce
专题命中 多模态生成 :multimodal(title);分类 cs.CV
Comments SIGIR eComm Accepted Paper
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(title);分类 cs.CV
Comments SIGIR eComm Accepted Paper
专题命中 多模态生成 :multimodal(title);分类 cs.CV
Comments 27th International Joint Conference on Artificial Intelligence (IJCAI 2018)
Defake-o3:从推测性理由到可验证证据的可解释AIGI检测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。
Comments Accepted by ACMMM 2026
Sci-VBench:面向科学领域知识与推理密集型视频生成的评估
机构 * Zhejiang University(浙江大学) ; UCAS(中国科学院大学) ; Tongji University(同济大学) ; Yale University(耶鲁大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。
Comments COLM 2026
交错思维中的模态隔离桥接:通过逐步强化监督模态转换
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Zhejiang University(浙江大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。
Comments 22 pages, 5 figures, 6 tables
共生MoE:解构生成与理解之间的协同效应
机构 * HKUST(香港科技大学) ; Tencent Hunyuan(腾讯混元)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出Symbiotic-MoE框架,通过模态感知专家解缠绕和渐进训练策略,解决生成与理解任务间的冲突,提升多模态协同能力,在MMLU和OCRBench上取得显著提升。
Comments Accepted to ECCV 2026
UniMotion: 一种用于运动-文本-视觉理解和生成的统一框架
机构 * Peking University(北京大学) ; Donghua University(东华大学) ; South China University of Technology(华南理工大学)
专题命中 多模态生成 :cross-modal(abstract);any-to-any(abstract);分类 cs.CV、cs.AI
AI总结 UniMotion首次提出统一框架,同时处理人类运动、自然语言和RGB图像的理解与生成,通过连续模态处理和自监督预训练解决传统模型的局限性。
Comments Accepted to ECCV 2026
安全自回归图像生成与迭代自改进码本
机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) ; Torr Vision Group, University of Oxford(牛津大学Torr视觉组)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 针对自回归统一多模态模型生成图像的安全性问题,提出迭代自改进码本方法,利用模型自身判断不安全图像并修正码本映射,消除有害输出并保证生成质量。
Comments 10 pages including references, 8 figures, accepted for publication at the 43rd International Conference on Machine Learning (ICML 2026)
FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成
机构 * The Australian National University(澳大利亚国立大学) ; ByteDance(字节跳动)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出FLUX3D框架,通过扩散对齐结构化潜变量(DA-SLAT)和稀疏结构感知扩散变压器(SMDiT)解决稀疏体素表示中高频细节丢失和跨模态对齐问题,实现高保真图像到3D高斯生成。
基于离散扩散模型的视觉-文本思维高效强化学习
机构 * KAIST(韩国科学技术院) ; Sony AI(索尼AI) ; AITRICS ; Sony Group Corporation(索尼集团公司)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出用离散扩散模型替代自回归模型进行多模态强化学习,通过局部视觉编辑减少计算量,并设计分解奖励分配策略解决跨模态干扰问题。
扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI
机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) ; School of Medicine, Stanford University(斯坦福大学医学院)
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。
Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑
机构 * National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.MM
AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。
AnyMo: 基于掩码建模的任意模态条件运动生成
机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院计算技术研究所,中国)) ; University of Chinese Academy of Sciences, China(中国科学院大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出AnyMo框架,结合残差FSQ运动分词器和可扩展掩码建模Transformer,利用大规模多模态对齐数据集OmniHuMo实现任意模态组合下的高质量人体运动生成。
帕累托优化的肖像生成:用于对齐、真实性和美学的视觉对齐文本监督
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种多模态扩散变换器(MM-DiT)的特征监督方法,通过引入轻量级的跨模态对齐机制,隐式提取多粒度的视觉对齐文本表示,以提升文本-图像对齐、真实性和美学质量,从而在Pareto前沿上实现协同改进。
DualToken: 向通过双视觉词汇统一视觉理解和生成迈进
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Baichuan Inc.(北川科技) ; Peking University(北京大学) ; Xiaomi EV(小米电动车)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。
RePAIR:通过提示感知模型修复实现交互式机器去学习
机构 * Indian Institute of Technology Mandi(印度理工学院曼迪)
专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RePAIR框架,通过提示感知模型修复实现用户交互式机器去学习,解决大语言模型在预训练中吸收有害知识、虚假信息和隐私数据的问题,实现用户自主控制数据。
InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用
机构 * University of Alberta(阿尔伯塔大学) ; vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。
Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型
机构 * FNii-Shenzhen(FNii-深圳) ; SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) ; Meshy AI
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。
当理解成为风险:新兴图像生成范式中的真实性与安全性风险
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) ; Xi’an Jiaotong University(西安交通大学) ; Flexera(Flexera公司)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。
Comments Accepted by CVPR 2026. 15 pages, 11 figures
EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑
机构 * Shanghai Jiao Tong University(上海交通大学) ; Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; University of Electronic and Science Technology of China(电子科技大学) ; Ocean University of China(海洋大学) ; Beijing University of Technology(北京理工大学)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.MM
AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。
QUSR: 一种基于质量感知和不确定性引导的图像超分辨率扩散模型
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 QUSR通过引入质量感知先验和不确定性引导噪声生成模块,提升图像超分辨率在复杂场景下的真实感和细节还原能力。
Comments This paper has been accepted by ICASSP 2026
两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。
Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/
生成实体交互的细节
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 本文提出了一种基于多模态大语言模型的方法,通过分解和细化过程提升图像中实体交互细节的生成质量。
Comments EMNLP 2025. Project Page: https://detailscribe.github.io/
JavisDiT++:联合音频视频生成的统一建模与优化
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; HiThink Research(HiThink研究) ; University of Rochester(罗切斯特大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。
Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page
SAVGBench: 多模态空间对齐音频视频生成基准测试
机构 * Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团)
专题命中 多模态生成 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。
Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026
Socratic-Geo:通过多智能体交互实现合成数据生成与几何推理
机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) ; EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; Shanghai University of Finance(上海财经大学) ; Wuhan University(武汉大学)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 Socratic-Geo通过多智能体交互实现合成数据生成与几何推理,利用教师代理和求解代理动态耦合数据合成与模型学习,提升图像生成和推理能力。
Comments 18pages
MAUGen: 一种用于多身份面部表情和AU标签生成的统一扩散方法
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 MAUGen通过统一的扩散方法生成多身份面部表情和AU标签,提升面部动作单元识别系统的泛化能力。
通过弱项针对性后训练实现统一的文本图像生成
机构 * FAIR at Meta(Meta旗下的FAIR) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出通过针对性后训练实现统一文本图像生成,提升多模态生成性能。
多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。
HyperCLOVA X 8B Omni:首个支持文本、音频和视觉的任何到任何多模态模型
机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)
专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI
AI总结 HyperCLOVA X 8B Omni是首个支持文本、音频和视觉的任何到任何多模态模型,通过统一的多模态处理实现高效且灵活的多模态交互。
Comments Technical Report